KI-Verifizierung
Kostenlos
AI Verify ist ein Open-Source-Framework und Software-Toolset für KI-Governance-Tests, das von der AI Verify Foundation unter IMDA in Singapur geleitet wird. Es umfasst das AI Verify Testing Framework (11 internationale Bewertungsrahmen für KI-Governance-Prinzipien), das AI Verify Toolkit (traditionelles KI-Modelltest-Tool) und Project Moonshot (LLM-Evaluierung und Red-Team-Test-Toolkit) und deckt Compliance-Testanforderungen von traditionellem ML bis hin zu generativer KI ab.
AIVerify
Kernparameter und Statistiken
AI Verify ist ein Open-Source-Framework und Software-Toolset für KI-Governance-Tests, das von der AI Verify Foundation unter der Singapore Infocomm Media Development Authority (IMDA) geleitet wird. Es handelt sich nicht um ein einzelnes Produkt, sondern besteht aus drei Funktionsebenen: AI Verify Testing Framework (Governance-Framework), AI Verify Toolkit (traditionelle KI-Testsoftware) und Project Moonshot (LLM-Bewertungstoolkit).
| Projekte | Öffentliche Informationen |
|---|---|
| Offizielle Positionierung | Framework und Software-Toolkit für KI-Governance-Tests |
| Art der Organisation | IMDA ist eine hundertprozentige gemeinnützige Tochtergesellschaft |
| Open-Source-Lizenz | Apache 2.0 |
| Governance-Grundsätze | 11 Internationale KI-Governance-Grundsätze |
| Toolkit neueste Version | 2.2.1 (23.03.2026, GitHub-Veröffentlichungen) |
| Moonshot neueste Version | 0.7.6 (05.02.2026, GitHub-Veröffentlichungen) |
| GitHub Stars (Toolkit) | 79 Sterne, 24 Forks, 20 Mitwirkende |
| GitHub Stars (Moonshot) | 337 Sterne, 65 Forks, 20 Mitwirkende |
| Framework erstmals veröffentlicht | 25.05.2022 (MVP) |
| GenAI Framework-Update | 29.05.2025 |
| Support-Plattform | Web, API, Desktop |
Organisatorischer Hintergrund: Die AI Verify Foundation ist eine hundertprozentige Tochtergesellschaft der singapurischen Regierungsbehörde IMDA, was bedeutet, dass ihr Governance-Rahmen natürlich mit der KI-Governance-Politik Singapurs (sowie den US-amerikanischen und europäischen Rahmenwerken, die sie als Benchmark verwenden) im Einklang steht und für multinationale Unternehmen mit grenzüberschreitenden Compliance-Anforderungen geeignet ist.
Strategie mit zwei Tools: AI Verify Toolkit deckt traditionelle Modelle des überwachten Lernens ab (Klassifizierung/Regression, Tabellen-/Bilddaten), und Project Moonshot deckt LLM-Bewertung und Red-Team-Tests ab. Die beiden ergänzen sich, überschneiden sich aber nicht. Unternehmen müssen die entsprechende Toolkette basierend auf ihren eigenen KI-Asset-Typen auswählen.
Gemeinschaftsmaßstab: Die beiden Kernlager haben insgesamt etwa 416 Sterne. Der Umfang ist klein, aber die meisten Mitwirkenden kommen vom offiziellen IMDA-Team und regierungsnahen Institutionen. Es handelt sich eher um eine von der Regierung geleitete Open Source als um eine Art spontanes Wachstum der Community.
Benutzer- und Markterkennung
Die Marktbekanntheit von AI Verify spiegelt sich hauptsächlich in den beiden Ebenen der zwischenstaatlichen Zusammenarbeit und der Beteiligung multinationaler Unternehmen wider und nicht in der spontanen Begeisterung der Community.
Zwischenstaatliches Benchmarking: Das AI Verify Testing Framework hat das Cross-Mapping (Crosswalk) mit internationalen Frameworks wie dem US NIST AI RMF, dem EU AI Act, der OECD und dem G7-Hiroshima-Prozess abgeschlossen. Im Mai 2025 wurde eine neue Version von Crosswalk mit dem NIST AI RMF Generative AI Profile veröffentlicht. Dies bedeutet, dass Unternehmen, die AI Verify verwenden, die Kosten für doppelte Bewertungen bei der Bewältigung länderübergreifender Compliance-Anforderungen reduzieren können.
Unternehmensbeteiligung: Zu den Premier-Mitgliedern gehören AWS, Dell, Google, IBM, Microsoft, Salesforce, Red Hat, Resaro usw. Zu den allgemeinen Mitgliedern gehören Ant Group Temus, ACCA usw., die mehrere Branchen wie Technologie, Finanzen und Wirtschaftsprüfung abdecken. Diese Mitglieder leisten nicht nur finanzielle Unterstützung, sondern beteiligen sich auch direkt an der Werkzeugentwicklung und der Festlegung von Teststandards.
Pilotverifizierung: Das im Februar 2025 gestartete Global AI Assurance Pilot zog über 100 Teilnehmer aus über 30 Organisationen an und deckte tatsächliche Tests von GenAI-Anwendungen in verschiedenen Branchen ab, vom Finanzwesen bis zur medizinischen Versorgung. Im Juli 2025 wird es auf die Global AI Assurance Sandbox aktualisiert, um das Test-Ökosystem weiter zu erweitern.
Benutzerrezensionen: X0PA (KI-Rekrutierungsplattform) bewertet das Toolkit als „einen robusten Rahmen für die Bewertung und Verbesserung der Fairness von KI-Systemen bietend“, Dell sagt, es „bietet einen einheitlichen Rahmen für Organisationen, um ehrliche, faire und gerechte Systeme zu erreichen“, und Singapore Airlines ist der Ansicht, dass es „ein ausgezeichneter Ausgangspunkt für die Selbstbewertung von KI-Systemen“ ist.
Kostenvorteil
Die Kostenstruktur von AI Verify steht in direktem Zusammenhang mit seinem Regierungskontext und unterscheidet sich dadurch deutlich von kommerziellen KI-Governance-Tools.
C-Seite/Einzelperson: Die PDF- und Excel-Versionen des AI Verify Testing Framework können kostenlos heruntergeladen und verwendet werden. Project Moonshot und AI Verify Toolkit sind beide Apache 2.0 Open Source ohne Lizenzgebühren. Einzelne Entwickler oder kleine Teams können es direkt von GitHub aus klonen und verwenden.
API/Entwickler: Project Moonshot stellt Python-Bibliotheken („pip install aiverify-moonshot[all]“), Web-API und CLI völlig kostenlos zur Verfügung. Entwickler müssen die Kosten für LLM-API-Aufrufe (die Inferenzkosten, die durch die Verbindung des Zielmodells während der Evaluierung entstehen) und Infrastrukturkosten (z. B. GPU-Server) tragen. Das AI Verify Toolkit muss lokal oder im Unternehmen bereitgestellt und ausgeführt werden.
Unternehmen/Privat: Alle Tools unterstützen die selbstgehostete Bereitstellung, es fallen keine Softwarelizenzgebühren an. Die tatsächlichen Kosten für Unternehmen konzentrieren sich auf Personal für Bereitstellung, Betrieb und Wartung, API-Aufrufgebühren für die Vorbereitung von Testdaten, KI-Modelle und Anwendungskosten für das Lernframework des Compliance-Teams. Für Unternehmen, die Tests und Zertifizierungen durch Dritte benötigen, bietet das AI Tester Accreditation Program (gestartet im Mai 2026) eine Liste offiziell anerkannter Testdienstleister. Die entsprechenden Prüfungsgebühren unterliegen dem Angebot des Dienstleisters.
Die kostenlose Wahrheit: Es stimmt, dass für Open Source keine Lizenzgebühren anfallen, aber die versteckten Kosten, die mit der vollständigen Implementierung des AI Verify-Frameworks verbunden sind, wie z. B. Personalschulung, Testkontextaufbau und kontinuierliche Compliance-Überwachung, können nicht ignoriert werden. Im Vergleich zu kommerziellen KI-Governance-Plattformen (wie IBM AI Governance, Google Vertex AI Governance) verursacht AI Verify geringere explizite Kosten, erfordert jedoch größere interne technische Fähigkeiten und eine größere Governance-Reife.
Hauptfunktionen
Die Kernfunktionen von AI Verify sind in einer dreischichtigen Struktur organisiert, wobei jede Schicht unterschiedliche Nutzungsrollen hat:
-
AI Verify Testing Framework (Governance-Framework-Ebene): Bietet eine strukturierte Bewertungsmethode für 11 internationale KI-Governance-Prinzipien. Jedes Prinzip enthält eine vierschichtige progressive Struktur aus Prinzip→Ergebnis→Prozess→Beweis. Das Framework kann unabhängig verwendet werden, indem PDF-/Excel-Formulare heruntergeladen werden, oder mit Toolkit oder Moonshot kombiniert werden, um Compliance-Berichte zu erstellen. Ideal für Compliance-Teams und Prüfer.
-
AI Verify Toolkit (traditionelle KI-Testschicht): Für überwachte Lernklassifizierungs- und Regressionsmodelle bietet es technische Tests wie Fairness (Bias-Erkennung), Robustheit (Bildbeschädigung/gegnerische Stichproben), Interpretierbarkeit (SHAP-Wert) und Sicherheit (Datenlecktests). Unterstützt Tabellendaten und Bilddaten, und nach Abschluss des Tests können benutzerdefinierte Berichte erstellt werden. Die aktuelle Version 2.2.1 integriert außerdem die Veritas Financial Compliance Test Suite, um die Sicherheitsgrundanforderungen des MAS zu erfüllen.
-
Project Moonshot (LLM-Bewertungsschicht): Bietet mehr als 100 Open-Source-Benchmark-Datensätze, die mehrdimensionale Bewertungen wie Leistung (Genauigkeit BLEU), vertrauenswürdige Sicherheit (Bias, Toxizität, Halluzination) usw. abdecken. Unterstützt automatisierte Red-Team-Angriffe (basierend auf forschungsgesteuerten Algorithmusstrategien kombiniert mit generativem LLM zur Generierung gegnerischer Hinweise), um Tests gegen mehrere LLM-Endpunkte gleichzeitig durchzuführen. Bietet interaktive HTML-Berichte und JSON-Rohdatenexport und unterstützt die CI/CD-Pipeline-Integration. Aktuelle Version 0.7.6.
Versteckte Verknüpfung: Die drei Schichten arbeiten nicht unabhängig voneinander – die Bewertungsergebnisse der Framework-Schicht können direkt den technischen Testelementen von Toolkit/Moonshot zugeordnet werden, und der Testbericht kann die Konformitätserklärung der Framework-Schicht umgekehrt überprüfen. Beispielsweise verwendet das Compliance-Team das Framework zunächst, um eine Selbstprüfung auf Prinzipebene durchzuführen, und übergibt es dann an das Engineering-Team, das Moonshot für die Durchführung spezifischer Red-Team-Tests verwendet. Die endgültigen Testdaten füllen den Rahmenbericht automatisch auf und stellen so eine Verbindung vom Management zur Technologie her.
Modell- und Versionsentwicklung
Die relevanten Informationen wurden nicht veröffentlicht. Bitte beachten Sie die offizielle Echtzeitseite.
Technische Vorteile
Der technische Vorteil von AI Verify ergibt sich aus der Kombination aus „Framework-Konsistenz auf Regierungsebene und Abdeckung der Open-Source-Toolkette“ und nicht aus einem einzelnen Leistungsparameter.
Framework-Ausrichtung: Das AI Verify Testing Framework wurde auf die wichtigsten Prinzipien von NIST AI RMF, ISO 42001 und dem EU AI Act abgestimmt. Das bedeutet, dass, wenn ein Unternehmen AI Verify zur Durchführung von Compliance-Bewertungen verwendet, die Ergebnisse teilweise für die Durchführung von Compliance-Überprüfungen in anderen Gerichtsbarkeiten wiederverwendet werden können, wodurch die Kosten für wiederholte Bewertungen gesenkt werden. Der Mechanismus besteht darin, dass Crosswalk-Dokumente die konzeptionelle Äquivalenz zwischen Frameworks klar markieren und nicht einfach nur die Ausrichtung deklarieren.
Die duale Toolkette deckt alle Modi ab: Toolkit deckt das Tabellen-/Bildmodell des traditionellen ML ab, und Moonshot deckt das Text-/Dialogmodell von LLM ab. Die beiden sind in der Testmethodik einheitlich, in der Technologieimplementierung jedoch unabhängig. Diese Segmentierung vermeidet die Anwendung herkömmlicher ML-Testmethoden auf LLM-Szenarien und verhindert, dass eine einzelne Toolkette übermäßig erweitert wird.
Modulare Architektur (2.0+): Toolkit 2.0 wird in eine Fünf-Komponenten-Architektur aus apigw (API-Gateway), Portal (Front-End-Portal), Test-Engine (Test-Engine), Test-Engine-Worker (Testarbeitsknoten) und Shared-Library (gemeinsam genutzte Bibliothek) umgestaltet. Testalgorithmen werden als unabhängige Python-Module ausgeführt, die unabhängig voneinander entwickelt, bereitgestellt und aktualisiert werden können, ohne den gesamten Release-Zyklus zu blockieren.
Automatisierte Red-Team-Funktionen: Moonshot automatisiert Red-Team-Tests teilweise, die traditionell auf manueller Arbeit beruhen, und nutzt algorithmische Strategien (wie z. B. Gradienten-/regelbasierte gegnerische Generierung) und generative LLM-unterstützte Testfallgenerierung, um parallele Angriffstests für mehrere LLM-Endpunkte zu erreichen. Dies ist die wichtigste Unterscheidungsfunktion von Moonshot gegenüber reinen Benchmarking-Tools.
Anwendbare Szenario-Erinnerung: Die Flexibilität, die die hohe Ausrichtung des Frameworks mit sich bringt, bedeutet auch, dass es nicht so tiefgreifend ist wie spezialisierte Lösungen. Die Erkennung bestimmter Arten von KI-Voreingenommenheit oder Sicherheitslücken muss möglicherweise durch spezielle Tools wie das Jailbreak-Bewertungsframework von Anthropic, Meta’s Purple Llama, ergänzt werden.
Wie man es benutzt
Der Nutzungseingang von AI Verify ist basierend auf unterschiedlichen Rollen und Testzielen in drei Pfade unterteilt:
| So verwenden Sie | Geeignet für die Menge | Kerngeschäfte | Kosten |
|---|---|---|---|
| Test-Framework-Dokumentation | Compliance-Teams, Prüfer | Laden Sie PDF/Excel herunter, führen Sie die Selbstprüfung gemäß 11 Prinzipien durch und erstellen Sie einen Ausrichtungsbericht | Kostenlos |
| AI Verify Toolkit | Data Scientist ML-Ingenieur | Stellen Sie lokalen Kontext bereit, laden Sie Modelle und Datensätze, führen Sie Fairness-/Robustheitstests durch und exportieren Sie Berichte | Kostenlos und Open Source, Sie müssen Ihre eigene Infrastruktur vorbereiten |
| Projekt Moonshot | LLM-Entwickler, Sicherheitsteam | pip install aiverify-moonshot[all], Verbindung zu LLM-Endpunkten herstellen, Benchmarks oder Red-Team-Angriffe ausführen, HTML-Berichte generieren |
Kostenlos und Open Source, es fallen Gebühren für den LLM-API-Aufruf an |
Schneller Einstieg mit Project Moonshot:
„Bash
Moonshot installieren
pip install „aiverify-moonshot[all]“
Testressourcen und Web-Benutzeroberfläche klonen
Python -m Moonshot -i Moonshot-Daten -i Moonshot-ui
Starten Sie die Web-Benutzeroberfläche
Python -m Moonshot Web
Öffnen Sie den Browser http://localhost:3000/
Oder starten Sie die interaktive CLI
Python -m Moonshot CLI interaktiv „
Typischer Implementierungspfad: Das Compliance-Team lädt zuerst das Framework-PDF herunter und führt eine Selbstprüfung auf Prinzipebene durch → identifiziert das KI-System, das eine technische Verifizierung erfordert → das ML-Team verwendet Toolkit, um den Fairness-/Robustheitstest des traditionellen Modells durchzuführen → das LLM-Team verwendet Moonshot, um Benchmarking und Red-Team-Tests durchzuführen → füllt den Framework-Bericht mit Testergebnissen auf → generiert einen vollständigen AI-Verify-Compliance-Bericht.
Produktpreise
Alle Kerntools von AI Verify sind Open Source unter der Apache 2.0-Lizenz und die öffentlichen Preisinformationen lauten wie folgt:
- C-seitige/einzelne Entwickler: Framework-Dokumente können kostenlos heruntergeladen werden, und Toolkit und Moonshot sind vollständig Open Source und kostenlos. Für den persönlichen Gebrauch betragen die tatsächlichen Kosten nur die LLM-API-Anrufgebühr (zum Zeitpunkt der Moonshot-Überprüfung) und die Computerinfrastruktur.
- Team-/Enterprise-Selbsthosting: Für die Software fallen keine Lizenzgebühren an und die Kosten konzentrieren sich auf Bereitstellung und Betrieb (Docker/K8s), Speicher und Rechenressourcen. Für die Toolkit-Bereitstellung ist ein Server mit mindestens 4 Kernen und 16 GB RAM erforderlich.
- Tests und Zertifizierung durch Dritte: Das AI Tester Accreditation Program (gestartet im Mai 2026) stellt offiziell anerkannte Drittanbieter von Testdienstleistungen zur Verfügung. Die entsprechenden Prüfungs- und Zertifizierungsgebühren unterliegen dem Angebot des Dienstleisters. Der offizielle Referenzpreis wird nicht bekannt gegeben.
- Stiftungsmitglied: Unternehmen können durch den Beitritt zur AI Verify Foundation strategischen Einfluss und Sitze im Governance-Ausschuss erlangen. Die Mitgliedsbeiträge unterliegen der offiziellen Geschäftskommunikation und der Standardpreis wird nicht bekannt gegeben.
Vergleich kommerzieller Lösungen: Im Vergleich zu kommerziellen Plattformen wie IBM AI Governance (Abrechnung nach Asset-Volumen) und Google Vertex AI Governance (Abrechnung nach Anzahl der Bewertungen) liegen die Softwarekosten von AI Verify bei Null, erfordern jedoch, dass Unternehmen über stärkere Fähigkeiten zur Selbstbereitstellung und zum Eigenbetrieb verfügen. Die Gesamtbetriebskosten (TCO) hängen vom Kompromiss zwischen interner Arbeit und Abonnementgebühren für kommerzielle Plattformen ab.
Anwendungsszenarien
Typische Implementierungsszenarien für AI Verify konzentrieren sich auf regulierte Branchen, die KI-Compliance- und Sicherheitsanforderungen erfüllen müssen:
-
KI-Compliance in der Finanzbranche: Banken, Versicherungen und andere von MAS regulierte Finanzinstitute können die Veritas-Suite im AI Verify Toolkit verwenden, um die Fairness und Sicherheit von Kreditbewertung, Betrugsbekämpfung und anderen Modellen zu überprüfen und so die KI-Governance-Richtlinien der MAS zu erfüllen. Vervollständigen Sie in Kombination mit dem Framework die vollständige Linkdokumentation von den Grundsätzen bis zu den Beweisen, um auf behördliche Inspektionen zu reagieren.
-
LLM-Sicherheits-Benchmarking und Red Teaming: Unternehmen nutzen Project Moonshot, um Benchmarking (Bias, Toxizität, Halluzinationen) und automatisierte Red-Teaming-Angriffe auf Basis- und fein abgestimmte Modelle durchzuführen, bevor sie generative KI-Anwendungen bereitstellen. Der HTML-Bericht von Moonshot kann direkt als Grundlage für die Risikoprüfung des AI Safety Committee dienen. Der eigentliche Vorteil besteht darin, menschliche Red-Teams von der „On-Demand-Ausführung“ zur „kontinuierlichen Integration“ zu verlagern.
-
Grenzüberschreitende Ausrichtung der KI-Governance: Singapurische Unternehmen mit Niederlassungen sowohl in den USA als auch in China können die übergreifende Zuordnung des AI Verify Framework mit NIST AI RMF und ISO 42001 nutzen. Eine Reihe von Bewertungsergebnissen kann gleichzeitig Compliance-Anforderungen an mehreren Stellen erfüllen und die Duplizierung paralleler Bewertungsarbeiten reduzieren. In der Praxis sind noch weitere Überprüfungen erforderlich, um Unterschiede in den lokalen Gesetzen und Vorschriften auszuräumen.
-
Akzeptanz von KI-Beschaffungen durch die Regierung und den öffentlichen Sektor: Wenn Regierungsbehörden KI-Systeme kaufen, können sie den AI Verify-Konformitätsbericht als eine der Leistungen des Lieferanten als quantifizierbare Grundlage für die Akzeptanz aufführen. Die Regierung Singapurs fördert diese Praxis bereits.
Anwendbare Personen
Das mehrschichtige Design von AI Verify ermöglicht es, drei Arten von Kernrollen zu erfüllen, die sich jeweils auf unterschiedliche Ebenen von Fähigkeiten konzentrieren:
-
Compliance- und Risikokontrollteam: Es muss ein KI-Governance-Framework aufgebaut und auf behördliche Inspektionen reagiert werden. Verwenden Sie hauptsächlich den 11-Prinzipien-Selbstprüfungsprozess des Testing Framework und Crosswalk-Mapping-Dokumente, um Compliance-Berichte zu erstellen. Voraussetzung ist, dass Sie über Grundkenntnisse der KI-Governance verfügen und regulatorische Anforderungen (z. B. EU-KI-Gesetz, MAS-Richtlinien) verstehen.
-
KI/ML-Ingenieure und Datenwissenschaftler: Die technische Sicherheit des Modells muss überprüft werden. Herkömmliche ML-Szenarien verwenden das AI Verify Toolkit für Fairness- und Robustheitstests. LLM-Szenarien nutzen Project Moonshot für Benchmarking und Red-Team-Tests. Voraussetzung ist die Vertrautheit mit der Modellbereitstellungsumgebung und der Python/Pip-Toolkette.
-
Drittanbieter-Audit- und Testagentur: Bietet unabhängige KI-Auditdienste. Mit dem AI-Tester-Akkreditierungsprogramm können Sie offiziell anerkannte Qualifikationen erwerben und mit der AI-Verify-Toolkette standardisierte Tests durchführen und Zertifizierungsberichte für Kunden erstellen.
Nicht für Grenzen geeignet: AI Verify ist nicht für Teams geeignet, die tiefgreifend angepasste Original-Sicherheitsstrategien benötigen (das Framework bietet allgemeine Richtlinien statt spezialisierter Lösungen); Es ist nicht für Organisationen geeignet, die kein Bewusstsein für KI-Governance und interne Prozesse haben (die Implementierung des Tools erfordert die Zusammenarbeit mit organisatorischer Reife). Es ist auch nicht für schnelle Erkennungsszenarien geeignet, die nur eine einzige Dimension erfordern (z. B. nur das Testen der LLM-Illusion, Community-spezifische Tools sind leichter).
Zusammenfassung und Ausblick
Der Kernwert von AI Verify besteht darin, dass es sich um ein seltenes KI-Governance-Testsystem handelt, das von Regierungsbehörden geleitet wird und vollständig Open Source ist. Es basiert auf 11 international abgestimmten Governance-Prinzipien als oberster Ebene und deckt einen vollständigen Bewertungszyklus von den Prinzipien bis zur Technologie über zwei Toolketten ab: Toolkit (traditionelle KI) und Moonshot (LLM). Für regulierte Unternehmen, die sich mit grenzüberschreitenden Compliance-Anforderungen auseinandersetzen müssen, bietet es einen „einen Satz von Bewertungen, Wiederverwendung an mehreren Orten“-Pfad.
Aktuelle Einschränkungen: Die Community-Größe der Toolkette ist viel kleiner als die der kommerziellen Konkurrenten (die beiden Kernlager haben insgesamt etwa 416 Sterne), Dokumentation und technischer Support basieren auf dem offiziellen IMDA-Team und die Geschwindigkeit der Problemreaktion und Funktionsiteration ist nicht so schnell wie die der sich schnell entwickelnden kommerziellen KI-Governance-Plattform. Moonshot befindet sich noch in der Betaphase und die Stabilität muss vor der groß angelegten Bereitstellung in einer Produktionsumgebung überprüft werden. Das Selbstbewertungsmodell des Frameworks basiert natürlich auf organisatorischer Ehrlichkeit und verfügt nicht über unabhängige Überprüfungsmechanismen (diese Lücke wird durch das AI Tester Accreditation Programme geschlossen).
Implementierungsvorschläge: Es wird empfohlen, Framework PDF zu verwenden, um intern eine Runde schneller Selbstprüfung auf Prinzipebene durchzuführen (ca. 1–2 Wochen), um die Prioritäten der KI-Systeme zu ermitteln, die wirklich einer technischen Überprüfung bedürfen, und dann die entsprechende Toolkette (Toolkit oder Moonshot) auszuwählen, um technische Tests auf 1–2 Pilotsystemen durchzuführen. Vor dem Kauf von Moonshot/Toolkit müssen sich Unternehmen auf die Überprüfung konzentrieren: die Übereinstimmung zwischen den Testdaten und ihren eigenen Szenarien, die Fähigkeit des Red-Team-Moduls, geschäftsspezifische Risiken abzudecken, und den Grad der Akzeptanz des Rahmenberichts in der Zielregulierungsjurisdiktion.
Verwandte Tools: originality-ai, gptzero
Versionsentwicklung von AI Verify
Die Versionsentwicklung von AI Verify folgt zwei Produktlinien sowie Iterationen des Frameworks selbst.
AI Verify Toolkit-Hauptzeile
- 2.2.1 (23.03.2026): Für den Produktionseinsatz wird die neueste stabile Version, einschließlich Fehlerbehebungen und Plug-in-Updates, empfohlen.
- 2.0.0 (~2025): Architekturrekonstruktionsversion, aufgeteilt von einer einzelnen Anwendung in eine modulare Architektur (apigw, Portal, Test-Engine, Test-Engine-Worker, Shared-Library), Einführung eines unabhängigen Testalgorithmus-Ausführungsmechanismus und Veritas-Finanz-Compliance-Integration.
- 1.0 (25.05.2022): MVP veröffentlicht, unterstützt grundlegende Fairness- und Robustheitstests traditioneller ML-Modelle.
Projekt Moonshot-Hauptlinie
- 0.7.6 (05.02.2026): Die neueste Version unterstützt im IMDA Starter Kit integrierte Verbesserungen der Web-Benutzeroberfläche und Verbesserungen des Red-Team-Moduls.
- 0.1.0 (31.05.2024): Erste öffentliche Veröffentlichung, positioniert als „eines der weltweit ersten LLM-Evaluierungs-Toolkits“. – Das Projekt befindet sich noch im Beta-Stadium mit einer Iterationsfrequenz von etwa 1–2 Versionen pro Monat und es gibt 26 Releases auf GitHub.
Meilensteine des Rahmenwerks
- 25.05.2022: AI Verify-Testframework MVP für internationale Piloten veröffentlicht.
- 2023-06-07: Das Framework und das Toolkit sind vollständig Open Source und die AI Verify Foundation wurde gegründet.
- 13.10.2023: Cross-Mapping-Veröffentlichung mit US NIST AI RMF.
- 31.05.2024: Project Moonshot veröffentlicht, Model AI Governance Framework für GenAI veröffentlicht.
- 29.05.2025: Die erweiterte Version des Frameworks wird veröffentlicht, die offiziell die GenAI-Bewertung abdeckt und Cross-Mapping mit NIST GenAI Profile, Hiroshima Process CoC und ISO 42001 hinzufügt.
- 18.05.2026: Das KI-Tester-Akkreditierungsprogramm wurde ins Leben gerufen, um ein KI-Test- und Zertifizierungssystem eines Drittanbieters einzurichten.
Versionsinfo
- AI Verify Toolkit 2.2.1 :Die neueste stabile Version des AI Verify Toolkits wurde auf der Grundlage einer modularen Architektur neu geschrieben und unterstützt den unabhängigen Testalgorithmus-Modulbetrieb, eine neu gestaltete Back-End-Test-Engine, eine neue Version der Front-End-Workflow-Integration von Veritas Financial Compliance und eine verbesserte Unterstützung für Computer-Vision-Tests.
- AI Verify Toolkit 2.0.0 :Umfangreiches Architektur-Upgrade, Einführung eines modularen Designs, Einführung einer unabhängigen Testalgorithmus-Engine, eines neuen Front-End-Workflows und der Integration der Veritas Financial Compliance Test Suite. Einen offiziellen genauen Termin gibt es noch nicht.
- Projekt Moonshot 0.7.6 :Die neueste Version von Project Moonshot (LLM-Evaluierungs-Toolkit) unterstützt über 100 Benchmark-Datensätze, die Web-Benutzeroberfläche des automatisierten Red-Team-Angriffsmoduls und die integrierte CI/CD-Berichterstellung der CLI-Dual-Bedienschnittstelle.
- AI Verify MVP :Das AI Verify-Testframework und das Software-Toolkit wurden zum ersten Mal in Form von MVP veröffentlicht, um Piloten und Feedback von der internationalen Gemeinschaft einzuholen, und wurden gemeinsam von IMDA und PDPC eingeführt.
Benutzerbewertungen