AI検証 無料

-

AI Verify は、シンガポールの IMDA 傘下の AI Verify Foundation が主導するオープンソースの AI ガバナンス テスト フレームワークおよびソフトウェア ツールセットです。これには、AI Verify Testing Framework (11 の国際的な AI ガバナンス原則評価フレームワーク)、AI Verify Toolkit (従来の AI モデル テスト ツール)、および Project Moonshot (LLM 評価およびレッド チーム テスト ツールキット) が含まれており、従来の ML から生成 AI までのコンプライアンス テストのニーズをカバーします。

AI検証 製品インターフェース

AIVerify

コアパラメータと統計

AI Verify は、シンガポール情報通信メディア開発庁 (IMDA) 傘下の AI Verify Foundation が主導するオープンソースの AI ガバナンス テスト フレームワークおよびソフトウェア ツールセットです。これは単一の製品ではなく、AI Verify Testing Framework (ガバナンス フレームワーク)、AI Verify Toolkit (従来の AI テスト ソフトウェア)、Project Moonshot (LLM 評価ツールキット) の 3 つの機能層で構成されています。

プロジェクト 広報
公式の位置づけ AI ガバナンス テスト フレームワークとソフトウェア ツールキット
組織の性質 IMDA 100%出資の非営利子会社
オープンソースライセンス アパッチ2.0
ガバナンス原則 11 の国際 AI ガバナンス原則
ツールキットの最新バージョン 2.2.1 (2026-03-23、GitHub リリース)
ムーンショット最新バージョン 0.7.6 (2026-02-05、GitHub リリース)
GitHub スター (ツールキット) 79 スター、24 フォーク、20 人の貢献者
GitHub スター (ムーンショット) 337 スター、65 フォーク、20 人の貢献者
フレームワークが最初にリリースされました 2022-05-25 (MVP)
GenAI フレームワークのアップデート 2025-05-29
サポートプラットフォーム ウェブ、API、デスクトップ

組織の背景: AI Verify Foundation はシンガポール政府機関 IMDA の完全子会社です。つまり、そのガバナンス フレームワークはシンガポールの AI ガバナンス ポリシー (およびそれをベンチマークする米国および欧州のフレームワーク) と自然に一致しており、国境を越えたコンプライアンス ニーズを持つ多国籍企業に適しています。

デュアル ツール戦略: AI Verify Toolkit は従来の教師あり学習モデル (分類/回帰、表形式/画像データ) をカバーし、Project Moonshot は LLM 評価とレッド チーム テストをカバーします。この 2 つは補完的ですが、重複しません。企業は、自社の AI 資産タイプに基づいて、対応するツール チェーンを選択する必要があります。

コミュニティ規模: 2 つの中核倉庫の合計は約 416 個のスターです。規模は小さいですが、寄稿者のほとんどはIMDA公式チームや政府関連機関からの参加者です。これは、自然発生的に成長するタイプのコミュニティではなく、政府主導のオープンソースです。

ユーザーと市場の認識

AI Verify の市場認識は、コミュニティの自発的な熱意ではなく、主に政府間の協力と多国籍企業の参加という 2 つのレベルに反映されています。

政府間ベンチマーク: AI Verify Testing Framework は、米国 NIST AI RMF、EU AI Act、OECD、G7 広島プロセスなどの国際枠組みとのクロスマッピング (クロスウォーク) を完了しました。 2025 年 5 月に、NIST AI RMF Generative AI プロファイルを備えた新しいバージョンの Crosswalk がリリースされました。これは、AI Verify を使用する企業は、複数の法域にわたるコンプライアンス要件に対処する際に、重複した評価のコストを削減できることを意味します。

エンタープライズ参加: プレミア メンバーには AWS、Dell、Google、IBM、Microsoft、Salesforce、Red Hat、Resaro などが含まれます。一般メンバーには Ant Group Temus、ACCA などが含まれ、テクノロジー、金融、監査などの複数の業界をカバーしています。これらのメンバーは財政的支援を提供するだけでなく、ツールの開発やテストの標準設定にも直接参加します。

パイロット検証: 2025 年 2 月に開始された Global AI Assurance Pilot には、30 以上の組織から 100 以上の参加者が集まり、金融から医療までの複数の業界における GenAI アプリケーションの実際のテストが行​​われました。テスト エコシステムの拡大を続けるために、2025 年 7 月に Global AI Assurance Sandbox にアップグレードされる予定です。

ユーザー レビュー: X0PA (AI 人材採用プラットフォーム) は、ツールキットを「AI システムの公平性を評価および改善するための堅牢なフレームワークを提供する」と評価し、デルは「組織が誠実で公正かつ公平なシステムを実現するための統一フレームワークを提供する」と述べ、シンガポール航空はこれが「AI システムの自己評価の優れた出発点」であると考えています。

コストメリット

AI Verify のコスト構造は政府の状況に直接関連しているため、商用 AI ガバナンス ツールとは大きく異なります。

C サイド/個人: AI Verify Testing Framework の PDF 版と Excel 版は無料でダウンロードして使用できます。 Project Moonshot と AI Verify Toolkit はどちらも Apache 2.0 オープンソースであり、ライセンス料はかかりません。個々の開発者または小規模チームは、GitHub から直接クローンを作成して使用できます。

API/開発者: Project Moonshot は、Python ライブラリ (pip install aiverify-moonshot[all])、Web API、および CLI を完全に無料で提供します。開発者は、LLM API 呼び出しのコスト (評価中にターゲット モデルを接続することで発生する推論コスト) とインフラストラクチャ コスト (GPU サーバーなど) を負担する必要があります。 AI Verify Toolkit は、ローカルまたは企業内に展開して実行する必要があります。

エンタープライズ/プライベート: すべてのツールはセルフホスト展開をサポートしており、ソフトウェア ライセンス料金はかかりません。企業の実際のコストは、導入と運用保守の人員、テストデータの準備 AI モデル API の呼び出し料金、コンプライアンス チームの学習フレームワークのアプリケーション コストに集中しています。サードパーティのテストと認証を必要とする企業向けに、AI テスター認定プログラム (2026 年 5 月開始) が、正式に認められたテスト サービス プロバイダーのリストを提供します。関連する監査料金は、サービスプロバイダーの見積りに応じて決まります。

無料の真実: オープンソースにライセンス料がかからないのは事実ですが、人材トレーニング、テスト コンテキストの構築、継続的なコンプライアンス監視など、AI Verify フレームワークの完全な実装に伴う隠れたコストは無視できません。商用 AI ガバナンス プラットフォーム (IBM AI Governance、Google Vertex AI Governance など) と比較して、AI Verify は明示的なコストが低くなりますが、より高い内部技術能力とガバナンスの成熟度が必要です。

主な機能

AI Verify のコア機能は 3 層構造に編成されており、各層は異なる使用役割に対応しています。

  • AI Verify Testing Framework (ガバナンス フレームワーク層): 11 の国際的な AI ガバナンス原則に対する構造化された評価方法を提供します。各原則には、「原則」→「結果」→「プロセス」→「証拠」の 4 層の漸進的な構造が含まれています。このフレームワークは、PDF/Excel フォームをダウンロードして単独で使用することも、Toolkit または Moonshot と組み合わせてコンプライアンス レポートを生成することもできます。コンプライアンス チームや監査人に最適です。

  • AI Verify Toolkit (従来の AI テスト レイヤー): 教師あり学習の分類および回帰モデルに対して、公平性 (バイアス検出)、堅牢性 (画像破損/敵対的サンプル)、解釈可能性 (SHAP 値)、セキュリティ (データ漏洩テスト) などの技術テストを提供します。テーブルデータと画像データをサポートしており、テスト完了後にカスタマイズされたレポートを生成できます。現在のバージョン 2.2.1 には、MAS のセキュリティ ベースライン要件を満たすために Veritas Financial Compliance Test Suite も統合されています。

  • プロジェクト ムーンショット (LLM 評価レイヤー): パフォーマンス (精度 BLEU)、信頼できるセキュリティ (バイアス、毒性、幻覚) などの多次元評価をカバーする 100 以上のオープン ソース ベンチマーク データ セットを提供します。自動化されたレッド チーム攻撃 (敵対的な手がかりを生成する生成 LLM と組み合わせた研究主導のアルゴリズム戦略に基づく) をサポートし、複数の LLM エンドポイントに対するテストを同時に実行します。 HTML インタラクティブ レポートと JSON 生データ エクスポートを提供し、CI/CD パイプライン統合をサポートします。現在のバージョンは0.7.6です。

隠れた連携: 3 つのレイヤーは独立して動作しません。フレームワーク レイヤーの評価結果は、Toolkit/Moonshot の技術テスト項目に直接マッピングでき、テスト レポートはフレームワーク レイヤーのコンプライアンス ステートメントを逆検証できます。たとえば、コンプライアンス チームはまずフレームワークを使用して原則レベルの自己検査を完了し、次にそれをエンジニアリング チームに渡し、ムーンショットを使用して特定のレッド チーム テストを実行します。最終的なテスト データはフレームワーク レポートに自動的にバックフィルされ、管理からテクノロジーへのリンクが形成されます。

モデルとバージョンの進化

関連情報は公開されていませんので、公式リアルタイムページをご参照ください。

技術的な利点

AI Verify の技術的利点は、単一のパフォーマンス パラメーターではなく、「政府レベルのフレームワークの一貫性 + オープンソース ツール チェーンの適用範囲」の組み合わせによってもたらされます。

フレームワークの調整: AI Verify テスト フレームワークは、NIST AI RMF、ISO 42001、および EU AI 法の最上位原則に相互マッピングされています。これは、企業が AI Verify を使用してコンプライアンス評価を実施する場合、その出力を部分的に再利用して他の管轄区域でのコンプライアンス レビューを処理できるため、繰り返しの評価にかかるコストを削減できることを意味します。そのメカニズムは、Crosswalk ドキュメントが単に整合性を宣言するのではなく、フレームワーク間の概念的な同等性を明確にマークすることです。

デュアル ツール チェーンはすべてのモードをカバーします: Toolkit は従来の ML のテーブル/画像モデルをカバーし、Moonshot は LLM のテキスト/ダイアログ モデルをカバーします。この 2 つはテスト方法では統一されていますが、テクノロジの実装では独立しています。このセグメント化により、従来の ML テスト手法を LLM シナリオに適用することが回避され、単一のツール チェーンが過度に拡張されるのを防ぎます。

モジュラー アーキテクチャ (2.0 以降): Toolkit 2.0 は、apigw (API ゲートウェイ)、portal (フロントエンド ポータル)、test-engine (テスト エンジン)、test-engine-worker (テスト作業ノード)、およびshared-library (共有ライブラリ) の 5 つのコンポーネント アーキテクチャにリファクタリングされています。テスト アルゴリズムは、リリース サイクル全体を妨げることなく、独立して開発、デプロイ、更新できる独立した Python モジュールとして実行されます。

自動化されたレッド チーム機能: Moonshot は、従来手作業に依存していたレッド チーム テストを部分的に自動化し、アルゴリズム戦略 (勾配/ルールベースの敵対的生成など) と生成的 LLM 支援テスト ケース生成を使用して、複数の LLM エンドポイントの並行攻撃テストを実現します。これが、Moonshot の純粋なベンチマーク ツールとの重要な差別化機能です。

該当するシナリオに関する注意事項: フレームワークの高度な調整によってもたらされる柔軟性は、フレームワークが特殊なソリューションほど深くないことも意味します。特定の種類の AI バイアスやセキュリティ脆弱性の検出には、Anthropic の脱獄評価フレームワークである Meta の Purple Llama などの特殊なツールを追加する必要がある場合があります。

使い方

AI Verify の使用入口は、さまざまな役割とテスト目標に基づいて 3 つのパスに分かれています。

使い方 群衆に適しています コア業務 コスト
テスト フレームワークのドキュメント コンプライアンス チーム、監査人 PDF/Excel をダウンロードし、11 原則に従って自己検査を完了し、調整レポートを生成します 無料
AI検証ツールキット データサイエンティスト ML エンジニア ローカル コンテキストのデプロイ、モデルとデータ セットの読み込み、公平性/堅牢性テストの実行、レポートのエクスポート 無料でオープンソースのため、独自のインフラストラクチャを準備する必要があります
プロジェクトムーンショット LLM 開発者、セキュリティ チーム pip install aiverify-moonshot[all]、LLM エンドポイントに接続、ベンチマークまたはレッド チーム攻撃の実行、HTML レポートの生成 無料のオープンソース、LLM API 呼び出し料金が必要

Project Moonshot をすぐに始めましょう:

「」バッシュ

Moonshot をインストールする

pip インストール「aiverify-moonshot[all]」

テストアセットとWeb UIのクローンを作成する

Python -m ムーンショット -i ムーンショットデータ -i ムーンショット ui

Web UIを起動する

Python -m ムーンショットウェブ

ブラウザを開きます http://localhost:3000/

または対話型 CLI を開始します

Python -m ムーンショット cli インタラクティブ 「」

一般的な実装パス: コンプライアンス チームは最初にフレームワーク PDF をダウンロードし、原則レベルの自己検査を完了します。 → 技術的検証が必要な AI システムを特定します。 → ML チームはツールキットを使用して従来のモデルの公平性/堅牢性テストを実行します。 → LLM チームは Moonshot を使用してベンチマークとレッド チーム テストを実行します。 → フレームワーク レポートにテスト結果をバックフィルします。 → 完全な AI Verify コンプライアンス レポートを生成します。

製品の価格設定

AI Verify のすべてのコア ツールは、Apache 2.0 ライセンスに基づくオープンソースであり、公開価格情報は次のとおりです。

  • C サイド/個人開発者: フレームワークのドキュメントは無料でダウンロードでき、Toolkit と Moonshot は完全にオープンソースで無料です。個人利用の場合、実際にかかる費用はLLM API呼び出し料(ムーンショットレビュー時点)とコンピュータインフラのみです。
  • チーム/エンタープライズセルフホスティング: ソフトウェアのライセンス料はゼロで、コストは展開と運用 (Docker/K8s)、ストレージ、およびコンピューティング リソースに集中します。ツールキットの展開には、少なくとも 4 コアと 16 GB の RAM を備えたサーバーが必要です。
  • サードパーティのテストと認定: AI Tester Accreditation Program (2026 年 5 月開始) は、正式に認められたサードパーティのテスト サービス プロバイダーを提供します。関連する監査および認証の料金は、サービス プロバイダーの見積もりの​​対象となります。正式な参考価格は非公開となっている。
  • 財団メンバー: 企業は、AI Verify Foundation に参加することで、戦略的影響力とガバナンス委員会の席を獲得できます。会費は正式な業務連絡の対象となり、標準価格は公開されていません。

商用ソリューションの比較: IBM AI Governance (資産量に応じて課金) や Google Vertex AI Governance (評価数に応じて課金) などの商用プラットフォームと比較すると、AI Verify のソフトウェア コストはゼロですが、企業はより強力な自己展開機能と自己運用機能を必要とします。総所有コスト (TCO) は、社内の人件費と商用プラットフォームのサブスクリプション料金とのトレードオフによって決まります。

アプリケーションのシナリオ

AI Verify の一般的な実装シナリオは、AI コンプライアンスとセキュリティ要件を満たす必要がある規制業界に集中しています。

  • 金融業界における AI コンプライアンス: MAS によって規制されている銀行、保険、その他の金融機関は、AI Verify ツールキットの Veritas スイートを使用して、信用スコアリング、不正行為防止、および MAS の AI ガバナンス ガイドラインを満たすその他のモデルの公平性と安全性を検証できます。フレームワークと組み合わせることで、規制検査に対応するための原則から証拠までのフルリンク文書を完成させることができます。

  • LLM セキュリティ ベンチマークとレッド チーム: 企業は、Project Moonshot を使用して、生成 AI アプリケーションを展開する前に、基本モデルと微調整されたモデルに対してベンチマーク (バイアス、毒性、幻覚) と自動レッド チーム攻撃を実行します。 Moonshot の HTML レポートは、AI 安全委員会のリスク レビューの基礎として直接機能します。本当の利点は、ヒューマンレッドチームを「オンデマンド実行」から「継続的統合」に移行することにあります。

  • 国境を越えた AI ガバナンスの連携: 米国と中国の両方で事業を展開しているシンガポール企業は、NIST AI RMF および ISO 42001 による AI Verify フレームワークのクロスマッピングを使用できます。一連の評価出力は、複数の場所でのコンプライアンス要件を同時に満たし、並行した評価作業の重複を削減できます。実際には、現地の法律や規制の違いに対処するために、追加のレビューが依然として必要です。

  • 政府および公共部門の AI 調達の受け入れ: 政府機関が AI システムを購入する場合、受け入れの定量的な根拠として、サプライヤーの成果物の 1 つとして AI Verify コンプライアンス レポートをリストすることができます。シンガポール政府はすでにこの慣行を推進しています。

該当する人

AI Verify の多層設計により、次の 3 種類の中核的な役割を果たすことができ、それぞれが異なるレベルの機能に重点を置いています。

  • コンプライアンスおよびリスク管理チーム: AI ガバナンスのフレームワークを構築し、規制検査に対応する必要があります。主に、テスト フレームワークの 11 原則の自己検査プロセスと Crosswalk マッピング ドキュメントを使用して、コンプライアンス レポートを作成します。前提条件は、AI ガバナンスの基本的な知識を持ち、規制要件 (EU AI 法、MAS ガイドラインなど) を理解していることです。

  • AI/ML エンジニアおよびデータ サイエンティスト: モデルの技術的安全性を検証する必要があります。従来の ML シナリオでは、公平性と堅牢性のテストに AI Verify Toolkit を使用します。 LLM シナリオでは、ベンチマークとレッド チーム テストに Project Moonshot を使用します。前提条件は、モデルのデプロイメント環境と Python/Pip ツール チェーンに精通していることです。

  • 第三者監査およびテスト機関: 独立した AI 監査サービスを提供します。 AI テスター認定プログラムを使用して正式に認められた資格を取得し、AI Verify ツール チェーンを使用して標準化されたテストを実行し、顧客向けに認定レポートを発行できます。

境界には適していません: AI Verify は、深くカスタマイズされた独自のセキュリティ戦略を必要とするチームには適していません (フレームワークは、特殊なソリューションではなく一般的なガイドラインを提供します)。 AI ガバナンスや内部プロセスを認識していない組織には適していません (ツールの導入には組織の成熟度の協力が必要です)。また、単一の次元のみを必要とする迅速な検出シナリオにも適していません (LLM 錯視のみをテストするなど、コミュニティ固有のツールはより軽量です)。

概要と展望

AI Verify の核となる価値は、政府機関が主導し、完全にオープンソースである珍しい AI ガバナンス テスト システムであることです。最上位層として国際的に整合した 11 のガバナンス原則に基づいており、Toolkit (従来型 AI) と Moonshot (LLM) という 2 つのツール チェーンを通じて原則からテクノロジーに至る完全な評価サイクルをカバーします。国境を越えたコンプライアンス要件に対処する必要がある規制対象企業に対して、「1 セットの評価を複数の場所で再利用する」パスを提供します。

現在の制限: ツール チェーンのコミュニティ サイズは、商用競合他社のコミュニティ サイズよりもはるかに小さく (2 つのコア ウェアハウスの合計は約 416 スター)、ドキュメントと技術サポートは公式 IMDA チームに依存しており、問題への対応と機能の反復の速度は、急速に進化している商用 AI ガバナンス プラットフォームほど速くありません。 Moonshot はまだベータ版であり、運用環境に大規模に導入する前に安定性を検証する必要があります。 Framework の自己評価モデルは当然、組織の誠実さに依存しており、独立した検証メカニズムが欠けています (このギャップは AI テスター認定プログラムによって埋められています)。

実装に関する提案: Framework PDF を使用して社内で原則レベルの簡単な自己検査を完了し (約 1 ~ 2 週間)、実際に技術的な検証が必要な AI システムの優先順位を特定し、対応するツール チェーン (Toolkit または Moonshot) を選択して 1 ~ 2 つのパイロット システムで技術テストを完了することをお勧めします。 Moonshot/Toolkit を購入する前に、企業は、テスト データと自社のシナリオの一致、ビジネス固有のリスクをカバーするレッド チーム モジュールの能力、対象となる規制管轄区域におけるフレームワーク レポートの受け入れの程度などの検証に重点を置く必要があります。

関連ツール: originality-ai、gptzero

AI Verifyのバージョン進化

AI Verify のバージョンの進化は、2 つの製品ラインに加えて、フレームワーク自体の反復に従って行われます。

AI Verify ツールキットのメインライン

  • 2.2.1 (2026-03-23): 実稼働環境での使用には、バグ修正とプラグインの更新を含む最新の安定バージョンが推奨されます。
  • 2.0.0 (~2025): アーキテクチャ再構築バージョン。単一のアプリケーションからモジュラー アーキテクチャ (apigw、ポータル、テスト エンジン、テスト エンジン ワーカー、共有ライブラリ) に分割され、独立したテスト アルゴリズム実行メカニズムと Veritas 財務コンプライアンスの統合が導入されています。
  • 1.0 (2022-05-25): MVP がリリースされ、従来の ML モデルの基本的な公平性と堅牢性のテストをサポートしました。

プロジェクト ムーンショット メイン ライン

  • 0.7.6 (2026-02-05): 最新バージョンは、IMDA スターター キットに統合された Web UI の改善とレッド チーム モジュールの機能強化をサポートしています。
  • 0.1.0 (2024-05-31): 「世界初の LLM 評価ツールキットの 1 つ」として位置付けられる、最初の公開リリース。
  • プロジェクトはまだベータ段階にあり、反復頻度は月に約 1 ~ 2 バージョンで、GitHub には 26 のリリースがあります。

フレームワークのマイルストーン

  • 2022-05-25: AI Verify テスト フレームワーク MVP が国際パイロット向けにリリースされました。
  • 2023-06-07: フレームワークとツールキットは完全にオープンソースとなり、AI Verify Foundation が設立されました。
  • 2023-10-13: 米国 NIST AI RMF とのクロスマッピング リリース。
  • 2024-05-31: Project Moonshot がリリースされ、GenAI のモデル AI ガバナンス フレームワークがリリースされました。
  • 2025-05-29: フレームワークの拡張バージョンがリリースされ、GenAI 評価を正式にカバーし、NIST GenAI プロファイル、広島プロセス CoC、および ISO 42001 とのクロスマッピングが追加されました。
  • 2026-05-18: サードパーティの AI テストおよび認定システムを確立するために、AI テスター認定プログラムが開始されました。

バージョン情報

  • AI 検証ツールキット 2.2.1 :AI Verify Toolkit の最新の安定バージョンは、モジュラー アーキテクチャに基づいて書き直されており、独立したテスト アルゴリズム モジュールの動作、再設計されたバックエンド テスト エンジン、フロントエンド ワークフローの新しいバージョンの Veritas 財務コンプライアンス統合、および強化されたコンピューター ビジョン テストのサポートをサポートしています。
  • AI 検証ツールキット 2.0.0 :主要なアーキテクチャのアップグレード、モジュラー設計の採用、独立したテスト アルゴリズム エンジンの導入、新しいフロントエンド ワークフロー、および Veritas 財務コンプライアンス テスト スイートの統合。公式の正確な日付はまだありません。
  • プロジェクトムーンショット0.7.6 :最新バージョンの Project Moonshot (LLM 評価ツールキット) は、100 を超えるベンチマーク データ セット、自動化されたレッド チーム攻撃モジュール Web UI、および CLI デュアル オペレーション インターフェイス CI/CD 統合レポート生成をサポートしています。
  • AI検証MVP :AI Verify テスト フレームワークとソフトウェア ツールキットは、国際社会からパイロットとフィードバックを募り、MVP の形で初めてリリースされ、IMDA と PDPC によって共同で立ち上げられました。

ユーザーレビュー

  • レビューを読み込み中...