AI Verify 免费

-

AI Verify 是由新加坡 IMDA 旗下 AI Verify 基金会主导的开源 AI 治理测试框架与软件工具集,包含 AI Verify Testing Framework(11 项国际 AI 治理原则评估框架)、AI Verify Toolkit(传统 AI 模型测试工具)和 Project Moonshot(LLM 评测与红队测试工具包),覆盖从传统 ML 到生成式 AI 的合规测试需求。

AI Verify 产品界面

AI Verify

核心参数与统计

AI Verify 是由新加坡资讯通信媒体发展局(IMDA)旗下 AI Verify 基金会主导的开源 AI 治理测试框架与软件工具集,非单一产品,而是由三层能力构成:AI Verify Testing Framework(治理框架)、AI Verify Toolkit(传统 AI 测试软件)和 Project Moonshot(LLM 评测工具包)。

项目 公开信息
官方定位 AI governance testing framework and software toolkit
组织性质 IMDA 全资非营利子公司
开源许可 Apache 2.0
治理原则 11 项国际 AI 治理原则
Toolkit 最新版本 2.2.1(2026-03-23,GitHub Releases)
Moonshot 最新版本 0.7.6(2026-02-05,GitHub Releases)
GitHub Stars(Toolkit) 79 stars、24 forks、20 contributors
GitHub Stars(Moonshot) 337 stars、65 forks、20 contributors
框架首次发布 2022-05-25(MVP)
GenAI 框架更新 2025-05-29
支持平台 Web、API、Desktop

组织背景:AI Verify 基金会是新加坡政府机构 IMDA 的全资子公司,这意味着它的治理框架天然与新加坡 AI 治理政策(以及与之对标的美欧框架)保持一致,适合有跨境合规需求的跨国企业。

双工具策略:AI Verify Toolkit 覆盖传统监督学习模型(分类/回归、表格/图像数据),Project Moonshot 覆盖 LLM 评测与红队测试,两者互补但不重叠。企业需根据自身 AI 资产类型选择对应工具链。

社区规模:两个核心仓库合计约 416 stars,规模不大但贡献者多来自 IMDA 官方团队与政府关联机构,属于政府主导型开源,而非社区自发生长型。

用户与市场认可

AI Verify 的市场认可主要体现在政府间合作与跨国企业参与两个层面,而非社区自发热度。

政府间对标:AI Verify Testing Framework 已与美国 NIST AI RMF、欧盟 AI Act、OECD、G7 广岛进程等国际框架完成交叉映射(Crosswalk),2025 年 5 月发布了与 NIST AI RMF Generative AI Profile 的新版 Crosswalk。这意味着采用 AI Verify 的企业在应对多司法管辖区合规要求时,可降低重复评估成本。

企业参与:Premier 成员包括 AWS、Dell、Google、IBM、Microsoft、Salesforce、Red Hat、Resaro 等,General 成员包括蚂蚁集团Temus、ACCA 等,覆盖科技、金融、审计等多行业。这些成员不仅提供资金支持,也直接参与工具开发与测试标准制定。

试点验证:2025 年 2 月启动的 Global AI Assurance Pilot 吸引了 30+ 组织100+ 参与者,涵盖从金融到医疗的多行业 GenAI 应用实测。2025 年 7 月升级为 Global AI Assurance Sandbox,持续扩大测试生态。

用户评价:X0PA(AI 招聘平台)评价 Toolkit "提供了评估和改进 AI 系统公平性的稳健框架",Dell 称其 "为组织实现诚实、公平和公平的系统提供了统一框架",新加坡航空认为它是 "进行 AI 系统自我评估的绝佳起点"。

成本优势

AI Verify 的成本结构与其政府背景直接相关,与商业 AI 治理工具形成明显差异。

C 端/个人:AI Verify Testing Framework 的 PDF 和 Excel 版本可免费下载使用,Project Moonshot 和 AI Verify Toolkit 均为 Apache 2.0 开源,无任何许可费用。个人开发者或小团队可以直接从 GitHub 克隆使用。

API/开发者:Project Moonshot 提供 Python 库(pip install aiverify-moonshot[all])、Web API 和 CLI,完全免费。开发者需自行承担 LLM API 调用费用(测评时连接目标模型产生的推理成本)和基础设施成本(如 GPU 服务器)。AI Verify Toolkit 则需在本地或企业有境部署运行。

企业/私有化:所有工具均支持自托管部署,无软件许可费。企业实际成本集中在:部署与运维人力、测试数据准备AI 模型 API 调用费、以及合规团队学习框架的应用成本。对于需要第三方测试认证的企业,AI Tester Accreditation Programme(2026 年 5 月启动)提供了官方认可的测试服务商名录,相关审计费用以服务商报价为准。

免费的真相:开源无许可费是真,但完整落地 AI Verify 框架涉及的人员培训、测试有境搭建、持续合规监控等隐性成本不容忽视。与商业 AI 治理平台(如 IBM AI Governance、Google Vertex AI Governance)相比,AI Verify 的显性成本更低,但需要更强的内部技术能力和治理成熟度。

主要功能

AI Verify 的核心能力按三层结构组织,每层面向不同的使用角色:

  • AI Verify Testing Framework(治理框架层):提供 11 项国际 AI 治理原则的结构化评估方法,每项原则包含 Principle→Outcome→Process→Evidence 四层递进结构。框架可通过下载 PDF/Excel 表单独立使用,也可结合 Toolkit 或 Moonshot 生成合规报告。适合合规团队与审计人员。

  • AI Verify Toolkit(传统 AI 测试层):针对监督学习的分类与回归模型,提供公平性(偏置检测)、鲁棒性(图像损坏/对抗样本)、可解释性(SHAP 值)、安全性(数据泄露测试)等技术测试。支持表格数据与图像数据,测试完成后可生成自定义报告。当前版本 2.2.1 还集成了 Veritas 金融合规测试套件,满足金管局 MAS 的安全基线要求。

  • Project Moonshot(LLM 评测层):提供 100+ 开源基准数据集,覆盖性能(准确率BLEU)、可信安全(偏见、毒性、幻觉)等多维评估。支持自动化红队攻击(基于研究驱动的算法策略与生成式 LLM 相结合产生对抗提示),可同时对多个 LLM 端点执行测试。提供 HTML 交互式报告和 JSON 原始数据导出,支持 CI/CD 流水线集成。当前版本 0.7.6。

隐藏联动:三层并非独立运行——框架层的评估结果可直接映射到 Toolkit/Moonshot 的技术测试项,测试报告又能反向验证框架层的合规声明。例如,合规团队先用框架完成原则级自查,再交由工程团队用 Moonshot 执行具体的红队测试,最终测试数据自动回填框架报告,形成从治理到技术的闭有。

模型与版本演进

相关信息未公开,以官方实时页面为准。

技术优势

AI Verify 的技术优势来自"政府级框架一致性 + 开源工具链覆盖"的组合,而非单一性能参数。

框架对齐:AI Verify Testing Framework 已与 NIST AI RMF、ISO 42001、EU AI Act 的顶级原则完成交叉映射。这意味着企业采用 AI Verify 进行合规评估时,其产出可部分复用应对其他司法管辖区的合规审查,减少重复评估成本。机制在于 Crosswalk 文档明确标注了框架间的概念等价关系,而非简单声明对齐。

双工具链覆盖全模态:Toolkit 覆盖传统 ML 的表格/图像模型,Moonshot 覆盖 LLM 的文本/对话模型,两者在测试方法论上统一但技术实现独立。这种切分避免了将传统 ML 的测试方法生搬硬套到 LLM 场景,也防止了单一工具链过度膨胀。

模块化架构(2.0+):Toolkit 2.0 重构为 apigw(API 网关)、portal(前端门户)、test-engine(测试引擎)、test-engine-worker(测试工作节点)、shared-library(共享库)五组件架构。测试算法以独立 Python 模块运行,可单独开发、部署和更新,不阻塞整体发布周期。

自动化红队能力:Moonshot 将传统依赖人工的红队测试部分自动化,通过算法策略(如基于梯度/规则的对抗生成)和生成式 LLM 辅助生成测试用例,实现多 LLM 端点的并行攻击测试。这是 Moonshot 区别于单纯基准测试工具的关键差异化能力。

适用场景提醒:框架的高对齐度带来的灵活性也意味着深度不及专门化方案。在检测特定类型的 AI 偏见或安全漏洞时,可能需要结合专用工具(如 Anthropic 的越狱评估框架Meta 的 Purple Llama)做补充。

如何使用

AI Verify 的使用入口因角色和测试目标不同分为三条路径:

使用方式 适合人群 核心操作 成本
Testing Framework 文档 合规团队、审计人员 下载 PDF/Excel,按 11 项原则完成自查,生成对齐报告 免费
AI Verify Toolkit 数据科学家ML 工程师 部署本地有境,加载模型与数据集,运行公平性/鲁棒性测试,导出报告 免费开源,需自备基础设施
Project Moonshot LLM 开发者、安全团队 pip install aiverify-moonshot[all],连接 LLM 端点,运行基准测试或红队攻击,生成 HTML 报告 免费开源,需承担 LLM API 调用费

快速上手 Project Moonshot

# 安装 Moonshot
pip install "aiverify-moonshot[all]"

# 克隆测试资产与 Web UI
python -m moonshot -i moonshot-data -i moonshot-ui

# 启动 Web UI
python -m moonshot web
# 浏览器打开 http://localhost:3000/

# 或启动交互式 CLI
python -m moonshot cli interactive

典型落地路径:合规团队先下载 Framework PDF 完成原则级自查 → 识别需要技术验证的 AI 系统 → ML 团队用 Toolkit 运行传统模型的公平性/鲁棒性测试 → LLM 团队用 Moonshot 执行基准评测与红队测试 → 测试结果回填框架报告 → 生成完整 AI Verify 合规报告。

产品定价

AI Verify 的所有核心工具均以 Apache 2.0 许可证开源,公开定价信息如下:

  • C 端/个人开发者:Framework 文档免费下载,Toolkit 和 Moonshot 完全开源免费。个人使用时,实际成本仅为 LLM API 调用费(Moonshot 评测时)和电脑基础设施。
  • 团队/企业自托管:软件零许可费,成本集中在部署运维(Docker/K8s)、存储与计算资源。Toolkit 部署需要至少 4 核 16GB 内存的服务器。
  • 第三方测试认证:AI Tester Accreditation Programme(2026 年 5 月启动)提供官方认可的第三方测试服务商,相关审计与认证费用以服务商报价为准,官方未公开参考价格。
  • 基金会会员:企业可通过加入 AI Verify Foundation 获取战略影响力和治理委员会席位,会员费以官方商务沟通为准,未公开标准价格。

对比商业方案:与 IBM AI Governance(按资产量计费)、Google Vertex AI Governance(按评估次数计费)等商业平台相比,AI Verify 的软件成本为零,但需要企业具备更强的自部署和自运营能力。总体拥有成本(TCO)取决于内部人力投入 vs 商业平台订阅费的权衡。

应用场景

AI Verify 的典型落地场景集中在需要满足 AI 合规与安全要求的受监管行业:

  • 金融行业 AI 合规:银行、保险等受 MAS 监管的金融机构可用 AI Verify Toolkit 中的 Veritas 套件验证信用评分、反欺诈等模型的公平性与安全性,满足金管局 AI 治理指引。结合 Framework 完成从原则到证据的全链路留档,应对监管检查。

  • LLM 安全评测与红队演练:企业在部署生成式 AI 应用前,使用 Project Moonshot 对基座模型和微调模型执行基准测试(偏见、毒性、幻觉)和自动化红队攻击。Moonshot 的 HTML 报告可直接作为 AI 安全委员会的风险评审依据。实际收益在于将人工红队从"按需执行"转为"持续集成"。

  • 跨境 AI 治理对齐:在美国和中国均有业务的新加坡企业,可利用 AI Verify Framework 与 NIST AI RMF、ISO 42001 的交叉映射,一套评估产出同时满足多地合规要求,减少平行评估的重复工作。实操中仍需针对各地法规差异做补充审查。

  • 政府与公共部门 AI 采购验收:政府机构在采购 AI 系统时,可将 AI Verify 合规报告列为供应商的交付物之一,作为验收的可量化依据。新加坡政府已在推动此实践。

适用人群

AI Verify 的多层设计使其服务于三类核心角色,每类角色关注的能力层级不同:

  • 合规与风控团队:需要搭建 AI 治理框架、应对监管检查。主要使用 Testing Framework 的 11 项原则自查流程和 Crosswalk 映射文档,产出合规报告。前置条件是具备 AI 治理基础认知,理解监管要求(如 EU AI Act、MAS 指引)。

  • AI/ML 工程师与数据科学家:需要验证模型的技术安全性。传统 ML 场景使用 AI Verify Toolkit 进行公平性、鲁棒性测试;LLM 场景使用 Project Moonshot 进行基准评测和红队测试。前置条件是熟悉模型部署有境和 Python/Pip 工具链。

  • 第三方审计与测试机构:提供独立 AI 审计服务。可利用 AI Tester Accreditation Programme 获取官方认可资质,使用 AI Verify 工具链为客户执行标准化测试并出具认证报告。

不适配边界:AI Verify 不适合需要深度定制化原创安全策略的团队(框架提供通用指南而非专精方案);不适合完全没有 AI 治理意识和内部流程的组织(工具落地需要组织成熟度配合);也不适合仅需单一维度的快速检测场景(如只测 LLM 幻觉,社区专用工具更轻量)。

总结与展望

AI Verify 的核心价值在于它是少有的、由政府机构主导且全面开源的 AI 治理测试体系。它以 11 项国际对齐的治理原则为顶层,通过 Toolkit(传统 AI)和 Moonshot(LLM)两条工具链覆盖从原则到技术的完整评估闭有。对于需要应对跨境合规要求的受监管企业,它提供了一条"一套评估、多地复用"的路径。

当前限制:工具链的社区规模远小于商业竞品(两个核心仓库合计约 416 stars),文档和技术支持依赖于 IMDA 官方团队,问题响应和功能迭代速度不及快速演进的商业 AI 治理平台。Moonshot 仍处于 Beta 阶段,在生产有境中大规模部署前需验证稳定性。Framework 的自我评估模式天然依赖组织诚实性,缺乏独立验证机制(此缺口正由 AI Tester Accreditation Programme 补充)。

落地建议:建议先用 Framework PDF 在内部完成一轮快速原则级自查(约 1-2 周),识别出真正需要技术验证的 AI 系统优先级,再选择对应工具链(Toolkit 或 Moonshot)在 1-2 个试点系统上完成技术测试。企业采购 Moonshot/Toolkit 前,需重点核实:测试数据与自身场景的匹配度、红队模块对业务特有风险的覆盖能力、以及 Framework 报告在目标监管辖区内的采信程度。

AI Verify 的版本演进

AI Verify 的版本脉络按两条产品线演进,外加框架本身的迭代。

AI Verify Toolkit 主线

  • 2.2.1(2026-03-23):当前最新稳定版,包含 Bug 修复与插件更新,推荐生产有境采用。
  • 2.0.0(~2025):架构重构版本,从单体应用拆分为模块化架构(apigw、portal、test-engine、test-engine-worker、shared-library),引入独立测试算法运行机制和 Veritas 金融合规集成。
  • 1.0(2022-05-25):MVP 发布,支持传统 ML 模型的基础公平性与鲁棒性测试。

Project Moonshot 主线

  • 0.7.6(2026-02-05):当前最新版,支持 IMDA Starter Kit 集成Web UI 改进、红队模块增强。
  • 0.1.0(2024-05-31):首次公开发布,定位为"世界首批 LLM 评测工具包之一"。
  • 项目仍处于 Beta 阶段,迭代频率约每月 1-2 个版本,GitHub 已有 26 个 Release。

框架里程碑

  • 2022-05-25:AI Verify 测试框架 MVP 发布,面向国际试点。
  • 2023-06-07:框架与工具包全面开源,AI Verify 基金会成立。
  • 2023-10-13:与美国 NIST AI RMF 交叉映射发布。
  • 2024-05-31:Project Moonshot 发布,Model AI Governance Framework for GenAI 发布。
  • 2025-05-29:增强版框架发布,正式覆盖 GenAI 评估,新增与 NIST GenAI Profile、Hiroshima Process CoC、ISO 42001 的交叉映射。
  • 2026-05-18:AI Tester Accreditation Programme 启动,建立第三方 AI 测试认证体系。

限制与不适配场景

该工具在以下场景中存在使用限制:

场景适配边界 需要高度行业专业知识的任务、对输出格式有严格规范的场景、需要零错误的自动化流程可能效果不达预期。AI 输出应作为初稿或辅助参考,最终结果需人工核验。

技术限制 上下文长度有限、复杂推理准确性可能不足、免费版有使用额度。建议在正式采用前通过试用验证核心场景的可用性。

版本信息

  • AI Verify Toolkit 2.2.1 :AI Verify Toolkit 最新稳定版,基于模块化架构重写,支持独立测试算法模块运行、重新设计的后端测试引擎、新版前端工作流Veritas 金融合规集成以及增强的计算机视觉测试支持。
  • Project Moonshot 0.7.6 :Project Moonshot(LLM 评测工具包)最新版本,支持 100+ 基准数据集、自动化红队攻击模块Web UI 与 CLI 双操作界面CI/CD 集成报告生成。
  • AI Verify MVP :AI Verify 测试框架与软件工具包首次以 MVP 形式发布,面向国际征集试点与反馈,由 IMDA 与 PDPC 联合推出。
  • AI Verify Toolkit 2.0.0 :重大架构升级,采用模块化设计,引入独立测试算法引擎、全新前端工作流,集成 Veritas 金融合规测试套件。暂无官方精确日期。

用户评价

  • 加载评价中...