OpenAI 用"两项设置"把 ARC-AGI-3 得分翻三倍:基准评测遭遇信任危机

OpenAI 7 月 29 日发布研究报告,披露通过"两项设置"即可将模型在 ARC-AGI-3 基准上的得分提升至三倍,揭示评测结果与推理/解码设置强相关,提醒业界警惕"评测配置依赖"导致的成绩虚高。

7 月 29 日,OpenAI 发布了一篇看似"自曝其短"的研究报告:披露通过"两项设置"即可将模型在 ARC-AGI-3 基准上的得分提升至三倍。如果连"设置"都能带来三倍差异,那么模型之间的真实能力差距,到底该怎么衡量?

ARC-AGI-3 是什么

ARC-AGI(Abstraction and Reasoning Corpus for AGI)是衡量模型"解决全新问题/抽象推理"能力的重要基准,被广泛视为"类人抽象推理"的标尺。其第 3 代(ARC-AGI-3)对模型的泛化与推理能力提出了更高要求。OpenAI 发现,某些推理/解码设置(通常与推理预算、搜索策略或采样相关)对成绩有巨大影响——仅调整两项即可实现三倍跃升。

一个方法论级别的提醒

这篇报告的核心价值不在结果,而在方法论提醒:模型的"真实能力"与"评测设置"强相关,评测结果必须在统一配置下才可横向比较。这直接动摇了"某模型得分 X"这类叙事的基础——如果别人用不同的推理预算跑出更高的分,这个分还有多少说服力?

这个提醒的针对性相当明显。就在几天前(7 月 24 日),ChatGPT 背后的老对手 Anthropic 在 Claude Opus 5 发布时宣称其 ARC-AGI 3 得分是次优模型的 3 倍。OpenAI 与 Anthropic 围绕 ARC-AGI-3 的"攻防",恰恰体现了 2026 年"推理基准"作为模型能力叙事核心的地位——但也让"谁得分高"这个问题变得愈发扑朔迷离。

从行业视角看,这篇报告揭示了一个正在蔓延的行业现象:当基准分数成为营销武器,厂商就会优化"配置"而非"能力"。对国内大模型评测生态而言,这是一个重要的警示——无论是公开榜单还是内部评测,都必须明确并统一"推理预算、采样设置、评测协议",否则分数只会变成一场没有意义的数字游戏。真正的能力比较,终将回到"统一条件下的可复现评测"。

后续值得跟踪的几个方向:

  1. "两项设置"的具体内容:OpenAI 是否会公开完整设置细节供复现。
  2. 评测规范的行业共识:是否会出现统一的 ARC-AGI-3 评测协议。
  3. Anthropic 的回应:面对"配置依赖"质疑,Opus 5 的 ARC-AGI 3 得分如何自证。
  4. 国内评测标准的修订:公开榜单是否会收紧评测配置的披露要求。
版权声明:本文内容来自 OpenAI 官方新闻(研究) 。本平台对该内容进行了编译和整理,仅用于信息传播和学习交流之用。如有侵权,请联系我们进行处理。

用户评价

  • 加载评价中...