OpenAI、「2 つの設定」で ARC-AGI-3 スコアを 3 倍に向上: ベンチマークは信頼の危機に直面

OpenAIは7月29日に調査レポートを発表し、「2つの設定」によりARC-AGI-3ベンチマークでのモデルのスコアが3倍になる可能性があることを明らかにし、評価結果が推論/デコード設定と強く関連していることを明らかにし、「評価構成の依存性」によって引き起こされる誤って高い結果に注意するよう業界に注意を喚起した。

7 月 29 日、OpenAI は「自身の欠点を明らかにした」と思われる調査レポートを発表しました。「2 つの設定」によって、ARC-AGI-3 ベンチマークでのモデルのスコアが 3 倍に増加する可能性があることが明らかになりました。 「設定」によってさえ 3 倍の違いが生じる可能性がある場合、モデル間の実際の能力の差をどのように測定すればよいでしょうか?

ARC-AGI-3 とは

ARC-AGI (Abstraction and Reasoning Corpus for AGI) は、モデルの「新しい問題の解決/抽象推論」能力を測定するための重要なベンチマークであり、「人間らしい抽象推論」のベンチマークとして広く認識されています。その第 3 世代 (ARC-AGI-3) では、モデルの一般化機能と推論機能に対してより高い要件が課されています。 OpenAI は、特定の推論/デコード設定 (通常は推論バジェット、検索戦略、またはサンプリングに関連する) がパフォーマンスに大きな影響を及ぼしていることを発見しました。わずか 2 つの項目を調整するだけで 3 倍の向上が得られました。

方法論的な思い出

このレポートの中核となる価値は結果ではなく、方法論的な注意点にあります。 モデルの「実際の能力」は「評価設定」と強く関連しています。評価結果を水平に比較するには、その前に評価結果が統一された構成の下にある必要があります。これは、「特定のモデルのスコアが X である」などの物語の基礎を直接揺るがします。他の誰かが別の推論予算を使用してより高いスコアを実行した場合、このスコアはどれほど説得力があるでしょうか?

このリマインダーが適切であることは明らかです。つい数日前 (7 月 24 日)、ChatGPT の古いライバルである Anthropic は、Claude Opus 5 の発表会で、その ARC-AGI 3 スコアが次善のモデルよりも 3 倍高いと主張しました。 ARC-AGI-3 を巡る OpenAI と Anthropic 間の「攻防」は、モデルの能力物語の中核としての 2026 年の「推論ベースライン」の状況を正確に反映していますが、同時に「誰が高いスコアを獲得するか」という問題をますます混乱させています。

業界の観点から、このレポートは、ベンチマーク スコアがマーケティングの武器になると、メーカーは「機能」ではなく「構成」を最適化するという、広がりつつある業界現象を明らかにしています。これは、国内の大規模モデル評価エコシステムに対する重要な警告です。公開リストであれ、内部評価であれ、「推論予算、サンプリング設定、評価プロトコル」が明確かつ統一されていなければ、スコアは単なる無意味な数字遊びになってしまいます。本当の意味での能力比較は、最終的には「均一な条件下での再現性のある評価」に戻ってきます。

将来的に追跡する価値のあるいくつかの方向性:

  1. 「2 つの設定」の具体的な内容: OpenAI が再現のために完全な設定内容を公開するかどうか。
  2. 評価仕様に関する業界のコンセンサス: 統一された ARC-AGI-3 評価プロトコルが存在するかどうか。
  3. Anthropic の回答: 「構成の依存性」の疑問に直面して、Opus 5 の ARC-AGI 3 スコアはどのように自己認証されますか。
  4. 国内評価基準の見直し: 公開リストにより評価構成の開示要件が強化されるかどうか。
著作権:コンテンツソース OpenAI公式ニュース(リサーチ) 。このプラットフォームは、情報提供と学習交流の目的でコンテンツを編集・整理しています。著作権に関する問題がございましたら、お問い合わせください。

レビュー

  • レビューを読み込み中...