DeepSeek V4 が数学的証明: プリンストン大学のチームは 170,000 ドルのタスクを 294 ドルで完了、500 倍のコスト優位性
プリンストン大学のチームは、DeepSeek V4 Flash を使用して Goedel-Architect を構築し、PutnamBench を 294 ドル (以前は 170,000 ドル必要) で完成させ、合格率は 75.6% で、ヒルベルトを上回りました。 MiniF2Fは初めて全244問をクリアした。
DeepSeek V4 は数学的証明を行う: プリンストン大学は 500 倍のコスト優位性で記録を破る
数学の分野は AI によって大きな影響を受けています。 2026 年 5 月、OpenAI は 80 年にわたる「単位距離の予想」を覆しました。フィールズ賞受賞者のガワーズ氏は、これを「画期的なマイルストーン」と呼んだ。テレンス・タオは、すべての新しい証明をリアルタイムで追跡することをやめる、「数学は証明不足の時代から証明過剰の時代に移行している」と発表した。
このような背景を背景に、プリンストン大学 PLI チーム (Sanjeev Arora + Chen Danqi) は、DeepSeek V4 Flash を使用して Goedel-Architect エージェント フレームワークを構築し、PutnamBench の 672 問すべてを 294 ドルで回答しました。Google Gemini 2.5 Pro を使用した以前の Hilbert システムには 170,000 ドルが必要でした。合格率は 75.6% 対 70.0% で、コストの優位性は約 500 倍です。 MiniF2F テストは 99.2% に達し、244 問すべてをクリアした最初のシステムとなりました。
Goedel-Architect の核となるイノベーション
「ブループリント」の概念は、Goedel-Architect の重要なブレークスルーです。証明する前に、補助定理のすべての定義と依存関係を含む有向非巡回グラフが生成され、並列処理のためにリーン証明器に配布されます。失敗は終わりではなく、診断信号です。システムは自動的に誤った命題を修正し、「設計図の改良」を通じて証明が困難な補題を分解します。制御変数を使用した実験により、500 倍のコスト優位性の鍵は、より優れたモデルではなくパイプライン設計にあることが証明されました。
コア研究開発チーム
PLI の創設ディレクターである Sanjeev Arora (ACM Computing Award 受賞者) と Chen Danqi (Google Scholar の引用数 90,000 以上、清華大学の学部生/スタンフォード博士) が共同で指揮を執っています。チームは以前に、MiniF2F を 60% から 90% に改善する Goedel-Prover シリーズをリリースしました。
ベンチマーク結果
- PutnamBench: 75.6% 合格@1 (ヒルベルト 70.0%)、自然言語支援後 88.8%
- MiniF2F テスト: 99.2% (244 の質問すべてを最初にクリアした人)
- IMO 2025: 4/6 の質問
- パットナム 2025: 11/12 の質問
- USAMO 2026: 3/6 問 (汚染耐性テスト)
500 倍のコスト優位性は、DeepSeek の究極のコスト効率とブループリント改良フレームワークの二重の革新によってもたらされます。形式定理の証明は、AI の調整と信頼性にとって重要な方向性です。リーン コンパイラーは、どのピア レビューよりも信頼性の高い確実性を提供します。さらに象徴的なのは、プリンストン大学のトップチームが、世界の AI 研究エコシステムに重大な影響を与えるこの画期的な研究を完了するために、アメリカのクローズドソース モデルではなく中国のオープンソース モデルを選択したことです。
フォローアップする価値があります:
- オープンソースの普及: Goedel-Architect フレームワークを他のモデル (Doubao/GLM) で使用して、同様の効果を再現できますか?
- 研究生態学的シグナル: 中国のオープンソース モデルを使用するというプリンストン大学の決定が世界の AI 学術コミュニティに与える影響
- 形式的検証の産業化: 主要なソフトウェア検証、スマートコントラクト監査、その他のシナリオでの応用の見通し
レビュー