絶対零度
無料
Absolute Zero は、清華大学およびその他の機関によって提案された、ゼロ人工データ推論モデルのトレーニング パラダイムです。中心となるアイデアは、言語モデルをプロポーザーとソルバーの両方として使用し、コード実行プログラムを通じて検証可能な報酬シグナルを提供し、手動のアノテーションを必要とせずにコードと数学的推論の機能を継続的に改善することです。
絶対零度の完全レビュー
コアパラメータと統計
| プロジェクト | 仕様 |
|---|---|
| 製品のポジショニング | ゼロデータ推論モデルのトレーニング パラダイム |
| 開発庁 | 清華大学 LeapLab、BIGAI、ペンシルベニア州立大学 |
| オープンソース ライセンス | MITライセンス |
| テクニカルルート | 強化学習セルフゲーム + コード実行プログラムの検証 |
| モデルサイズ | 3B / 7B / 14B (公共検問所あり) |
| トレーニング リソース | 3B ≈ 2×80GB GPU; 7B ≈ 4×80GB GPU。 14B ≈ 8×80GB GPU |
| 推論モード | 演繹、アブダクション、帰納 |
| 紙のアドレス | arxiv.org/abs/2505.03335 |
「絶対零度は製品ですか?」と疑問に思うかもしれません。いいえ、これは「モデルに学習させる」トレーニング方法に似ています。これは、学生が自分でテスト用紙を書き、質問に答え、自分で修正し、間違いから学ぶようなものです。プロセス全体に教師 (ヒューマン アノテーター) の参加は必要ありません。
ユーザーと市場の認識
Absolute Zero は 2025 年 5 月に arXiv 論文を通じて一般公開され、同時期に完全な実装が GitHub と Hugging Face でオープンソース化されました。これは一般向けの SaaS 製品ではありませんが、人間がラベル付けしたデータがなくなったときにモデルをどのように改善できるかという、LLM 分野の基本的な質問に答えるものであるため、研究コミュニティで注目を集めています。 **
- 学術的影響: 論文で提案されている「ゼロデータ推論」パラダイムは、人工選好に依存する RLHF の従来のルートに直接挑戦し、RLVR (検証可能な報酬を伴う強化学習) の新しい実用的な道を提供します。
- コミュニティ活動: GitHub リポジトリは非常に完成度が高く (トレーニング コード、評価、モデルの重み変換ツール、W&B ログを含む)、研究者は論文の結果を直接再現できます。スターの特定の数は、ウェアハウスからのリアルタイム データの影響を受けます。
- 業界ベンチマーク: DeepSeek-R1 の強化学習推論トレーニングと OpenAI o1 の連鎖推論のアイデアを補完します。ただし、Absolute Zero は「人工データゼロ」を主張する点でより過激です。
コストメリット
| 請求の次元 | 現在の状況 |
|---|---|
| フレームワークとコード | MIT オープンソースで無料 |
| モデルのチェックポイント | ハグフェイス公開ダウンロード |
| API サービス | 提供されていません |
| エンタープライズ テクニカル サポート | 未公開 |
無料の真実: コードとモデルは無料ですが、トレーニングには実際の GPU が必要です。公式のリファレンス構成 (3B モデルでは約 2 A100-80GB、14B モデルでは約 8 GB) は、典型的な実験におけるクラウド GPU コストが数千ドルから数万ドルの範囲であることを意味します。 「無料」のものはソフトウェアであり、高価なものはコンピューティング能力です。
コストの階層化
- C サイド/個人研究者: 公式に提供されている 3B チェックポイントを推論と実験の微調整に使用できます。 8 A100 ~ 80GB の料金は 1 時間あたり約 16 ~ 24 米ドルです。再トレーニングではなく推論のみを行う必要がある場合は、24GB のビデオ メモリを搭載した 1 枚のカードで 3B モデルを実行できます。
- 開発者/API: パブリック API はありません。独自の推論サービスを構築する必要があります。
- 企業/機関: 内部データでトレーニング プロセスを再現する必要がある場合は、独自の GPU クラスターを準備する必要があります。 MIT ライセンスでは商用利用が許可されていますが、README には、Python エグゼキュータは 研究用途 に限定されており、実稼働環境のセキュリティは自分で強化する必要があると明記されています。
隠れたメリット: 推論トレーニング方法を研究しているチームにとって、Absolute Zero は高度に設計されたベースライン (完全なトレーニング/評価コード、セルフゲーム コンテキスト、ログ システム) を提供します。これにより、チームは同じワークロードを最初から構築するのに約数か月かかりますが、エンドツーエンドのゼロデータ推論トレーニング実験を数日で実行できます。
宣伝性の検証: 論文では「人工データがゼロ」であると主張しています。ここでの「データゼロ」とは、手動の注釈に依存しない質問と回答のペアを指しますが、モデルには依然として事前知識として大規模な事前トレーニング コーパスとコード実行コンテキストが必要です。 「データゼロ」は「コストゼロ」と同じではありません。トレーニングフェーズと事前トレーニングフェーズの間の依存関係を区別する必要があります。
主な機能
- 自律的なタスク生成 (提案者): このモデルは、質問バンクの手動スクリーニングに依存するのではなく、「学習可能な」プログラミングまたは数学のタスクを自動的に生成します。タスクの難易度は、Python の単純な単一行操作から複雑な複数ステップのアルゴリズムの問題まで、学習の進行に応じて動的に調整されます。
- タスク自律ソルバー (ソルバー): モデルは、提案されたタスクを解決し、Python エグゼキューターを通じて答えの正しさを検証します。 「問題設定」と「問題解決」は同じモデルの異なる推論モードによって完了し、共有パラメータは共同で最適化されます。
- トリプル推論モード: 演繹的推論 (ルールから結論を導き出す)、アブダクティブ推論 (観察から原因を推測)、および帰納的推論 (例からルールを要約する) をサポートします。 3 つのモードは人間の推論の核となるタイプをカバーしており、このモデルは単なる「高速計算」以上のものになっています。
- ゼロデータ トレーニング プロセス: 手動でラベル付けされたデータや事前定義された質問と回答のペアに依存しません。このモデルは、コード実行とのコンテキスト相互作用を通じて検証可能な報酬シグナルを取得し、セルフゲーム サイクル中に改善を続けます。
モデルとバージョンの進化
メインライン リリース
- ~2025-05: Absolute Zero Reasoner の初公開。 arXiv の論文 (2505.03335) では、ゼロデータ推論パラダイムの理論が説明されています。 GitHub は、トレーニングおよび評価チェックポイントを含む完全なコード リポジトリをオープン ソースと同期します。
このプロジェクトは研究の初期段階にあり、マルチバージョンの反復システムはまだ形成されていません。その後の進化には、より安全なコード実行プログラム、より多くのタスク タイプ (科学的推論、論理的推論など) のサポート、および大規模モデルのトレーニング実験が含まれる可能性があります。
技術的な利点
メカニズム分析: モデルはどのように学習するのでしょうか?
Absolute Zero のコアテクノロジーリンクは 4 つの役割で構成されます。
「」 ┌───────────────────────┐ │ 提案者(質問者) ←→ ソルバー(問題解決者) │ │ ↓ ↓ │ │ タスクの説明を生成し、問題解決プロセスと回答を生成する │ │ ↓ ↓ │ │ ┌───── コードエグゼキューター ─────────┐ │ │ │ ① タスクが実行可能であり、自明ではないことを確認する │ │ │ │ ② 問題解決コードを実行し、出力が正しいかどうかを確認する │ │ │ │ ③ 検証可能な報酬シグナルを返す(学習性報酬+正しさ報酬) │ │ │ ━━━━━━━━━━━━━━━━━━━━┘ │ │ ↓ │ │ TRR++ オプティマイザー → プロポーザーとソルバーのパラメーターを共同で更新 │ ━━━━━━━━━━━━━━━━━━━━┘ 「」
-
検証可能な報酬が人為的な優先順位を置き換えます: 従来の RLHF は、人間のアノテーターに依存してモデルの出力優先順位をランク付けしますが、Absolute Zero はコード実行者の合否を客観的な報酬として使用します。その効果は、人間の好みの主観性と不一致を取り除き、トレーニング信号をよりクリーンでよりスケーラブルにすることです。プログラムによってルールを検証できる領域 (コード、数学) に適しています。
-
セルフゲーム コース学習: 提案者は、現在の能力の境界に近い「最適な難易度」のタスクを自動的に生成します。簡単すぎる質問には報酬が与えられず (学習価値がないため)、難しすぎる質問には解決されず、報酬も与えられません。その結果、トレーニング プロセスが自動的にカリキュラム学習曲線を形成し、モデルは常に「コンフォート ゾーンの端」でトレーニングされるようになります。トレーニングに大量の多様性を必要とする推論モデルに適しています。
-
TRR++ 結合最適化: 従来の GRPO/PPO に基づいて改善され、提案者のタスク生成戦略とソルバーの問題解決戦略を最適化します。その結果、2 人の登場人物が対立の中で一緒に進歩することになります。質問をする人はますます「ずる賢く」なり、問題を解決する人はますます「強く」なり、正のフィードバックのスパイラルが形成されます。
-
緊急推論動作: 公式表示では、トレーニング後、モデルは注釈計画 (最初に注釈計画ステップを記述してからコードを記述する)、試行錯誤によるバックトラッキング (エラーが発生した場合に再試行に戻る)、自己検証 (問題解決後の自動チェック) などの高次推論動作を自発的に示しましたが、これらの動作はトレーニング データでは明示的に示されていませんでした。
使い方
『絶対零度』は研究者向けです。入り口はGitHubリポジトリとコマンドラインツールです。グラフィカルインターフェイスはありません。
論文の結果を再現します: 「」バッシュ git clone https://github.com/LeapLabTHU/Absolute-Zero-Reasoner cd 絶対零度リーズナー
README に従って Conda コンテキストを設定します
conda env create -f 環境.yaml conda は絶対零度をアクティブにします
トレーニング前のチェックポイントをダウンロードする
ハグフェイスコレクションを参照: https://huggingface.co/collections/andrewzh/absolute-zero-reasoner
推論評価を実行する
python eval.py --modelAbsolute-zero-3b --ベンチマークコード
セルフゲームトレーニングを開始します (4×80GB GPU が必要です)
python train_selfplay.py --modelbase-3b --output ./experiment 「」
研究用フレームワークであるため、ユーザーは GPU クラスター管理、Python 開発、強化学習に関する基本的な知識を持っている必要があります。プロジェクトによって提供されるアクチュエーターは実稼働環境には適していません。ユーザーコードを安全に実行する必要がある場合は、自分でコードを強化する必要があります。
製品の価格設定
| プロジェクト | 説明 |
|---|---|
| ソフトウェア ライセンス | MIT ライセンス、無料かつオープンソース |
| トレーニング ハードウェア | 最小 2×A100-80GB (3B モデル実験) |
| 推論ハードウェア | 24 GB のビデオ メモリを搭載した 1 枚のカードで 3B チェックポイントを実行できます。 |
| クラウド GPU コスト | 完全再現実験には約 1,500 ~ 8,000 ドル |
| ビジネス API | 利用できません |
アプリケーションのシナリオ
- 推論モデルの研究: 研究チームは、ゼロデータ推論トレーニングのベースライン フレームワークとして「Absolute Zero」を使用できます。セルフゲーム トレーニング システムを最初から実装する場合と比較して、Absolute Zero に基づく完全なパイプラインを使用すると、実験の開始時間を数か月から数日に短縮できます。ウェアハウスをフォークし、コンテキストを構成し、ハイパーパラメーターを調整するだけです。
- モデル能力の境界探索: 「人間によるデータ入力なしでモデルがどこまでできるか」を研究し、推論能力の出現の条件と限界を評価します。 AI の安全性、能力の境界、および緊急の動作の方向性に関する研究実験に適しています。
- 強化学習トレーニング方法の実験: さまざまな報酬設計、セルフゲーム戦略、および推論モードの組み合わせがモデルの推論能力に及ぼす影響をテストします。プロジェクトのモジュール設計 (交換可能なアクチュエーター、報酬関数、推論戦略) により、実験のバリエーションが容易になります。
境界には適していません: 本番環境向けのコード実行サンドボックスとしては適していません (組み込みのエグゼキュータは研究用としてマークされています)。 GPU リソースを持たない個人の開発者が直接使用するのには適していません。すぐに使える推論サービスを必要とするビジネス シナリオには適していません。
該当する人
- LLM トレーニング研究者: 強化学習と推論能力のセルフプレイに焦点を当てている研究者は、Absolute Zero を実験ベースおよび論文ベースラインとして使用できます。
- フロンティア モデル チーム エンジニア: 既存のモデルに基づいてゼロデータ推論トレーニング手法を試し、その手法が独自のモデル スケールやタスク シナリオに適しているかどうかを評価する技術チーム。
- AI セキュリティおよび調整研究者: モデルの動作が「自己学習と自己学習」パラダイムの下で制御可能かどうか、報酬がハッキングされているかどうか、および緊急の動作の予測可能性を研究します。
対象外: 非技術的な背景を持つプロダクト マネージャーまたはビジネス ユーザー (プログラミングおよび ML エンジニアリングの経験が必要)。 GPU クラスターの予算が不足している個人の開発者。実稼働グレードの推論 API を必要とするエンジニアリング チーム。
概要と展望
Absolute Zero は、主流の RLHF とはまったく異なる技術的ルートを表しており、人間のフィードバックを状況に応じたフィードバックに置き換えます。これは、コードと数学的推論の分野において、手動によるアノテーションを継続的に行う必要がなく、モデルが「自己生成、自己解決、自己検証」のプロセスを通じて改善し続けることができることを証明しています。研究プロトタイプとして、現在のバージョンはトレーニング ツール チェーンの完全性の点で優れていますが、研究室の方法論と実装可能なトレーニング フレームワークとの間にはまだエンジニアリングのギャップがあります。
現在の制限: トレーニング リソースのしきい値が高い (14B モデルには A100 のカードが 8 枚必要)。組み込みのコード実行プログラムは研究用途としてマークされており、運用環境では安全ではありません。プロジェクトは初期段階にあり、コミュニティのサポートとドキュメントを改善する必要があります。コード/数学以外の領域における推論機能 (常識的な推論、オープンドメインの質問応答) の効果は完全には検証されていません。
取得/採用のリスク評価: 学術オープンソース プロジェクトとして、Absolute Zero には商業化の約束はありません。研究チームはこれを技術的な参考資料および実験のベースラインとして使用することをお勧めします。産業グレードのトレーニング プラットフォームを選択するには、内部 MLOps システムとの互換性、アクチュエータの安全性強化のコスト、長期メンテナンスに対する人的投資を評価する必要があります。 MIT ライセンスは商用利用と互換性がありますが、独自のモデルをトレーニングする前に、派生モデルのコンプライアンス条件を確認することをお勧めします。
関連ツール: hugging-face、replicate
バージョン情報
- 絶対零度のリーズナー :トレーニング コード、モデル チェックポイント、推論モード (演繹/アブダクション/帰納) および評価スクリプトを含む、最初に公開された完全な実装ですが、正式な正確な日付はまだありません。
- 絶対零度のリーズナー :トレーニング コード、モデル チェックポイント、推論モード、評価スクリプトを含む完全な実装が初めて公開されます。公式の正確な日付はまだありません。
ユーザーレビュー