フォージトレイン
無料
ForgeTrain は、Wallface Intelligence と清華大学の OpenBMB コミュニティによってリリースされたオープンソースの大規模モデル事前トレーニング フレームワークです。フレームワーク コードは、Forge Engineering の 3 段階の方法論 (標準の確立 → ビットごとの調整 → パフォーマンスのオーバーシュート) を使用して、AI Agent Loop によって 100% 自己記述されています。 NVIDIA H100 でのトレーニング速度は、Megatron-LM のトレーニング速度を約 10% 上回ります。 Huawei の Ascend チップで事前トレーニング プロセスを完全に実行し、MiniCPM5-1B モデルのトレーニングに成功しました。
ForgeTrain — AI エージェントが独自に作成した大規模モデルの事前トレーニング フレームワーク
コアパラメータと統計
ForgeTrain は、人間によるコードの介入を一切行わず、AI エージェントによって完全に記述された実稼働レベルの大規模モデルの事前トレーニング フレームワークです。これは、Face Wall Intelligence と清華大学自然言語処理研究室の OpenBMB オープンソース コミュニティによって共同リリースされたもので、コンセプトの検証から実稼働実装に至る「AI for AI」の歩みにおける重要なマイルストーンを表しています。
| パラメータ項目 | 値 |
|---|---|
| 開発者 | Wall-Facating Intelligence (ModelBest) と清華大学 OpenBMB コミュニティ |
| ターゲットシナリオ | 大規模分散LLM事前トレーニング(百カロリーからキロカロリーレベル) |
| サポートされているハードウェア | NVIDIA H100 (SM90)/Huawei Ascend シリーズ |
| 検証済みモデル | MiniCPM4-0.5B、MiniCPM4-8B、MiniCPM5-1B |
| トレーニング フレームワークの規模 | DP のみ (0.5B) および TP=2 / DP=4 (8B) をサポート |
| コードの書き方 | 100% AI エージェント ループが自己生成され、人間による手動編集は不要 |
| オープンソースライセンス | アパッチ2.0 |
| トレーニングのスループット | H100 の MFU は 44.13% に達し、Megatron-LM を約 10% 上回ります。 |
| 測定されたクラスター | 64 基の H100 GPU、BF16 精度、分散データ並列 |
| ハーネスコンポーネント | 間もなくオープンソースになる予定 (エージェント ループの自動出力トレーニング フレームワークを推進する足場) |
MiniCPM4-0.5B を 64× H100、BF16、純粋な DP モードでトレーニングすることにより、ForgeTrain の MFU (モデル FLOPS 使用率) 44.13% が測定されました。比較のために、同じハードウェア構成における Megatron-LM v0.15 の MFU は約 40% です。これは、同じコンピューティング能力への投資で、ForgeTrain は GPU コンピューティング コストを約 10% 節約できるか、同じ予算内でより大きなモデルをトレーニングできることを意味します。 64 枚のカードを含むクラスターの場合、10% のコンピューティング電力節約は、数万ドルの電力コストとマシン時間コストに相当します。
ユーザーと市場の認識
ForgeTrain は、リリース以来、学界や産業界から幅広い注目を集めています。その核となる価値は、「AI エージェントは独自に運用レベルのトレーニング フレームワークを作成できる」という命題を初めて検証したことです。
- 学術的な承認: このプロジェクトは清華大学の自然言語処理研究室によって推進されており、関連する方法論はトップカンファレンスの提出段階で公開されています。この論文のプレプリントでは、AI 自律書き込みインフラストラクチャに再現可能な理論的フレームワークを提供する Forge Engineering の 3 段階の方法論が引用されています。
- 産業実装: Wall-Facing Intelligence は ForgeTrain を使用して、Huawei Ascend チップ上の MiniCPM5-1B の事前トレーニング プロセスを完全に実行しました。このモデルは、2B 未満の AA リストで世界第 1 位にランクされます。これは、国産チップが初めて、自作の AI トレーニング スタックを通じて大規模モデルの実稼働レベルの事前トレーニングを完了し、「トレーニング フレームワークは人間の手書きによって最適化する必要がある」という従来のパス依存性を打破したことを意味します。
- オープン ソース コミュニティ: GitHub リポジトリ (OpenBMB/ForgeTrain) は、Apache 2.0 プロトコルに基づくオープン ソースです。コミュニティの貢献者には、Wallface コア チームと外部開発者が含まれます。 v0.1.0 トレーニング エンジンは現在リリースされており、Harness オーケストレーション フレームワーク (エージェント ループ自動スキャフォールディング) は近日公開の状態です。
- 業界ベンチマーク: NVIDIA VibeTensor (製品版ではないとマークされている)、Anthropic C コンパイラー OpenAI Harness などの競合製品と比較して、ForgeTrain は製品レベルで同時に使用でき、優れたパフォーマンスを備え、完全にオープンソースである唯一の AI 生成フレームワークです。これは、メタ社などの大手メーカーが「AIライティングAI」を模索している業界において、重要な参考価値とエンジニアリング実証の意義を持っています。
コストメリット
ForgeTrain のコスト上の利点は、次の 3 つのレベルから理解する必要があります。
| 寸法比較 | フォージトレイン | Megatron-LM (NVIDIA) | 手書きトレーニング フレームワーク |
|---|---|---|---|
| 開発費 | AI エージェントは独立して作成され、人的投資はほぼゼロに近い | 上級システム エンジニアのチームによる長期メンテナンスが必要 | 数か月から数年のチーム開発サイクル |
| コンピューティング効率 | 44.13% MFU、メガトロンより約 10% 高い | ~40% MFU (同じハードウェア) | チームの最適化レベルに依存しますが、通常は成熟したフレームワークよりも低くなります。 |
| ハードウェアの適応 | H100 + Ascend デュアル プラットフォーム、ハーネスは自動的に適応可能 | NVIDIA GPU のみ | 新しいハードウェアの適応ごとに再開発が必要 |
| ライセンス | Apache 2.0 は完全にオープンソースで無料です。オープンソースだが環境的にロックされた CUDA | 自己調査コストが高い | |
| トレーニングの成果 | MiniCPM5-1B量産レベルモデルを生産開始 | 開発とメンテナンスには追加の人員が必要です | 完全なリンクのサポートが必要です |
C サイド ユーザー: ForgeTrain は、個々のユーザーを直接ターゲットにしていません。その使用しきい値は、マルチカード GPU クラスターを備えた研究機関または企業向けです。ただし、オープンソースと無料の方法により、コンピューティング リソースを持っているチームはコストなしでリソースを取得して使用できます。
開発者および研究機関: オープンソース ライセンス (Apache 2.0) により、自由な使用、変更、商用利用が許可されています。商用ライセンスの購入が必要なクローズドソースのトレーニング フレームワークと比較すると、ForgeTrain の導入コストはクラスターのハードウェアと電力のコストのみです。学術研究チームにとって、これにより大規模モデルの事前トレーニング実験の敷居が大幅に下がります。
エンタープライズ ユーザー: 国内チップ適応における ForgeTrain の画期的な進歩には重要な商業的価値があります。企業は、自社開発の CUDA 互換スタックを開発するのに N 年も待つ必要はありません。 ForgeTrain を直接使用して、国内チップで大規模なモデルのトレーニングを開始できます。 AI インフラストラクチャを構築している中規模および大企業の場合、ForgeTrain を採用することで、単一の GPU ベンダーに固定されることを回避しながら、コンピューティング電力コストを 10% 以上節約できます。
主な機能
- 分散事前トレーニング エンジン: 数百から数千の GPU の分散協調トレーニングをサポートし、64× H100 クラスターで実稼働レベルの検証を完了しました。トレーニング エンジンには 5 つの組み込み CUDA グラフ キャプチャ粒度 (forward / step / step_full / step_optimizer / step_nccl_opt) があり、BucketedGradReducer およびシャーディング オプティマイザー wgrad-overlap と自由に組み合わせて、さまざまなサイズのトレーニング タスクに柔軟な最適化スペースを提供できます。
- クロスハードウェア プラットフォームへの適応: NVIDIA H100 (SM90) と Huawei Ascend シリーズ チップの両方をサポートします。 H100 の MFU は 44.13% に達し、MiniCPM5-1B 事前トレーニング プロセスは Shengteng に完全に引き継がれています。このデュアル プラットフォームのサポートは、国内のコンピューティング パワー エコシステムの構築にとって戦略的に重要です。モデル チームは、H100 を迅速に反復し、Ascend での運用展開を完了できます。
- AI エージェント ループ独立開発: フレームワーク コードは自動ループ モードでコーディング エージェントによって完全に独立して生成され、人間はハーネス仕様とコンテキストを提供するだけです。エージェントは、「リファレンス実装の読み取り → コードの作成 → トレーニングの開始 → ログの解析 → 根本原因の特定 → パッチの修正 → アクセス制御の通過 → コードの送信」という完全な開発プロセスを独自に完了します。各オペレーターは実際の分散トレーニングによって検証されています。
- 自社開発の高性能オペレーター ライブラリ: CuTeDSL に基づく 5 つのカスタム GEMM オペレーターが含まれており、単一オペレーターの MFU は最大 90% です。自社開発の FlashAttendant 実装により、そのパフォーマンスは Transformer Engine / FlashAttendant 3 を上回り、FlashAttendant 4 と同じになります。オペレーターは、AOT C エクスポートを通じて永続キャッシュにコンパイルされ、後続のトレーニングで発生する
dlopenオーバーヘッドは数秒だけです。 - ビットごとの整合性検証: AI で生成されたフレームワークとリファレンス実装 (Megatron-LM) は、同じ入力の下でまったく同じ数値結果を生成します。これは、Forge Engineering の「ビットごとのアライメント」の第 2 段階によって実現されます。エージェントは、ハーネス制約の下でリファレンス実装の前方/後方伝播の結果を正確に再現し、パフォーマンスの最適化段階に入る前に正確さを保証します。
- 自動評価ハーネス (近日公開予定): 組み込みの自動テストとパフォーマンス評価
「正しく走る」「速く走る」を機械が自動的に判断できる基準に変換します。 Harness にはエージェント ループ オーケストレーション ソリューションも含まれており、どのチームでもビット単位の調整からパフォーマンスのオーバーシュートまでの完全なプロセスを再現できます。
モデルとバージョンの進化
ForgeTrain は現在、v0.1.0 の初期リリース段階にあり、プロジェクトのロードマップは明確です。
| バージョン | 発売日 | 対象となるコンテンツ |
|---|---|---|
| v0.1.0 (現在) | 2026-05 | トレーニング エンジンは公開されており、NVIDIA H100 ・ MiniCPM4-0.5B (DP のみ) および MiniCPM4-8B (TP=2) をサポートしています。トレーニング エンジンのソース コード、5 つの CuTeDSL カスタム GEMM、および自社開発の FlashAttendant が含まれています。 |
| ハーネス (近日公開予定) | 未定 | エージェント ループ オーケストレーション スキャフォールディングにより、コーディング エージェントはトレーニング フレームワークのコア仕様を自動的に生成できます。 「AIライティングAI」の再現性を実現するための重要なコンポーネントです。 |
| Huawei Ascend バージョン | ロードマップについて | MiniCPM5-1B Ascend トレーニング フレームワークが実用化され、正式版がリリースされます。 |
| 自己生成ハーネス | ロードマップについて | トレーニング フレームワークはハーネス スキャフォールディングを自己生成し、再帰的な自己改善を実現します。 |
v0.1.0 はプロジェクトの最初のマイルストーンであり、AI エージェントの実稼働レベルのトレーニング フレームワークを独自に作成する実現可能性を検証します。次のマイルストーンは、既に作成されたトレーニング エンジンを使用するだけでなく、サードパーティ チームがエージェント ループのトレーニング フレームワーク作成プロセスを再現できるようにする Harness コンポーネントをリリースすることです。
技術的な利点
ForgeTrain の技術アーキテクチャは、Forge エンジニアリング方法論 → エージェント ループの独立開発 → 高性能トレーニング エンジン → クロスハードウェア適応 という核となるイノベーション リンクを中心に展開しています。
Forge Engineering の 3 段階の方法論
Forge Engineering は ForgeTrain の基礎となる方法論であり、次の 3 つの段階に分かれています。
- 標準の確立 (ハーネス): リファレンス トレーニング スタック (Megatron-LM) から主要な動作データを収集し、自動評価ハーネスを構築し、正確性とパフォーマンスのベンチマークを定義します。ハーネスは静的なドキュメントではなく、データ ストリームの切り捨て、数値比較、パフォーマンスのしきい値、その他の機械で決定可能な標準を含む、実行可能な仕様のセットです。
- ビット対ビットのレプリケーション: AI エージェントは、ハーネス制約の下でリファレンス実装と少しずつ一貫性のあるトレーニング フレームワークを生成します。この段階ではパフォーマンスは追求されず、正確性のみが追求されます。エージェントによって生成されたコードの出力が、同じ入力の下でのリファレンス実装と完全に一致していない場合、自動的にロールバックされ修復されます。
- 上回るパフォーマンス: バイナリの整合性制限を解除し、パフォーマンス指向のハーネスに切り替えることで、AI エージェントがより大きな演算子の組み合わせ空間で独立して反復的に最適化できるようになり、最終的に人間が作成したリファレンス実装を速度で上回ります。このステップが重要です。同じハーネス プロトコルでも、異なるハードウェア上でまったく異なる独自の最適化実装を構築できます。
Agent Loop 独自開発
従来の「人間がコードを書く → コンパイル → デバッグ」サイクルとは異なり、ForgeTrain のコードはコーディング エージェントによって完全に自動化されたサイクルで完成します。
「」 LLM (コーディング エージェント) → ハーネス プロトコルの読み取り → オペレーター コードの生成 → torchrun によるトレーニングの開始 → ログの解析 → 根本原因の特定 → コードの変更 → 数値ゲートの通過 → エクスポートへの送信/ 「」
このサイクルの最大の特徴は、各オペレーターの生成が実際の分散トレーニングによって検証されていることです。開発プロセス中、Agent は、CuTeDSL / cuBLAS / Triton / TransformerEngine などの複数のオペレーター実装バリアントと数十の通信 + CUDA グラフ キャプチャの組み合わせを独自に列挙およびベンチマークし、最終的に本番環境のデフォルト構成として最高のパフォーマンスを持つ組み合わせを選択しました。
高性能とエンジニアリングの最適化
- 44.13% の MFU 実装メカニズム: CUDA Graph 5 キャプチャ粒度による CuTeDSL カスタム GEMM (シングル オペレーター MFU が 90% に達する)、Triton フュージョン カーネル (CE fwd+bwd / SwiGLU / RMSNorm+residual / RoPE / fusion Adam + パラメーター同期)、および純粋な DP モードでの通信と計算のオーバーラップ (通信と計算のオーバーラップ)ハードウェアの理論上の限界。
- 抽象化損失ゼロ: 抽象化レイヤーを通じて汎用性を維持する従来のトレーニング フレームワークとは異なり、ForgeTrain は Harness プロトコルの汎用性と各 Forge の高いパフォーマンスを維持します。これは、特定のハードウェアおよびモデル サイズに対して生成されたコードには、不要な抽象化オーバーヘッドが含まれていないことを意味します。
- 消費者開発コンセプト: コードを長期保守のための「資産」として扱う従来のソフトウェアとは異なり、Forge Engineering はコードを、オンデマンドで鍛造される深くカスタマイズされた製品にバンドルしません。ハードウェアの交換やモデルのアップグレードの場合、古いコードを修正する必要はなく、直接ハーネスの再鍛造を実行します。
使い方
ForgeTrain の使用は、作成されたトレーニング エンジン (現在利用可能) を使用する方法と、Harness 自律鍛造トレーニング フレームワーク (近日リリース予定) を使用する方法の 2 つのレベルに分かれています。
トレーニング エンジン (v0.1.0) の使用
| 入口 | 住所 | 説明 |
|---|---|---|
| GitHub リポジトリ | https://github.com/OpenBMB/ForgeTrain | トレーニング エンジンのソース コードと完全なドキュメントを含むメイン リポジトリ |
| トレーニング エンジンのドキュメント | exports/train_engine_0.5B/README.md |
完全な CLI ドキュメント、構成リファレンス、0.5B モデル トレーニング エンジンのパフォーマンス ベースライン |
| トレーニング エンジンのドキュメント | exports/train_engine_8b/README.md |
8B モデル トレーニング エンジンの完全なドキュメント |
要件: Python ≥ 3.11 · CUDA 12.x · PyTorch ≥ 2.4 · NVIDIA H100 80GB (SM90)。完全な事前トレーニングには 8× H100 が必要で、初期の調整段階は 1 枚のカードで実行できます。
一般的な手順:
-
リポジトリのクローンを作成し、依存関係をインストールします: 「」バッシュ git clone https://github.com/OpenBMB/ForgeTrain.git cd ForgeTrain/exports/train_engine_0.5B pip install -e 。 pip install データセットトランスフォーマー 「」
-
インストールを確認します: 「」バッシュ PYTHONPATH=src python -c "training_engine_tensor インポート設定から; print('OK')" 「」 予期される出力:
OK -
プリコンパイルされた演算子 (最初の実行): 「」バッシュ PYTHONPATH=src CUSTOM_GEMM=1 OP_ATTENTION=v1 python scripts/precompile_ops.py 「」 このコマンドは、AOT エクスポートと「cpp_extension」ビルドをウォームアップし、5 つの CuTeDSL GEMM を永続キャッシュにコンパイルします。
-
単一ノード 8× H100 トレーニング: 「」バッシュ torchrun --standalone --nproc-per-node=8 \ -m training_engine_tensor 事前学習 \ --ステップ数 200 \ --グローバルバッチサイズ 1280 --マイクロバッチサイズ 10 \ --seq-length 4096 \ --hf-dataset openai/gsm8k \ --hf-dataset-config main \ --hf-text-template "質問: {question}\n回答: {answer}" \ --tokenizer-path openbmb/MiniCPM4-0.5B \ --save-dir ./checkpoints/run1 「」
鍛造ハーネス付き (近日発売予定)
ハーネス コンポーネントがリリースされた後、チームは次の方法で独立した鍛造を開始できます。
「」バッシュ cd Forgeトレイン/ハーネス bash Agent-loop.sh # 手動介入なしでエージェント ループを開始する 「」
このスクリプトはコーディング エージェントをループ内で実行します。リファレンス トレーニング スタックの読み取りから始まり、ビットごとの調整とパフォーマンスの最適化を経て、最後にカスタマイズされたトレーニング フレームワークを生成します。
製品の価格設定
ForgeTrain は現在完全に無料のオープンソースであり、Apache 2.0 ライセンスに基づいてライセンスされています。
- オープンソースで無料: トレーニング エンジンの完全なソース コードとドキュメントは GitHub で公開されており、無料で入手、使用、変更できます。商用利用には追加の許可は必要ありません。
- ハーネス コンポーネント: 近日中にリリースされ、Apache 2.0 ライセンスの下でオープン ソースになる予定です。
- エンタープライズ サポート: Facewall Intelligence は、ForgeTrain のエンタープライズ レベルの展開およびテクニカル サポート サービスを提供します。具体的な価格については事業主にお問い合わせください。大規模な GPU クラスターを持ち、トレーニング スタックをカスタマイズしたい企業の場合、ハーネスのカスタマイズ、チップ アダプテーションの最適化、専門家のオンサイト サービスなどのエンタープライズ レベルのサービスを交渉できます。
- クラウド/ホスト型サービス: 現在、ホスト型トレーニング サービスはありません。ユーザーは GPU インフラストラクチャを自分で管理する必要があります。 Facewall Intelligence が将来、ForgeTrain に基づくモデル トレーニング プラットフォームを立ち上げる可能性を排除することはできません。
全体として、ForgeTrain の価格設定は開発者コミュニティにとって非常に親切であり、購入コストゼロで実稼働グレードのトレーニング フレームワークを入手できます。企業の隠れたコストには、主にハードウェア投資と GPU クラスターの運用保守の人件費が含まれますが、事前トレーニング フレームワークを使用する場合、これらのコストは避けられません。
アプリケーションのシナリオ
- 大規模モデルの事前トレーニングと微調整: Megatron-LM や DeepSpeed などの人が作成したトレーニング フレームワークを直接置き換え、実稼働レベルの大規模モデルの完全な事前トレーニングと指示の微調整に使用されます。 ForgeTrain は、同じハードウェア下で約 10% の MFU 向上を実現します。これは、多くの場合、数百枚のカードが必要で数週間かかる大規模なモデルのトレーニングにおいて、大幅なコンピューティング電力の節約になります。期待される利点は、同じ予算でより大きなモデルをトレーニングすること、または同じモデル サイズでトレーニング サイクルを短縮することです。
- 国内のコンピューティング能力の適応: ForgeTrain は、ファーウェイの Ascend チップ上で完全な事前トレーニング プロセスを実行する初の自作 AI トレーニング フレームワークです。国内のチップ メーカーや国内のコンピューティング パワーを使用する企業は、ForgeTrain を使用すると、別の CUDA エコシステムの構築に 10 年も投資することなく、Ascend やその他のチップ向けの専用の高性能トレーニング スタックを迅速に構築できます。期待される利点は、「チップのテープアウト」から「ソフトウェアの可用性」までの時間が大幅に短縮されることです。
- AI 研究の加速: ForgeTrain により、「大規模モデルの年間処理能力の増加を、人間のスケールの関数からコンピューティング能力の関数にシフトする」ことが可能になります。研究チームは Harness を使用して、より大きな検索空間で独立して繰り返し、新しいトレーニング方法、モデル アーキテクチャ、最適化戦略を迅速に実験します。期待される利点は、チームのエネルギーをトレーニング フレームワークのメンテナンスからモデル アルゴリズムの革新に移すことです。
- ソフトウェア エンジニアリング パラダイム実験: Forge Engineering の最初の産業レベルのインスタンスとして、ForgeTrain は、他の複雑なシステム (コンパイラー、データベース、オペレーティング システム、ディープ ラーニング ランタイム) の AI 自動生成のための参照方法論とアーキテクチャ リファレンスを提供します。研究チームは、ForgeTrain のハーネス モデルに基づいて、それぞれの分野で AI の自律開発を検討できます。
- エンドサイド モデル開発: Wall-face Intelligence は、ForgeTrain を使用して MiniCPM5-1B をトレーニングし、AA リストの 2B 未満の規模で世界 1 位にランクされています。これは、ForgeTrain がエンドサイドでの高効率モデルの開発にも適していることを証明しています。モバイル IoT などのエンドサイド展開シナリオのニーズがあるチームは、
このトレーニング パスを直接受講してください。
該当する人
- 大規模モデルのトレーニング エンジニアおよび研究者: これは ForgeTrain の中心的なユーザー グループです。大規模モデルの事前トレーニングにトレーニング エンジンを直接使用することも、エージェント ループによって生成されたオペレーター コードを詳しく調べて、高性能トレーニング フレームワークの実装を学習することもできます。 ForgeTrain のオープンソース コード ベース自体は、「H100 ハイ パフォーマンス トレーニング プロジェクト」の実行可能な教科書です。
- AI インフラストラクチャ チーム: エンタープライズ AI トレーニング インフラストラクチャを担当する技術チームは、ForgeTrain を使用してコンピューティング電力コストを削減 (Megatron-LM と比較して MFU が約 10% 向上) すると同時に、クロスハードウェア サポートを通じて単一チップ ベンダーに固定されることを回避できます。トレーニング フレームワークのオプションを検討しているチームにとって、ForgeTrain の Apache 2.0 ライセンスとオープンソース コミュニティ エコシステムにより、トレーニング フレームワークが低リスクで長期的なオプションになります。
- 国内チップ エコシステム開発者: Ascend や Cambrian などの国内チップ用のトレーニング スタックを作成する開発者は、ForgeTrain の Harness 方法論を使用して、最初から始めるのではなく、国内チップ専用のトレーニング フレームワークを迅速に作成できます。 Harness の「プロトコル駆動の自動鍛造」モデルは、人件費とチップ適応のタイム サイクルを削減します。
- AI エージェントおよび自動化テクノロジーの愛好家: ForgeTrain は、「AI による AI 作成」の最先端の実践です。エージェント ループ、自動コード生成、AI の自己改善、その他の技術的方向性に興味のある開発者は、その実装メカニズムを詳しく調べることができます。エージェントフレンドリーなクイック展開は、コーディング エージェントが完全な展開と受け入れプロセスを独立して完了できるように設計されています。
群衆には適さない: ForgeTrain は次のシナリオには適していません - 高性能 GPU クラスターを持たない個人の開発者 (シングル カード ユーザーやカードを持たないユーザーでさえその価値を実感できない)。すぐに使える SaaS トレーニング サービスを必要とするチーム (ForgeTrain はセルフサービスのオープン ソース フレームワークであり、ホスティング サービスは提供しません)。基盤となる CUDA / PyTorch を理解しておらず、エンジニアリングの運用とメンテナンスに投資する気のないチーム。完全な MLops が必要 プラットフォーム (データセット管理、実験追跡、モデル登録など) を使用する企業は、プラットフォームを置き換えるのではなく、従来の MLops プラットフォームと組み合わせて使用する必要があります。
概要と展望
ForgeTrain の核となる競争力は、「AI が作った AI」のコンセプトから本番レベルの実装までの完全な移行を初めて実現できる能力にあります。これは概念実証のデモではなく、64 枚のカード クラスター上で実際のモデルの重みを生成した実稼働グレードのトレーニング フレームワークです。その Forge Engineering 手法は、AI が独立してインフラストラクチャ ソフトウェアを作成するための再現可能なパスを提供します。標準の確立からビットごとの調整、パフォーマンスのオーバーシュートまで、各ステップには明確な合格基準があります。
現在の制限事項:
- サポートされているモデルの範囲が限定されています: v0.1.0 では、MiniCPM4-0.5B (DP のみ) と MiniCPM4-8B (TP=2) の 2 つの構成のみが検証されています。大規模なモデルや異なるアーキテクチャのモデルには、追加の適応作業が必要です。
- Harness コンポーネントはまだオープンソースではありません。現在、ユーザーは作成されたトレーニング エンジンのみを使用でき、「独立鍛造」の完全なプロセスをまだ体験できません。 Agent Loop オーケストレーション フレームワークのリリースは、コミュニティが最も期待している機能です。
- 高いハードウェアしきい値: 完全なトレーニングには H100 80GB 以上の GPU が必要ですが、1 枚のカードでは実稼働レベルの事前トレーニングを完了できないため、個々の開発者の参加が制限されます。
- コミュニティ エコシステムは初期段階にあります。成熟したコミュニティと豊富なドキュメントを備えた Megatron-LM や DeepSpeed と比較して、ForgeTrain のチュートリアル、ケース、サードパーティの貢献はまだ蓄積されています。
- MLops 統合の欠如: ForgeTrain はトレーニング エンジン自体に焦点を当てており、実験管理、モデルの登録、展開などの MLops 機能は含まれていないため、他のツールと組み合わせて使用する必要があります。
調達と導入のリスク評価: ForgeTrain の購入を計画している企業には、「まずパイロット、小規模検証、その後拡張」という戦略を採用することをお勧めします。まず、フレームワークの安定性とパフォーマンスのデータが小規模なトレーニング タスク (シングル ノード 8 カード MiniCPM4-0.5B など) で公式と一致しているかどうかを検証します。確認後、より大規模なモデルのトレーニングに拡張します。次の側面に特別な注意を払う必要があります: Harness の正式リリース時期 (自律鍛造ワークフローを実装できるかどうかを決定します)、Wallface Intelligence の課金モデルとエンタープライズ レベルのサポートのサービス SLA、およびプロジェクトの長期メンテナンスの持続可能性。技術的リスクの観点から見ると、ForgeTrain は成熟したオープンソース コンポーネント (PyTorch、CUTLASS、FlashAttendant) に基づいており、コア トレーニング エンジンは高い信頼性を持っています。主なリスクは、ハーネス コンポーネントの配信品質と、コミュニティ エコシステムが成長し続けることができるかどうかにあります。全体として、ForgeTrain は大きな可能性を秘めたプロジェクトであり、当初は技術的な実現可能性が証明されていますが、主流のトレーニング フレームワークになるまでには、環境に配慮した構築を経るにはまだ長い時間が必要です。
関連ツール: hugging-face、replicate
バージョン情報
- 初期リリース :最初に公開されたバージョンは、NVIDIA H100 上の MiniCPM4-0.5B および MiniCPM4-8B の分散事前トレーニングをサポートします。トレーニング エンジンのソース コード、5 つの CuTeDSL カスタム GEMM オペレーター、および自社開発の FlashAttendant 実装が含まれます。 Harness コンポーネント (エージェント ループ オーケストレーション フレームワーク) がリリースされる予定です。
- 初期リリース :最初に公開されたバージョンは、NVIDIA H100 での MiniCPM4-0.5B および MiniCPM4-8B の分散事前トレーニングをサポートします。
ユーザーレビュー