ForgeTrain Gratuit

-

ForgeTrain est un cadre de pré-formation open source pour grands modèles publié par Wallface Intelligence et la communauté OpenBMB de l'Université Tsinghua. Le code-cadre est 100 % auto-écrit par AI Agent Loop, en utilisant la méthodologie en trois étapes de Forge Engineering (établissement de la norme → alignement bit par bit → dépassement des performances). La vitesse d'entraînement sur NVIDIA H100 dépasse celle du Megatron-LM d'environ 10 %. Il a entièrement suivi le processus de pré-formation sur la puce Ascend de Huawei et a formé avec succès le modèle MiniCPM5-1B.

ForgeTrain Interface du produit

ForgeTrain — Cadre de pré-formation pour grands modèles auto-écrit par AI Agent

Paramètres et statistiques de base

ForgeTrain est un cadre de pré-formation pour grands modèles de niveau production entièrement écrit par des agents IA sans intervention de code humain. Il a été publié conjointement par Face Wall Intelligence et la communauté open source OpenBMB du laboratoire de traitement du langage naturel de l'université Tsinghua, et représente une étape importante dans le parcours de « l'IA pour l'IA », de la vérification du concept à la mise en œuvre de la production.

Élément de paramètre Valeur
Développeur Intelligence murale (ModelBest) et communauté OpenBMB de l'Université Tsinghua
Scénario cible Pré-formation LLM distribuée à grande échelle (niveau de cent calories à kilocalories)
Matériel pris en charge Série NVIDIA H100 (SM90)/Huawei Ascend
Modèle vérifié MiniCPM4-0,5B, MiniCPM4-8B, MiniCPM5-1B
Échelle du cadre de formation Prend en charge DP uniquement (0,5B) et TP=2 / DP=4 (8B)
Méthode d'écriture de code 100 % AI Agent Loop auto-généré, aucune édition manuelle humaine
Licence Open Source Apache2.0
Débit de formation MFU sur H100 atteint 44,13%, dépassant Megatron-LM d'environ 10%
Amas mesuré 64 GPU H100, précision BF16, données distribuées en parallèle
Composant de harnais Sera bientôt open source (échafaudage qui pilote le cadre de formation à la sortie automatique d'Agent Loop)

Le MFU (utilisation du modèle FLOPS) de ForgeTrain 44,13 % a été mesuré en entraînant le MiniCPM4-0,5B en 64 × H100, BF16, mode DP pur. À titre de comparaison, le MFU du Megatron-LM v0.15 sous la même configuration matérielle est d'environ 40 %. Cela signifie qu'avec le même investissement en puissance de calcul, ForgeTrain peut économiser environ 10 % des coûts de calcul GPU ou former un modèle plus grand avec le même budget. Pour un cluster de 64 cartes, une économie de puissance de calcul de 10 % se traduit par des dizaines de milliers de dollars en coûts d'énergie et de temps machine.

Reconnaissance des utilisateurs et du marché

ForgeTrain a reçu une large attention de la part du monde universitaire et de l'industrie depuis sa sortie. Sa valeur fondamentale est qu'il a vérifié pour la première fois la proposition selon laquelle « l'agent IA peut écrire indépendamment un cadre de formation au niveau de la production ».

  • Approbation académique : Le projet a été incubé par le Laboratoire de traitement du langage naturel de l'Université Tsinghua, et la méthodologie pertinente a été publiée lors de la phase de soumission de la conférence suprême. La prépublication de l'article cite la méthodologie en trois étapes de Forge Engineering, qui fournit un cadre théorique reproductible pour l'infrastructure d'écriture autonome de l'IA.
  • Mise en œuvre industrielle : Wall-Facing Intelligence a utilisé ForgeTrain pour exécuter complètement le processus de pré-formation du MiniCPM5-1B sur la puce Huawei Ascend. Ce modèle se classe premier au monde dans la liste AA en dessous de 2B en taille. Cela signifie que pour la première fois, les puces nationales ont complété la pré-formation au niveau de la production de grands modèles grâce à une pile de formation d'IA auto-écrite, brisant la dépendance traditionnelle au chemin selon lequel « le cadre de formation doit être optimisé par l'écriture manuscrite humaine ».
  • Communauté Open Source : Le référentiel GitHub (OpenBMB/ForgeTrain) est open source sous le protocole Apache 2.0. Les contributeurs de la communauté incluent l'équipe principale de Wallface et des développeurs externes. Le moteur de formation v0.1.0 est actuellement publié et le cadre d'orchestration Harness (échafaudage automatisé Agent Loop) est à l'état Coming Soon.
  • Analyse comparative de l'industrie : comparé aux produits concurrents tels que NVIDIA VibeTensor (marqué non destiné à la production), le compilateur Anthropic C OpenAI Harness, ForgeTrain est le seul framework de génération d'IA qui est simultanément utilisable au niveau de la production, offre d'excellentes performances et est entièrement open source. Cela a une valeur de référence importante et une importance de démonstration technique dans le contexte de l'industrie où de grands fabricants tels que Meta explorent « l'IA écrivant l'IA ».

Avantage de coût

L'avantage en termes de coût de ForgeTrain doit être compris à trois niveaux :

Dimensions comparatives ForgeTrain Mégatron-LM (NVIDIA) Cadre de formation à l'écriture manuscrite
Coût de développement AI Agent est écrit de manière indépendante, l'investissement humain est proche de zéro Nécessite une maintenance à long terme par une équipe d'ingénieurs système seniors Cycle de développement d'équipe de plusieurs mois à plusieurs années
Efficacité informatique 44,13 % MFU, environ 10 % de plus que Megatron ~ 40 % MFU (même matériel) Dépend du niveau d'optimisation de l'équipe, généralement inférieur à celui des frameworks matures
Adaptation matérielle H100 + Ascend double plateforme, le harnais peut s'adapter automatiquement GPU NVIDIA uniquement Redéveloppement requis pour chaque nouvelle adaptation matérielle
Licence Apache 2.0 est entièrement open source et gratuit Open source mais écologiquement verrouillé CUDA Les coûts d'auto-recherche sont élevés
Résultats de la formation Le modèle de niveau de production MiniCPM5-1B a été produit Une main d'œuvre supplémentaire est nécessaire pour le développement et la maintenance La prise en charge complète des liens est requise

Utilisateurs côté C : ForgeTrain n'est pas directement destiné aux utilisateurs individuels. Son seuil d'utilisation concerne les instituts de recherche ou les entreprises disposant de clusters GPU multi-cartes. Cependant, grâce à des méthodes open source et gratuites, toute équipe disposant de ressources informatiques peut les obtenir et les utiliser sans frais.

Développeurs et instituts de recherche : La licence open source (Apache 2.0) permet une utilisation, une modification et une utilisation commerciale gratuites. Par rapport aux cadres de formation fermés qui nécessitent l'achat d'une licence commerciale, le coût d'adoption de ForgeTrain correspond uniquement au coût du matériel et de l'électricité du cluster. Pour les équipes de recherche universitaires, cela abaisse considérablement le seuil des expériences de pré-formation sur de grands modèles.

Utilisateurs professionnels : la percée de ForgeTrain dans l'adaptation des puces nationales a une valeur commerciale importante. Les entreprises n'ont pas besoin d'attendre N années pour développer une pile compatible CUDA auto-développée. Ils peuvent directement utiliser ForgeTrain pour démarrer une formation de grands modèles sur des puces nationales. Pour les moyennes et grandes entreprises qui construisent une infrastructure d'IA, l'adoption de ForgeTrain peut éviter de se cantonner à un seul fournisseur de GPU tout en économisant plus de 10 % des coûts de puissance de calcul.

Fonctions principales

  • Moteur de pré-formation distribué : prend en charge la formation collaborative distribuée de centaines, voire de milliers de GPU, et a effectué une vérification au niveau de la production sur un cluster 64× H100. Le moteur de formation dispose de cinq granularités de capture CUDA Graph intégrées (forward / step / step_full / step_optimizer / step_nccl_opt), qui peuvent être librement combinées avec BucketedGradReducer et l'optimiseur de partitionnement wgrad-overlap pour fournir un espace d'optimisation flexible pour les tâches de formation de différentes tailles.
  • Adaptation multi-plateforme matérielle : prend en charge les puces des séries NVIDIA H100 (SM90) et Huawei Ascend. Le MFU sur le H100 atteint 44,13 % et le processus de pré-formation MiniCPM5-1B a été entièrement transmis sur le Shengteng. Cette prise en charge double plate-forme revêt une importance stratégique pour la construction d'un écosystème de puissance de calcul national : l'équipe modèle peut rapidement itérer sur H100 et terminer le déploiement de production sur Ascend.
  • Développement indépendant de AI Agent Loop : Le code du framework est entièrement généré indépendamment par l'agent de codage en mode boucle automatique, et les humains ne fournissent que les spécifications et le contexte du harnais. L'agent termine indépendamment le processus de développement complet de « lecture de l'implémentation de référence → écriture de code → démarrage de la formation → analyse des journaux → localisation de la cause première → correction des correctifs → passage du contrôle d'accès → soumission du code ». Chaque opérateur a été vérifié par une véritable formation distribuée.
  • Bibliothèque d'opérateurs hautes performances auto-développée : contient 5 opérateurs GEMM personnalisés basés sur CuTeDSL, avec un seul opérateur MFU jusqu'à 90 % ; Implémentation FlashAttention auto-développée, les performances surpassent Transformer Engine / FlashAttention 3 et sont les mêmes que FlashAttention 4. L'opérateur est compilé dans un cache persistant via AOT C-export, ce qui n'entraîne que quelques secondes de surcharge « dlopen » lors de la formation ultérieure.
  • Vérification de cohérence bit par bit : le cadre généré par l'IA et l'implémentation de référence (Megatron-LM) produisent exactement les mêmes résultats numériques sous la même entrée. Ceci est réalisé grâce à la deuxième étape « d'alignement bit par bit » de Forge Engineering : l'agent reproduit avec précision les résultats de propagation avant/arrière de l'implémentation de référence sous les contraintes Harness, garantissant l'exactitude avant d'entrer dans la phase d'optimisation des performances.
  • Harnais d'évaluation automatisé (à venir) : tests automatisés intégrés et évaluation des performances

Le système convertit « Fonctionnement correct » et « Fonctionnement rapide » en critères que la machine peut évaluer automatiquement. Harness comprend également une solution d'orchestration Agent Loop, permettant à n'importe quelle équipe de reproduire le processus complet, de l'alignement bit par bit jusqu'au dépassement des performances.

Evolution du modèle et de la version

ForgeTrain est actuellement dans la phase de publication initiale de la v0.1.0, et la feuille de route du projet est claire :

Version Date de sortie Contenu couvert
v0.1.0 (actuel) 2026-05 Le moteur de formation est rendu public et prend en charge NVIDIA H100 · MiniCPM4-0.5B (DP uniquement) et MiniCPM4-8B (TP=2). Contient le code source du moteur de formation, 5 GEMM personnalisés CuTeDSL et FlashAttention auto-développé.
Harnais (à venir) À déterminer L'échafaudage d'orchestration Agent Loop permet à Coding Agent de générer automatiquement les spécifications de base du cadre de formation. Il s'agit d'un élément clé pour atteindre la reproductibilité de « l'IA écrivant l'IA ».
Version Huawei Ascend Sur la feuille de route Le cadre de formation MiniCPM5-1B Ascend a été mis en pratique et la version officielle doit être publiée.
Harnais auto-généré Sur la feuille de route Le cadre de formation génère automatiquement un échafaudage Harness pour parvenir à une auto-amélioration récursive.

La v0.1.0 est la première étape du projet : vérifier la faisabilité de l'écriture indépendante d'un cadre de formation au niveau de la production pour AI Agent. La prochaine étape est la sortie du composant Harness pour permettre aux équipes tierces de reproduire le processus de production du cadre de formation d'Agent Loop au lieu de simplement utiliser le moteur de formation déjà produit.

Avantages techniques

L'architecture technique de ForgeTrain s'articule autour d'un lien d'innovation central : Méthodologie Forge Engineering → Développement indépendant d'Agent Loop → Moteur de formation haute performance → Adaptation cross-hardware.

Méthodologie en trois étapes de Forge Engineering

Forge Engineering est la méthodologie sous-jacente de ForgeTrain, qui est divisée en trois étapes :

  1. Établissement de normes (Exploitation) : Collectez les données opérationnelles clés de la pile de formation de référence (Megatron-LM), créez un harnais d'évaluation automatisé et définissez des références d'exactitude et de performance. Harness n'est pas un document statique, mais un ensemble de spécifications exécutables, comprenant la troncature du flux de données, la comparaison numérique, les seuils de performances et d'autres normes décidables par la machine.
  2. Réplication bit par bit : l'agent AI génère un cadre de formation cohérent petit à petit avec l'implémentation de référence sous les contraintes Harness. Cette étape ne vise pas les performances, seulement l'exactitude - si la sortie du code produit par l'agent n'est pas complètement cohérente avec l'implémentation de référence sous la même entrée, elle sera automatiquement annulée et réparée.
  3. Surpassement des performances : supprimez la restriction de cohérence binaire et passez à un harnais axé sur les performances, permettant à l'agent IA d'optimiser de manière itérative indépendante dans un espace de combinaison d'opérateurs plus grand et, en fin de compte, de surpasser l'implémentation de référence écrite par les humains en termes de vitesse. Cette étape est essentielle : le même protocole Harness peut forger des implémentations d'optimisation propriétaires complètement différentes sur différents matériels.

Agent Loop développé indépendamment

Différent du cycle traditionnel « les humains écrivent du code → compiler → déboguer », le code de ForgeTrain est complété par Coding Agent dans un cycle entièrement automatisé :

LLM (Coding Agent) → Lire le protocole du harnais → Générer le code de l'opérateur → Torchrun démarre la formation → Analyser le journal → Emplacement de la cause première → Modifier le code → Passer la porte numérique → Soumettre aux exportations/

La plus grande particularité de ce cycle est que la génération de chaque opérateur a été vérifiée par une véritable formation distribuée. Au cours du processus de développement, Agent a énuméré et comparé de manière indépendante plusieurs variantes d'implémentation d'opérateurs telles que CuTeDSL / cuBLAS / Triton / TransformerEngine et des dizaines de combinaisons de communication + capture CUDA-Graph, et a finalement sélectionné la combinaison offrant les meilleures performances comme configuration par défaut pour la production.

Hautes performances et optimisation de l'ingénierie

  • Mécanisme d'implémentation MFU à 44,13 % : GEMM personnalisé CuTeDSL via CUDA Graph cinq granularités de capture (MFU à opérateur unique atteint 90 %), noyau de fusion Triton (CE fwd+bwd / SwiGLU / RMSNorm+residual / RoPE / fusion Adam + synchronisation des paramètres) et chevauchement communication-calcul (chevauchement comm-calcul), en mode DP pur, approchant la limite théorique du matériel.
  • Zéro perte d'abstraction : contrairement aux cadres de formation traditionnels qui maintiennent la polyvalence grâce aux couches d'abstraction, ForgeTrain conserve la polyvalence dans le protocole Harness et des performances élevées dans chaque forge. Cela signifie que le code généré pour un matériel et une taille de modèle spécifiques ne contient aucune surcharge d'abstraction inutile.
  • Concept de développement grand public : contrairement aux logiciels traditionnels qui traitent le code comme un « actif » pour la maintenance à long terme, Forge Engineering décompose le code en produits profondément personnalisés, forgés à la demande. Lorsque le matériel est remplacé ou que le modèle est mis à niveau, il n'est pas nécessaire de modifier l'ancien code, mais d'exécuter directement la reforgeage du harnais.

Comment utiliser

L'utilisation de ForgeTrain est divisée en deux niveaux : l'utilisation du moteur de formation produit (actuellement disponible) et l'utilisation du cadre de formation en forgeage autonome Harness (à paraître prochainement).

Utilisation du moteur de formation (v0.1.0)

Entrée Adresse Descriptif
Dépôt GitHub https://github.com/OpenBMB/ForgeTrain Dépôt principal, contenant le code source du moteur de formation et la documentation complète
Documentation du moteur de formation exports/train_engine_0.5B/README.md Documentation CLI complète, référence de configuration, référence de performances du moteur de formation de modèle 0,5B
Documentation du moteur de formation exports/train_engine_8b/README.md Documentation complète pour le moteur de formation du modèle 8B

Exigences : Python ≥ 3.11 · CUDA 12.x · PyTorch ≥ 2.4 · NVIDIA H100 80 Go (SM90). Une pré-formation complète nécessite 8 × H100 et les premières étapes d'alignement peuvent être exécutées sur une seule carte.

Étapes typiques :

  1. Clonez le référentiel et installez les dépendances :

    clone git https://github.com/OpenBMB/ForgeTrain.git
    cd ForgeTrain/exports/train_engine_0.5B
    pip install -e .
    pip installer des transformateurs d'ensembles de données
  2. Vérifiez l'installation :

    PYTHONPATH=src python -c "à partir de la configuration d'importation training_engine_tensor ; print('OK')"

    Résultat attendu : « OK »

  3. Opérateur précompilé (première exécution) :

    PYTHONPATH=src CUSTOM_GEMM=1 OP_ATTENTION=v1 scripts python/precompile_ops.py

    Cette commande réchauffe l'exportation AOT et la construction de cpp_extension, en compilant les 5 GEMM CuTeDSL dans un cache persistant.

  4. Formation à nœud unique 8 × H100 :

    torchrun --standalone --nproc-per-node=8 \
     -m training_engine_tensor pré-entraînement \
     --num-steps 200 \
     --global-batch-size 1280 --micro-batch-size 10 \
     --seq-length 4096 \
     --hf-dataset openai/gsm8k \
     --hf-dataset-config principal \
     --hf-text-template "Question : {question}\nRéponse : {réponse}" \
     --tokenizer-path openbmb/MiniCPM4-0.5B \
     --save-dir ./checkpoints/run1

Forgé avec harnais (à venir)

Une fois le composant Harness publié, l’équipe peut commencer le forgeage indépendant des manières suivantes :

cd ForgeTrain/harnais
bash agent-loop.sh # Démarrez la boucle d'agent sans aucune intervention manuelle

Ce script conduira un agent de codage à s'exécuter en boucle, en commençant par la lecture de la pile de formation de référence, en passant par l'alignement petit à petit et l'optimisation des performances, et enfin en produisant un cadre de formation personnalisé.

Prix des produits

ForgeTrain est actuellement entièrement gratuit et open source, sous licence Apache 2.0.

  • Open source et gratuit : Le code source complet et la documentation du moteur de formation ont été rendus publics sur GitHub et peuvent être obtenus, utilisés et modifiés sans aucun frais. Aucune autorisation supplémentaire n’est requise pour un usage commercial.
  • Composant Harness : bientôt disponible, il devrait également être open source sous la licence Apache 2.0.
  • Support d'entreprise : Facewall Intelligence fournit les services de déploiement et de support technique au niveau de l'entreprise de ForgeTrain. Veuillez contacter le propriétaire de l'entreprise pour connaître les tarifs spécifiques. Pour les entreprises disposant de clusters GPU à grande échelle et souhaitant personnaliser leur pile de formation, elles peuvent négocier des services de niveau entreprise, notamment la personnalisation du harnais, l'optimisation de l'adaptation des puces et des services d'experts sur site.
  • Service Cloud/Hébergé : Il n'existe actuellement aucun service de formation hébergé, les utilisateurs doivent gérer eux-mêmes l'infrastructure GPU. La possibilité que Facewall Intelligence lance une plateforme de formation modèle basée sur ForgeTrain ne peut être exclue à l’avenir.

Dans l’ensemble, les tarifs de ForgeTrain sont extrêmement conviviaux pour la communauté des développeurs : vous bénéficiez d’un cadre de formation de niveau production à un coût d’achat nul. Les coûts cachés pour les entreprises comprennent principalement l'investissement matériel et la main d'œuvre pour l'exploitation et la maintenance des clusters GPU, mais ces coûts ne peuvent être évités lors de l'utilisation d'un cadre de pré-formation.

Scénarios d'application

  • Pré-formation et réglage fin des grands modèles : remplace directement les cadres de formation écrits par des humains tels que Megatron-LM et DeepSpeed, et est utilisé pour la pré-formation complète et le réglage fin des instructions des grands modèles au niveau de la production. ForgeTrain offre une amélioration d'environ 10 % du MFU avec le même matériel, ce qui représente une économie de puissance de calcul significative pour la formation de grands modèles qui nécessite souvent des centaines de cartes et prend des semaines. Les bénéfices attendus sont de former un modèle plus grand avec le même budget, ou de raccourcir le cycle de formation avec la même taille de modèle.
  • Adaptation de la puissance informatique domestique : ForgeTrain est le premier cadre de formation en IA auto-écrit qui parcourt le processus complet de pré-formation sur la puce Ascend de Huawei. Pour les fabricants de puces nationaux et les entreprises qui utilisent la puissance de calcul nationale, ForgeTrain peut être utilisé pour créer rapidement des piles de formation exclusives hautes performances pour Ascend et d'autres puces sans investir dix ans dans la construction d'un autre écosystème CUDA. L'avantage attendu est que le délai entre « l'enregistrement de la puce » et la « disponibilité du logiciel » est considérablement réduit.
  • Accélération de la recherche en IA : ForgeTrain permet de "faire passer la croissance annuelle de la capacité des grands modèles d'une fonction à l'échelle humaine à une fonction à l'échelle de la puissance de calcul". L'équipe de recherche utilise Harness pour itérer de manière indépendante dans un espace de recherche plus large et expérimenter rapidement de nouvelles méthodes de formation, architectures de modèles et stratégies d'optimisation. Les bénéfices attendus déplaceront l’énergie de l’équipe de la maintenance du cadre de formation vers l’innovation des algorithmes de modèles.
  • Software Engineering Paradigm Experiment : en tant que première instance de Forge Engineering au niveau industriel, ForgeTrain fournit une méthodologie de référence et une référence architecturale pour la génération automatique d'IA pour d'autres systèmes complexes (compilateurs, bases de données, systèmes d'exploitation, environnements d'exécution d'apprentissage en profondeur). Les équipes de recherche peuvent explorer le développement autonome de l’IA dans leurs propres domaines sur la base du modèle Harness de ForgeTrain.
  • Développement de modèles end-side : Wall-face Intelligence a utilisé ForgeTrain pour entraîner MiniCPM5-1B, se classant premier au monde à une échelle inférieure à 2B sur la liste AA. Cela prouve que ForgeTrain est également adapté au développement de modèles à haute efficacité du côté final : les équipes qui ont besoin de scénarios de déploiement final tels que l'IoT mobile peuvent

Suivez directement ce parcours de formation.

Personnes concernées

  • Ingénieurs et chercheurs en formation de grands modèles : il s'agit du groupe d'utilisateurs principal de ForgeTrain. Ils peuvent utiliser directement le moteur de formation pour la pré-formation de grands modèles, ou se plonger dans le code opérateur généré par Agent Loop pour apprendre la mise en œuvre d'un cadre de formation haute performance. La base de code open source de ForgeTrain elle-même est un manuel exécutable sur le « Projet de formation haute performance H100 ».
  • Équipe d'infrastructure IA : les équipes techniques responsables de l'infrastructure de formation en IA d'entreprise peuvent utiliser ForgeTrain pour réduire les coûts de puissance de calcul (amélioration d'environ 10 % du MFU par rapport à Megatron-LM), tout en évitant d'être enfermées dans un seul fournisseur de puces grâce à une prise en charge multi-matériel. Pour les équipes qui étudient les options de cadre de formation, la licence Apache 2.0 de ForgeTrain et l'écosystème communautaire open source en font une option à faible risque et à long terme.
  • Développeurs d'écosystèmes de puces nationaux : les développeurs qui écrivent des piles de formation pour les puces nationales telles qu'Ascend et Cambrian peuvent utiliser la méthodologie Harness de ForgeTrain pour créer rapidement des cadres de formation exclusifs pour les puces nationales au lieu de repartir de zéro. Le modèle de « forgeage automatique piloté par protocole » de Harness réduit le coût de la main-d'œuvre et le cycle de temps d'adaptation des puces.
  • Passionnés d'agents IA et de technologies d'automatisation : ForgeTrain est la pratique de pointe du "IA making AI". Les développeurs intéressés par Agent Loop, la génération automatique de code, l'auto-amélioration de l'IA et d'autres orientations techniques peuvent se plonger dans son mécanisme de mise en œuvre. Agent-Friendly Quick Deploy est conçu pour que Coding Agent puisse terminer le processus complet de déploiement et d'acceptation de manière indépendante.

Ne convient pas au grand public : ForgeTrain ne convient pas aux scénarios suivants : développeurs individuels qui ne disposent pas de clusters GPU hautes performances (les utilisateurs avec une seule carte ou même sans carte ne peuvent pas réaliser sa valeur) ; les équipes qui ont besoin de services de formation SaaS prêts à l'emploi (ForgeTrain est un framework open source en libre-service et ne fournit pas de services d'hébergement) ; des équipes qui n'ont aucune compréhension du sous-jacent CUDA / PyTorch et ne sont pas disposées à investir dans l'ingénierie, l'exploitation et la maintenance ; besoin d'un MLops complet Les entreprises qui utilisent la plateforme (gestion des ensembles de données, suivi des expériences, enregistrement du modèle, etc.) doivent l'utiliser en conjonction avec la plateforme MLops traditionnelle, et non en remplacement.

Résumé et Outlook

La principale compétitivité de ForgeTrain réside dans sa capacité à réaliser pour la première fois la transition complète de « l’IA créée par l’IA » du concept à la mise en œuvre au niveau de la production. Il ne s'agit pas d'une démonstration de validation de principe, mais d'un cadre de formation de niveau production qui a produit de véritables poids de modèle sur un cluster de 64 cartes. Sa méthodologie Forge Engineering fournit un chemin reproductible permettant à l'IA d'écrire indépendamment des logiciels d'infrastructure - de l'établissement des normes à l'alignement bit par bit jusqu'au dépassement des performances, chaque étape est soumise à des normes de réussite claires.

Limites actuelles :

  • Gamme limitée de modèles pris en charge : la v0.1.0 n'a vérifié que deux configurations : MiniCPM4-0.5B (DP uniquement) et MiniCPM4-8B (TP=2). Les modèles à plus grande échelle ou avec des architectures différentes nécessitent un travail d'adaptation supplémentaire.
  • Le composant Harness n'est pas encore open source : actuellement les utilisateurs ne peuvent utiliser que le moteur de formation qui a été produit, et ne peuvent pas encore expérimenter le processus complet de « forgeage indépendant ». La sortie du framework d'orchestration Agent Loop est la fonctionnalité la plus attendue par la communauté.
  • Seuil matériel élevé : une formation complète nécessite un GPU H100 de 80 Go ou plus, et une seule carte ne peut pas compléter la pré-formation au niveau de la production, limitant la participation des développeurs individuels.
  • L'écosystème communautaire en est à ses débuts : par rapport à Megatron-LM et DeepSpeed, qui disposent de communautés matures et d'une documentation riche, les tutoriels, cas et contributions de tiers de ForgeTrain sont encore en train de s'accumuler.
  • Manque d'intégration MLops : ForgeTrain se concentre sur le moteur de formation lui-même et n'inclut pas les fonctionnalités MLops telles que la gestion des expériences, l'enregistrement des modèles et le déploiement, et doit être utilisé conjointement avec d'autres outils.

Évaluation des risques d'approvisionnement et d'adoption : Pour les entreprises qui envisagent d'acheter ForgeTrain, il est recommandé d'adopter la stratégie « pilote d'abord, vérification à petite échelle, puis expansion ». Tout d'abord, vérifiez si les données de stabilité et de performances du cadre sont cohérentes avec celles officielles sur une petite tâche de formation (telle qu'un MiniCPM4-0.5B à 8 cartes à nœud unique) ; après confirmation, étendez-vous à la formation de modèles à plus grande échelle. Une attention particulière doit être accordée aux aspects suivants : l'heure de sortie officielle de Harness (qui déterminera si un flux de travail de forgeage autonome peut être mis en œuvre), le modèle de facturation et le SLA de service de Wallface Intelligence pour le support au niveau de l'entreprise, et la durabilité de la maintenance à long terme du projet. Du point de vue des risques techniques, ForgeTrain est basé sur des composants open source matures (PyTorch, CUTLASS, FlashAttention) et le moteur de formation de base a une grande crédibilité ; le principal risque réside dans la qualité de livraison du composant Harness et dans la capacité de l’écosystème communautaire à continuer de croître. Dans l’ensemble, ForgeTrain est un projet à fort potentiel et a dans un premier temps prouvé sa faisabilité technique, mais il lui faudra encore beaucoup de temps pour passer par une construction écologique avant de devenir un cadre de formation grand public.

Outils associés : hugging-face, replicate

Informations de version

  • Version initiale :La première version publique prend en charge la pré-formation distribuée des MiniCPM4-0.5B et MiniCPM4-8B sur NVIDIA H100 ; comprend le code source du moteur de formation, 5 opérateurs GEMM personnalisés CuTeDSL et l'implémentation FlashAttention auto-développée ; le composant Harness (framework d'orchestration Agent Loop) doit être publié.
  • Version initiale :La première version rendue publique prend en charge la pré-formation distribuée des MiniCPM4-0.5B et MiniCPM4-8B sur NVIDIA H100.

Avis des utilisateurs

  • Chargement des avis...