फोर्जट्रेन मुफ्त

-

फोर्जट्रेन वॉलफेस इंटेलिजेंस और सिंघुआ यूनिवर्सिटी के ओपनबीएमबी समुदाय द्वारा जारी एक ओपन सोर्स बड़ा मॉडल प्री-ट्रेनिंग फ्रेमवर्क है। फोर्ज इंजीनियरिंग की तीन-चरण पद्धति (मानक स्थापना → बिट-बाय-बिट संरेखण → प्रदर्शन ओवरशूट) का उपयोग करते हुए, फ्रेमवर्क कोड एआई एजेंट लूप द्वारा 100% स्व-लिखित है। NVIDIA H100 पर प्रशिक्षण गति मेगेट्रॉन-एलएम से लगभग 10% अधिक है। यह पूरी तरह से Huawei की Ascend चिप पर पूर्व-प्रशिक्षण प्रक्रिया से गुजरा है और MiniCPM5-1B मॉडल को सफलतापूर्वक प्रशिक्षित किया है।

फोर्जट्रेन उत्पाद इंटरफेस

फोर्जट्रेन - एआई एजेंट का स्व-लिखित बड़ा मॉडल प्री-ट्रेनिंग ढांचा

मुख्य पैरामीटर और आँकड़े

फोर्जट्रेन एक उत्पादन-स्तर का बड़ा मॉडल प्री-ट्रेनिंग फ्रेमवर्क है जो पूरी तरह से एआई एजेंटों द्वारा शून्य मानव कोड हस्तक्षेप के साथ लिखा गया है। इसे फेस वॉल इंटेलिजेंस और सिंघुआ विश्वविद्यालय की प्राकृतिक भाषा प्रसंस्करण प्रयोगशाला के ओपनबीएमबी ओपन सोर्स समुदाय द्वारा संयुक्त रूप से जारी किया गया था, और यह अवधारणा सत्यापन से उत्पादन कार्यान्वयन तक "एआई फॉर एआई" की यात्रा में एक महत्वपूर्ण मील का पत्थर दर्शाता है।

पैरामीटर आइटम मूल्य
डेवलपर वॉल-फेसिंग इंटेलिजेंस (मॉडलबेस्ट) और सिंघुआ यूनिवर्सिटी ओपनबीएमबी कम्युनिटी
लक्ष्य परिदृश्य बड़े पैमाने पर वितरित एलएलएम पूर्व-प्रशिक्षण (सौ-कैलोरी से किलो-कैलोरी स्तर)
समर्थित हार्डवेयर NVIDIA H100 (SM90)/हुआवेई एसेंड सीरीज
सत्यापित मॉडल MiniCPM4-0.5B, MiniCPM4-8B, MiniCPM5-1B
प्रशिक्षण रूपरेखा स्केल केवल डीपी (0.5बी) और टीपी=2 / डीपी=4 (8बी) का समर्थन करता है
कोड लिखने की विधि 100% एआई एजेंट लूप स्व-निर्मित, शून्य मानव मैनुअल संपादन
ओपन सोर्स लाइसेंस अपाचे 2.0
प्रशिक्षण थ्रूपुट एच100 पर एमएफयू 44.13% तक पहुंच गया, मेगेट्रॉन-एलएम से लगभग 10% आगे निकल गया
मापा क्लस्टर 64 एच100 जीपीयू, बीएफ16 सटीकता, वितरित डेटा समानांतर
हार्नेस घटक जल्द ही खुला स्रोत होगा (मचान जो एजेंट लूप के स्वचालित आउटपुट प्रशिक्षण ढांचे को संचालित करता है)

फोर्जट्रेन का एमएफयू (मॉडल फ्लॉप्स यूटिलाइजेशन) 44.13% मिनीसीपीएम4-0.5बी को 64× एच100, बीएफ16, शुद्ध डीपी मोड में प्रशिक्षित करके मापा गया था। तुलना के लिए, समान हार्डवेयर कॉन्फ़िगरेशन के तहत मेगेट्रॉन-एलएम v0.15 का एमएफयू लगभग 40% है। इसका मतलब यह है कि कंप्यूटिंग शक्ति में समान निवेश के साथ, फोर्जट्रेन जीपीयू कंप्यूटिंग लागत का लगभग 10% बचा सकता है, या उसी बजट के तहत एक बड़े मॉडल को प्रशिक्षित कर सकता है। 64-कार्ड क्लस्टर के लिए, 10% कंप्यूटिंग पावर बचत का मतलब बिजली और मशीन समय की लागत में हजारों डॉलर होता है।

उपयोगकर्ता और बाज़ार की पहचान

फोर्जट्रेन ने अपनी रिलीज के बाद से शिक्षा जगत और उद्योग जगत का व्यापक ध्यान आकर्षित किया है। इसका मूल मूल्य यह है कि इसने पहली बार इस प्रस्ताव को सत्यापित किया है कि "एआई एजेंट स्वतंत्र रूप से उत्पादन-स्तरीय प्रशिक्षण ढांचा लिख ​​सकता है।"

  • शैक्षणिक अनुमोदन: परियोजना को सिंघुआ विश्वविद्यालय की प्राकृतिक भाषा प्रसंस्करण प्रयोगशाला द्वारा शुरू किया गया था, और संबंधित पद्धति को शीर्ष सम्मेलन के सबमिशन चरण में प्रकाशित किया गया है। पेपर का प्रीप्रिंट फोर्ज इंजीनियरिंग की तीन-चरणीय पद्धति को उद्धृत करता है, जो एआई स्वायत्त लेखन बुनियादी ढांचे के लिए एक प्रतिलिपि प्रस्तुत करने योग्य सैद्धांतिक ढांचा प्रदान करता है।
  • औद्योगिक कार्यान्वयन: वॉल-फेसिंग इंटेलिजेंस ने Huawei Ascend चिप पर MiniCPM5-1B की पूर्व-प्रशिक्षण प्रक्रिया को पूरी तरह से चलाने के लिए फोर्जट्रेन का उपयोग किया है। यह मॉडल 2बी आकार से नीचे एए सूची में दुनिया में पहले स्थान पर है। इसका मतलब यह है कि पहली बार, घरेलू चिप्स ने "प्रशिक्षण ढांचे को मानव लिखावट द्वारा अनुकूलित किया जाना चाहिए" की पारंपरिक पथ निर्भरता को तोड़ते हुए, स्व-लिखित एआई प्रशिक्षण स्टैक के माध्यम से बड़े मॉडलों का उत्पादन-स्तर पूर्व-प्रशिक्षण पूरा कर लिया है।
  • ओपन सोर्स कम्युनिटी: GitHub रिपॉजिटरी (OpenBMB/ForgeTrain) Apache 2.0 प्रोटोकॉल के तहत ओपन सोर्स है। सामुदायिक योगदानकर्ताओं में वॉलफेस कोर टीम और बाहरी डेवलपर्स शामिल हैं। V0.1.0 प्रशिक्षण इंजन वर्तमान में जारी किया गया है, और हार्नेस ऑर्केस्ट्रेशन फ्रेमवर्क (एजेंट लूप स्वचालित मचान) जल्द ही आने वाली स्थिति में है।
  • उद्योग बेंचमार्किंग: NVIDIA VibeTensor (उत्पादन के लिए चिह्नित नहीं), एंथ्रोपिक सी कंपाइलर ओपनएआई हार्नेस जैसे प्रतिस्पर्धी उत्पादों की तुलना में, फोर्जट्रेन एकमात्र एआई पीढ़ी का ढांचा है जो उत्पादन स्तर पर एक साथ प्रयोग करने योग्य है, उत्कृष्ट प्रदर्शन करता है, और पूरी तरह से खुला स्रोत है। उद्योग के संदर्भ में इसका महत्वपूर्ण संदर्भ मूल्य और इंजीनियरिंग प्रदर्शन महत्व है जहां मेटा जैसे प्रमुख निर्माता "एआई लेखन एआई" की खोज कर रहे हैं।

लागत लाभ

फोर्जट्रेन के लागत लाभ को तीन स्तरों से समझने की आवश्यकता है:

तुलनात्मक आयाम फोर्जट्रेन मेगेट्रॉन-एलएम (NVIDIA) हस्तलेखन प्रशिक्षण रूपरेखा
विकास लागत एआई एजेंट स्वतंत्र रूप से लिखा गया है, मानव निवेश शून्य के करीब है वरिष्ठ सिस्टम इंजीनियरों की एक टीम द्वारा दीर्घकालिक रखरखाव की आवश्यकता है महीनों से वर्षों तक टीम विकास चक्र
कंप्यूटिंग दक्षता 44.13% एमएफयू, मेगेट्रॉन से लगभग 10% अधिक ~40% एमएफयू (समान हार्डवेयर) टीम अनुकूलन स्तर पर निर्भर करता है, आमतौर पर परिपक्व रूपरेखाओं से कम
हार्डवेयर अनुकूलन H100 + एसेंड डुअल प्लेटफॉर्म, हार्नेस स्वचालित रूप से अनुकूलित हो सकता है केवल NVIDIA GPU प्रत्येक नए हार्डवेयर अनुकूलन के लिए पुनर्विकास आवश्यक
लाइसेंस Apache 2.0 पूरी तरह से खुला स्रोत और मुफ़्त है खुला स्रोत लेकिन पारिस्थितिक रूप से बंद CUDA स्व-अनुसंधान लागत अधिक है
प्रशिक्षण आउटपुट MiniCPM5-1B उत्पादन-स्तर मॉडल का उत्पादन किया गया है विकास और रखरखाव के लिए अतिरिक्त जनशक्ति की आवश्यकता है पूर्ण लिंक समर्थन आवश्यक है

सी-साइड उपयोगकर्ता: फोर्जट्रेन सीधे व्यक्तिगत उपयोगकर्ताओं पर लक्षित नहीं है। इसकी उपयोग सीमा मल्टी-कार्ड जीपीयू क्लस्टर वाले अनुसंधान संस्थानों या उद्यमों के लिए है। हालाँकि, खुले स्रोत और मुफ़्त तरीकों के माध्यम से, कंप्यूटिंग संसाधनों वाली कोई भी टीम इसे शून्य लागत पर प्राप्त और उपयोग कर सकती है।

डेवलपर्स और अनुसंधान संस्थान: ओपन सोर्स लाइसेंस (अपाचे 2.0) मुफ्त उपयोग, संशोधन और व्यावसायिक उपयोग की अनुमति देता है। बंद-स्रोत प्रशिक्षण ढांचे की तुलना में जिसके लिए वाणिज्यिक लाइसेंस की खरीद की आवश्यकता होती है, फोर्जट्रेन को अपनाने की लागत केवल क्लस्टर हार्डवेयर और बिजली की लागत है। अकादमिक अनुसंधान टीमों के लिए, यह बड़े मॉडल पूर्व-प्रशिक्षण प्रयोगों के लिए सीमा को काफी कम कर देता है।

उद्यम उपयोगकर्ता: घरेलू चिप अनुकूलन में फोर्जट्रेन की सफलता का महत्वपूर्ण व्यावसायिक मूल्य है। उद्यमों को स्व-विकसित CUDA संगत स्टैक विकसित करने के लिए N वर्षों तक प्रतीक्षा करने की आवश्यकता नहीं है। वे घरेलू चिप्स पर बड़े मॉडल प्रशिक्षण शुरू करने के लिए सीधे फोर्जट्रेन का उपयोग कर सकते हैं। मध्यम और बड़े उद्यमों के लिए जो एआई बुनियादी ढांचे का निर्माण कर रहे हैं, फोर्जट्रेन को अपनाने से कंप्यूटिंग पावर लागत में 10% से अधिक की बचत करते हुए एकल जीपीयू विक्रेता में बंद होने से बचा जा सकता है।

मुख्य कार्य

  • वितरित पूर्व-प्रशिक्षण इंजन: सैकड़ों से हजारों जीपीयू के वितरित सहयोगात्मक प्रशिक्षण का समर्थन करता है, और 64× H100 क्लस्टर पर उत्पादन-स्तर का सत्यापन पूरा कर चुका है। प्रशिक्षण इंजन में पांच अंतर्निहित CUDA ग्राफ़ कैप्चर ग्रैन्युलैरिटीज़ (फॉरवर्ड / स्टेप / स्टेप_फुल / स्टेप_ऑप्टिमाइज़र / स्टेप_एनसीसीएल_ऑप्ट) हैं, जिन्हें विभिन्न आकारों के प्रशिक्षण कार्यों के लिए लचीला अनुकूलन स्थान प्रदान करने के लिए BucketedGradReducer और शार्डिंग ऑप्टिमाइज़र wgrad-overlap के साथ स्वतंत्र रूप से जोड़ा जा सकता है।
  • क्रॉस-हार्डवेयर प्लेटफ़ॉर्म अनुकूलन: NVIDIA H100 (SM90) और Huawei Ascend श्रृंखला चिप्स दोनों का समर्थन करता है। एच100 पर एमएफयू 44.13% तक पहुंच गया है, और मिनीसीपीएम5-1बी पूर्व-प्रशिक्षण प्रक्रिया शेंगटेंग पर पूरी तरह से पारित हो गई है। घरेलू कंप्यूटिंग पावर पारिस्थितिकी तंत्र के निर्माण के लिए यह दोहरी-प्लेटफ़ॉर्म समर्थन रणनीतिक महत्व का है - मॉडल टीम जल्दी से H100 पर पुनरावृत्ति कर सकती है और Ascend पर उत्पादन परिनियोजन पूरा कर सकती है।
  • एआई एजेंट लूप स्वतंत्र विकास: फ्रेमवर्क कोड स्वचालित लूप मोड में कोडिंग एजेंट द्वारा पूरी तरह से स्वतंत्र रूप से उत्पन्न होता है, और मनुष्य केवल हार्नेस विनिर्देश और संदर्भ प्रदान करते हैं। एजेंट स्वतंत्र रूप से "संदर्भ कार्यान्वयन पढ़ना → कोड लिखना → प्रशिक्षण शुरू करना → लॉग पार्स करना → मूल कारण स्थान → पैच फिक्स करना → एक्सेस कंट्रोल पास करना → कोड सबमिट करना" की संपूर्ण विकास प्रक्रिया को पूरा करता है। प्रत्येक ऑपरेटर को वास्तविक वितरित प्रशिक्षण द्वारा सत्यापित किया गया है।
  • स्व-विकसित उच्च-प्रदर्शन ऑपरेटर लाइब्रेरी: इसमें CuTeDSL पर आधारित 5 कस्टम GEMM ऑपरेटर शामिल हैं, जिसमें 90% तक का एकल ऑपरेटर MFU है; स्व-विकसित फ्लैशअटेंशन कार्यान्वयन, प्रदर्शन ट्रांसफॉर्मर इंजन / फ्लैशअटेंशन 3 से आगे निकल जाता है, और फ्लैशअटेंशन 4 के समान है। ऑपरेटर को एओटी सी-एक्सपोर्ट के माध्यम से लगातार कैश में संकलित किया जाता है, जो बाद के प्रशिक्षण में केवल कुछ सेकंड के dlopen ओवरहेड को खर्च करता है।
  • बिट-दर-बिट स्थिरता सत्यापन: एआई-जनरेटेड फ्रेमवर्क और संदर्भ कार्यान्वयन (मेगेट्रॉन-एलएम) एक ही इनपुट के तहत बिल्कुल समान संख्यात्मक परिणाम उत्पन्न करते हैं। यह फोर्ज इंजीनियरिंग के "बिट-बाय-बिट संरेखण" के दूसरे चरण के माध्यम से प्राप्त किया जाता है - एजेंट प्रदर्शन अनुकूलन चरण में प्रवेश करने से पहले शुद्धता सुनिश्चित करते हुए, हार्नेस बाधाओं के तहत संदर्भ कार्यान्वयन के आगे/पीछे प्रसार परिणामों को सटीक रूप से पुन: पेश करता है।
  • स्वचालित मूल्यांकन हार्नेस (जल्द ही आ रहा है): अंतर्निहित स्वचालित परीक्षण और प्रदर्शन मूल्यांकन

सिस्टम "दाहिनी ओर दौड़ना" और "तेज़ी से दौड़ना" को ऐसे मानदंडों में परिवर्तित करता है जिन्हें मशीन स्वचालित रूप से आंक सकती है। हार्नेस में एक एजेंट लूप ऑर्केस्ट्रेशन समाधान भी शामिल है, जो किसी भी टीम को बिट-बाय-बिट संरेखण से लेकर प्रदर्शन ओवरशूट तक पूरी प्रक्रिया को पुन: पेश करने की अनुमति देता है।

मॉडल और संस्करण विकास

फोर्जट्रेन वर्तमान में v0.1.0 के प्रारंभिक रिलीज चरण में है, और परियोजना का रोडमैप स्पष्ट है:

संस्करण रिलीज की तारीख कवर की गई सामग्री
v0.1.0 (वर्तमान) 2026-05 प्रशिक्षण इंजन सार्वजनिक रूप से जारी किया गया है, जो NVIDIA H100 · MiniCPM4-0.5B (केवल DP) और MiniCPM4-8B (TP=2) का समर्थन करता है। इसमें प्रशिक्षण इंजन स्रोत कोड, 5 CuTeDSL कस्टम GEMM और स्व-विकसित फ़्लैशअटेंशन शामिल हैं।
हार्नेस (जल्द ही आ रहा है) निर्धारित किया जाना है एजेंट लूप ऑर्केस्ट्रेशन मचान कोडिंग एजेंट को प्रशिक्षण ढांचे के मुख्य विनिर्देशों को स्वचालित रूप से उत्पन्न करने की अनुमति देता है। यह "एआई लेखन एआई" की पुनरुत्पादकता प्राप्त करने के लिए एक महत्वपूर्ण घटक है।
हुआवेई एसेंड संस्करण रोडमैप पर MiniCPM5-1B एसेंड प्रशिक्षण ढांचे को व्यवहार में लाया गया है और आधिकारिक संस्करण जारी किया जाना है।
स्व-निर्मित हार्नेस रोडमैप पर पुनरावर्ती आत्म-सुधार प्राप्त करने के लिए प्रशिक्षण ढांचा स्वयं हार्नेस मचान उत्पन्न करता है।

v0.1.0 परियोजना का पहला मील का पत्थर है - एआई एजेंट के लिए स्वतंत्र रूप से उत्पादन-स्तरीय प्रशिक्षण ढांचे को लिखने की व्यवहार्यता की पुष्टि करना। अगला मील का पत्थर हार्नेस घटक को जारी करना है ताकि तीसरे पक्ष की टीमों को पहले से ही उत्पादित प्रशिक्षण इंजन का उपयोग करने के बजाय एजेंट लूप की प्रशिक्षण रूपरेखा उत्पादन प्रक्रिया को पुन: पेश करने में सक्षम बनाया जा सके।

तकनीकी लाभ

फोर्जट्रेन की तकनीकी वास्तुकला एक मुख्य नवाचार लिंक के इर्द-गिर्द घूमती है: फोर्ज इंजीनियरिंग पद्धति → एजेंट लूप का स्वतंत्र विकास → उच्च-प्रदर्शन प्रशिक्षण इंजन → क्रॉस-हार्डवेयर अनुकूलन

फोर्ज इंजीनियरिंग तीन चरणीय पद्धति

फोर्ज इंजीनियरिंग फोर्जट्रेन की अंतर्निहित कार्यप्रणाली है, जिसे तीन चरणों में विभाजित किया गया है:

  1. Establishing standards (Harnessing): Collect key operating data from the reference training stack (Megatron-LM), build automated evaluation Harness, and define correctness and performance benchmarks. Harness is not a static document, but a set of executable specifications - including data stream truncation, numerical comparison, performance thresholds and other machine-decidable standards.
  2. Bit-for-Bit Replication: The AI ​​Agent generates a training framework that is consistent bit by bit with the reference implementation under Harness constraints. This stage does not pursue performance, only correctness - if the output of the code produced by the Agent is not completely consistent with the reference implementation under the same input, it will be automatically rolled back and repaired.
  3. Performance Surpassing: Lift the binary consistency restriction and switch to performance-oriented Harness, allowing the AI ​​Agent to independently iteratively optimize in a larger operator combination space, and ultimately surpass the reference implementation written by humans in speed. यह चरण महत्वपूर्ण है - एक ही हार्नेस प्रोटोकॉल विभिन्न हार्डवेयर पर पूरी तरह से अलग मालिकाना अनुकूलन कार्यान्वयन बना सकता है।

एजेंट लूप स्वतंत्र रूप से विकसित हुआ

Different from the traditional "humans write code → compile → debug" cycle, ForgeTrain's code is completed by Coding Agent in a fully automated cycle:

LLM (Coding Agent) → Read Harness protocol → Generate operator code → torchrun starts training → Parse log → Root cause location → Modify code → Pass numerical gate → Submit to exports/

इस चक्र की सबसे बड़ी विशेषता यह है कि प्रत्येक ऑपरेटर की पीढ़ी को वास्तविक वितरित प्रशिक्षण द्वारा सत्यापित किया गया है। During the development process, Agent independently enumerated and benchmarked multiple operator implementation variants such as CuTeDSL / cuBLAS / Triton / TransformerEngine and dozens of communication + CUDA-Graph capture combinations, and finally selected the combination with the best performance as the default configuration for production.

उच्च प्रदर्शन और इंजीनियरिंग अनुकूलन

  • 44.13% एमएफयू कार्यान्वयन तंत्र: सीयूडीए ग्राफ के माध्यम से CuTeDSL कस्टम GEMM पांच कैप्चर ग्रैन्युलैरिटी (एकल ऑपरेटर एमएफयू 90% तक पहुंचता है), ट्राइटन फ्यूजन कर्नेल (CE fwd + bwd / swiGLU / RMSNorm + अवशिष्ट / RoPE / फ्यूजन एडम + पैरामीटर सिंक्रनाइज़ेशन), और संचार-गणना ओवरलैप (कॉम-कंप्यूट ओवरलैप), शुद्ध डीपी मोड में, सैद्धांतिक के करीब हार्डवेयर की सीमा.
  • शून्य अमूर्त हानि: अमूर्त परतों के माध्यम से बहुमुखी प्रतिभा बनाए रखने वाले पारंपरिक प्रशिक्षण ढांचे के विपरीत, फोर्जट्रेन हार्नेस प्रोटोकॉल में बहुमुखी प्रतिभा और प्रत्येक फोर्ज में उच्च प्रदर्शन को बरकरार रखता है। इसका मतलब यह है कि एक विशिष्ट हार्डवेयर और मॉडल आकार के लिए उत्पन्न कोड में कोई अनावश्यक अमूर्त ओवरहेड नहीं होता है।
  • उपभोक्ता विकास अवधारणा: पारंपरिक सॉफ्टवेयर के विपरीत, जो दीर्घकालिक रखरखाव के लिए कोड को "संपत्ति" के रूप में मानता है, फोर्ज इंजीनियरिंग मांग के अनुसार गहराई से अनुकूलित उत्पादों में कोड को अनबंडल करता है। जब हार्डवेयर बदला जाता है या मॉडल अपग्रेड किया जाता है, तो पुराने कोड को संशोधित करने की कोई आवश्यकता नहीं होती है, बल्कि सीधे हार्नेस री-फोर्जिंग चलाते हैं।

कैसे उपयोग करें

फोर्जट्रेन के उपयोग को दो स्तरों में विभाजित किया गया है: उत्पादित प्रशिक्षण इंजन का उपयोग करना (वर्तमान में उपलब्ध) और हार्नेस स्वायत्त फोर्जिंग प्रशिक्षण ढांचे का उपयोग करना (जल्द ही जारी किया जाएगा)।

प्रशिक्षण इंजन का उपयोग करना (v0.1.0)

प्रवेश पता विवरण
GitHub रिपोजिटरी https://github.com/OpenBMB/ForgeTrain मुख्य भंडार, जिसमें प्रशिक्षण इंजन स्रोत कोड और संपूर्ण दस्तावेज़ीकरण शामिल है
प्रशिक्षण इंजन दस्तावेज़ीकरण exports/train_engine_0.5B/README.md पूर्ण सीएलआई दस्तावेज़ीकरण, कॉन्फ़िगरेशन संदर्भ, 0.5बी मॉडल प्रशिक्षण इंजन का प्रदर्शन आधार रेखा
प्रशिक्षण इंजन दस्तावेज़ीकरण exports/train_engine_8b/README.md 8बी मॉडल प्रशिक्षण इंजन के लिए संपूर्ण दस्तावेज़

आवश्यकताएँ: पायथन ≥ 3.11 · CUDA 12.x · PyTorch ≥ 2.4 · NVIDIA H100 80GB (SM90)। पूर्ण पूर्व-प्रशिक्षण के लिए 8× H100 की आवश्यकता होती है, और प्रारंभिक संरेखण चरणों को एक ही कार्ड पर चलाया जा सकता है।

सामान्य चरण:

  1. रिपॉजिटरी को क्लोन करें और निर्भरताएँ स्थापित करें:

    गिट क्लोन https://github.com/OpenBMB/ForgeTrain.git
    सीडी फोर्जट्रेन/निर्यात/ट्रेन_इंजन_0.5बी
    पिप इंस्टाल -ई।
    पिप डेटासेट ट्रांसफार्मर स्थापित करें
  2. इंस्टॉलेशन सत्यापित करें:

    PYTHONPATH=src Python -c "training_engine_tensor आयात कॉन्फ़िगरेशन से; प्रिंट('ठीक')"

    अपेक्षित आउटपुट: ठीक

  3. पूर्व संकलित ऑपरेटर (पहला रन):

    PYTHONPATH=src CUSTOM_GEMM=1 OP_ATTENTION=v1 पायथॉन स्क्रिप्ट/precompile_ops.py

    यह कमांड AOT एक्सपोर्ट और cpp_extension बिल्ड को गर्म करता है, 5 CuTeDSL GEMM को एक सतत कैश में संकलित करता है।

  4. एकल नोड 8× H100 प्रशिक्षण:

    टॉर्चरुन --स्टैंडअलोन --nproc-प्रति-नोड=8 \
     -एम ट्रेनिंग_इंजन_टेंसर प्रीट्रेन \
     --संख्या-चरण 200 \
     --वैश्विक-बैच-आकार 1280 --माइक्रो-बैच-आकार 10 \
     --सेक-लंबाई 4096 \
     --hf-डेटासेट openai/gsm8k \
     --hf-डेटासेट-कॉन्फ़िगरेशन मुख्य \
     --hf-text-टेम्पलेट "प्रश्न: {प्रश्न}\nउत्तर: {उत्तर}" \
     --टोकनाइज़र-पथ ओपनबीएमबी/मिनीसीपीएम4-0.5बी \
     --save-dir ./checkpoints/run1

हार्नेस के साथ जाली (जल्द ही आ रहा है)

हार्नेस घटक जारी होने के बाद, टीम निम्नलिखित तरीकों से स्वतंत्र फोर्जिंग शुरू कर सकती है:

सीडी फोर्जट्रेन/हार्नेस
बैश एजेंट-लूप.श # शून्य मैन्युअल हस्तक्षेप के साथ एजेंट लूप प्रारंभ करें

यह स्क्रिप्ट एक कोडिंग एजेंट को एक लूप में चलाने के लिए प्रेरित करेगी, जो संदर्भ प्रशिक्षण स्टैक को पढ़ने से शुरू करके, बिट-दर-बिट संरेखण और प्रदर्शन अनुकूलन के माध्यम से, और अंत में एक अनुकूलित प्रशिक्षण ढांचे का निर्माण करेगी।

उत्पाद का मूल्य निर्धारण

ForgeTrain वर्तमान में पूरी तरह से मुफ़्त और खुला स्रोत है, जिसे Apache 2.0 लाइसेंस के तहत लाइसेंस प्राप्त है।

  • खुला स्रोत और मुफ़्त: प्रशिक्षण इंजन का संपूर्ण स्रोत कोड और दस्तावेज़ीकरण GitHub पर सार्वजनिक रूप से जारी किया गया है, और इसे बिना किसी शुल्क के प्राप्त, उपयोग और संशोधित किया जा सकता है। व्यावसायिक उपयोग के लिए किसी अतिरिक्त प्राधिकरण की आवश्यकता नहीं है।
  • हार्नेस घटक: जल्द ही आ रहा है, अपाचे 2.0 लाइसेंस के तहत खुला स्रोत होने की भी उम्मीद है।
  • एंटरप्राइज़ समर्थन: फेसवॉल इंटेलिजेंस फोर्जट्रेन की एंटरप्राइज़-स्तरीय तैनाती और तकनीकी सहायता सेवाएँ प्रदान करता है। कृपया विशिष्ट मूल्य निर्धारण के लिए व्यवसाय स्वामी से संपर्क करें। ऐसे उद्यमों के लिए जिनके पास बड़े पैमाने पर जीपीयू क्लस्टर हैं और वे अपने प्रशिक्षण स्टैक को अनुकूलित करना चाहते हैं, वे हार्नेस अनुकूलन, चिप अनुकूलन अनुकूलन और विशेषज्ञ ऑनसाइट सेवाओं सहित उद्यम-स्तरीय सेवाओं पर बातचीत कर सकते हैं।
  • क्लाउड/होस्टेड सेवा: वर्तमान में कोई होस्टेड प्रशिक्षण सेवा नहीं है, उपयोगकर्ताओं को स्वयं GPU बुनियादी ढांचे का प्रबंधन करने की आवश्यकता है। भविष्य में फेसवॉल इंटेलिजेंस द्वारा फोर्जट्रेन पर आधारित एक मॉडल प्रशिक्षण प्लेटफॉर्म लॉन्च करने की संभावना से इंकार नहीं किया जा सकता है।

कुल मिलाकर, फोर्जट्रेन का मूल्य निर्धारण डेवलपर समुदाय के लिए बेहद अनुकूल है - आपको शून्य खरीद लागत पर उत्पादन-ग्रेड प्रशिक्षण ढांचा मिलता है। उद्यमों के लिए छिपी हुई लागतों में मुख्य रूप से हार्डवेयर निवेश और जीपीयू क्लस्टर के लिए संचालन और रखरखाव जनशक्ति शामिल है, लेकिन किसी भी पूर्व-प्रशिक्षण ढांचे का उपयोग करते समय इन लागतों से बचा नहीं जा सकता है।

अनुप्रयोग परिदृश्य

  • बड़े मॉडल पूर्व-प्रशिक्षण और फाइन-ट्यूनिंग: मेगेट्रॉन-एलएम और डीपस्पीड जैसे मानव-लिखित प्रशिक्षण ढांचे को सीधे प्रतिस्थापित करता है, और इसका उपयोग उत्पादन-स्तर के बड़े मॉडलों के पूर्ण पूर्व-प्रशिक्षण और निर्देश फाइन-ट्यूनिंग के लिए किया जाता है। फोर्जट्रेन उसी हार्डवेयर के तहत लगभग 10% एमएफयू सुधार प्रदान करता है, जो बड़े मॉडल प्रशिक्षण के लिए एक महत्वपूर्ण कंप्यूटिंग बिजली की बचत है जिसके लिए अक्सर सैकड़ों कार्ड की आवश्यकता होती है और इसमें कई सप्ताह लगते हैं। अपेक्षित लाभ समान बजट के साथ एक बड़े मॉडल को प्रशिक्षित करना, या समान मॉडल आकार के साथ प्रशिक्षण चक्र को छोटा करना है।
  • घरेलू कंप्यूटिंग पावर अनुकूलन: फोर्जट्रेन पहला स्व-लिखित एआई प्रशिक्षण ढांचा है जो हुआवेई के एसेंड चिप पर पूरी पूर्व-प्रशिक्षण प्रक्रिया से चलता है। घरेलू चिप निर्माताओं और घरेलू कंप्यूटिंग शक्ति का उपयोग करने वाली कंपनियों के लिए, फोर्जट्रेन का उपयोग एक और CUDA पारिस्थितिकी तंत्र के निर्माण में दस साल का निवेश किए बिना एसेंड और अन्य चिप्स के लिए विशेष उच्च-प्रदर्शन प्रशिक्षण स्टैक बनाने के लिए किया जा सकता है। अपेक्षित लाभ यह है कि "चिप टेप-आउट" से "सॉफ़्टवेयर उपलब्धता" तक का समय बहुत कम हो गया है।
  • एआई रिसर्च एक्सेलेरेशन: फोर्जट्रेन "बड़े मॉडलों की वार्षिक क्षमता वृद्धि को मानव पैमाने के एक फ़ंक्शन से कंप्यूटिंग पावर स्केल के एक फ़ंक्शन में स्थानांतरित करना" संभव बनाता है। अनुसंधान टीम एक बड़े खोज स्थान में स्वतंत्र रूप से पुनरावृति करने और नई प्रशिक्षण विधियों, मॉडल आर्किटेक्चर और अनुकूलन रणनीतियों के साथ त्वरित प्रयोग करने के लिए हार्नेस का उपयोग करती है। अपेक्षित लाभ टीम की ऊर्जा को प्रशिक्षण ढांचे के रखरखाव से मॉडल एल्गोरिदम नवाचार में स्थानांतरित कर देगा।
  • सॉफ्टवेयर इंजीनियरिंग प्रतिमान प्रयोग: फोर्ज इंजीनियरिंग के पहले औद्योगिक-स्तर के उदाहरण के रूप में, फोर्जट्रेन अन्य जटिल प्रणालियों (कंपाइलर, डेटाबेस, ऑपरेटिंग सिस्टम, गहन शिक्षण रनटाइम) के लिए एआई की स्वचालित पीढ़ी के लिए एक संदर्भ पद्धति और वास्तुशिल्प संदर्भ प्रदान करता है। अनुसंधान दल फोर्जट्रेन के हार्नेस मॉडल के आधार पर अपने स्वयं के क्षेत्रों में एआई के स्वायत्त विकास का पता लगा सकते हैं।
  • एंड-साइड मॉडल विकास: वॉल-फेस इंटेलिजेंस ने मिनीसीपीएम5-1बी को प्रशिक्षित करने के लिए फोर्जट्रेन का उपयोग किया है, जो एए सूची में 2बी से नीचे के पैमाने में दुनिया में पहले स्थान पर है। इससे साबित होता है कि फोर्जट्रेन एंड-साइड पर उच्च दक्षता वाले मॉडल के विकास के लिए भी उपयुक्त है - जिन टीमों को मोबाइल IoT जैसे एंड-साइड परिनियोजन परिदृश्यों की आवश्यकता होती है, वे ऐसा कर सकते हैं।

इस प्रशिक्षण पथ को सीधे अपनाएँ।

लागू लोग

  • बड़े मॉडल प्रशिक्षण इंजीनियर और शोधकर्ता: यह फोर्जट्रेन का मुख्य उपयोगकर्ता समूह है। वे बड़े मॉडल पूर्व-प्रशिक्षण के लिए सीधे प्रशिक्षण इंजन का उपयोग कर सकते हैं, या वे उच्च-प्रदर्शन प्रशिक्षण ढांचे के कार्यान्वयन को सीखने के लिए एजेंट लूप द्वारा उत्पन्न ऑपरेटर कोड में तल्लीन कर सकते हैं। फोर्जट्रेन का ओपन सोर्स कोड बेस स्वयं "H100 हाई परफॉर्मेंस ट्रेनिंग प्रोजेक्ट" पर एक निष्पादन योग्य पाठ्यपुस्तक है।
  • एआई इन्फ्रास्ट्रक्चर टीम: एंटरप्राइज एआई प्रशिक्षण बुनियादी ढांचे के लिए जिम्मेदार तकनीकी टीमें क्रॉस-हार्डवेयर समर्थन के माध्यम से एकल चिप विक्रेता में बंद होने से बचते हुए कंप्यूटिंग पावर लागत (मेगेट्रॉन-एलएम की तुलना में लगभग 10% एमएफयू सुधार) को कम करने के लिए फोर्जट्रेन का उपयोग कर सकती हैं। प्रशिक्षण रूपरेखा विकल्पों की जांच करने वाली टीमों के लिए, फोर्जट्रेन का अपाचे 2.0 लाइसेंस और ओपन सोर्स सामुदायिक पारिस्थितिकी तंत्र इसे कम जोखिम वाला, दीर्घकालिक विकल्प बनाता है।
  • घरेलू चिप पारिस्थितिकी तंत्र डेवलपर्स: जो डेवलपर्स एसेंड और कैंब्रियन जैसे घरेलू चिप्स के लिए प्रशिक्षण स्टैक लिखते हैं, वे स्क्रैच से शुरू करने के बजाय घरेलू चिप्स के लिए तुरंत विशेष प्रशिक्षण ढांचे बनाने के लिए फोर्जट्रेन की हार्नेस पद्धति का उपयोग कर सकते हैं। हार्नेस का "प्रोटोकॉल-चालित, स्वचालित फोर्जिंग" मॉडल चिप अनुकूलन की श्रम लागत और समय चक्र को कम करता है।
  • एआई एजेंट और स्वचालन प्रौद्योगिकी उत्साही: फोर्जट्रेन "एआई बनाने वाली एआई" का अत्याधुनिक अभ्यास है। एजेंट लूप, स्वचालित कोड जनरेशन, एआई स्व-सुधार और अन्य तकनीकी दिशाओं में रुचि रखने वाले डेवलपर्स इसके कार्यान्वयन तंत्र में तल्लीन कर सकते हैं। एजेंट-फ्रेंडली क्विक डिप्लॉय को डिज़ाइन किया गया है ताकि कोडिंग एजेंट पूरी तैनाती और स्वीकृति प्रक्रिया को स्वतंत्र रूप से पूरा कर सके।

भीड़ के लिए उपयुक्त नहीं: फोर्जट्रेन निम्नलिखित परिदृश्यों के लिए उपयुक्त नहीं है - व्यक्तिगत डेवलपर्स जिनके पास उच्च-प्रदर्शन वाले जीपीयू क्लस्टर नहीं हैं (एकल कार्ड या यहां तक ​​कि बिना कार्ड वाले उपयोगकर्ता भी इसके मूल्य का एहसास नहीं कर सकते हैं); ऐसी टीमें जिन्हें उपयोग के लिए तैयार SaaS प्रशिक्षण सेवाओं की आवश्यकता है (फोर्जट्रेन एक स्व-सेवा ओपन सोर्स ढांचा है और होस्टिंग सेवाएं प्रदान नहीं करता है); ऐसी टीमें जिन्हें अंतर्निहित CUDA/PyTorch की कोई समझ नहीं है और वे इंजीनियरिंग संचालन और रखरखाव में निवेश करने को तैयार नहीं हैं; संपूर्ण एमएलओपीएस उद्यमों की आवश्यकता है जो प्लेटफ़ॉर्म (डेटासेट प्रबंधन, प्रयोग ट्रैकिंग, मॉडल पंजीकरण इत्यादि) का उपयोग करते हैं, उन्हें इसे पारंपरिक एमएलओपीएस प्लेटफ़ॉर्म के साथ संयोजन में उपयोग करना चाहिए, प्रतिस्थापन के रूप में नहीं।

सारांश और आउटलुक

फोर्जट्रेन की मुख्य प्रतिस्पर्धात्मकता पहली बार अवधारणा से उत्पादन-स्तर के कार्यान्वयन तक "एआई-निर्मित एआई" के पूर्ण परिवर्तन को महसूस करने की क्षमता में निहित है। यह एक प्रूफ-ऑफ-कॉन्सेप्ट डेमो नहीं है, बल्कि एक प्रोडक्शन-ग्रेड ट्रेनिंग फ्रेमवर्क है जिसने 64-कार्ड क्लस्टर पर वास्तविक मॉडल वेट तैयार किया है। इसकी फोर्ज इंजीनियरिंग पद्धति एआई को बुनियादी ढांचे के सॉफ्टवेयर को स्वतंत्र रूप से लिखने के लिए एक प्रतिलिपि प्रस्तुत करने योग्य मार्ग प्रदान करती है - मानक स्थापना से लेकर बिट-बाय-बिट संरेखण से लेकर प्रदर्शन ओवरशूट तक, प्रत्येक चरण में स्पष्ट उत्तीर्ण मानक होते हैं।

वर्तमान सीमाएँ:

  • समर्थित मॉडलों की सीमित सीमा: v0.1.0 ने केवल दो कॉन्फ़िगरेशन सत्यापित किए: MiniCPM4-0.5B (केवल DP) और MiniCPM4-8B (TP=2)। बड़े पैमाने या विभिन्न आर्किटेक्चर वाले मॉडलों को अतिरिक्त अनुकूलन कार्य की आवश्यकता होती है।
  • हार्नेस घटक अभी तक खुला स्रोत नहीं है: वर्तमान में उपयोगकर्ता केवल उत्पादित प्रशिक्षण इंजन का उपयोग कर सकते हैं, और अभी तक "स्वतंत्र फोर्जिंग" की पूरी प्रक्रिया का अनुभव करने में सक्षम नहीं हैं। एजेंट लूप ऑर्केस्ट्रेशन फ्रेमवर्क की रिलीज़ समुदाय द्वारा सबसे प्रत्याशित सुविधा है।
  • उच्च हार्डवेयर सीमा: पूर्ण प्रशिक्षण के लिए H100 80GB या उससे अधिक GPU की आवश्यकता होती है, और एक एकल कार्ड उत्पादन-स्तर के पूर्व-प्रशिक्षण को पूरा नहीं कर सकता है, जिससे व्यक्तिगत डेवलपर्स की भागीदारी सीमित हो जाती है।
  • सामुदायिक पारिस्थितिकी तंत्र अपने शुरुआती चरण में है: मेगेट्रॉन-एलएम और डीपस्पीड की तुलना में, जिनके पास परिपक्व समुदाय और समृद्ध दस्तावेज हैं, फोर्जट्रेन के ट्यूटोरियल, मामले और तीसरे पक्ष के योगदान अभी भी जमा हो रहे हैं।
  • एमएलओपीएस एकीकरण का अभाव: फोर्जट्रेन प्रशिक्षण इंजन पर ही ध्यान केंद्रित करता है और इसमें प्रयोग प्रबंधन, मॉडल पंजीकरण और तैनाती जैसी एमएलओपीएस क्षमताओं को शामिल नहीं किया जाता है, और इसे अन्य उपकरणों के साथ संयोजन में उपयोग करने की आवश्यकता होती है।

खरीद और गोद लेने का जोखिम मूल्यांकन: फोर्जट्रेन खरीदने की योजना बनाने वाली कंपनियों के लिए, "पहले पायलट, छोटे पैमाने पर सत्यापन और फिर विस्तार" की रणनीति अपनाने की सिफारिश की जाती है। सबसे पहले, सत्यापित करें कि क्या फ्रेमवर्क की स्थिरता और प्रदर्शन डेटा एक छोटे प्रशिक्षण कार्य (जैसे एकल नोड 8-कार्ड MiniCPM4-0.5B) पर अधिकारी के अनुरूप हैं; पुष्टि के बाद, बड़े पैमाने पर मॉडल प्रशिक्षण का विस्तार करें। निम्नलिखित पहलुओं पर विशेष ध्यान देने की आवश्यकता है: हार्नेस का आधिकारिक रिलीज समय (जो निर्धारित करेगा कि एक स्वायत्त फोर्जिंग वर्कफ़्लो लागू किया जा सकता है), वॉलफेस इंटेलिजेंस का चार्जिंग मॉडल और एंटरप्राइज़-स्तरीय समर्थन के लिए सेवा एसएलए, और परियोजना के दीर्घकालिक रखरखाव की स्थिरता। तकनीकी जोखिम के नजरिए से, फोर्जट्रेन परिपक्व ओपन सोर्स घटकों (पाइटोरच, कटलैस, फ्लैशअटेंशन) पर आधारित है, और कोर प्रशिक्षण इंजन की उच्च विश्वसनीयता है; मुख्य जोखिम हार्नेस घटक की वितरण गुणवत्ता में निहित है और क्या सामुदायिक पारिस्थितिकी तंत्र का विकास जारी रह सकता है। कुल मिलाकर, फोर्जट्रेन बड़ी संभावनाओं वाली एक परियोजना है और इसने शुरुआत में अपनी तकनीकी व्यवहार्यता साबित कर दी है, लेकिन मुख्यधारा के प्रशिक्षण ढांचे में बदलने से पहले इसे अभी भी पारिस्थितिक निर्माण से गुजरने में लंबा समय लगेगा।

संबंधित टूल: <एक्सलिंक टाइप='टूल' स्लग='हगिंग-फेस'>, <एक्सलिंक टाइप='टूल' स्लग='रेप्लिकेट'>

संस्करण जानकारी

  • प्रारंभिक रिहाई :पहला सार्वजनिक रूप से जारी किया गया संस्करण NVIDIA H100 पर MiniCPM4-0.5B और MiniCPM4-8B के वितरित पूर्व-प्रशिक्षण का समर्थन करता है; इसमें प्रशिक्षण इंजन स्रोत कोड, 5 CuTeDSL कस्टम GEMM ऑपरेटर और स्व-विकसित फ़्लैशअटेंशन कार्यान्वयन शामिल है; हार्नेस घटक (एजेंट लूप ऑर्केस्ट्रेशन फ्रेमवर्क) जारी किया जाना है।
  • प्रारंभिक रिहाई :पहला सार्वजनिक रूप से जारी किया गया संस्करण NVIDIA H100 पर MiniCPM4-0.5B और MiniCPM4-8B के वितरित पूर्व-प्रशिक्षण का समर्थन करता है।

उपयोगकर्ता समीक्षाएं

  • समीक्षाएं लोड हो रही हैं...