निर्धारित एआई मुफ्त

-

निर्धारित एआई एक खुला स्रोत गहन शिक्षण प्रशिक्षण मंच है जो वितरित प्रशिक्षण, स्वचालित सुपर-पैरामीटर खोज, जीपीयू क्लस्टर प्रबंधन और प्रयोग ट्रैकिंग क्षमताएं प्रदान करता है, और PyTorch और TensorFlow का समर्थन करता है।

निर्धारित एआई उत्पाद इंटरफेस

निर्धारितएआई

एआई के मुख्य मापदंडों और आंकड़ों को निर्धारित किया

निर्धारित एआई को "गहन शिक्षण प्रशिक्षण के लिए ऑपरेटिंग सिस्टम" के रूप में तैनात किया गया है और एमएल इंजीनियरिंग में सबसे कठिन वितरित ऑर्केस्ट्रेशन समस्या को हल करता है: जब प्रशिक्षण कार्य एक कार्ड से कई नोड्स तक फैलता है, तो कोड संशोधन लागत, संसाधन प्रतिस्पर्धा और प्रयोगात्मक अराजकता लगभग हर टीम के लिए एक अपरिहार्य दर्द बिंदु बन गई है। डिटर्मिन्ड एक एकीकृत शेड्यूलिंग परत के माध्यम से इन मुद्दों को समाहित करता है, जिससे शोधकर्ताओं को केवल मॉडल पर ही ध्यान केंद्रित करने की अनुमति मिलती है।

प्रोजेक्ट्स सार्वजनिक सूचना
आधिकारिक स्थिति ओपन सोर्स डीप लर्निंग ट्रेनिंग प्लेटफॉर्म
मुख्य क्षमताएं वितरित प्रशिक्षण, हाइपरपैरामीटर खोज, प्रयोग ट्रैकिंग जीपीयू क्लस्टर प्रबंधन
समर्थित ढाँचे PyTorch, TensorFlow, Keras (KerasTuner सहित)
परिनियोजन विधि स्व-होस्टेड: कुबेरनेट्स, स्थानीय एजेंट क्लस्टर स्लम/पीबीएस, एडब्ल्यूएस/जीसीपी
एक्सेस पोर्टल वेब यूआई, सीएलआई (डिट), पायथन एसडीके, रेस्ट एपीआई
ओपन सोर्स लाइसेंस अपाचे 2.0
कोड भंडार GitHub determined-ai/determined (3.2k स्टार्स, 372 फोर्क्स, 96 योगदानकर्ता)
नवीनतम संस्करण v0.38.1 (2025-03-20)
कंपनी का स्वामित्व एचपीई (हेवलेट पैकर्ड एंटरप्राइज) - 2021 अधिग्रहण
टेक्नोलॉजी स्टैक गो (44.6%) / पायथन (27.9%) / टाइपस्क्रिप्ट (24.4%)

एक वाक्य में एक संक्षिप्त टिप्पणी: यह कोई अन्य एमएलओपीएस डैशबोर्ड नहीं है, बल्कि एक शेड्यूलिंग इंजन है जो "मल्टी-मशीन और मल्टी-कार्ड ट्रेनिंग" को मैन्युअल कॉन्फ़िगरेशन से घोषणात्मक सबमिशन में बदलता है। मुख्य मूल्य टीम को एकल-मशीन कोड लिखने के मानसिक बोझ के साथ वितरित प्रशिक्षण पूरा करने की अनुमति देना है।

एचपीई अधिग्रहण पृष्ठभूमि: अधिग्रहण के बाद, निर्धारित उद्यम-स्तरीय समर्थन संसाधन प्राप्त हुए। EE (एंटरप्राइज़ संस्करण) संस्करण के लिए लाइसेंस कुंजी की आवश्यकता होने लगी। ओएसएस संस्करण और ईई संस्करण में एसएसओ और आरबीएसी ऑडिटिंग जैसी एंटरप्राइज़ सुविधाओं में कार्यात्मक अंतर हैं। समुदाय को इस बात पर ध्यान देने की आवश्यकता है कि क्या ओएसएस संस्करण को ईई संस्करण के समान गुणवत्ता के मुख्य प्रशिक्षण सुविधा अपडेट प्राप्त होते रहेंगे।

निर्धारित एआई के उपयोगकर्ता और बाजार की मान्यता

गिटहब सामुदायिक गतिविधि: गोदाम में 3.2k स्टार्स, 372 फोर्क्स, कुल 121 रिलीज़ (2026-07 तक), और 96 योगदानकर्ता हैं, जो दर्शाता है कि परियोजना का ओपन सोर्स एमएलओपीएस के क्षेत्र में स्थिर ध्यान है, लेकिन अभी तक सुपर लोकप्रिय रैंक में प्रवेश नहीं किया है (एमएलफ्लो जैसी समान परियोजनाओं में उच्च सितारे हैं)।

एंटरप्राइज़ एडॉप्शन: एचपीई वित्त, विनिर्माण, वैज्ञानिक अनुसंधान और अन्य उद्योगों में एचपीसी ग्राहकों के लिए अपने एआई बुनियादी ढांचे के समाधान में डिटर्मिन्ड को एकीकृत करता है। सार्वजनिक रूप से उपलब्ध गोद लेने के मामलों में शैक्षणिक संस्थानों और मध्यम आकार की एमएल टीमों का वर्चस्व है, जबकि बड़े पैमाने पर उद्यम तैनाती की संख्या अज्ञात है।

उद्योग बेंचमार्किंग: क्यूबफ्लो (पूर्ण K8s देशी एमएलओपीएस) और एमएलफ्लो (प्रायोगिक ट्रैकिंग + मॉडल पंजीकरण के प्रति पक्षपाती) की तुलना में, डिटर्मिन्ड का मुख्य अंतर पूर्ण-लिंक ऑर्केस्ट्रेशन के बजाय "प्रशिक्षण कार्य के शेड्यूलिंग और त्वरण" में निहित है। वितरित प्रशिक्षण के उपक्षेत्र में, यह होरोवोड (केवल वितरित संचार परत) और वेट एंड बायसेस (केवल प्रायोगिक ट्रैकिंग) के साथ सीधे प्रतिस्पर्धा करने के बजाय पूरक है।

तुलनात्मक आयाम निर्धारित एआई क्यूबफ्लो एमएलफ्लो होरोवोड
पोजिशनिंग प्रशिक्षण शेड्यूलिंग प्लेटफार्म फुल-लिंक एमएलओपीएस प्रयोग ट्रैकिंग + मॉडल पंजीकरण वितरित प्रशिक्षण संचार पुस्तकालय
वितरित प्रशिक्षण स्वचालित ऑर्केस्ट्रेशन मैन्युअल कॉन्फ़िगरेशन की आवश्यकता है शामिल नहीं संचार आदिम प्रदान करें
हाइपरपैरामीटर खोज अंतर्निर्मित (ग्रिड/बायेसियन/आशा) कातिब को एकीकृत करने की आवश्यकता अंतर्निर्मित नहीं शामिल नहीं
क्लस्टर शेड्यूलिंग अंतर्निर्मित कतार + कोटा K8s मूल शेड्यूलिंग शामिल नहीं शामिल नहीं
आरंभ करने में कठिनाई मध्यम (K8s मूल बातें आवश्यक है) उच्च निम्न मध्यम

निर्धारित एआई के लागत लाभ

सी-साइड/व्यक्तिगत

ओपन सोर्स संस्करण पूरी तरह से मुफ़्त है (अपाचे 2.0)। व्यक्ति पिप इंस्टॉल निर्धारित के माध्यम से सीएलआई स्थापित कर सकते हैं और एक मशीन या अपने स्वयं के जीपीयू पर एक स्थानीय क्लस्टर तैनात कर सकते हैं। शून्य लाइसेंसिंग शुल्क है, लेकिन आपको अपने स्वयं के PostgreSQL + स्टोरेज बैकएंड को बनाए रखने की परिचालन लागत वहन करनी होगी।

डेवलपर/टीम

ओपन सोर्स संस्करण के लिए कोई सॉफ़्टवेयर लाइसेंस शुल्क नहीं है, और टीमें आवश्यकतानुसार इसे तैनात करना चुन सकती हैं:

  • स्थानीय एजेंट मोड: बेयर मेटल या वीएम पर मास्टर + एजेंट तैनात करें, जो कम संचालन और रखरखाव जटिलता के साथ मौजूदा जीपीयू सर्वर वाली टीमों के लिए उपयुक्त है।
  • कुबेरनेट्स मोड: हेल्म चार्ट के माध्यम से तैनात, उन टीमों के लिए उपयुक्त जिनके पास पहले से ही K8s बुनियादी ढांचा है, लेकिन उन्हें K8s प्रबंधन क्षमताओं की आवश्यकता है।
  • क्लाउड परिनियोजन: डिट परिनियोजन aws/gcp up एक-क्लिक परिनियोजन, क्लाउड संसाधनों के वास्तविक उपयोग के अनुसार भुगतान, कोई अतिरिक्त लाइसेंस शुल्क नहीं।

छिपी हुई लागतें मुख्य रूप से संचालन और रखरखाव जनशक्ति में परिलक्षित होती हैं: PostgreSQL डेटाबेस प्रबंधन, भंडारण (S3/GCS/साझा फ़ाइल सिस्टम) कॉन्फ़िगरेशन, नेटवर्क और सुरक्षा समूह नीतियां, संस्करण उन्नयन और माइग्रेशन, आदि।

उद्यम/निजीकरण

एचपीई एंटरप्राइज़ संस्करण प्रदान करता है, जिसमें शामिल हैं:

  • एसएसओ/एसएएमएल एकीकरण
  • आरबीएसी बारीक-बारीक अनुमति ऑडिट
  • वाणिज्यिक एसएलए और तकनीकी सहायता
  • प्रोलिएंट सर्वर निंबले स्टोरेज जैसे एचपीई हार्डवेयर के साथ पूर्व-एकीकृत सत्यापन

एंटरप्राइज़ संस्करण मूल्य निर्धारण का खुलासा नहीं किया गया है, कृपया एचपीई सेल्स के माध्यम से कोटेशन प्राप्त करें। खरीदने से पहले सत्यापित करने के लिए मुख्य शर्तें: क्या लाइसेंस का बिल नोड्स/जीपीयू या उपयोगकर्ताओं की संख्या के आधार पर किया गया है, क्या इसमें उत्पादन सीमाबद्ध एसएलए प्रतिक्रिया समय, अपग्रेड पथ और डेटा माइग्रेशन समर्थन दायरा शामिल है।

लागत पदानुक्रम लागत घटक विशिष्ट वार्षिक लागत (व्युत्पत्ति)
व्यक्तिगत/छोटी टीम (ओएसएस) 0 लाइसेंस शुल्क + क्लाउड होस्ट/जीपीयू शुल्क $0 + ऑन-डिमांड क्लाउड संसाधन
मध्यम आकार की टीम (ओएसएस + स्व-संचालन और रखरखाव) 0 लाइसेंस शुल्क + संचालन और रखरखाव जनशक्ति (लगभग 0.5~1 व्यक्ति-महीना/वर्ष) $5K~$15K (संचालन और रखरखाव रूपांतरण)
एंटरप्राइज़ (एचपीई ईई) लाइसेंस शुल्क + समर्थन अनुबंध + हार्डवेयर व्यवसाय की पुष्टि आवश्यक

निर्धारित एआई के मुख्य कार्य

  • शून्य-संशोधन वितरित प्रशिक्षण: उपयोगकर्ताओं को प्रशिक्षण स्क्रिप्ट में केवल determined.pytorch.PyTorchTrial या determined.keras.KerasTrial बेस क्लास का उपयोग करने की आवश्यकता है, और प्लेटफ़ॉर्म स्वचालित रूप से ग्रेडिएंट सिंक्रोनाइज़ेशन (ऑल-रिड्यूस), डेटा शार्डिंग और नोड फ़ॉल्ट टॉलरेंस को संभालता है। torch.distributed.launch या tf.distribute.Strategy को मैन्युअल रूप से लिखने की कोई आवश्यकता नहीं है, जो वितरित प्रशिक्षण के लिए प्रवेश बाधा को कम करता है।

    • विशेषज्ञ दृष्टिकोण: इस अमूर्त परत का छिपा हुआ लाभ यह है कि टीम कोड में वितरित तर्क को एम्बेड किए बिना एकल-कार्ड प्रोटोटाइप से मल्टी-कार्ड उत्पादन में सीधे संक्रमण कर सकती है। बाद में GPU की संख्या बढ़ाने के लिए, आपको प्रशिक्षण कोड को बदले बिना, YAML कॉन्फ़िगरेशन में केवल slots_per_trial को बदलना होगा।
  • एडेप्टिव हाइपरपैरामीटर सर्च (आशा): एसिंक्रोनस सक्सेसिव हॉल्टिंग एल्गोरिदम के आधार पर, जब संसाधन सीमित होते हैं तो कम-क्षमता वाले परीक्षणों को पहले समाप्त कर दिया जाता है, और उच्च-क्षमता वाले पैरामीटर संयोजनों को अधिक कंप्यूटिंग शक्ति आवंटित की जाती है। अर्ली स्टॉपिंग, ग्रिड सर्च और बायेसियन सर्च का समर्थन करता है, और खोज प्रक्रिया के दौरान खोज स्थान को गतिशील रूप से समायोजित कर सकता है।

    • विशेषज्ञ दृष्टिकोण: आशा और प्लेटफ़ॉर्म शेड्यूलर के बीच सहयोग निर्धारित का मुख्य अंतर है - खोज एल्गोरिदम न केवल "मापदंडों का अगला सेट क्या है" निर्धारित कर सकता है, बल्कि प्लेटफ़ॉर्म शेड्यूलर के माध्यम से "कौन से परीक्षणों को प्रीमेप्ट किया जा सकता है" को भी नियंत्रित कर सकता है, औपचारिक प्रशिक्षण कार्यों को अवरुद्ध करने वाले हाइपरपैरामीटर खोजों से बचने के लिए, क्लस्टर पूर्ण होने पर स्वचालित रूप से कम-प्राथमिकता वाले खोज परीक्षणों को डाउनग्रेड कर सकता है।
  • जीपीयू कोटा और कतार शेड्यूलिंग: संसाधन पूल (संसाधन पूल) द्वारा जीपीयू कोटा को विभाजित करने का समर्थन करता है। उपयोगकर्ता द्वारा डेट एक्सपेरिमेंट क्रिएट के माध्यम से कार्य सबमिट करने के बाद, प्लेटफ़ॉर्म स्वचालित रूप से कतारबद्ध, शेड्यूल और स्लॉट आवंटित करता है। एकल उपयोगकर्ता को क्लस्टर भरने से रोकने के लिए प्राथमिकता शेड्यूलर और फेयर शेड्यूलर का समर्थन करता है।

    • विशेषज्ञ दृष्टिकोण: शेड्यूलर + कोटा का संयोजन "जीपीयू निष्क्रियता और विवाद सह-अस्तित्व" की विशिष्ट टीम दुविधा को हल करता है। शोधकर्ताओं को अब मैन्युअल रूप से बातचीत करने की आवश्यकता नहीं है कि कौन कार्ड का उपयोग कब करेगा, और प्लेटफ़ॉर्म गारंटी देता है कि सबमिट किए गए कार्यों को अंततः शेड्यूल किया जाएगा - जो 10+ लोगों की टीम में समन्वय लागत को काफी कम कर सकता है।
  • प्रयोग ट्रैकिंग और स्वचालित स्नैपशॉट: स्वचालित रूप से संकेतक (हानि/सटीकता जैसी समय श्रृंखला), हाइपरपैरामीटर कॉन्फ़िगरेशन, पूर्ण कोड स्नैपशॉट (गिट कमिट + अनट्रैक की गई फ़ाइलें), और प्रत्येक प्रशिक्षण के लिए मॉडल वेट चेकपॉइंट रिकॉर्ड करें। वेब यूआई कई प्रयोगात्मक संकेतकों की तुलना और विज़ुअलाइज़ेशन का समर्थन करता है, और चेकपॉइंट एक क्लिक के साथ प्रशिक्षण फिर से शुरू या जारी रख सकता है।

    • विशेषज्ञ दृष्टिकोण: कोड स्नैपशॉट का स्वचालित अवरोधन मैन्युअल रिकॉर्डिंग की तुलना में अधिक विश्वसनीय है - भले ही शोधकर्ता प्रतिबद्ध होना भूल जाए, सबमिट करते समय प्लेटफ़ॉर्म स्वचालित रूप से स्रोत कोड को संग्रहीत कर देगा। प्रायोगिक पुनरुत्पादन के लिए यह महत्वपूर्ण है, खासकर जब कई शोधकर्ता एक क्लस्टर साझा करते हैं। "यह मॉडल कोड के किस संस्करण के साथ चलाया गया था" अब कोई रहस्य नहीं है।
  • नोटबुक और इंटरैक्टिव कार्य: क्लस्टर जीपीयू नोड पर ज्यूपिटर नोटबुक, टेन्सरबोर्ड या शेल प्रारंभ करें, और गणना सीधे जीपीयू नोड पर की जाती है। नोटबुक में डेटा और प्रशिक्षण कार्य एक ही भंडारण परत (साझा फ़ाइल सिस्टम या ऑब्जेक्ट स्टोरेज) साझा करते हैं, जो डेटा प्रीप्रोसेसिंग के बाद प्रशिक्षण कार्यों को सीधे प्रस्तुत करने की सुविधा प्रदान करता है।

    • विशेषज्ञ दृष्टिकोण: नोटबुक और प्रशिक्षण कार्य GPU पूल साझा करते हैं, जिसका अर्थ है कि एक ही कार्ड एक ही समय में नोटबुक और प्रशिक्षण नहीं चला सकता है। इंटरैक्टिव कार्यों को उत्पादन प्रशिक्षण संसाधनों पर कब्जा करने से रोकने के लिए नोटबुक को कम-प्राथमिकता वाले संसाधन पूल तक सीमित करने या छोटे जीपीयू पूल को अलग करने की अनुशंसा की जाती है।
  • डीपस्पीड एकीकरण: संस्करण 0.17.0 के बाद से अंतर्निहित डीपस्पीड समर्थन, बहुत बड़े मॉडल प्रशिक्षण परिदृश्यों में ग्राफिक्स मेमोरी उपयोग को कम करने के लिए YAML कॉन्फ़िगरेशन के माध्यम से ज़ीरो ऑप्टिमाइज़ेशन (स्टेज 1/2/3) को सक्षम किया जा सकता है। डिटर्मिन्ड के स्वचालित ग्रेडिएंट सिंक्रोनाइज़ेशन के साथ, ज़ीरो का संचार मोड और प्लेटफ़ॉर्म शेड्यूलर एक साथ काम करते हैं।

  • कोर एपीआई (निचले स्तर का इंटरफ़ेस): उन उन्नत उपयोगकर्ताओं के लिए जिन्हें ट्रायल बेस क्लास की आवश्यकता नहीं है, डिटर्मिन्ड कोर एपीआई प्रदान करता है, जो उपयोगकर्ताओं को प्लेटफ़ॉर्म फ़ंक्शंस को कम से कम घुसपैठ वाले तरीके से एकीकृत करने की अनुमति देता है - प्रशिक्षण चक्र संरचना में संशोधन के बिना, संकेतक रिकॉर्ड करने और चेकपॉइंट्स को सहेजने के लिए संदर्भ प्राप्त करने के लिए केवल det.core.init() का उपयोग करें। हगिंग फेस ट्रेनर जैसे तृतीय-पक्ष प्रशिक्षण पुस्तकालयों के साथ एकीकृत करते समय यह विशेष रूप से उपयोगी होता है।

निर्धारित एआई का मॉडल और संस्करण विकास

निर्धारित "ओएसएस + ईई" दोहरे ट्रैक रिलीज़ रणनीति को अपनाता है: ओएसएस संस्करण सिमेंटिक संस्करण का पालन करता है, और ईई संस्करण ओएसएस संस्करण संख्या के बाद -ee प्रत्यय जोड़ता है।

मेनलाइन रिलीज़

संस्करण संख्या रिलीज की तारीख मुख्य परिवर्तन
v0.32.0 2026-05 (अभी तक कोई आधिकारिक सटीक तारीख नहीं) प्रदर्शन अनुकूलन और बग फिक्स सहित नवीनतम रिलीज़ संस्करण
v0.38.1 2025-03-20 नवीनतम स्थिर संस्करण, जिसमें पर्यावरण छवि अद्यतन और निर्भरता मरम्मत शामिल है
v0.38.0 2024-11-23 खोजकर्ता संदर्भ (वास्तुकला सरलीकरण), कार्य कॉन्फ़िगरेशन नीति (कॉन्फ़िगर नीतियाँ) GA, वैश्विक कॉन्फ़िगरेशन नीतियाँ UI हटाएँ
v0.37.0 2024-09-30 नया रन ऑब्जेक्ट (रन सेंट्रिक एपीआई), वर्कलोड अलर्टिंग (वर्कलोड अलर्टिंग), कॉन्फिग नीतियां प्रारंभिक समर्थन
v0.36.0 2024-08-24 फ्लैट रन व्यू जीए, आरबीएसी वेबहुक, डेटा लाइनेज प्रारंभिक समर्थन
v0.35.0 2024-08-09 फ़्लैट रन तुलना दृश्य, मेटाडेटा फ़िल्टर खोज, K8s पॉड टू जॉब सबमिशन, फ़्रेमवर्क स्प्लिटिंग (फ़्रेमवर्क स्प्लिटिंग)
v0.34.0 2024-06-29 नोटबुक टोकन प्रमाणन K8s नोड चयनकर्ता/एफ़िनिटी पॉज़/रेज़्यूमे रन का समर्थन करता है
v0.33.0 2024-05-30 वेबयूआई टेम्पलेट प्रबंधन फ्लैट रन सॉर्टिंग/फ़िल्टरिंग, हीट मैप (हीटमैप), हेल्म पासवर्ड जटिलता जांच
v0.32.0 2024-04 (अभी तक कोई आधिकारिक सटीक तारीख नहीं) टेम्प्लेट CRUD API, K8s मल्टी-RM समर्थन, प्रयोगात्मक बैच ऑपरेशन

संस्करण प्रबंधन अवलोकन

  • गति: 2024 में प्रति माह लगभग एक छोटे संस्करण की पुनरावृत्ति आवृत्ति बनाए रखें, और 2025 में प्रवेश करने के बाद गति धीमी हो जाएगी (v0.38.1 2025-03 में जारी किया जाएगा), जो उत्पाद परिपक्वता में सुधार या टीम संसाधनों के समायोजन को प्रतिबिंबित कर सकता है।
  • आर्किटेक्चर इवोल्यूशन: v0.35 से v0.38 तक की मुख्य प्रवृत्ति "प्रयोग-परीक्षण केंद्रीकरण" से "केंद्रीकरण चलाएं" (फ्लैट रन) की ओर स्थानांतरण है, और बहु-किरायेदार शासन क्षमताओं को बढ़ाने के लिए कॉन्फ़िगरेशन नीतियों की शुरूआत है।
  • एंटरप्राइज़ संस्करण अंतर: एसएसओ सुधार (v0.38.0+), लाइसेंस कुंजी सत्यापन, आरबीएसी ऑडिट लॉग इत्यादि जैसे एंटरप्राइज़ सुविधाओं में ईई संस्करण ओएसएस से आगे है। ओएसएस उपयोगकर्ताओं को इस बात पर ध्यान देने की आवश्यकता है कि क्या इन कार्यों को धीरे-धीरे सामुदायिक संस्करण में स्थानांतरित किया जाएगा, या क्या वे लंबे समय तक ईई के लिए विशिष्ट रहेंगे।

निर्धारित एआई के तकनीकी लाभ

घोषणात्मक प्रशिक्षण कॉन्फ़िगरेशन: उपयोगकर्ता YAML के माध्यम से प्रशिक्षण हाइपरपैरामीटर, संसाधन आवश्यकताओं (स्लॉट_पर_ट्रायल), खोज एल्गोरिदम और शेड्यूलिंग रणनीतियों को परिभाषित करते हैं, और प्लेटफ़ॉर्म तदनुसार परीक्षण और शेड्यूल निष्पादन उत्पन्न करता है। इस घोषणात्मक अमूर्तता का मुख्य लाभ यह है कि शोधकर्ता "कैसे करें" के बजाय "क्या करना है" का वर्णन करते हैं, और प्लेटफ़ॉर्म स्वचालित रूप से पृष्ठभूमि में क्लस्टर लोड के आधार पर "किस मशीन पर कितने जीपीयू चलाने हैं" का निर्णय लेता है।

स्वचालित ग्रेडिएंट सिंक्रोनाइज़ेशन (ऑल-रिड्यूस एग्रीगेशन): डिटरमाइन्ड का हार्नेस घटक स्वचालित रूप से उपयोगकर्ता प्रशिक्षण कोड के शीर्ष पर ग्रेडिएंट सिंक्रोनाइज़ेशन लॉजिक (एनसीसीएल या ग्लू पर आधारित) को इंजेक्ट करता है, जिससे उपयोगकर्ताओं को वितरित संचार कोड लिखने की आवश्यकता समाप्त हो जाती है। एकाधिक परीक्षण स्वतंत्र रूप से अपने संबंधित निर्धारित स्लॉट पर आगे/पीछे होते हैं। यह सुनिश्चित करने के लिए कि प्रत्येक नोड के मॉडल पैरामीटर सुसंगत हैं, हार्नेस प्रत्येक बैकवर्ड()के बाद स्वचालित रूप से ऑल-रिड्यूस एग्रीगेशन ग्रेडिएंट निष्पादित करता है। यह तंत्र प्रशिक्षण स्क्रिप्ट को छुए बिना, YAML मेंslots_per_trial` को संशोधित करके एक कार्ड से कई कार्ड तक विस्तार की अनुमति देता है।

आशा खोज के लिए शेड्यूलिंग सहयोग: पारंपरिक हाइपरपैरामीटर खोज उपकरण शेड्यूलर से स्वतंत्र रूप से चलते हैं, और खोजे गए परीक्षणों को अभी भी संसाधनों के लिए कतारबद्ध करने की आवश्यकता होती है। Determined खोजकर्ता और अनुसूचक को गहराई से एकीकृत करता है: खोजकर्ता मापदंडों के अगले सेट को निर्धारित करने के बाद, अनुसूचक यह तय करता है कि परीक्षण तुरंत शुरू करना है या नहीं और वर्तमान क्लस्टर लोड के आधार पर कम-प्राथमिकता वाले परीक्षणों को पहले से शुरू करना है या नहीं। यह सह-डिज़ाइन हाइपरपैरामीटर खोज को क्लस्टर पूर्ण होने पर उत्पादन प्रशिक्षण कार्यों को अवरुद्ध नहीं करने की अनुमति देता है - खोज परीक्षणों को प्रीमेप्टेबल के रूप में चिह्नित किया जाता है, उच्च प्राथमिकता वाले कार्य सबमिट होने पर स्वचालित रूप से जीपीयू जारी किया जाता है।

डुअल-ट्रैक शेड्यूलिंग (एजेंट RM + K8s RM): निर्धारित दो संसाधन प्रबंधन मोड का समर्थन करता है - एजेंट RM (स्व-प्रबंधित एजेंट क्लस्टर) और K8s RM (कुबेरनेट्स नेटिव शेड्यूलिंग)। एजेंट आरएम नंगे धातु/एचपीसी वातावरण के लिए उपयुक्त है, इसे K8s निर्भरता की आवश्यकता नहीं है, और तैनात करने के लिए यह अधिक हल्का है; K8s RM उन टीमों के लिए उपयुक्त है जिनके पास पहले से ही K8s बुनियादी ढांचा है, और वे K8s के स्वचालित विस्तार और संकुचन, नेमस्पेस अलगाव और अन्य क्षमताओं का लाभ उठा सकते हैं। दोनों को एक ही समय (मल्टी-आरएम) में सक्षम किया जा सकता है, जिससे एक ही मास्टर को विषम समूहों को प्रबंधित करने की अनुमति मिलती है।

चेकपॉइंट का स्टोरेज एब्स्ट्रैक्शन: चेकपॉइंट साझा फ़ाइल सिस्टम S3/GCS ऑब्जेक्ट स्टोरेज, या HDFS में स्टोरेज का समर्थन करता है। प्लेटफ़ॉर्म स्वचालित रूप से चेकपॉइंट जीवन चक्र (जीसी नीति) को बनाए रखता है और स्टोरेज परतों में डेटा माइग्रेशन को कॉन्फ़िगर कर सकता है। यह अमूर्तता प्रशिक्षण क्लस्टर के भंडारण और गणना को अलग करती है - प्रशिक्षण नोड्स स्टेटलेस उदाहरण हो सकते हैं, और किसी प्रयोग के विफल होने के बाद त्वरित पुनर्प्राप्ति की सुविधा के लिए चौकियों को बाहरी ऑब्जेक्ट भंडारण में बनाए रखा जाता है।

प्रदर्शन प्रोफाइलिंग अंतर्निहित: वेब यूआई में एक अंतर्निहित प्रशिक्षण प्रदर्शन विश्लेषण उपकरण है जो प्रशिक्षण बाधाओं का पता लगाने में सहायता के लिए जीपीयू उपयोग, डेटा लोडिंग थ्रूपुट और संचार अनुपात जैसे संकेतक देख सकता है (जैसे कि डेटा लोडिंग एक बाधा है या संचार एक बाधा है)। इस फ़ंक्शन को प्रोमेथियस/ग्राफाना के अतिरिक्त एकीकरण की आवश्यकता नहीं है, जिससे प्रदर्शन ट्यूनिंग के लिए टूल श्रृंखला की जटिलता कम हो जाती है।

कोड वेयरहाउस (44.6%) में मुख्य भाषा के रूप में गो की पसंद से पता चलता है कि मास्टर घटक में समवर्ती प्रदर्शन के लिए उच्च आवश्यकताएं हैं - मास्टर को एक ही समय में सैकड़ों एजेंटों के दिल की धड़कन, शेड्यूलिंग निर्णय और एपीआई अनुरोधों को प्रबंधित करने की आवश्यकता होती है। इस परिदृश्य में गो का गोरोइन मॉडल पायथन से अधिक कुशल है। पायथन (27.9%) का उपयोग हार्नेस (प्रशिक्षण रनटाइम) और एसडीके के लिए किया जाता है, और टाइपस्क्रिप्ट (24.4%) का उपयोग वेब यूआई के लिए किया जाता है।

Determined AI का उपयोग कैसे करें

सीएलआई स्थापित करें और क्लस्टर प्रारंभ करें

# सीएलआई स्थापित करें
पाइप इंस्टालेशन निर्धारित

# स्थानीय क्लस्टर (एकल मशीन पर त्वरित अनुभव)
स्थानीय क्लस्टर-अप को तैनात करें

#AWSDeployment
इसे तैनात करें

# जीसीपी परिनियोजन
जीसीपी को तैनात करें

प्रशिक्षण कार्य सबमिट करें

प्रशिक्षण स्क्रिप्ट अनुकूलन (PyTorch उदाहरण):

निर्धारित.pytorch से PyTorchTrial, DataLoader, PyTorchTrialContext आयात करें

कक्षा MyTrial(PyTorchTrial):
    def __init__(स्वयं, संदर्भ: PyTorchTrialContext):
        स्व.संदर्भ = प्रसंग
        self.model = self.context.wrap_model(nn.Sequential(...))

    डीईएफ़ ट्रेन_बैच(स्वयं, बैच, epoch_idx):
        हानि = स्व.मॉडल(बैच)
        स्वयं.संदर्भ.पिछड़ा(नुकसान)
        self.context.step_optimizer(स्वयं.ऑप्टिमाइज़र)
        वापसी {"नुकसान": हानि}

YAML कॉन्फ़िगरेशन फ़ाइल (experiment.yaml):

नाम: my_experiment
प्रवेश बिंदु:train.py
हाइपरपैरामीटर:
  सीखने की दर:
    प्रकार: दोहरा
    न्यूनतम: 0.0001
    अधिकतम: 1.0
खोजकर्ता:
  नाम: अनुकूली_आशा
  मीट्रिक: हानि
  छोटा_है_बेहतर: सत्य
  अधिकतम_परीक्षण: 100
संसाधन:
  स्लॉट_प्रति_परीक्षण: 8

आदेश सबमिट करें:

यह प्रयोग create explore.yaml .

परिनियोजन विकल्पों की तुलना

परिनियोजन विधि लागू परिदृश्य पूर्वावश्यकताएँ रखरखाव जटिलता
स्थानीय क्लस्टर (स्थानीय परिनियोजन) व्यक्तिगत विकास/एकाधिक कार्ड वाली एकल मशीन डोकर निम्न
AWS det Deploy aws बादल पर त्वरित शुरुआत AWS खाता + कोटा मध्यम
जीसीपी डिटोप्लॉय जीसीपी बादल पर त्वरित शुरुआत जीसीपी खाता + कोटा मध्यम
कुबेरनेट्स हेल्म चार्ट मौजूदा K8s क्लस्टर K8s क्लस्टर + हेल्म 3 मध्यम से उच्च
एजेंट मैनुअल परिनियोजन बेयर मेटल/एचपीसी PostgreSQL + साझा संग्रहण उच्च
स्लम/पीबीएस एकीकरण एचपीसी क्लस्टर स्लम/पीबीएस प्रासंगिक उच्च

त्वरित सत्यापन पथ: व्यक्तिगत डेवलपर्स पाइप इंस्टॉल निर्धारित और स्थानीय क्लस्टर-अप को तैनात करने की सलाह देते हैं, जो 5 मिनट के भीतर स्थानीय रूप से मास्टर + एजेंट वाले एकल-नोड क्लस्टर को खींच सकता है और आधिकारिक एमएनआईएसटी नमूना सत्यापन कोर प्रक्रिया चला सकता है।

निर्धारित एआई के लिए उत्पाद मूल्य निर्धारण

निर्धारित AI "ओपन सोर्स कोर + एंटरप्राइज़ संस्करण" के दोहरे ट्रैक मूल्य निर्धारण मॉडल को अपनाता है:

  • ओपन सोर्स संस्करण (ओएसएस): अपाचे 2.0 लाइसेंस, वितरित प्रशिक्षण, सुपर पैरामीटर खोज, प्रयोग ट्रैकिंग और शेड्यूलिंग सहित पूरी तरह कार्यात्मक। कोई उपयोग प्रतिबंध या GPU सीमा नहीं है। व्यक्तियों, शैक्षणिक टीमों और स्व-संचालन और रखरखाव क्षमताओं वाली मध्यम आकार की टीमों के लिए उपयुक्त।
  • एंटरप्राइज़ संस्करण (एचपीई एंटरप्राइज़ संस्करण): ओएसएस पर आधारित, यह एचपीई हार्डवेयर पूर्व-एकीकृत सत्यापन के लिए एसएसओ/एसएएमएल एकीकृत आरबीएसी फाइन-ग्रेन्ड परमिशन ऑडिटिंग और वाणिज्यिक एसएलए समर्थन जोड़ता है। वार्षिक सदस्यता के आधार पर कीमतें एचपीई बिक्री के माध्यम से प्राप्त की जाती हैं, और विशिष्ट बिलिंग इकाई (नोड/जीपीयू/उपयोगकर्ता) का खुलासा नहीं किया जाता है।
  • क्लाउड होस्टेड संस्करण: एचपीई SaaS होस्टिंग की पेशकश नहीं करता है, सभी परिनियोजन स्वयं-होस्टेड हैं। यदि आप एक ऑपरेशन-मुक्त अनुभव चाहते हैं, तो आप इसे डिट डिप्लॉय एडब्ल्यूएस/जीसीपी के माध्यम से तुरंत क्लाउड पर लॉन्च कर सकते हैं, लेकिन प्रबंधन और निगरानी अभी भी टीम की जिम्मेदारी है।
संस्करण लाइसेंस कीमत लागू स्केल
ओएसएस अपाचे 2.0 मुफ़्त व्यक्तियों से लेकर मध्यम आकार की टीमों तक (<100 जीपीयू)
ईई वाणिज्यिक लाइसेंस व्यवसाय की पुष्टि आवश्यक मध्यम और बड़े उद्यम (100+ जीपीयू)

एंटरप्राइज़ संस्करण खरीदने से पहले, आपको एचपीई से पुष्टि करनी होगी: क्या यह जीपीयू की संख्या के आधार पर स्तरीय मूल्य निर्धारण का समर्थन करता है, और क्या इसमें उत्पादन-सक्षम 24/7 समर्थन, अपग्रेड और डेटा माइग्रेशन के लिए विशिष्ट शर्तें शामिल हैं।

निर्धारित एआई अनुप्रयोग परिदृश्य

  • मल्टी-जीपीयू क्लस्टर प्रशिक्षण प्रबंधन: जब कोई टीम 10~100 जीपीयू साझा करती है, तो डिटर्मिन्ड की कतार शेड्यूलिंग प्रभावी ढंग से निष्क्रिय अपशिष्ट को कम करती है - शोधकर्ताओं को अब मैन्युअल रूप से समन्वय करने की आवश्यकता नहीं है कि कौन कार्ड का उपयोग कब करता है। सुपरपैरामीटर खोज स्वचालित रूप से पैरामीटर स्थान को स्कैन करती है, जिससे पैरामीटर को मैन्युअल रूप से संशोधित करने और फिर से चलाने की आवश्यकता समाप्त हो जाती है। सत्यापन के मुख्य बिंदु: जब उच्च-प्राथमिकता वाले कार्यों को अक्सर कतार शेड्यूलिंग में सबमिट किया जाता है, तो क्या कम-प्राथमिकता वाले खोज परीक्षणों को सही ढंग से पूर्वनिर्धारित और पुनर्स्थापित किया जा सकता है।

  • मानकीकृत प्रयोग पाइपलाइन: प्रत्येक प्रशिक्षण के लिए कोड स्नैपशॉट, हाइपरपैरामीटर, संकेतक और चेकपॉइंट स्वचालित रूप से रिकॉर्ड किए जाते हैं। जब नए शोधकर्ता प्रोजेक्ट संभालते हैं, तो वे सीधे वेब यूआई पर ऐतिहासिक प्रयोगों को देख सकते हैं, उन्हें एक क्लिक से पुन: पेश कर सकते हैं, या निर्दिष्ट चेकपॉइंट से प्रशिक्षण जारी रख सकते हैं। सत्यापित करने के लिए मुख्य बिंदु: क्या कोड स्नैपशॉट में पूरी तरह से अनट्रैक की गई स्थानीय संशोधित फ़ाइलें शामिल हैं और क्या चेकपॉइंट जीसी रणनीति समय से पहले विलोपन का कारण बन सकती है।

  • बहुत बड़ा मॉडल प्रशिक्षण (डीपस्पीड इंटीग्रेशन): दसियों अरब मापदंडों के साथ मॉडल प्रशिक्षण के लिए, ज़ीरो स्टेज 2/3 वीडियो मेमोरी के उपयोग को अनुकूलित करता है और बड़े मॉडल प्रशिक्षण के लिए बुनियादी ढांचे की सीमा को कम करने के लिए डिटर्मिन्ड के स्वचालित मल्टी-नोड शेड्यूलिंग के साथ सहयोग करता है। सत्यापन फोकस: ज़ीरो स्टेज 3 के तहत डीपस्पीड संस्करण और निर्धारित संस्करण संचार दक्षता की संगतता।

  • हाइब्रिड क्लाउड/विषम क्लस्टर प्रशिक्षण: मल्टी-आरएम के माध्यम से क्लाउड पर स्थानीय बेयर मेटल क्लस्टर और K8s क्लस्टर के प्रबंधन को एकीकृत करें, और संसाधन आवश्यकताओं के अनुसार प्रशिक्षण कार्य स्वचालित रूप से उपलब्ध नोड्स पर निर्धारित होते हैं। सत्यापन फोकस: वितरित प्रशिक्षण पर क्रॉस-क्लस्टर चेकपॉइंट सिंक्रनाइज़ेशन तंत्र और नेटवर्क विलंब का प्रभाव।

  • एचपीसी/शैक्षणिक अनुसंधान कंप्यूटिंग: वैज्ञानिक शोधकर्ताओं को प्रशिक्षण कार्यों को प्रस्तुत करने के लिए एक वेब यूआई प्रदान करने के लिए स्लम/पीबीएस क्लस्टर पर निर्धारित तैनाती, नौकरियों को मैन्युअल रूप से सबमिट करने की पारंपरिक एसएसएच पद्धति की जगह। अंतर्निहित प्रयोग ट्रैकिंग "रिकॉर्ड मापदंडों को भूलने" के कारण होने वाली गैर-प्रजनन योग्य समस्याओं को कम करती है। सत्यापन फोकस: स्लम का एकीकृत संस्करण जॉब ऐरे का समर्थन करता है और मौजूदा एचपीसी शेड्यूलिंग रणनीतियों के साथ सह-अस्तित्व में है।

निर्धारित एआई के लागू समूह

  • डीप लर्निंग रिसर्चर/एल्गोरिदम इंजीनियर: वितरित कोड अनुकूलन के कार्यभार को कम करने, स्वचालित रूप से प्रयोगात्मक मापदंडों और परिणामों को रिकॉर्ड करने और एक क्लिक के साथ प्रयोगात्मक संकेतकों के कई सेटों की तुलना करने की उम्मीद में, लगातार वितरित प्रशिक्षण प्रयोगों का संचालन करने की आवश्यकता है। 5~50 जीपीयू वाली मध्यम आकार की टीमों के बीच मूल्य सबसे स्पष्ट है।

  • एमएल इंफ्रास्ट्रक्चर/प्लेटफ़ॉर्म इंजीनियर: टीम के लिए प्रशिक्षण बुनियादी ढांचे के निर्माण के लिए जिम्मेदार। हम "सबमिट करें और प्रशिक्षित करें" का एक स्व-सेवा मंच प्रदान करने और "शोधकर्ताओं को वातावरण को कॉन्फ़िगर करने, ड्राइवरों को समायोजित करने और पैकेज पैकेजों को समायोजित करने में मदद करने" के दैनिक समर्थन कार्य को कम करने की उम्मीद करते हैं। K8s/PostgreSQL संचालन और रखरखाव लागत और दक्षता में सुधार के बीच संतुलन का मूल्यांकन करना आवश्यक है।

  • एचपीसी क्लस्टर प्रशासक: जॉब प्राथमिकताओं और संसाधन कोटा को नियंत्रित करने की क्षमता को बरकरार रखते हुए, शोधकर्ताओं के लिए वेब यूआई के माध्यम से क्लस्टर का उपयोग करने की सीमा को कम करने की उम्मीद करते हुए, स्लम/पीबीएस क्लस्टर का प्रबंधन करता है। मौजूदा शेड्यूलरों और प्रतिस्थापन लागतों के साथ निर्धारित अनुकूलता की पुष्टि की जानी चाहिए।

  • तकनीकी निर्णय निर्माता (सीटीओ/वीपी इंजी): एमएलओपीएस प्लेटफॉर्म चयन का मूल्यांकन करने के लिए, क्यूबफ्लो/एमएलफ्लो/निर्धारित की कार्यात्मक कवरेज और संचालन और रखरखाव लागत की तुलना करना आवश्यक है। डिटर्मिन्ड में "प्रशिक्षण दक्षता सुधार" के एकल आयाम में उत्कृष्ट प्रतिस्पर्धात्मकता है, लेकिन यदि टीम को पूर्ण मॉडल परिनियोजन और निगरानी लिंक की आवश्यकता है, तो इसे अन्य उपकरणों के साथ जोड़ने की आवश्यकता हो सकती है।

भीड़ के लिए उपयुक्त नहीं:

  • छोटी टीमों या व्यक्तियों के लिए जिनकी ज़रूरतें एक ही कार्ड से पूरी हो सकती हैं, डिटर्मिन्ड की क्लस्टर परिनियोजन और रखरखाव लागत लाभ से अधिक हो सकती है। torchrun या python train.py का सीधे उपयोग करना अधिक हल्का है।
  • उन टीमों के लिए जिन्हें पूर्ण अनुमान परिनियोजन + ए/बी परीक्षण + मॉडल मॉनिटरिंग लिंक की आवश्यकता होती है, निर्धारित में अनुमान सेवा घटक शामिल नहीं होते हैं और उन्हें केसर्व/सेल्डन जैसे टूल के साथ जोड़ा जाना आवश्यक है।
  • टीमें K8s पर अपरिहार्य निर्भरता के प्रति प्रतिरोधी हैं - हालांकि एजेंट RM मोड उपलब्ध है, अधिकांश उन्नत सुविधाएं (मल्टी-आरएम, ऑटो-स्केलिंग) अभी भी K8s पर निर्भर हैं।

निर्धारित एआई का सारांश और आउटलुक

मुख्य दक्षताएँ: निर्धारित एआई "वितरित प्रशिक्षण शेड्यूलिंग" के ऊर्ध्वाधर क्षेत्र में ओपन सोर्स समुदाय में सबसे पूर्ण आउट-ऑफ-द-बॉक्स समाधान प्रदान करता है। घोषणात्मक YAML कॉन्फ़िगरेशन + स्वचालित ग्रेडिएंट सिंक्रनाइज़ेशन + आशा खोज + GPU कोटा प्रबंधन का इसका संयोजन मल्टी-मशीन और मल्टी-कार्ड प्रशिक्षण को "प्रत्येक टीम अपना स्वयं का पहिया बनाती है" से "कॉन्फ़िगरेशन-ए-ट्रेनिंग" में बदल देती है। GPU संसाधन-गहन (10+ GPU) ML टीमों के लिए, यह प्रशिक्षण कोड को बदले बिना GPU उपयोग और प्रयोग दक्षता में उल्लेखनीय सुधार कर सकता है।

वर्तमान सीमाएँ:

  • सीखने की अवस्था K8s परिनियोजन और YAML कॉन्फ़िगरेशन समझ पर केंद्रित है। गैर-कंटेनरीकृत टीमों के लिए, पहली तैनाती में 1 से 2 सप्ताह लग सकते हैं।
  • ओएसएस संस्करण और ईई संस्करण के बीच कार्यात्मक अंतर के बारे में अनिश्चितता है - एसएसओ और आरबीएसी ऑडिटिंग जैसी एंटरप्राइज़ सुविधाएं लंबे समय से ईई संस्करण में बंद हैं। यह देखा जाना बाकी है कि क्या ओएसएस संस्करण मुख्य प्रशिक्षण कार्यों की पूर्ण पुनरावृत्ति प्रगति को बनाए रख सकता है।
  • समुदाय का आकार (3.2k सितारे) क्यूबफ्लो (~14k सितारे) और एमएलफ्लो (~18k सितारे) से छोटा है, और समुदाय के मुद्दों पर तीसरे पक्ष के पारिस्थितिक योगदान और प्रतिक्रिया की गति सीमित हो सकती है।

खरीद/गोद लेने का जोखिम मूल्यांकन: यह अनुशंसा की जाती है कि टीम पहले मौजूदा क्लस्टर पर पायलट के रूप में ओएसएस संस्करण को तैनात करे, और वितरित प्रशिक्षण के उपयोग और शेड्यूलिंग प्रभाव की आसानी को सत्यापित करने के लिए 1 ~ 2 विशिष्ट प्रशिक्षण कार्यों (गैर-कोर उत्पादन कार्यों) का चयन करें। पायलट अवधि के दौरान निम्नलिखित तीन प्रमुख संकेतकों पर ध्यान देने की सिफारिश की गई है: (1) प्रशिक्षण जमा करने से लेकर प्रशिक्षण शुरू होने तक का औसत प्रतीक्षा समय (मैन्युअल समन्वय में सुधार की डिग्री की तुलना में); (2) हाइपरपैरामीटर खोज की शुरुआत के बाद, इष्टतम पैरामीटर खोजने के लिए आवश्यक परीक्षणों और जीपीयू घंटों की संख्या; (3) शोधकर्ताओं द्वारा प्लेटफ़ॉर्म पर स्विच करने के बाद कोड संशोधन का कार्यभार (जितना कम होगा, अमूर्त परत उतनी ही अधिक प्रभावी होगी)। यदि पायलट सत्यापन पारित हो गया है, तो मूल्यांकन करें कि क्या ईई संस्करण की एंटरप्राइज़ सुविधाओं की आवश्यकता है, और इस प्रक्रिया में एचपीई के साथ ईई संस्करण की कीमत शर्तों और डेटा माइग्रेशन पथ की पुष्टि करें।

संबंधित टूल: <एक्सलिंक टाइप='टूल' स्लग='हगिंग-फेस'>, <एक्सलिंक टाइप='टूल' स्लग='रेप्लिकेट'>

संस्करण जानकारी

  • 0.32.0 निर्धारित :अभी तक कोई आधिकारिक सटीक तारीख नहीं है।
  • 0.28.0 निर्धारित :अभी तक कोई आधिकारिक सटीक तारीख नहीं है।

उपयोगकर्ता समीक्षाएं

  • समीक्षाएं लोड हो रही हैं...