परम शून्य
मुफ्त
एब्सोल्यूट ज़ीरो सिंघुआ विश्वविद्यालय और अन्य संस्थानों द्वारा प्रस्तावित एक शून्य-कृत्रिम डेटा अनुमान मॉडल प्रशिक्षण प्रतिमान है। मुख्य विचार एक भाषा मॉडल को प्रस्तावक और सॉल्वर दोनों के रूप में उपयोग करना है, कोड निष्पादक के माध्यम से सत्यापन योग्य इनाम संकेत प्रदान करना और मैन्युअल एनोटेशन की आवश्यकता के बिना कोड और गणितीय तर्क क्षमताओं में लगातार सुधार करना है।
एब्सोल्यूट जीरो की पूर्ण समीक्षा
मुख्य पैरामीटर और आँकड़े
| प्रोजेक्ट | विशेष विवरण |
|---|---|
| उत्पाद स्थिति | शून्य-डेटा अनुमान मॉडल प्रशिक्षण प्रतिमान |
| विकास एजेंसी | सिंघुआ यूनिवर्सिटी लीपलैब, बिगाई, पेंसिल्वेनिया स्टेट यूनिवर्सिटी |
| ओपन सोर्स लाइसेंस | एमआईटी लाइसेंस |
| तकनीकी मार्ग | सुदृढीकरण सीखना स्व-खेल + कोड निष्पादक सत्यापन |
| मॉडल आकार | 3बी/7बी/14बी (सार्वजनिक चेकपॉइंट प्रदान किया गया) |
| प्रशिक्षण संसाधन | 3बी ≈ 2×80 जीबी जीपीयू; 7बी ≈ 4×80जीबी जीपीयू; 14बी ≈ 8×80जीबी जीपीयू |
| अनुमान मोड | कटौती, अपहरण, प्रेरण |
| कागज का पता | arxiv.org/abs/2505.03335 |
आप पूछ सकते हैं: क्या एब्सोल्यूट ज़ीरो एक उत्पाद है? नहीं, यह "मॉडल को स्वयं सिखाने दें" प्रशिक्षण पद्धति की तरह है। यह एक छात्र की तरह है जो अपने स्वयं के टेस्ट पेपर लिखता है, प्रश्नों का उत्तर देता है, उन्हें स्वयं ठीक करता है, और फिर अपनी गलतियों से सीखता है - पूरी प्रक्रिया में शिक्षक (मानव व्याख्याकार) की भागीदारी की आवश्यकता नहीं होती है।
उपयोगकर्ता और बाज़ार की पहचान
एब्सोल्यूट ज़ीरो को मई 2025 में एक arXiv पेपर के माध्यम से सार्वजनिक रूप से जारी किया गया था, और उसी अवधि के दौरान संपूर्ण कार्यान्वयन GitHub और हगिंग फेस पर खुला स्रोत था। हालाँकि यह आम जनता के लिए SaaS उत्पाद नहीं है, लेकिन इसने अनुसंधान समुदाय का ध्यान आकर्षित किया है क्योंकि यह एलएलएम के क्षेत्र में एक बुनियादी सवाल का जवाब देता है: जब मॉडल मानव-लेबल डेटा से बाहर हो जाते हैं तो वे कैसे सुधार कर सकते हैं? **
- शैक्षणिक प्रभाव: पेपर में प्रस्तावित "शून्य डेटा तर्क" प्रतिमान कृत्रिम प्राथमिकताओं पर निर्भर आरएलएचएफ के पारंपरिक मार्ग को सीधे चुनौती देता है, और आरएलवीआर (सत्यापन योग्य पुरस्कारों के साथ सुदृढीकरण सीखना) के लिए एक नया व्यावहारिक मार्ग प्रदान करता है।
- सामुदायिक गतिविधि: GitHub रिपॉजिटरी अत्यधिक पूर्ण है (प्रशिक्षण कोड, मूल्यांकन, मॉडल वजन रूपांतरण उपकरण और W&B लॉग सहित), और शोधकर्ता सीधे पेपर के परिणामों को पुन: पेश कर सकते हैं। सितारों की विशिष्ट संख्या गोदाम से वास्तविक समय डेटा के अधीन है।
- उद्योग बेंचमार्किंग: डीपसीक-आर1 के सुदृढीकरण शिक्षण तर्क प्रशिक्षण और ओपनएआई ओ1 के श्रृंखला तर्क विचार के साथ पूरक - लेकिन एब्सोल्यूट ज़ीरो "शून्य कृत्रिम डेटा" पर जोर देने में अधिक कट्टरपंथी है।
लागत लाभ
| बिलिंग आयाम | वर्तमान स्थिति |
|---|---|
| फ्रेमवर्क और कोड | एमआईटी खुला स्रोत और मुफ़्त |
| मॉडल चेकपॉइंट | आलिंगन चेहरा सार्वजनिक डाउनलोड |
| एपीआई सेवा | प्रदान नहीं किया गया |
| उद्यम तकनीकी सहायता | अज्ञात |
निःशुल्क सत्य: कोड और मॉडल निःशुल्क हैं, लेकिन प्रशिक्षण के लिए वास्तविक जीपीयू की आवश्यकता होती है। आधिकारिक संदर्भ कॉन्फ़िगरेशन-3बी मॉडल के लिए लगभग 2 ए100-80जीबी और 14बी मॉडल के लिए 8-इसका मतलब है कि एक विशिष्ट प्रयोग के लिए क्लाउड जीपीयू की लागत हजारों से लेकर दसियों हजार डॉलर तक होती है। "मुफ़्त" चीज़ सॉफ़्टवेयर है, महंगी चीज़ कंप्यूटिंग शक्ति है।
लागत स्तरीकरण
- सी-साइड/व्यक्तिगत शोधकर्ता: आप अनुमान और फाइन-ट्यूनिंग प्रयोगों के लिए आधिकारिक तौर पर प्रदान किए गए 3बी चेकपॉइंट का उपयोग कर सकते हैं। 8 A100-80GB की कीमत लगभग US$16-24/घंटा है। यदि आपको पुनः प्रशिक्षण के बजाय केवल अनुमान लगाने की आवश्यकता है, तो 24 जीबी वीडियो मेमोरी वाला एक कार्ड 3बी मॉडल चला सकता है।
- डेवलपर/एपीआई: कोई सार्वजनिक एपीआई नहीं, आपको अपनी स्वयं की अनुमान सेवा बनाने की आवश्यकता है।
- उद्यम/संस्थान: यदि आपको आंतरिक डेटा पर प्रशिक्षण प्रक्रिया को पुन: पेश करने की आवश्यकता है, तो आपको अपना स्वयं का जीपीयू क्लस्टर तैयार करना होगा। एमआईटी लाइसेंस व्यावसायिक उपयोग की अनुमति देता है, लेकिन रीडमी स्पष्ट रूप से बताता है कि पायथन निष्पादक अनुसंधान उपयोग तक सीमित है, और उत्पादन सुरक्षा को स्वयं द्वारा सुदृढ़ करने की आवश्यकता है।
छिपे हुए लाभ: अनुमान प्रशिक्षण विधियों पर शोध करने वाली टीमों के लिए, एब्सोल्यूट ज़ीरो एक उच्च इंजीनियर बेसलाइन प्रदान करता है - पूर्ण प्रशिक्षण/मूल्यांकन कोड, स्व-गेम संदर्भ और लॉग सिस्टम, जिससे टीम को कुछ ही दिनों में एंड-टू-एंड शून्य-डेटा अनुमान प्रशिक्षण प्रयोग के माध्यम से चलने की अनुमति मिलती है, जबकि स्क्रैच से समान कार्यभार बनाने में लगभग कई महीने लगते हैं।
प्रचार सत्यापन: पेपर "शून्य कृत्रिम डेटा" का दावा करता है - "शून्य डेटा" यहां प्रश्न और उत्तर जोड़े को संदर्भित करता है जो मैन्युअल एनोटेशन पर भरोसा नहीं करते हैं, लेकिन मॉडल को अभी भी पूर्व ज्ञान के रूप में बड़े पैमाने पर पूर्व-प्रशिक्षण कॉर्पस और कोड निष्पादन संदर्भ की आवश्यकता होती है। "शून्य डेटा" "शून्य लागत" के बराबर नहीं है। प्रशिक्षण चरण और पूर्व-प्रशिक्षण चरण के बीच निर्भरता को अलग करना आवश्यक है।
मुख्य कार्य
- स्वायत्त कार्य निर्माण (प्रस्तावक): मॉडल प्रश्न बैंकों की मैन्युअल स्क्रीनिंग पर निर्भर होने के बजाय, स्वयं "सीखने योग्य" प्रोग्रामिंग या गणित कार्य उत्पन्न करता है। कार्यों की कठिनाई सीखने की प्रगति के साथ गतिशील रूप से समायोजित हो जाती है - पायथन में सरल सिंगल-लाइन संचालन से लेकर जटिल मल्टी-स्टेप एल्गोरिदम समस्याओं तक।
- टास्क ऑटोनॉमस सॉल्वर (सॉल्वर): मॉडल अपने द्वारा प्रस्तावित कार्यों को हल करता है और पायथन निष्पादक के माध्यम से उत्तरों की शुद्धता की पुष्टि करता है। "समस्या सेटिंग" और "समस्या समाधान" एक ही मॉडल के विभिन्न तर्क मोड द्वारा पूरा किया जाता है, और साझा पैरामीटर संयुक्त रूप से अनुकूलित होते हैं।
- ट्रिपल रीजनिंग मोड: निगमनात्मक तर्क (नियमों से निष्कर्ष निकालना), अपहरणात्मक तर्क (अवलोकनों से कारणों का अनुमान लगाना), और आगमनात्मक तर्क (उदाहरणों से नियमों का सारांश) का समर्थन करता है। तीन मोड मानव तर्क के मुख्य प्रकारों को कवर करते हैं, जिससे मॉडल केवल "तेजी से गणना करने" से कहीं अधिक हो जाता है।
- शून्य डेटा प्रशिक्षण प्रक्रिया: किसी भी मैन्युअल रूप से लेबल किए गए डेटा या पूर्वनिर्धारित प्रश्न और उत्तर जोड़े पर निर्भर नहीं है। मॉडल कोड निष्पादन के साथ प्रासंगिक बातचीत के माध्यम से सत्यापन योग्य इनाम संकेत प्राप्त करता है, और स्व-गेम चक्र के दौरान सुधार जारी रखता है।
मॉडल और संस्करण विकास
मेनलाइन रिलीज़
- ~2025-05: एब्सोल्यूट जीरो रीज़नर की पहली सार्वजनिक रिलीज़। arXiv पेपर (2505.03335) शून्य-डेटा अनुमान प्रतिमान के सिद्धांत की व्याख्या करता है। GitHub प्रशिक्षण और मूल्यांकन चौकियों सहित संपूर्ण कोड रिपॉजिटरी को ओपन सोर्स से सिंक्रनाइज़ करता है।
परियोजना प्रारंभिक अनुसंधान चरण में है और अभी तक बहु-संस्करण पुनरावृत्ति प्रणाली नहीं बनाई है। बाद के विकास में शामिल हो सकते हैं: अधिक सुरक्षित कोड निष्पादक, अधिक कार्य प्रकारों के लिए समर्थन (जैसे वैज्ञानिक तर्क, तार्किक तर्क), और बड़े पैमाने के मॉडल के लिए प्रशिक्षण प्रयोग।
तकनीकी लाभ
तंत्र विश्लेषण: मॉडल स्वयं को कैसे सिखाता है?
एब्सोल्यूट ज़ीरो की मुख्य प्रौद्योगिकी कड़ी में चार भूमिकाएँ शामिल हैं:
┌─────────────────────────── ───────────────────────────┐
│ प्रस्तावक (प्रश्न निर्माता) ←→ समाधानकर्ता (समस्या समाधानकर्ता) │
│ ↓ ↓ │
│ कार्य विवरण तैयार करें, समस्या-समाधान प्रक्रिया और उत्तर तैयार करें │
│ ↓ ↓ │
│ ┌──────────────── कोड निष्पादक ──────────────────┐ │
│ │ ① सत्यापित करें कि क्या कार्य निष्पादन योग्य और गैर-तुच्छ है │ │
│ │ ② समस्या-समाधान कोड निष्पादित करें और सत्यापित करें कि आउटपुट सही है या नहीं │ │
│ │ ③ सत्यापन योग्य इनाम संकेत लौटें (सीखने योग्य इनाम + शुद्धता इनाम) │ │
│ └──────────────────────── ─────────────────────────┘ │
│ ↓ │
│ टीआरआर++ अनुकूलक → प्रस्तावक और सॉल्वर मापदंडों को संयुक्त रूप से अद्यतन करें │
└─────────────────────────── ───────────────────────────┘
-
सत्यापन योग्य पुरस्कार कृत्रिम प्राथमिकताओं की जगह लेते हैं: पारंपरिक आरएलएचएफ मॉडल आउटपुट प्राथमिकताओं को रैंक करने के लिए मानव एनोटेटर्स पर निर्भर करता है, जबकि एब्सोल्यूट ज़ीरो वस्तुनिष्ठ पुरस्कारों के रूप में कोड निष्पादकों के पास/असफल का उपयोग करता है। इसका प्रभाव मानवीय प्राथमिकताओं की व्यक्तिपरकता और असंगतता को दूर करना है, जिससे प्रशिक्षण संकेत साफ-सुथरा और अधिक स्केलेबल हो जाता है। उन क्षेत्रों के लिए उपयुक्त जहां नियमों को प्रोग्राम (कोड, गणित) द्वारा सत्यापित किया जा सकता है।
-
स्व-खेल पाठ्यक्रम सीखना: प्रस्तावक वर्तमान क्षमता सीमा के निकट स्वचालित रूप से "इष्टतम कठिनाई" कार्य उत्पन्न करता है - जो प्रश्न बहुत आसान हैं उन्हें पुरस्कृत नहीं किया जाएगा (क्योंकि उनमें सीखने का कोई मूल्य नहीं है), और जो प्रश्न बहुत कठिन हैं उन्हें हल नहीं किया जाएगा और उन्हें पुरस्कृत नहीं किया जाएगा। इसका प्रभाव यह है कि प्रशिक्षण प्रक्रिया स्वचालित रूप से एक पाठ्यचर्या सीखने की अवस्था बनाती है, और मॉडल को हमेशा "आराम क्षेत्र के किनारे" पर प्रशिक्षित किया जाता है। उन अनुमान मॉडलों के लिए उपयुक्त जिन्हें प्रशिक्षण के लिए बड़ी मात्रा में विविधता की आवश्यकता होती है।
-
TRR++ संयुक्त अनुकूलन: प्रस्तावक की कार्य निर्माण रणनीति और सॉल्वर की समस्या-समाधान रणनीति को अनुकूलित करते हुए पारंपरिक GRPO/PPO के आधार पर सुधार किया गया। इसका प्रभाव यह होता है कि दोनों पात्र टकराव में एक साथ प्रगति करते हैं - प्रश्न निर्माता अधिक से अधिक "चालाक" हो जाता है, और समस्या समाधानकर्ता अधिक से अधिक "मजबूत" हो जाता है, जिससे एक सकारात्मक प्रतिक्रिया सर्पिल बनती है।
-
आकस्मिक तर्क व्यवहार: आधिकारिक प्रदर्शन में, प्रशिक्षण के बाद, मॉडल ने स्वचालित रूप से उच्च-क्रम तर्क व्यवहार दिखाया जैसे कि एनोटेशन योजना (पहले एनोटेशन योजना चरण लिखें और फिर कोड लिखें), परीक्षण और त्रुटि बैकट्रैकिंग (त्रुटि का सामना करने पर पुनः प्रयास करना), स्व-सत्यापन (समस्या को हल करने के बाद स्वचालित जांच), और इन व्यवहारों को प्रशिक्षण डेटा में स्पष्ट रूप से प्रदर्शित नहीं किया गया था।
कैसे उपयोग करें
एब्सोल्यूट ज़ीरो का लक्ष्य शोधकर्ताओं पर है। प्रवेश द्वार GitHub रिपॉजिटरी और कमांड लाइन टूल्स है। कोई ग्राफिकल इंटरफ़ेस नहीं है.
पेपर के परिणामों को पुन: प्रस्तुत करें:
गिट क्लोन https://github.com/LeapLabTHU/Absolute-Zero-Reasoner
सीडी निरपेक्ष-शून्य-कारणकर्ता
# रीडमी के अनुसार कॉनडा संदर्भ को कॉन्फ़िगर करें
कोंडा एनवी क्रिएट -एफ एनवायरनमेंट.यमएल
कोंडा पूर्ण-शून्य सक्रिय करता है
# प्री-ट्रेनिंग चेकपॉइंट डाउनलोड करें
# हगिंग फेस संग्रह देखें: https://huggingface.co/collections/andrewzh/absolute-zero-reasoner
#अनुमान मूल्यांकन चलाएँ
पायथन eval.py --मॉडल एब्सोल्यूट-जीरो-3बी --बेंचमार्क कोड
# स्व-गेम प्रशिक्षण प्रारंभ करें (≥4×80GB GPU की आवश्यकता है)
पायथन ट्रेन_सेल्फप्ले.py --मॉडल बेस-3बी --आउटपुट ./प्रयोग
चूंकि यह एक शोध ढांचा है, इसलिए उपयोगकर्ताओं को जीपीयू क्लस्टर प्रबंधन, पायथन विकास और सुदृढीकरण सीखने का बुनियादी ज्ञान होना आवश्यक है। परियोजना द्वारा प्रदान किए गए एक्चुएटर्स उत्पादन वातावरण के लिए उपयुक्त नहीं हैं। यदि आपको उपयोगकर्ता कोड को सुरक्षित रूप से निष्पादित करने की आवश्यकता है, तो आपको इसे स्वयं मजबूत करने की आवश्यकता है।
उत्पाद का मूल्य निर्धारण
| प्रोजेक्ट | विवरण |
|---|---|
| सॉफ़्टवेयर लाइसेंस | एमआईटी लाइसेंस, मुफ़्त और खुला स्रोत |
| प्रशिक्षण हार्डवेयर | न्यूनतम 2×A100-80GB (3बी मॉडल प्रयोग) |
| अनुमान हार्डवेयर | 24GB वीडियो मेमोरी वाला एक कार्ड 3B चेकपॉइंट चला सकता है |
| क्लाउड जीपीयू लागत | संपूर्ण पुनरुत्पादन प्रयोग के लिए लगभग $1,500-8,000 |
| बिजनेस एपीआई | उपलब्ध नहीं है |
अनुप्रयोग परिदृश्य
- अनुमान मॉडल अनुसंधान: अनुसंधान दल शून्य-डेटा अनुमान प्रशिक्षण के लिए आधारभूत ढांचे के रूप में निरपेक्ष शून्य का उपयोग कर सकते हैं। स्क्रैच से स्व-गेम प्रशिक्षण प्रणाली को लागू करने की तुलना में, एब्सोल्यूट ज़ीरो पर आधारित एक पूरी पाइपलाइन प्रयोग के स्टार्टअप समय को महीनों से दिनों तक कम कर सकती है - बस गोदाम को फोर्क करें, संदर्भ को कॉन्फ़िगर करें, और हाइपरपैरामीटर को समायोजित करें।
- मॉडल क्षमता सीमा अन्वेषण: "मानव डेटा इनपुट के बिना एक मॉडल कितनी दूर तक जा सकता है" का अध्ययन करें और तर्क क्षमताओं के उद्भव के लिए स्थितियों और सीमाओं का मूल्यांकन करें। यह एआई सुरक्षा, क्षमता सीमाओं और आकस्मिक व्यवहार दिशाओं पर अनुसंधान प्रयोगों के लिए उपयुक्त है।
- सुदृढीकरण शिक्षण प्रशिक्षण विधि प्रयोग: मॉडल की तर्क क्षमता पर विभिन्न इनाम डिजाइन, स्व-गेम रणनीतियों और तर्क मोड संयोजनों के प्रभाव का परीक्षण करें। परियोजना का मॉड्यूलर डिज़ाइन (प्रतिस्थापन योग्य एक्चुएटर्स, इनाम फ़ंक्शन, अनुमान रणनीतियाँ) प्रयोगात्मक विविधताओं की सुविधा प्रदान करता है।
सीमाओं के लिए उपयुक्त नहीं: उत्पादन-बाउंड कोड निष्पादन सैंडबॉक्स के रूप में उपयुक्त नहीं है (अंतर्निहित निष्पादक अनुसंधान उपयोग के लिए चिह्नित है); GPU संसाधनों के बिना व्यक्तिगत डेवलपर्स द्वारा सीधे उपयोग के लिए उपयुक्त नहीं; उन व्यावसायिक परिदृश्यों के लिए उपयुक्त नहीं है जिनके लिए आउट-ऑफ़-द-बॉक्स अनुमान सेवाओं की आवश्यकता होती है।
लागू लोग
- एलएलएम प्रशिक्षण शोधकर्ता: जो शोधकर्ता सुदृढीकरण सीखने और तर्क क्षमता सेल्फ-प्ले पर ध्यान केंद्रित करते हैं, वे प्रायोगिक आधार और पेपर बेसलाइन के रूप में एब्सोल्यूट जीरो का उपयोग कर सकते हैं।
- फ्रंटियर मॉडल टीम इंजीनियर: एक तकनीकी टीम जो मौजूदा मॉडलों के आधार पर शून्य-डेटा अनुमान प्रशिक्षण पद्धति का प्रयास करती है ताकि यह मूल्यांकन किया जा सके कि यह विधि अपने मॉडल पैमाने और कार्य परिदृश्यों के लिए उपयुक्त है या नहीं।
- एआई सुरक्षा और संरेखण शोधकर्ता: शोध करें कि क्या मॉडल का व्यवहार "स्व-शिक्षण और स्व-शिक्षण" प्रतिमान के तहत नियंत्रित किया जा सकता है, क्या पुरस्कार हैक किए गए हैं, और उभरते व्यवहारों की पूर्वानुमेयता।
लोगों के लिए उपयुक्त नहीं: गैर-तकनीकी पृष्ठभूमि वाले उत्पाद प्रबंधक या व्यावसायिक उपयोगकर्ता (प्रोग्रामिंग और एमएल इंजीनियरिंग अनुभव आवश्यक); व्यक्तिगत डेवलपर्स जिनके पास GPU क्लस्टर बजट की कमी है; इंजीनियरिंग टीमें जिन्हें उत्पादन-ग्रेड अनुमान एपीआई की आवश्यकता होती है।
सारांश और आउटलुक
एब्सोल्यूट ज़ीरो मुख्यधारा के आरएलएचएफ से एक पूरी तरह से अलग तकनीकी मार्ग का प्रतिनिधित्व करता है: मानवीय प्रतिक्रिया को प्रासंगिक प्रतिक्रिया के साथ प्रतिस्थापित करना। यह साबित करता है कि कोड और गणितीय तर्क के क्षेत्र में, मैन्युअल एनोटेशन की एक स्थिर धारा की आवश्यकता के बिना मॉडल "स्व-उत्पादन, स्व-समाधान और स्व-सत्यापन" की प्रक्रिया के माध्यम से सुधार जारी रख सकते हैं। एक अनुसंधान प्रोटोटाइप के रूप में, वर्तमान संस्करण प्रशिक्षण उपकरण श्रृंखला की पूर्णता के मामले में उत्कृष्ट है, लेकिन प्रयोगशाला पद्धति और कार्यान्वयन योग्य प्रशिक्षण ढांचे के बीच अभी भी एक इंजीनियरिंग अंतर है।
वर्तमान सीमाएँ: प्रशिक्षण संसाधन सीमा अधिक है (14बी मॉडल के लिए ए100 के 8 कार्ड की आवश्यकता होती है); अंतर्निहित कोड निष्पादक अनुसंधान उपयोग के लिए चिह्नित है और उत्पादन के लिए सुरक्षित नहीं है; परियोजना प्रारंभिक चरण में है, और सामुदायिक समर्थन और दस्तावेज़ीकरण में सुधार की आवश्यकता है; कोड/गणित (सामान्य ज्ञान तर्क, ओपन डोमेन प्रश्न उत्तर) के अलावा अन्य क्षेत्रों में तर्क क्षमताओं के प्रभाव को पूरी तरह से सत्यापित नहीं किया गया है।
अधिग्रहण/गोद लेने का जोखिम मूल्यांकन: एक अकादमिक ओपन सोर्स प्रोजेक्ट के रूप में, एब्सोल्यूट ज़ीरो की कोई व्यावसायीकरण प्रतिबद्धता नहीं है। यह अनुशंसा की जाती है कि अनुसंधान टीम इसे तकनीकी संदर्भ और प्रयोगात्मक आधार रेखा के रूप में उपयोग करे; औद्योगिक-ग्रेड प्रशिक्षण मंच के चयन के लिए आंतरिक एमएलओपीएस प्रणाली के साथ अनुकूलता, एक्चुएटर सुरक्षा सुदृढीकरण की लागत और दीर्घकालिक रखरखाव में मानव निवेश का मूल्यांकन करने की आवश्यकता है। एमआईटी लाइसेंस व्यावसायिक उपयोग के अनुकूल है, लेकिन अपने स्वयं के मॉडल को प्रशिक्षित करने से पहले व्युत्पन्न मॉडल की अनुपालन शर्तों की पुष्टि करने की अनुशंसा की जाती है।
संबंधित टूल: <एक्सलिंक टाइप='टूल' स्लग='हगिंग-फेस'>, <एक्सलिंक टाइप='टूल' स्लग='रेप्लिकेट'>
संस्करण जानकारी
- पूर्णतः शून्य तर्ककर्ता :पहला सार्वजनिक पूर्ण कार्यान्वयन, जिसमें प्रशिक्षण कोड, मॉडल चेकपॉइंट, तर्क मोड (कटौती/अपहरण/प्रेरण) और मूल्यांकन स्क्रिप्ट शामिल है, अभी तक कोई आधिकारिक सटीक तारीख नहीं है।
- पूर्णतः शून्य तर्ककर्ता :प्रशिक्षण कोड, मॉडल चेकपॉइंट, अनुमान मोड और मूल्यांकन स्क्रिप्ट सहित संपूर्ण कार्यान्वयन का पहली बार खुलासा किया गया है। अभी तक कोई आधिकारिक सटीक तारीख नहीं है।
उपयोगकर्ता समीक्षाएं