बिगकोड
मुफ्त
बिगकोड हगिंग फेस और सर्विसनाउ रिसर्च द्वारा संयुक्त रूप से शुरू की गई एक खुली विज्ञान सहयोग परियोजना है, जो कोड लार्ज लैंग्वेज मॉडल (कोड एलएलएम) के खुले और जिम्मेदार विकास के लिए समर्पित है। मुख्य आउटपुट में StarCoder श्रृंखला मॉडल (StarCoder 15B, StarCoder2 3B/7B/15B), स्टैक डेटा सेट BigCodeBench बेंचमार्क और BigCodeArena कोड मूल्यांकन प्लेटफ़ॉर्म शामिल हैं।
बिगकोड
मुख्य पैरामीटर और आँकड़े
बिगकोड एक खुला विज्ञान सहयोग परियोजना है जो हगिंग फेस और सर्विस नाउ रिसर्च द्वारा संयुक्त रूप से शुरू की गई है, जो ओपन सोर्स अनुसंधान और कोड लार्ज लैंग्वेज मॉडल (कोड एलएलएम) के जिम्मेदार विकास पर केंद्रित है। परियोजना की आधिकारिक वेबसाइट "खुले वैज्ञानिक सहयोग, बड़े कोड मॉडल के खुले और जिम्मेदार विकास के लिए प्रतिबद्ध" के रूप में स्थित है। यह कोई एकल उत्पाद नहीं है, बल्कि मॉडल, डेटा, मूल्यांकन और परिनियोजन टूल को कवर करने वाले ओपन सोर्स इकोसिस्टम का एक पूरा सेट है।
| प्रोजेक्ट्स | सार्वजनिक सूचना |
|---|---|
| आधिकारिक स्थिति | खुला वैज्ञानिक सहयोग, बड़े कोड भाषा मॉडल के खुले और जिम्मेदार विकास के लिए प्रतिबद्ध |
| प्रायोजक | हगिंग फेस + सर्विसनाउ रिसर्च |
| संगठनात्मक स्वरूप | गैर-लाभकारी खुला विज्ञान सहयोग |
| कोर मॉडल | स्टारकोडर (15.5बी), स्टारकोडर2 (3बी/7बी/15बी) |
| कोर डेटासेट | स्टैक (v1/v2, अधिकतम लाइसेंस प्राप्त कोड पूर्व-प्रशिक्षण डेटा सेट) |
| मूल्यांकन रूपरेखा | बिगकोडबेंच, बिगकोडएरेना, बिगकोड इवैल्यूएशन हार्नेस |
| ओपन सोर्स लाइसेंस | अपाचे-2.0 (कोर रिपोजिटरी), बिगकोड ओपनरेल-एम v1 (मॉडल) |
| समुदाय का आकार | GitHub 1.8k HF को फ़ॉलो करें 2.1k 359 टीम सदस्यों को फ़ॉलो करें |
| नवीनतम मॉडल संस्करण | स्टारकोडर2-15बी (2024-02-29) |
| समर्थित प्लेटफार्म | वेब (एचएफ स्पेस), एपीआई (टीजीआई), स्व-होस्टेड |
सामुदायिक पैमाना: GitHub द्वारा आयोजित 29 सार्वजनिक गोदाम हैं। StarCoder वेयरहाउस 7.5k स्टार्स, 2.1k स्टार्स और BigCode इवैल्यूएशन हार्नेस 1.1k स्टार्स के साथ StarCoder2 वेयरहाउस में सबसे आगे है। हगिंग फेस संगठन में 69 मॉडल, 93 डेटा सेट और 29 स्पेस हैं। सबसे अधिक डाउनलोड किया जाने वाला मॉडल, StarCoder2-3B, 181k डाउनलोड जमा कर चुका है।
आउटपुट कवरेज: बिगकोड एक साथ चार खंडों को कवर करता है: मॉडल प्रशिक्षण, डेटा गवर्नेंस, मूल्यांकन बेंचमार्क और अनुमान परिनियोजन। ओपन सोर्स कोड मॉडल परियोजनाओं के बीच यह अपेक्षाकृत दुर्लभ है - अधिकांश परियोजनाएं केवल एक अनुभाग पर ध्यान केंद्रित करती हैं (जैसे कि केवल मॉडल जारी करना या केवल बेंचमार्क प्रदान करना)।
उपयोगकर्ता और बाज़ार की पहचान
बिगकोड की मान्यता पारंपरिक अर्थों में उपयोगकर्ता पंजीकरण या राजस्व आंकड़ों के बजाय ओपन सोर्स समुदाय और अकादमिक उद्धरणों द्वारा अपनाने में परिलक्षित होती है।
ओपन सोर्स सामुदायिक लोकप्रियता: स्टारकोडर श्रृंखला रिपॉजिटरी में कुल 10k से अधिक GitHub सितारे हैं। बिगकोड इवैल्यूएशन हार्नेस (1.1k स्टार) कोड मॉडल मूल्यांकन के लिए मानक ढांचे में से एक बन गया है और इसे कई तृतीय-पक्ष मॉडल परियोजनाओं द्वारा मूल्यांकन उपकरण के रूप में उद्धृत किया गया है।
एंटरप्राइज़-स्तर पर अपनाना: सह-प्रायोजक के रूप में ServiceNow ने कोड इंटेलिजेंस परिदृश्यों के लिए आंतरिक रूप से StarCoder मॉडल का उपयोग किया है; हगिंग फेस टेक्स्ट जेनरेशन इनफेरेंस (टीजीआई) के माध्यम से स्टारकोडर2 अनुमान सेवाएं प्रदान करता है। ओपन सोर्स इकोसिस्टम में स्टारकोडर फाइन-ट्यूनिंग पर आधारित पहले से ही कई वर्टिकल मॉडल मौजूद हैं (13 एडेप्टर मॉडल और 21 फाइन-ट्यून मॉडल हगिंग फेस मॉडल ट्री पर सूचीबद्ध हैं)।
शैक्षणिक प्रभाव: StarCoder2 पेपर (arXiv 2402.19173) फरवरी 2024 में प्रकाशित हुआ था, BigCodeBench पेपर ICLR 2025 द्वारा स्वीकार किया गया था, और SelfCodeAlign पेपर NeurIPS 2024 द्वारा स्वीकार किया गया था। कोड पीढ़ी के क्षेत्र में परियोजना द्वारा उत्पादित अकादमिक उद्धरणों की संख्या लगातार बढ़ रही है।
कार्यान्वयन के लिए पूर्वापेक्षाएँ: स्टारकोडर श्रृंखला एक कमांड मॉडल के बजाय एक बेस मॉडल है। इसे विशिष्ट कार्यों (जैसे कोड पूर्णता, बग मरम्मत और परीक्षण पीढ़ी) के अनुकूल बनाने के लिए फाइन-ट्यूनिंग या शीघ्र इंजीनियरिंग की आवश्यकता होती है। जब सीधे बातचीत के तरीके में इसका उपयोग किया जाता है तो यह अच्छी तरह से काम नहीं करता है।
लागत लाभ
बिगकोड परियोजना का लागत लाभ एपीआई मूल्य निर्धारण प्रतिस्पर्धा में नहीं है, बल्कि अपाचे-2.0 लाइसेंस के तहत सभी मॉडल भार को खोलने में है, जिससे टीमों को शून्य लाइसेंस शुल्क पर कोड उत्पादन क्षमताएं प्राप्त करने की अनुमति मिलती है।
सी-साइड/इंडिविजुअल: स्टारकोडर2 मॉडल पूरी तरह से मुफ़्त है और इसे हगिंग फेस स्पेस के माध्यम से ऑनलाइन अनुभव किया जा सकता है या स्थानीय जीपीयू पर चलाया जा सकता है। 3बी मॉडल को उपभोक्ता-ग्रेड जीपीयू (जैसे आरटीएक्स 3090) पर 8-बिट परिमाणीकरण के साथ चलाया जा सकता है और यह लगभग 9 जीबी वीडियो मेमोरी लेता है; 15B मॉडल के लिए 8-बिट परिमाणीकरण के साथ लगभग 17GB वीडियो मेमोरी की आवश्यकता होती है।
डेवलपर/स्व-होस्टेड: मॉडल वेट डाउनलोड करने के लिए निःशुल्क हैं, और आप टीजीआई या वीएलएलएम के माध्यम से अपनी खुद की अनुमान सेवा बना सकते हैं। हार्डवेयर लागत मॉडल आकार और थ्रूपुट आवश्यकताओं पर निर्भर करती है - 3बी मॉडल को एकल कार्ड टी4 के साथ तैनात किया जा सकता है, और 15बी मॉडल कम से कम 24 जीबी वीडियो मेमोरी और परिमाणीकरण के साथ जीपीयू का उपयोग करने की सिफारिश करता है। कुल मिलाकर, स्व-होस्टेड कोड मॉडल की कुल लागत = जीपीयू इंस्टेंस शुल्क + संचालन और रखरखाव जनशक्ति, जो टोकन द्वारा बिल की जाने वाली समान क्षमताओं वाले वाणिज्यिक एपीआई की तुलना में बहुत कम है।
उद्यम/निजी: उद्यम बिगकोड परियोजना के लिए लाइसेंस शुल्क का भुगतान किए बिना सीधे StarCoder2 भार के आधार पर निजी तौर पर तैनात और फाइन-ट्यून कर सकते हैं। हालाँकि, आपको BigCode OpenRAIL-M v1 लाइसेंस समझौते (उपयोग प्रतिबंधों सहित) की बाधाओं पर ध्यान देना चाहिए। यह अनुशंसा की जाती है कि कानूनी विभाग व्यावसायिक उपयोग से पहले लाइसेंस की समीक्षा पूरी कर ले।
छिपी हुई लागत: बेस मॉडल को प्रयोग करने योग्य स्तर तक पहुंचने के लिए फाइन-ट्यूनिंग या शीघ्र इंजीनियरिंग की आवश्यकता होती है, जिसे अक्सर कम करके आंका जाता है। इसके अलावा, मॉडल-जनरेटेड कोड के कॉपीराइट स्वामित्व और लाइसेंसिंग अनुपालन के लिए अतिरिक्त प्रशासन की भी आवश्यकता होती है - बिगकोड प्रशिक्षण डेटा के स्रोत का पता लगाने के लिए एक खोज अनुक्रमण उपकरण प्रदान करता है, लेकिन कंपनियों को अभी भी अपनी स्वयं की कोड ट्रैसेबिलिटी प्रक्रियाएं स्थापित करने की आवश्यकता होती है।
मुख्य कार्य
बिगकोड प्रोजेक्ट की मुख्य क्षमताओं को कोड एलएलएम के पूर्ण-लिंक ओपन सोर्स के आसपास डिज़ाइन किया गया है, और सार्वजनिक आउटपुट को पांच स्तरों में संक्षेपित किया जा सकता है:
- कोड जेनरेशन मॉडल (स्टारकोडर श्रृंखला): मल्टी-स्केल (1.1बी से 15बी) बेस मॉडल प्रदान करता है, फिल-इन-द-मिडिल (एफआईएम) कोड पूर्णता, मल्टी-लैंग्वेज कोड जेनरेशन (स्टारकोडर2 600+ प्रोग्रामिंग भाषाओं को कवर करता है), और लंबी संदर्भ कोड समझ (16K टोकन) का समर्थन करता है।
- प्री-ट्रेनिंग डेटा सेट (द स्टैक): स्टैक v2 वर्तमान में सबसे बड़ा लाइसेंस प्राप्त कोड प्री-ट्रेनिंग डेटा सेट (5.45B टोकन) है, जो 600+ प्रोग्रामिंग भाषाओं को कवर करता है, और ऑप्ट-आउट तंत्र का समर्थन करता है ताकि डेवलपर्स को प्रशिक्षण डेटा से अपने स्वयं के वेयरहाउस को हटाने का विकल्प चुनने की अनुमति मिल सके।
- मूल्यांकन बेंचमार्क (बिगकोडबेंच/बिगकोडएरेना): बिगकोडबेंच (आईसीएलआर 2025) एकाधिक फ़ंक्शन कॉल और जटिल निर्देशों के कोड जनरेशन मूल्यांकन पर केंद्रित है; BigCodeArena (2025) कोड निष्पादन परिणामों के माध्यम से मॉडल प्राथमिकताओं का मूल्यांकन करता है, और अधिक विश्वसनीय स्वचालित मूल्यांकन पद्धति प्रदान करता है।
- इवैल्यूएशन हार्नेस: एक मानकीकृत कोड मॉडल मूल्यांकन ढांचा प्रदान करता है, जो ह्यूमनएवल, ह्यूमनएवल+, जीएसएम8के (पीएएल), डीएस-1000, क्रुक्सएवल-आई आदि जैसे कई बेंचमार्क के एक-क्लिक मूल्यांकन का समर्थन करता है।
- फाइन-ट्यूनिंग और परिनियोजन उपकरण: लोरा फाइन-ट्यूनिंग स्क्रिप्ट पीईएफटी एकीकृत बिट्सैंडबाइट्स क्वांटिफिकेशन समर्थन टीजीआई अनुमान कंटेनर, और स्टारकोडर.सीपीपी (जीजीएमएल पर आधारित सी++ अनुमान कार्यान्वयन) प्रदान करें।
सिनर्जी: ये क्षमताएं अलग-अलग मौजूद नहीं हैं - स्टैक डेटा सेट का उपयोग स्टारकोडर मॉडल को प्रशिक्षित करने के लिए किया जाता है, स्टारकोडर मॉडल का मूल्यांकन मूल्यांकन हार्नेस के माध्यम से किया जाता है, और बिगकोडबेंच एक मानकीकृत मूल्यांकन पद्धति प्रदान करता है। तीनों एक "डेटा-मॉडल-मूल्यांकन" संरचना बनाते हैं। इसका मतलब यह है कि बिगकोड का उपयोग करने वाली टीमें कई परियोजनाओं में घटकों को एक साथ जोड़े बिना, प्रशिक्षण से लेकर मूल्यांकन तक की पूरी प्रक्रिया को पूरा करने के लिए एक ही टूल श्रृंखला का पुन: उपयोग कर सकती हैं।
मॉडल और संस्करण विकास
निरंतर पुनरावृत्त अद्यतन, नवीनतम संस्करण प्रदर्शन अनुकूलन और नई सुविधाएँ पेश करता है। ऐतिहासिक संस्करण की जानकारी आधिकारिक रिलीज़ पृष्ठ के माध्यम से देखी जा सकती है। वर्तमान में कोई पूर्ण सार्वजनिक संस्करण विकास समयरेखा नहीं है।
तकनीकी लाभ
बिगकोड के तकनीकी लाभ मॉडल डिजाइन, प्रशिक्षण पैमाने और ओपन सोर्स गवर्नेंस के तीन आयामों में परिलक्षित होते हैं। मुख्य तर्क "खुले विज्ञान के माध्यम से कोड मॉडल को अधिक पारदर्शी और प्रतिलिपि प्रस्तुत करने योग्य बनाना है।"
मॉडल आर्किटेक्चर: StarCoder2 ग्रुपेड क्वेरी अटेंशन (GQA) का उपयोग करता है, जो अनुमान के दौरान KV कैश के उपयोग को कम करता है और मल्टी-हेड अटेंशन की तुलना में स्व-परिनियोजन मेमोरी आवश्यकताओं को कम करता है। स्लाइडिंग विंडो अटेंशन (4K टोकन) 16K प्रभावी संदर्भ को बनाए रखते हुए लंबे अनुक्रम परिदृश्यों में कम्प्यूटेशनल लागत को नियंत्रित करता है। एफआईएम प्रशिक्षण उद्देश्य मॉडल को कोड पूर्णता परिदृश्यों के लिए स्वाभाविक रूप से फिट बनाता है - यह केवल बाएं से दाएं पाठ पीढ़ी के बजाय कोड के बीच में भरने के शब्दार्थ को समझता है।
प्रशिक्षण पैमाना: 15बी मॉडल को 1024× एच100 जीपीयू पर प्रशिक्षित किया गया, कुल मिलाकर 4+ ट्रिलियन टोकन। यह पैमाना ओपन सोर्स कोड मॉडल में प्रथम सोपानक का है। प्रशिक्षण NVIDIA NeMo फ्रेमवर्क और Eos सुपरकंप्यूटर का उपयोग करता है, जो समान आकार के वाणिज्यिक मॉडल के प्रशिक्षण कॉन्फ़िगरेशन के बराबर है।
डेटा गवर्नेंस: स्टैक v2 की प्रोसेसिंग पाइपलाइन (डीडुप्लीकेशन, परमिशन फ़िल्टरिंग पीआईआई रिमूवल ऑप्ट-आउट सपोर्ट) ओपन सोर्स कोड डेटासेट में सबसे परिपक्व है। प्रत्येक प्रशिक्षण नमूना स्रोत ट्रैसेबिलिटी को बरकरार रखता है, और खोज सूचकांक उपकरण उपयोगकर्ताओं को यह सत्यापित करने की अनुमति देता है कि उत्पन्न कोड एक विशिष्ट ओपन सोर्स वेयरहाउस से आता है, जो एंटरप्राइज़ अनुपालन ट्रैसेबिलिटी के लिए महत्वपूर्ण है।
मूल्यांकन पुनरुत्पादन: बिगकोड मूल्यांकन हार्नेस मानकीकृत मूल्यांकन स्क्रिप्ट और डॉकर वातावरण प्रदान करता है। एक ही बेंचमार्क पर विभिन्न टीमों के परिणामों की सीधे तुलना की जा सकती है, जिससे मूल्यांकन पद्धतियों में अंतर के कारण होने वाली अतुलनीयता की समस्याएं कम हो जाती हैं।
तकनीकी सीमाएँ: स्टारकोडर श्रृंखला कमांड फाइन-ट्यूनिंग मॉडल के बजाय एक बेस मॉडल है, और प्रत्यक्ष संवाद प्रभाव खराब है। मॉडल की तर्कशक्ति, गणित और अन्य क्षमताएं समान पैमाने के मल्टी-मोडल बुनियादी मॉडल (जैसे डीपसीक, एलएलएएमए 3) से कमजोर हैं। लंबी फ़ाइल पुनर्निर्माण परिदृश्यों के लिए जिनके लिए मजबूत संदर्भ समझ की आवश्यकता होती है, 16K संदर्भ विंडो पर्याप्त नहीं हो सकती है।
कैसे उपयोग करें
- वेब क्लाइंट: आप आधिकारिक वेबसाइट पर जाकर और खाता पंजीकृत करके इसका उपयोग कर सकते हैं। अधिकांश फ़ंक्शनों को इंस्टॉलेशन की आवश्यकता नहीं होती है.
- एपीआई एक्सेस: रेस्टफुल एपीआई प्रदान करता है, डेवलपर्स एपीआई कुंजी प्राप्त कर सकते हैं और इसे अपने स्वयं के अनुप्रयोगों में एकीकृत कर सकते हैं।
उत्पाद का मूल्य निर्धारण
बिगकोड परियोजना के लिए कोई शुल्क नहीं है। सभी मॉडल भार, डेटासेट और कोड एक ओपन सोर्स लाइसेंस के तहत जारी किए जाते हैं।
- सी-साइड/व्यक्तिगत: पूरी तरह से मुफ़्त। हगिंग फेस स्पेस के साथ इसे ऑनलाइन अनुभव करें, या मॉडल को स्थानीय जीपीयू पर चलाएं।
- डेवलपर्स/एपीआई उपयोगकर्ता: कोई आधिकारिक होस्ट किया गया एपीआई नहीं। आप टीजीआई या वीएलएलएम के माध्यम से अपनी खुद की अनुमान सेवा बना सकते हैं, और लागत में केवल जीपीयू उदाहरण की लागत शामिल है।
- उद्यम/निजी: मॉडल वज़न निःशुल्क उपलब्ध हैं, बिना किसी लाइसेंस शुल्क के। BigCode OpenRAIL-M v1 लाइसेंस अनुबंध (उपयोग प्रतिबंधों सहित) की शर्तों के अधीन। व्यावसायिक उपयोग से पहले कानूनी लाइसेंसिंग समीक्षा पूरी करने की अनुशंसा की जाती है।
अनुप्रयोग परिदृश्य
बिगकोड के मॉडल में कोड निर्माण और समझ के क्षेत्र में लागू परिदृश्यों की एक विस्तृत श्रृंखला है, और इसका मूल "ओपन सोर्स कोड से सामान्य प्रोग्रामिंग पैटर्न सीखने" की क्षमता में निहित है:
- कोड पूर्णता और जनरेशन: वास्तविक समय कोड पूर्णता, फ़ंक्शन बॉडी जेनरेशन और बॉयलरप्लेट कोड फिलिंग प्रदान करने के लिए आईडीई प्लग-इन या सीएलआई टूल में स्टारकोडर मॉडल को एकीकृत करें। इसका लाभ दोहराए जाने वाले कोडिंग प्रयासों को कम करना और प्रोटोटाइप विकास में तेजी लाना है। यह ध्यान दिया जाना चाहिए कि बेस मॉडल को प्राकृतिक भाषा निर्देशों के बजाय उचित त्वरित डिजाइन की आवश्यकता होती है।
- कोड अनुवाद और माइग्रेशन: एक भाषा से दूसरी भाषा (जैसे पायथन→जावा) में कोड का अनुवाद करने में सहायता के लिए, या फ्रेमवर्क अपग्रेड के लिए कोड माइग्रेशन पूरा करने में सहायता के लिए बहु-भाषा कोड को समझने की मॉडल की क्षमता का उपयोग करें। प्रभाव प्रशिक्षण डेटा में स्रोत और लक्ष्य भाषाओं के कवरेज पर निर्भर करता है।
- टेस्ट केस जेनरेशन: फ़ंक्शन सिग्नेचर और डॉक्यूमेंटेशन स्ट्रिंग के आधार पर यूनिट टेस्ट स्केलेटन जेनरेट करें। BigCodeBench मूल्यांकन डेटा से पता चलता है कि StarCoder2 जटिल मल्टी-फ़ंक्शन कॉल परिदृश्यों में अच्छा प्रदर्शन करता है, लेकिन परीक्षण उत्पन्न करने के लिए अभी भी कवरेज और शुद्धता की मैन्युअल समीक्षा की आवश्यकता होती है।
लागू लोग
बिगकोड की ओपन सोर्स पोजिशनिंग इसके सेवा समूह को मुख्य रूप से डेवलपर्स और शोधकर्ता बनाती है:
- एआई/एमएल शोधकर्ता: अनुसंधान कोड एलएलएम आर्किटेक्चर, प्रशिक्षण विधियां, या मूल्यांकन पद्धतियां। बिगकोड एक पूर्ण प्रतिलिपि प्रस्तुत करने योग्य आधार रेखा प्रदान करता है, जिसमें मॉडल वजन, डेटा प्रोसेसिंग पाइपलाइन, मूल्यांकन ढांचे और बेंचमार्क शामिल हैं।
- सॉफ़्टवेयर इंजीनियर और आर्किटेक्ट: ऐसी टीमें जिन्हें अपनी स्वयं की कोड इंटेलिजेंस क्षमताओं का निर्माण करने की आवश्यकता है। तृतीय-पक्ष API को स्रोत कोड भेजने से बचने के लिए StarCoder2 मॉडल के आधार पर एक निजी कोड पूर्णता सेवा बनाई जा सकती है।
- एंटरप्राइज़ एआई प्लेटफ़ॉर्म टीम: ओपन सोर्स कोड मॉडल का मूल्यांकन करें और आंतरिक टूलचेन में एकीकृत करें। बिगकोड की लाइसेंसिंग पारदर्शिता और डेटा सेट ट्रैसेबिलिटी इसके बिजनेस मॉडल की तुलना में मुख्य लाभ हैं।
सीमाओं में फिट नहीं बैठता:
- ऐसे परिदृश्य जिनमें संवादात्मक कोड सहायकों की आवश्यकता होती है (जैसे कि गिटहब कोपायलट चैट) - स्टारकोडर श्रृंखला एक निर्देश मॉडल नहीं है, और इंटरैक्शन विधि संवाद के बजाय पूर्णता पर आधारित है।
- उत्पन्न कोड में कॉपीराइट के लिए शून्य सहिष्णुता के साथ अनुपालन परिदृश्य - मॉडल प्रशिक्षण डेटा में ओपन सोर्स लाइसेंस प्राप्त कोड के समान स्निपेट उत्पन्न कर सकते हैं, जिसके लिए अतिरिक्त ट्रैसेबिलिटी समीक्षा की आवश्यकता होती है।
- बेहद सीमित संसाधनों वाले एज डिवाइस - यहां तक कि 3बी मॉडल के लिए भी कुछ जीपीयू या मेमोरी संसाधनों की आवश्यकता होती है, जिससे इसे सीधे मोबाइल टर्मिनल या एमसीयू पर चलाना अवास्तविक हो जाता है।
सारांश और आउटलुक
बिगकोड का मुख्य मूल्य खुले वैज्ञानिक तरीके से कोड एलएलएम बुनियादी ढांचे का एक पूरा सेट प्रदान करना है: प्रशिक्षण डेटा (द स्टैक), मॉडल (स्टारकोडर श्रृंखला), मूल्यांकन बेंचमार्क (बिगकोडबेंच) से लेकर तैनाती उपकरण (टीजीआई, स्टारकोडर.सीपीपी) तक, प्रशिक्षण से कार्यान्वयन तक कोड मॉडल के पूरे लिंक को कवर करना। यह सबसे तेज़ कोड सहायक नहीं है, न ही यह सबसे हल्का मॉडल है, लेकिन उन टीमों के लिए जिन्हें कोड पीढ़ी क्षमताओं को पूरी तरह से नियंत्रित करने और डेटा ट्रैसेबिलिटी और लाइसेंस पारदर्शिता पर ध्यान देने की आवश्यकता है, बिगकोड ओपन सोर्स पारिस्थितिकी तंत्र में सबसे संपूर्ण टूल श्रृंखला प्रदान करता है।
वर्तमान सीमाएँ: StarCoder2 श्रृंखला में आधिकारिक निर्देश फाइन-ट्यूनिंग संस्करण का अभाव है (समुदाय का निर्देश-v0.1 अभी भी प्रयोगात्मक है), और टीम को फाइन-ट्यूनिंग और अनुकूलन को स्वयं पूरा करने की आवश्यकता है; बड़े कोड बेस के साथ काम करते समय मॉडल संदर्भ विंडो (16के) अपर्याप्त हो सकती है; प्रोजेक्ट एक प्रबंधित एपीआई प्रदान नहीं करता है, और स्व-तैनाती के लिए कुछ एमएलओपीएस क्षमताओं की आवश्यकता होती है।
खरीद और अंगीकरण जोखिम मूल्यांकन: बिगकोड के मॉडल भार अपाचे-2.0 और ओपनरेल-एम वी1 लाइसेंस के तहत जारी किए जाते हैं। लाइसेंसिंग जोखिम अपेक्षाकृत नियंत्रणीय हैं, लेकिन ओपनरेल-एम में अतिरिक्त उपयोग प्रतिबंधों के लिए कानूनी पुष्टि की आवश्यकता होती है कि क्या वे लक्ष्य परिदृश्य पर लागू होते हैं। अपनाने से पहले, उद्यमों को मूल्यांकन पर ध्यान केंद्रित करना चाहिए: ① लक्ष्य प्रोग्रामिंग भाषा और कोडिंग शैली में StarCoder2 की पूर्णता सटीकता प्रयोग करने योग्य सीमा तक पहुंचती है या नहीं; ② स्वीकार्य प्रदर्शन स्तर को ठीक करने के लिए आवश्यक डेटा एनोटेशन और जीपीयू लागत; ③ प्रोजेक्ट गवर्नेंस मॉडल की दीर्घकालिक स्थिरता (हगिंग फेस और सर्विसनाउ के नेतृत्व में)। प्रभाव को सत्यापित करने के लिए पहले एक छोटे नमूने के साथ गैर-उत्पादन वातावरण में 7बी मॉडल चलाने की सिफारिश की जाती है, और फिर मूल्यांकन के दायरे का विस्तार किया जाता है।
संबंधित उपकरण: github-copilot, कर्सर
बिगकोड का संस्करण विकास
बिगकोड का संस्करण संदर्भ मॉडल रिलीज पर आधारित है, जो धीरे-धीरे शुरुआती छोटे पैमाने की खोज से लेकर स्टारकोडर2 श्रृंखला के बड़े पैमाने के प्रशिक्षण तक विकसित हो रहा है।
प्रारंभिक अन्वेषण (~2023-01)
- सांताकोडर-1.1बी: पहला सार्वजनिक मॉडल आउटपुट, 1.1बी पैरामीटर, जिसका उपयोग बहु-भाषा कोड पीढ़ी की बुनियादी क्षमताओं को सत्यापित करने के लिए किया जाता है।
मेनलाइन रिलीज़
- स्टारकोडर-15.5बी (~2023-05): पहला फ्लैगशिप मॉडल, 15.5बी पैरामीटर, 80+ प्रोग्रामिंग भाषाएं, 1 ट्रिलियन टोकन प्रशिक्षण, 8के संदर्भ। पास@1 ह्यूमनएवल पर 33.6% तक पहुंच गया, और रिलीज के बाद समुदाय में कई बेहतर संस्करण तेजी से उभरे।
- StarCoder2-3B/7B/15B (2024-02-29): दूसरी पीढ़ी की मॉडल श्रृंखला, पूरी तरह से उन्नत। 3B/7B को 3+ ट्रिलियन टोकन पर प्रशिक्षित किया जाता है, और 15B को 4+ ट्रिलियन टोकन पर प्रशिक्षित किया जाता है; समूहीकृत क्वेरी ध्यान, 16K संदर्भ विंडो (4K स्लाइडिंग विंडो), और FIM लक्ष्य पेश किए गए हैं; प्रशिक्षण हार्डवेयर को 1024× H100 GPU में अपग्रेड किया गया है।
मूल्यांकन और पारिस्थितिक अनुपूरक (2024-2025)
- बिगकोडबेंच (ICLR 2025): एक मल्टी-फंक्शन कॉल बेंचमार्क जारी करता है, जो मौजूदा बेंचमार्क के अंतर को भरता है जो केवल सिंगल फ़ंक्शन जेनरेशन का परीक्षण करता है।
- SelfCodeAlign (NeurIPS 2024): मैन्युअल एनोटेशन के बिना मॉडल निर्देश अनुपालन क्षमताओं में सुधार के लिए एक कोड स्व-संरेखण विधि का प्रस्ताव करता है।
- बिगकोडएरेना (2025-10): पारंपरिक मैनुअल मूल्यांकन की पुनरावृत्ति समस्या को हल करने के लिए निष्पादन परिणामों के आधार पर कोड वरीयता मूल्यांकन का परिचय।
- ऑक्टोपैक (~2024): कोड मॉडल के लिए मानकीकृत संरेखण डेटा प्रदान करने के लिए डेटा सेट और प्रशिक्षण उत्पादों को ठीक करने के लिए निर्देश जारी करें।
जुलाई 2026 तक, प्रोजेक्ट GitHub और Hugging Face के माध्यम से नए मॉडल और डेटा सेट का उत्पादन जारी रखता है, लेकिन एक निश्चित संस्करण रिलीज़ चक्र निर्धारित नहीं किया है। उत्पादन उपयोगकर्ताओं के लिए मूल्यांकन आधार रेखा के रूप में StarCoder2-15B या StarCoder2-7B का उपयोग करने और कार्य की जटिलता के आधार पर उचित विशिष्टताओं का चयन करने की अनुशंसा की जाती है।
बिगकोड का उपयोग कैसे करें
बिगकोड के मॉडल विभिन्न तरीकों से प्राप्त और उपयोग किए जा सकते हैं, जो विभिन्न तकनीकी पृष्ठभूमि वाली टीमों के लिए उपयुक्त हैं:
| कैसे उपयोग करें | भीड़ के लिए उपयुक्त | विशेषताएँ | लागत |
|---|---|---|---|
| हगिंग फेस स्पेस ऑनलाइन अनुभव | उत्पाद मूल्यांकन/त्वरित सत्यापन | किसी इंस्टॉलेशन की आवश्यकता नहीं है, सीधे ब्राउज़र में चलाएं | मुफ़्त |
| ट्रांसफार्मर लाइब्रेरी लोड हो रही है | विकास एकीकरण | PyTorch, बिट्सैंडबाइट्स परिमाणीकरण का समर्थन करता है | मुफ़्त (आपके अपने GPU की आवश्यकता है) |
| टेक्स्ट जेनरेशन अनुमान (टीजीआई) | उत्पादन अनुमान परिनियोजन | REST API, निरंतर बैच प्रोसेसिंग का समर्थन करता है | निःशुल्क खुला स्रोत (जीपीयू आवश्यक) |
| स्टारकोडर.सीपीपी (जीजीएमएल) | एज/सीपीयू परिनियोजन | C++ कार्यान्वयन, कोई पायथन निर्भरता नहीं | मुफ़्त |
| स्थानीय फ़ाइन-ट्यूनिंग (PEFT + LoRA) | मॉडल अनुकूलन | 4 बिट परिमाणीकरण फाइन-ट्यूनिंग, उपभोक्ता-ग्रेड जीपीयू उपलब्ध | निःशुल्क (जीपीयू आवश्यक) |
विशिष्ट उपयोग चरण (उदाहरण के तौर पर StarCoder2-15B लोड करने वाले ट्रांसफॉर्मर को लें):
# निर्भरता स्थापित करें
# पिप इंस्टाल git+https://github.com/huggingface/transformers.git
ट्रांसफार्मर से AutoModelForCausalLM, AutoTokenizer आयात करें
चेकप्वाइंट = "बिगकोड/स्टारकोडर2-15बी"
डिवाइस = "क्यूडा"
टोकननाइज़र = AutoTokenizer.from_pretrained(चेकपॉइंट)
मॉडल = AutoModelForCausalLM.from_pretrained(
चौकी,
डिवाइस_मैप = "ऑटो",
टॉर्च_dtype=torch.bfloat16
.to(डिवाइस)
इनपुट्स = टोकननाइज़र.एनकोड('def fibonacci(n):', return_tensors='pt').to(डिवाइस)
आउटपुट = मॉडल.जेनरेट(इनपुट, max_new_tokens=128)
प्रिंट(टोकनाइज़र.डीकोड(आउटपुट[0]))
मात्रात्मक तैनाती: बिटसैंडबाइट्स का उपयोग करके 8 बिट (लगभग 16.9 जीबी वीडियो मेमोरी) या 4 बिट (लगभग 9.2 जीबी वीडियो मेमोरी) अनुमान प्राप्त किया जा सकता है, जिससे जीपीयू आवश्यकताओं में काफी कमी आती है।
फाइन-ट्यूनिंग अनुकूलन: परियोजना पीईएफटी + लोआरए पर आधारित एक फाइन-ट्यूनिंग स्क्रिप्ट प्रदान करती है, जो 4 बिट क्वांटाइजेशन के तहत एकल-कार्ड उपभोक्ता-ग्रेड जीपीयू के साथ डोमेन अनुकूलन को पूरा कर सकती है।
वास्तविक कार्यान्वयन को चार चरणों में बढ़ावा देने की सिफारिश की गई है: "मूल्यांकन बेसलाइन चयन → छोटा नमूना सत्यापन → फाइन-ट्यूनिंग और अनुकूलन → मात्रात्मक तैनाती"। पहला सप्ताह लक्ष्य प्रोग्रामिंग भाषा और कार्य प्रकार में मॉडल की पूर्णता सटीकता को सत्यापित करने पर केंद्रित है, और फिर तय करता है कि फाइन-ट्यूनिंग में प्रवेश करना है या नहीं।
संस्करण जानकारी
- स्टारकोडर2-15बी :StarCoder2 श्रृंखला (15B पैरामीटर) में सबसे बड़ा मॉडल, 16K संदर्भ विंडो के साथ समूहीकृत क्वेरी अटेंशन का उपयोग करते हुए, 600+ प्रोग्रामिंग भाषाओं और 4+ ट्रिलियन टोकन पर प्रशिक्षित।
- स्टारकोडर2-7बी :StarCoder2 श्रृंखला मध्य-स्तरीय मॉडल (7B पैरामीटर), 3+ ट्रिलियन टोकन प्रशिक्षण, एकल GPU परिनियोजन परिदृश्यों के लिए उपयुक्त।
- स्टारकोडर2-3बी :StarCoder2 श्रृंखला (3B पैरामीटर) का सबसे छोटा मॉडल, संसाधन-विवश परिदृश्यों में कोड पूरा करने और उत्पन्न करने के लिए उन्मुख है।
- स्टारकोडर-15.5बी :पहला स्टारकोडर श्रृंखला फ्लैगशिप मॉडल, 80+ प्रोग्रामिंग भाषाएं 1 ट्रिलियन टोकन प्रशिक्षण, 8K संदर्भ विंडो। अभी तक कोई आधिकारिक सटीक तारीख नहीं है।
- सांताकोडर-1.1बी :बहु-भाषा कोड पीढ़ी की खोज के लिए बिगकोड का एक छोटे पैमाने के कोड मॉडल (1.1B पैरामीटर) का प्रारंभिक आउटपुट। अभी तक कोई आधिकारिक सटीक तारीख नहीं है।
उपयोगकर्ता समीक्षाएं