सी-इवल
मुफ्त
सी-इवल बड़े भाषा मॉडलों के लिए एक चीनी व्यापक मूल्यांकन सूट है। इसमें 13,948 बहुविकल्पीय प्रश्न हैं, जिनमें 52 विषय और चार कठिनाई स्तर शामिल हैं। यह सार्वजनिक रैंकिंग भी प्रदान करता है और बुनियादी चीनी मॉडलों की क्षमता को मापने के लिए आमतौर पर उपयोग किए जाने वाले शैक्षणिक बेंचमार्क में से एक है।
सी-इवल
सी-इवल के मुख्य पैरामीटर और आँकड़े
सी-इवल अंतिम उपयोगकर्ताओं के लिए एक एप्लिकेशन नहीं है, बल्कि शोधकर्ताओं और मॉडल टीमों के लिए चीनी बड़े मॉडल मूल्यांकन बेंचमार्क का एक सेट है। इसका मूल मूल्य "मॉडल के चीनी ज्ञान और तर्क क्षमता को मापने के लिए एक एकीकृत और तुलनीय प्रश्न बैंक का उपयोग करना है।" यह जिस समस्या का समाधान करता है वह चीनी परिदृश्य में मानकीकृत, अंतःविषय क्षैतिज मूल्यांकन पैमानों की कमी है।
| प्रोजेक्ट्स | सार्वजनिक सूचना |
|---|---|
| बेंचमार्क प्रकार | चीनी बड़े मॉडल बहुविषयक मूल्यांकन किट |
| प्रश्न का आकार | 13948 बहुविकल्पीय प्रश्न |
| विषय कवरेज | 52 विषय |
| कठिनाई स्तर | चार कठिनाई स्तर (बुनियादी, व्यावसायिक, स्नातकोत्तर, व्यापक) |
| प्रश्न स्रोत | चीनी विश्वविद्यालय परीक्षा, स्नातक प्रवेश परीक्षा, व्यावसायिक योग्यता परीक्षा, खुली प्रतियोगिता |
| प्रारूप | सार्वजनिक प्रश्न बैंक + ऑनलाइन रैंकिंग |
| खुलापन | डेटासेट और कोड GitHub ओपन सोर्स (MIT लाइसेंस) |
| बिलिंग मॉडल | मुफ़्त (शैक्षणिक बेंचमार्क) |
| मूल्यांकन प्रोटोकॉल | 5-शॉट और 0-शॉट सेटिंग्स |
| रैंकिंग स्केल | लगातार दर्जनों मुख्यधारा मॉडलों के परिणाम शामिल हैं |
पैरामीटर अर्थ: 13948 प्रश्न बुनियादी विषयों (गणित, भौतिकी, रसायन विज्ञान) से लेकर पेशेवर क्षेत्रों (चिकित्सा, कानून, कंप्यूटर) से लेकर उन्नत तर्क (तर्क, नैतिकता) तक पूरे स्पेक्ट्रम को कवर करते हैं। 52 विषयों का स्तरीय डिज़ाइन मॉडल को न केवल समग्र स्कोर उत्पन्न करने में सक्षम बनाता है बल्कि विषय के अनुसार योग्यता प्रोफाइल को तोड़ने में भी सक्षम बनाता है। चार कठिनाई स्तर (बुनियादी, पेशेवर, स्नातक और व्यापक) सरल सामान्य ज्ञान और उच्च-क्रम तर्क में मॉडल के बीच अंतर को अलग करते हैं - एक ही मॉडल बुनियादी स्तर पर पूर्ण स्कोर के करीब हो सकता है, लेकिन स्नातक स्तर पर काफी कम हो जाता है। यह अंतर कुल स्कोर की तुलना में मॉडल की क्षमताओं की वास्तविक गहराई को बेहतर ढंग से दर्शा सकता है।
मूल्यांकन प्रोटोकॉल: सी-इवल डिफ़ॉल्ट रूप से 5-शॉट (5 उदाहरण) और 0-शॉट (कोई उदाहरण नहीं) की दो मूल्यांकन सेटिंग्स प्रदान करता है। 5-शॉट परिणाम आम तौर पर संदर्भ सीखने (संदर्भ में सीखने) की थोड़ी मात्रा के तहत मॉडल के प्रदर्शन को दर्शाते हैं, जबकि 0-शॉट परिणाम मॉडल की "नग्न ज्ञान" महारत के करीब होते हैं। दोनों के बीच का अंतर यह निर्धारित करने में मदद कर सकता है कि मॉडल नमूना प्रारूप पर कितना निर्भर है।
बेंचमार्क तुलना: समान चीनी मूल्यांकन बेंचमार्क की तुलना में, सी-इवल में विषय की चौड़ाई और कठिनाई स्तरीकरण में स्पष्ट अंतर है।
| बेंचमार्क | प्रश्नों की संख्या | विषय/क्षेत्र | कठिनाई स्तर | संगठनात्मक स्वरूप | भाषा |
|---|---|---|---|---|---|
| सी-एवल | 13948 | 52 विषय | चार स्तर (बुनियादी/व्यावसायिक/स्नातक/व्यापक) | बहुविकल्पी | चीनी |
| एमएमएलयू | ~15900 | 57 विषय | कोई स्पष्ट स्तरीकरण नहीं | बहुविकल्पी | अंग्रेजी |
| सीएमएमएलयू | ~10000 | 67 विषय | कोई स्पष्ट स्तरीकरण नहीं | बहुविकल्पी | चीनी |
| एजीइवल | ~6800 | 20+ परीक्षा प्रकार | परीक्षा स्रोत के अनुसार स्कोर | बहुविकल्पी + रिक्त स्थान भरें | चीनी-अंग्रेजी |
| गाओकाओ | ~4500 | 9 विषय कॉलेज प्रवेश परीक्षा प्रश्न | ग्रेड द्वारा विभाजित | बहुविकल्पी + रिक्त स्थान भरें | चीनी |
प्रचार सत्यापन: आधिकारिक वेबसाइट स्पष्ट रूप से इसे "बड़े भाषा मॉडल (2023) के लिए उपयुक्त एक बहु-स्तरीय और बहु-विषयक चीनी मूल्यांकन सूट" के रूप में रखती है। 13948 प्रश्न और 52 अनुशासन, कठिनाई के चार स्तर और ओपन सोर्स प्रोटोकॉल जैसे प्रमुख मापदंडों को सीधे आधिकारिक वेबसाइट और GitHub रिपॉजिटरी पर सत्यापित किया जा सकता है।
सी-इवल का उपयोगकर्ता और बाज़ार मान्यता
- अनुसंधान और उद्योग को अपनाना: सी-इवल चीनी बड़े मॉडलों के लिए वास्तविक "प्रवेश परीक्षा" बन गया है। लगभग सभी बड़े घरेलू मॉडल (डीपसीक, टोंगयी कियानवेन, वेन्क्सिनियियान चैटजीएलएम, बाइचुआन, यी श्रृंखला आदि सहित) चीनी क्षमता के प्रमुख संदर्भ संकेतक के रूप में तकनीकी रिपोर्ट या प्रचार जारी करते समय सी-इवल स्कोर सूचीबद्ध करेंगे। सार्वजनिक तकनीकी रिपोर्ट के आंकड़ों के अनुसार, सी-इवल की पांच वर्गीकरण सटीकता दरों (2026 के मध्य तक) में 90% से अधिक के कुल स्कोर के साथ 15 से अधिक मॉडल हैं, जो मॉडल पुनरावृत्तियों में इस बेंचमार्क के निरंतर ध्यान को दर्शाते हैं।
- सत्यापन योग्य डेटा: 13,948 प्रश्न, 52 विषय और चार कठिनाई स्तर सभी आधिकारिक वेबसाइट पर सार्वजनिक रूप से उपलब्ध हैं। रैंकिंग आधिकारिक वेबसाइट पर लगातार अपडेट की जाती है, और प्रत्येक मॉडल द्वारा प्रस्तुत स्कोर प्रविष्टियाँ सबमिशन समय और सेटिंग निर्देशों (जैसे 5-शॉट / 0-शॉट) के साथ होती हैं।
- अकादमिक उद्धरण: सी-इवल के मूल पेपर को Google Scholar पर (2026 के मध्य तक) 2,000 से अधिक बार उद्धृत किया गया है, जो चीनी एनएलपी मूल्यांकन के क्षेत्र में सबसे अधिक उद्धृत बेंचमार्क पेपरों में से एक बन गया है।
- सामुदायिक पारिस्थितिकी: GitHub रिपॉजिटरी (hkust-nlp/ceval) सार्वजनिक रूप से 400+ सितारे, 100+ कांटे और सक्रिय मुद्दे और पीआर चर्चाओं को प्रदर्शित करता है, जो इस मानक के लिए अकादमिक समुदाय की चिंता और लगातार सुधार करने की इच्छा को दर्शाता है।
- सीमा विवरण: रैंकिंग स्कोर प्रत्येक मॉडल टीम द्वारा प्रस्तुत किए जाते हैं या तीसरे पक्ष के मूल्यांकन द्वारा प्राप्त किए जाते हैं। मूल्यांकन सेटिंग्स में अंतर हैं (प्रॉम्प्ट शब्दांकन, बैच आकार, आउटपुट डिकोडिंग रणनीति आदि में परिवर्तन)। एकल-विकल्प प्रश्न बेंचमार्क के रूप में, सी-इवल पीढ़ी की गुणवत्ता, निर्देशों का पालन और संवाद के कई दौर जैसे आयामों को कवर नहीं करता है, और वास्तविक कार्यों में मॉडल के व्यापक प्रदर्शन का पूरी तरह से प्रतिनिधित्व नहीं कर सकता है। इसके अलावा, चूंकि प्रश्न बैंक एक स्थिर सार्वजनिक प्रश्न बैंक है, इसलिए पूर्व-प्रशिक्षण डेटा (डेटा प्रदूषण) द्वारा "याद" किए जाने का जोखिम होता है, अर्थात, मॉडल ने प्रशिक्षण चरण के दौरान कुछ प्रश्न देखे होंगे, जिससे गलत तरीके से उच्च अंक प्राप्त होंगे।
सी-इवल के लागत लाभ
सी-ईवल स्वयं कोई उपयोग शुल्क नहीं लेता है, लेकिन मूल्यांकन की पूरी लागत को "व्यक्तिगत शोधकर्ता", "शैक्षणिक/मॉडल टीम" और "उद्यम औद्योगीकरण मूल्यांकन" के तीन स्तरों से विभाजित करने की आवश्यकता है।
सी-साइड/व्यक्तिगत शोधकर्ता
- उपकरण लागत: शून्य लागत। डेटा सेट और मूल्यांकन कोड पूरी तरह से खुला स्रोत हैं और इन्हें सीधे GitHub से डाउनलोड किया जा सकता है और उपयोग किया जा सकता है।
- कंप्यूटिंग पावर लागत: अपना स्वयं का जीपीयू लाएं। 13948 प्रश्नों के एक पूर्ण मूल्यांकन में एक कार्ड A100-80G (मॉडल आकार और डिकोडिंग दक्षता के आधार पर) पर लगभग 1-4 घंटे लगते हैं। 7B से कम पैरामीटर वाले छोटे मॉडल के लिए, एक एकल उपभोक्ता-ग्रेड GPU (जैसे RTX 4090) मूल्यांकन पूरा कर सकता है।
- छिपी लागत: आपको मूल्यांकन संदर्भ (पायथन, पायटोरच और ट्रांसफार्मर निर्भरता) को सही ढंग से कॉन्फ़िगर करने और मूल्यांकन प्रोटोकॉल (5-शॉट टेम्पलेट प्रारूप, उत्तर निष्कर्षण नियम) को समझने की आवश्यकता है। नए लोग इस अनुभाग पर 1-3 दिन बिता सकते हैं।
एपीआई डेवलपर्स और मॉडल टीम
- उपकरण लागत: शून्य लागत।
- एकीकरण लागत: सी-इवल मूल्यांकन स्क्रिप्ट को मॉडल प्रशिक्षण पाइपलाइन में एकीकृत करने के लिए (जैसे कि प्रत्येक चेकपॉइंट सहेजे जाने के बाद स्वचालित रूप से निष्पादित करना) इंजीनियरिंग निवेश की आवश्यकता होती है। आधिकारिक पायथन मूल्यांकन स्क्रिप्ट प्रदान की गई है, लेकिन बैच मॉडल संस्करण तुलना, परिणाम विज़ुअलाइज़ेशन और विसंगति का पता लगाने जैसी उन्नत आवश्यकताओं को स्वयं विकसित करने की आवश्यकता है।
- तुलना लागत: यदि आपको समान सेटिंग्स के तहत प्रतिस्पर्धी मॉडलों के साथ उचित तुलना करने की आवश्यकता है, तो आपको प्रतिस्पर्धी मॉडलों के लिए अपना स्वयं का अनुमान संदर्भ या एपीआई एक्सेस तैयार करना होगा। लागत का यह हिस्सा मॉडल कॉलिंग पक्ष पर पड़ता है, न कि सी-इवल पर।
उद्यम और बड़े पैमाने पर मूल्यांकन की जरूरतें
- उपकरण लागत: शून्य लागत। कोई वाणिज्यिक लाइसेंस शुल्क नहीं है, और एमआईटी ओपन सोर्स लाइसेंस वाणिज्यिक उपयोग और पुनर्वितरण की अनुमति देता है।
- स्केल मूल्यांकन लागत: यदि किसी उद्यम को दर्जनों मॉडल वेरिएंट (जैसे विभिन्न फाइन-ट्यूनिंग रणनीतियों के साथ नियंत्रित प्रयोग) पर कई मूल्यांकन करने की आवश्यकता होती है, तो मशीन की लागत रैखिक रूप से बढ़ जाएगी। आधिकारिक स्क्रिप्ट समानांतर मूल्यांकन का समर्थन करती है, लेकिन बड़े पैमाने के समाधानों के लिए टीम को स्वयं एक वितरित मूल्यांकन ढांचा बनाने की आवश्यकता होती है।
- अनुपालन लागत: कोई नहीं। सी-इवल प्रश्न बैंक सार्वजनिक शैक्षणिक सामग्री और परीक्षा प्रश्नों से आता है, और डेटा सेट लाइसेंस एमआईटी है, जिसमें कोई अतिरिक्त अनुपालन जोखिम नहीं है। हालाँकि, यदि कोई उद्यम अपने स्वयं के मूल्यांकन सेट या विस्तारित प्रश्नों का उपयोग करता है, तो उसे स्वयं अधिकारों की पुष्टि करने की आवश्यकता होती है।
तुलना आयाम: स्व-निर्मित मूल्यांकन सेटों की तुलना में, सी-ईवल एक तैयार मानकीकृत प्रश्न बैंक और एकीकृत सूची प्रदान करता है, जिससे निर्माण (आमतौर पर 2-5 मानव-महीने की आवश्यकता होती है) और संरेखण लागत की बचत होती है। मूल्यांकन के लिए अंग्रेजी एमएमएलयू का उपयोग करने की तुलना में, सी-इवल चीनी परिदृश्यों पर केंद्रित है, चीनी विषय प्रणाली को कवर करता है, और चीनी ज्ञान और तर्क में मॉडल के वास्तविक स्तर को अधिक सटीक रूप से प्रतिबिंबित कर सकता है।
सी-इवल के मुख्य कार्य
- मानकीकृत प्रश्न बैंक: 52 विषयों को कवर करने वाले 13948 बहुविकल्पीय प्रश्न, प्रत्येक प्रश्न में 4 विकल्प, एकीकृत प्रारूप और स्वचालित स्कोरिंग का समर्थन है। विषयों को चार श्रेणियों में विभाजित किया गया है: मानविकी और सामाजिक विज्ञान (जैसे इतिहास, दर्शन, अर्थशास्त्र), एसटीईएम (जैसे गणित, भौतिकी, कंप्यूटर विज्ञान), चिकित्सा (जैसे नैदानिक चिकित्सा, फार्मेसी, बुनियादी चिकित्सा) और अन्य (जैसे तर्क, नैतिकता, कानून), चीन की उच्च शिक्षा और व्यावसायिक योग्यता परीक्षाओं की मुख्य ज्ञान प्रणाली को कवर करते हैं।
- एकाधिक कठिनाई स्तरीकरण: चार कठिनाई स्तर - बुनियादी (बुनियादी स्नातक ज्ञान के अनुरूप), पेशेवर (पेशेवर क्षेत्रों में गहन ज्ञान के अनुरूप), स्नातकोत्तर (स्नातक स्तर पर उन्नत अवधारणाओं के अनुरूप), व्यापक (अंतःविषय व्यापक अनुप्रयोग)। यह स्तरीकरण न केवल मॉडल की "चौड़ाई" को माप सकता है, बल्कि "गहराई" को भी अलग कर सकता है - एक मॉडल जो बुनियादी स्तर पर 90% स्कोर करता है और स्नातक स्तर पर केवल 50% स्कोर करता है, और एक मॉडल जो दोनों स्तरों पर 80% स्कोर करता है, पूरी तरह से अलग अनुसंधान और विकास पथों के अनुरूप हो सकता है (पूर्व को उच्च-क्रम तर्क को बढ़ाने की आवश्यकता है, और बाद वाले को ज्ञान ब्लाइंड स्पॉट की मरम्मत की आवश्यकता है)।
- सार्वजनिक रैंकिंग: आधिकारिक वेबसाइट लगातार प्रत्येक मॉडल के 5-शॉट और 0-शॉट स्कोर एकत्र करती है, और उन्हें समग्र औसत स्कोर के आधार पर क्रमबद्ध करती है। रैंकिंग सूची प्रत्येक अंक के लिए विषय विवरण, सबमिशन तिथि और मूल्यांकन सेटिंग्स के साथ आती है, जिससे क्षैतिज रूप से संदर्भित करना आसान हो जाता है। रैंकिंग के लिए कोई सबमिशन प्रक्रिया प्रतिबंध नहीं हैं, लेकिन सबमिटर्स को बुनियादी तुलनीयता बनाए रखने के लिए मूल्यांकन कॉन्फ़िगरेशन को इंगित करना आवश्यक है।
- ओपन सोर्स कोड और डेटा: GitHub रिपॉजिटरी एक संपूर्ण डेटा सेट (JSON प्रारूप), मूल्यांकन स्क्रिप्ट (पायथन, lm_eval फ्रेमवर्क पर आधारित), प्रॉम्प्ट टेम्पलेट और उत्तर निष्कर्षण तर्क प्रदान करता है। कस्टम मॉडल एक्सेस का समर्थन करता है, बस मानक टेक्स्ट जेनरेशन इंटरफ़ेस (इनपुट → आउटपुट → स्कोरिंग) लागू करें। समुदाय के पास पहले से ही कई व्याख्या लेख और तृतीय-पक्ष उन्नत संस्करण (जैसे बहु-भाषा विस्तार, अनुकूली मूल्यांकन कठिनाई समायोजन, आदि) हैं।
- विषय स्तरीय डायग्नोस्टिक रिपोर्ट: सी-इवल की विषय वर्गीकरण ग्रैन्युलैरिटी मॉडल उत्पन्न करने की क्षमता का समर्थन करती है
"रडार चार्ट"। उदाहरण के लिए, एक मॉडल कंप्यूटर विज्ञान और गणित में उच्च अंक प्राप्त कर सकता है, लेकिन फोरेंसिक विज्ञान या नैतिकता में काफी कम अंक प्राप्त कर सकता है। यह दानेदार निदान एकल कुल स्कोर से बेहतर लक्षित प्रशिक्षण डेटा अनुपूरण का मार्गदर्शन कर सकता है।
सी-एवल का मॉडल और संस्करण विकास
एक अकादमिक बेंचमार्क के रूप में, सी-इवल का "संस्करण पुनरावृत्ति" मुख्य रूप से तीन स्तरों में परिलक्षित होता है: पारंपरिक अर्थों में सॉफ़्टवेयर संस्करण संख्या में वृद्धि के बजाय डेटा सेट रखरखाव, रैंकिंग सूची अद्यतन और मूल्यांकन प्रोटोकॉल अनुकूलन।
1. प्रारंभिक रिलीज़ (2023-05)
- पहली बार पेपर "सी-इवल: ए मल्टी-लेवल मल्टी-डिसिप्लिन चाइनीज इवैल्यूएशन सूट फॉर लार्ज लैंग्वेज मॉडल्स" के साथ प्रकाशित हुआ।
- 52 विषयों और चार कठिनाई स्तरों में 13948 प्रश्नों की एक मुख्य संरचना स्थापित करें।
- प्रारंभिक रैंकिंग सूची सार्वजनिक कर दी गई है, जिसमें GPT-4, ChatGPT और क्लाउड जैसे मॉडलों के पहले बैच के परिणाम शामिल हैं।
- जब पेपर प्रकाशित हुआ, तो 5-शॉट सेटिंग के तहत जीपीटी-4 का कुल स्कोर लगभग 68% था, जबकि उस समय चीनी ओपन सोर्स मॉडल का उच्चतम स्कोर लगभग 45%-50% था, जो चीनी और विदेशी मॉडलों के बीच चीनी ज्ञान में महत्वपूर्ण अंतर को दर्शाता है।
2. डेटा सेट में सुधार और प्रोटोकॉल फाइन-ट्यूनिंग (2023-06 से 2024-06)
- सामुदायिक प्रतिक्रिया से प्रेरित होकर, हम धीरे-धीरे कुछ प्रश्नों के गलत उत्तरों और विषय वर्गीकरण में विचलन को ठीक कर देंगे (GitHub समस्या का पता लगाया जा सकता है)।
- 5-शॉट को डिफ़ॉल्ट मूल्यांकन प्रोटोकॉल के रूप में स्पष्ट रूप से अनुशंसित किया गया है और परिणामों की तुलनीयता में सुधार के लिए प्रॉम्प्ट टेम्पलेट को मानकीकृत किया गया है।
- विभिन्न मॉडल श्रृंखला (एमओई आर्किटेक्चर, सुदृढीकरण सीखने के फाइन-ट्यूनिंग मॉडल, आदि) के लिए संगतता परीक्षण जोड़ा गया।
- रैंकिंग में शामिल मॉडलों की संख्या शुरुआती दर्जन से बढ़ाकर दर्जनों कर दी गई है, जिसमें मुख्यधारा के खुले स्रोत और बंद स्रोत मॉडल शामिल हैं।
3. निरंतर प्रभाव विस्तार (2024-06 से वर्तमान तक)
- सी-इवल स्कोर चीनी बड़े मॉडल तकनीकी रिपोर्ट के लिए "मानक" संकेतक बन गया है।
- बाद के व्युत्पन्न कार्य (जैसे सी-इवल हार्ड, सी-इवल ज़ीरो) सी-इवल के आधार पर प्रतिकूल नमूना या शून्य नमूना मूल्यांकन की कठिनाई को बढ़ाने का प्रयास करते हैं।
- मूल पेपर चीनी एनएलपी मूल्यांकन के क्षेत्र में एक उच्च उद्धृत बेंचमार्क पेपर बन गया है।
- डेटा संदूषण की चुनौती का सामना करना: चूंकि मूल डेटा सेट का व्यापक रूप से खुलासा किया गया है, बाद के प्रशिक्षण मॉडल को प्रशिक्षण डेटा रिसाव के माध्यम से प्रश्नों के लिए निष्क्रिय रूप से उजागर किया जा सकता है, जिसके परिणामस्वरूप गलत तरीके से उच्च अंक प्राप्त हो सकते हैं। समुदाय पहले से ही विकल्प के रूप में अदृश्य प्रश्नों के साथ एक गतिशील प्रश्न बैंक बनाने पर चर्चा कर रहा है।
सी-इवल के तकनीकी फायदे
- विषय और कठिनाई का द्वि-आयामी डिज़ाइन: सी-इवल का मुख्य नवाचार एक ही समय में "विषय क्षेत्र" और "कठिनाई स्तर" के दो ऑर्थोगोनल आयामों से प्रश्नों को व्यवस्थित करना है। यह मूल्यांकन आउटपुट को न केवल कुल स्कोर बनाता है, बल्कि 52×4 क्षमता मैट्रिक्स बनाता है, जिसमें प्रत्येक ग्रिड एक विशिष्ट विषय में विशिष्ट कठिनाई स्तर पर मॉडल के प्रदर्शन का प्रतिनिधित्व करता है। चीन की उच्च शिक्षा में "व्यापक क्षमता और मोटी नींव" के संदर्भ में, यह ग्रैन्युलैरिटी एमएमएलयू के एकल विषय वर्गीकरण की तुलना में मॉडल की ज्ञान संरचना की कमियों को बेहतर ढंग से पकड़ने में सक्षम है।
- चीनी प्रतिलिपि प्रस्तुत करने योग्य मूल्यांकन प्रोटोकॉल: सी-ईवल स्पष्ट रूप से 5-शॉट और 0-शॉट के लिए शीघ्र प्रारूप, उत्तर निष्कर्षण नियम और स्कोरिंग मानकों को निर्धारित करता है। कुछ बेंचमार्क की तुलना में जो केवल डेटा सेट प्रदान करते हैं लेकिन मूल्यांकन प्रोटोकॉल पर सख्ती से सहमत नहीं होते हैं, सी-इवल का सामान्यीकरण का उच्च स्तर यह सुनिश्चित करता है कि विभिन्न टीमों और विभिन्न समय बिंदुओं के परिणाम मूल रूप से क्षैतिज रूप से तुलनीय हैं। इसके व्यापक रूप से अपनाने का यह प्रमुख इंजीनियरिंग कारण है।
- परीक्षा-संचालित प्रश्न डिज़ाइन: प्रश्न वास्तविक चीनी परीक्षाओं (विश्वविद्यालय फाइनल, स्नातकोत्तर प्रवेश परीक्षा, व्यावसायिक योग्यता परीक्षा) से लिए गए हैं, शोधकर्ताओं द्वारा स्व-संकलित नहीं। इसका मतलब यह है कि प्रश्न स्वाभाविक रूप से हैं: (1) भाषा वास्तविक और प्राकृतिक है, "डेटासेट भाषा" की कृत्रिम भावना के बिना; (2) उत्तरों में स्पष्ट आधिकारिक मानक हैं और कोई व्यक्तिपरक अस्पष्टता नहीं है; (3) वे चीनी शैक्षिक ज्ञान प्रणाली के साथ जुड़े हुए हैं और चीनी संदर्भ में मॉडल के ज्ञान स्तर को सीधे प्रतिबिंबित कर सकते हैं। इससे सीमाएं भी आती हैं - प्रश्नों की समयबद्धता परीक्षा के समय तक सीमित होती है, और उभरते क्षेत्रों (जैसे एआई नैतिकता, क्वांटम कंप्यूटिंग और अन्य विषय जो अभी तक मानकीकृत परीक्षाओं में शामिल नहीं हुए हैं) का कवरेज कम है।
- मूल्यांकन - निदान - बंद: सी-इवल का तकनीकी मूल्य सिर्फ "स्कोर से बाहर" नहीं है, बल्कि विषय ग्रैन्युलैरिटी पर इसकी नैदानिक क्षमताओं में निहित है। सी-इवल परिणाम प्राप्त करने के बाद, एक मॉडल टीम तुरंत कमजोर विषयों का पता लगा सकती है और फिर लक्षित तरीके से उस विषय में पूर्व-प्रशिक्षण डेटा या फाइन-ट्यूनिंग डेटा को पूरक कर सकती है। मूल्यांकन से सुधार तक की यह प्रक्रिया मूल्यांकन के अगले दौर तक,
सी-इवल को फिनिश लाइन के बजाय मॉडल क्षमता पुनरावृत्ति के लिए एक डैशबोर्ड बनाएं।
सी-इवल का उपयोग कैसे करें
प्रवेश तुलना
| उद्देश्य | प्रवेश | विवरण |
|---|---|---|
| विवरण और रैंकिंग देखें | https://cevalbenchmark.com/ | आधिकारिक वेबसाइट, स्थिति, रैंकिंग, विषय वर्गीकरण ब्राउज़ करें |
| डेटा सेट और कोड डाउनलोड करें | https://github.com/hkust-nlp/ceval | GitHub रिपॉजिटरी, संपूर्ण डेटा सेट और मूल्यांकन स्क्रिप्ट |
| पेपर पढ़ें | https://arxiv.org/abs/2305.10957 | arXiv, डिज़ाइन सिद्धांतों और आधारभूत परिणामों को समझें |
| सामुदायिक चर्चा | गिटहब मुद्दे, झिहू | प्रतिक्रिया मुद्दे, चर्चा और मूल्यांकन सेटिंग्स |
मानक मूल्यांकन चरण
- सीमा तैयारी: रिपॉजिटरी को क्लोन करें और पायथन निर्भरताएं (PyTorch, ट्रांसफार्मर, डेटासेट, आदि) स्थापित करें।
- डेटा लोडिंग: वेयरहाउस द्वारा प्रदान की गई
ceval/डेटा निर्देशिका का उपयोग करें, या हगिंग फेस डेटासेट के माध्यम सेceval/cevalलोड करें। - मूल्यांकन कॉन्फ़िगर करें: मूल्यांकन पैरामीटर सेट करें - मॉडल का नाम या पथ, मूल्यांकन सेटिंग्स (5-शॉट या 0-शॉट), अधिकतम पीढ़ी की लंबाई, आदि।
- मूल्यांकन चलाएँ: मूल्यांकन स्क्रिप्ट निष्पादित करें, और स्क्रिप्ट स्वचालित रूप से मॉडल को लोड करेगी → तर्क करेगी और उत्तर देगी → उत्तर निकालेगी → मानक उत्तर के साथ तुलना करेगी → प्रत्येक विषय की सटीकता और समग्र सटीकता की गणना करेगी।
- परिणाम विश्लेषण: आउटपुट परिणाम (प्रत्येक विषय की सटीकता दर और समग्र औसत) की जांच करें, और अंतर का पता लगाने के लिए रैंकिंग के साथ तुलना करें।
मुख्य नोट्स
- प्रॉम्प्ट संगति: प्रॉम्प्ट टेम्प्लेट में छोटे बदलाव (जैसे कि "उत्तर है" बनाम "उत्तर:") के कारण स्कोर में 1-3 प्रतिशत अंकों का उतार-चढ़ाव हो सकता है। सुनिश्चित करें कि उपयोग किया गया संकेत आधिकारिक डिफ़ॉल्ट टेम्पलेट के अनुरूप है, अन्यथा परिणाम तुलनीय नहीं होंगे।
- डिकोडिंग रणनीति: लालची डिकोडिंग (
तापमान=0) या सुसंगत सेटिंग्स का उपयोग करने की अनुशंसा की जाती है। बीम खोज और नमूनाकरण जैसी रणनीतियाँ अस्थिर आउटपुट का कारण बनेंगी और प्रतिलिपि प्रस्तुत करने योग्यता को प्रभावित करेंगी। - विषय भार: रैंकिंग में समग्र औसत स्कोर विषय भारित औसत (सरल अंकगणितीय औसत के बजाय) को अपनाता है। विशिष्ट भार विषय प्रश्नों की संख्या के आधार पर भिन्न होता है। रैंकिंग की तुलना करते समय, आपको यह पुष्टि करनी चाहिए कि भार देने के तरीके सुसंगत हैं।
सी-इवल के लिए उत्पाद मूल्य निर्धारण
| उपयोगकर्ता स्तर | लागत मद | विवरण |
|---|---|---|
| सी-साइड/व्यक्तिगत शोधकर्ता | मुफ़्त | डेटा सेट और कोड पूरी तरह से खुला स्रोत, एमआईटी लाइसेंस, शून्य लाइसेंस शुल्क है |
| शैक्षणिक/मॉडल टीम | मुफ़्त | कोई सदस्यता शुल्क या भुगतान-प्रति-दृश्य नहीं, असीमित समीक्षाएँ |
| उद्यम | मुफ़्त (उपकरण परत) | उपकरण परत के लिए शून्य लागत; बड़े पैमाने पर मूल्यांकन के लिए स्व-तैयार कंप्यूटिंग क्लस्टर की आवश्यकता होती है |
| व्यावसायिक उपयोग | मुफ़्त | एमआईटी लाइसेंस अतिरिक्त अनुमति के बिना व्यावसायिक उपयोग और पुनर्वितरण की अनुमति देता है |
शामिल लागत: मूल्यांकन की मुख्य लागत उपकरण ही नहीं है, बल्कि मॉडल अनुमान कंप्यूटिंग शक्ति और इंजीनियरिंग एकीकरण है। संपूर्ण सी-इवल मूल्यांकन (13948 प्रश्न, 5-शॉट) की कंप्यूटिंग बिजली की खपत मॉडल के आकार पर निर्भर करती है - 7बी मॉडल के लिए लगभग 0.5-1 जीपीयू घंटे (ए100) की आवश्यकता होती है, 70बी मॉडल के लिए लगभग 4-8 जीपीयू घंटे की आवश्यकता होती है, और 700बी+ मॉडल के लिए 24 घंटे से अधिक की आवश्यकता हो सकती है। यदि बार-बार मूल्यांकन की आवश्यकता होती है (जैसे कि प्रत्येक प्रशिक्षण चेकपॉइंट के बाद), तो कुल कंप्यूटिंग पावर लागत जल्दी से जमा हो जाएगी।
सी-इवल के अनुप्रयोग परिदृश्य
- मॉडल विकास स्व-परीक्षण: एक बड़े चीनी मॉडल को प्रशिक्षण या फाइन-ट्यूनिंग करते समय, यह सत्यापित करने के लिए प्रत्येक प्रमुख जांच बिंदु के बाद सी-इवल मूल्यांकन करें कि ज्ञान और तर्क क्षमताओं की पुनरावृत्त दिशा सही है या नहीं। स्वीकृति बिंदु: पहले और बाद के दो मूल्यांकनों के बीच विषय-स्तरीय परिवर्तनों की तुलना करें - यदि कुल स्कोर बढ़ता है लेकिन एक निश्चित विषय में काफी गिरावट आती है, तो इसका मतलब विनाशकारी भूल हो सकता है, और प्रशिक्षण डेटा अनुपात की जांच करने की आवश्यकता है।
- बाहरी क्षमता प्रकटीकरण: जब मॉडल जारी या अपग्रेड किया जाता है, तो सी-इवल परिणाम तकनीकी रिपोर्ट या सार्वजनिक पृष्ठ में चीनी दक्षता के लिए तीसरे पक्ष के संदर्भ के रूप में सूचीबद्ध किए जाएंगे। स्वीकृति के लिए मुख्य बिंदु: रैंकिंग के साथ संरेखण सुनिश्चित करने के लिए मूल्यांकन सेटिंग्स (5-शॉट/0-शॉट, प्रॉम्प्ट संस्करण, स्कोरिंग विधि) को स्पष्ट रूप से चिह्नित करें; यदि गैर-मानक सेटिंग्स का उपयोग किया जाता है, तो क्षैतिज तुलना के लिए मानक सेटिंग्स के तहत स्कोर भी दिए जाने चाहिए।
- विषय निदान और प्रशिक्षण मार्गदर्शन: बाद के डेटा संग्रह और प्रशिक्षण रणनीतियों का मार्गदर्शन करने के लिए सी-इवल के विषय ग्रैन्युलैरिटी परिणामों के माध्यम से मॉडल की क्षमता कमियों का पता लगाएं। उदाहरण के लिए, यदि मॉडल "कानून" और "चिकित्सा" के विषयों में खराब प्रदर्शन करना जारी रखता है, तो आप पूर्व-प्रशिक्षण चरण में संबंधित विषयों के चीनी कोष को जोड़ने, या एसएफटी चरण में विषयों के प्रश्न-उत्तर जोड़े को पूरक करने पर विचार कर सकते हैं। स्वीकृति कुंजी: नैदानिक निष्कर्ष को प्रशिक्षण डेटा वितरण के साथ क्रॉस-सत्यापन की आवश्यकता है - किसी निश्चित विषय में कम अंक विषय में अपर्याप्त ज्ञान प्रशिक्षण के कारण हो सकता है, या यह सी-इवल प्रश्न अभिव्यक्ति पद्धति और प्रशिक्षण डेटा वितरण के बीच असंगतता के कारण होने वाली सामान्यीकरण समस्या हो सकती है।
- अकादमिक अनुसंधान और बेंचमार्क निर्माण: चीनी एनएलपी मूल्यांकन के लिए एक संदर्भ आधार रेखा के रूप में, नए प्रस्तावित मूल्यांकन तरीकों या डेटा सेटों की तुलना करने के लिए, या क्रॉस-मॉडल क्षमता तुलना के लिए एक मानकीकृत मंच के रूप में उपयोग किया जाता है। स्वीकृति बिंदु: मॉडल की वास्तविक क्षमताओं के साथ सहसंबंध के लिए नई प्रस्तावित मूल्यांकन विधियों को सी-इवल पर सत्यापित किया जाना चाहिए।
सी-इवल के लागू समूह
- बड़े मॉडल शोधकर्ता और एल्गोरिथम इंजीनियर: मॉडल पुनरावृत्ति प्रभावों को मापने और विषय ग्रैन्युलर निदान के माध्यम से प्रशिक्षण रणनीतियों का मार्गदर्शन करने के लिए मानकीकृत चीनी मूल्यांकन की आवश्यकता है। आवश्यकताएँ: बुनियादी मॉडल तर्क और प्रासंगिक निर्माण क्षमताएं हों, और प्रॉम्प्ट प्रोजेक्ट और मूल्यांकन प्रोटोकॉल को समझें।
- मॉडल मूल्यांकन इंजीनियर: टीम के लिए एक स्वचालित मूल्यांकन पाइपलाइन बनाने, सीआई/सीडी प्रक्रिया में सी-इवल को एकीकृत करने और मॉडल संस्करणों की क्षमता में बदलाव को लगातार ट्रैक करने के लिए जिम्मेदार। आवश्यकताएँ: पायथन और मुख्यधारा के बड़े मॉडल अनुमान ढांचे (हगिंग फेस ट्रांसफॉर्मर, वीएलएलएम, आदि) से परिचित, और वितरित मूल्यांकन परिदृश्यों को संभालने में सक्षम।
- अकादमिक शोधकर्ता: नए तरीकों या नए डेटा सेटों की तुलना करने के लिए आधार रेखा के रूप में सी-इवल का उपयोग करते हुए, चीनी एनएलपी मूल्यांकन, बेंचमार्क अनुसंधान और क्रॉस-मॉडल विश्लेषण में लगे हुए हैं। पूर्वापेक्षा: मूल्यांकन पद्धति को समझें और प्रयोगात्मक परिणामों पर डेटा संदूषण मुद्दों के प्रभाव पर ध्यान दें।
- तकनीकी चयन मूल्यांकनकर्ता (सीटीओ/तकनीकी वीपी): आधार मॉडल खरीदने या पेश करने से पहले चीनी दक्षता के मात्रात्मक आयाम के रूप में मूल्यांकन मैट्रिक्स में सी-इवल स्कोर शामिल करें। आवश्यकताएँ: एकल बेंचमार्क की सीमाओं को पहचानें और परिदृश्य-आधारित आकलन (जैसे उत्पाद कार्यात्मक परीक्षण, छोटे पैमाने पर ग्रेस्केल सत्यापन) के आधार पर व्यापक निर्णय लें।
- अनुपयुक्त सीमा: (1) सामान्य उपयोगकर्ता जिन्हें सीधे "उपलब्ध उत्पाद सुविधाएँ" प्राप्त करने की आवश्यकता होती है - सी-इवल एक इंटरैक्टिव एप्लिकेशन के बजाय एक मूल्यांकन बेंचमार्क है और इसका सीधे उपयोग नहीं किया जा सकता है; (2) जिन टीमों को संवाद गुणवत्ता, सुरक्षा और विचार निर्माण जैसे खुले कार्यों पर मॉडल के प्रदर्शन का मूल्यांकन करने की आवश्यकता है - सी-इवल बहुविकल्पीय प्रश्न प्रारूप जेनरेटर क्षमता के माप को कवर नहीं कर सकता है; (3) टीमें डेटा संदूषण के बारे में चिंतित हैं - स्थैतिक प्रश्न बैंक को पूर्व-प्रशिक्षण डेटा द्वारा कवर किया जा सकता है, क्रॉस-सत्यापन के लिए अन्य अदृश्य प्रश्न बैंकों (जैसे आंतरिक स्व-निर्मित मूल्यांकन सेट) को संयोजित करने की सिफारिश की जाती है; (4) जिन टीमों को गैर-चीनी परिदृश्यों में मॉडल का मूल्यांकन करने की आवश्यकता है - सी-इवल पूरी तरह से चीनी और चीनी विषय प्रणालियों पर उन्मुख है, और अंग्रेजी मॉडल मूल्यांकन को अनुकूलित किया जाना चाहिए
एमएमएलयू या समकक्ष अंग्रेजी बेंचमार्क का उपयोग करके प्रारंभ करें।
सारांश और आउटलुक
52 विषयों और चार कठिनाई स्तरों में 13,948 प्रश्नों के साथ, सी-इवल सबसे व्यवस्थित चीनी बड़े पैमाने के मॉडल मूल्यांकन बेंचमार्क में से एक है। इसकी मुख्य प्रतिस्पर्धात्मकता विषय और कठिनाई के दोहरे आयामों, प्रतिलिपि प्रस्तुत करने योग्य मूल्यांकन प्रोटोकॉल और लगातार अद्यतन रैंकिंग के परिष्कृत डिजाइन में निहित है - ये तीनों मिलकर सी-इवल को एक डेटा सेट से एक मानकीकृत मूल्यांकन पारिस्थितिकी तंत्र तक बढ़ाते हैं। चीनी बेसिक मॉडल टीम के लिए, सी-इवल एक "प्रवेश परीक्षा" और "नैदानिक उपकरण" दोनों है: कुल स्कोर दक्षता के स्तर को मापता है, और विषय-स्तर के स्कोर कमियों की दिशा को प्रकट करते हैं।
वर्तमान सीमाएँ: (1) स्थैतिक प्रश्न बैंक को डेटा संदूषण का खतरा है। जैसा कि प्रश्न बैंक का व्यापक रूप से खुलासा किया गया है, प्रशिक्षण के बाद का मॉडल प्रशिक्षण डेटा रिसाव के माध्यम से निष्क्रिय रूप से प्रश्न प्राप्त कर सकता है, जिसके परिणामस्वरूप गलत तरीके से उच्च अंक प्राप्त होंगे और बेंचमार्क की विश्वसनीयता कम हो जाएगी; (2) बहुविकल्पीय प्रश्न प्रारूप जेनरेटर कार्यों (जैसे अनुवाद गुणवत्ता, कोड फ़ंक्शन शुद्धता, रचनात्मक लेखन) की मूल्यांकन आवश्यकताओं को कवर नहीं कर सकता है; (3) विषय कवरेज पारंपरिक ज्ञान प्रणालियों के प्रति पक्षपाती है, जो एआई के लिए अच्छा नहीं है। नैतिकता, क्वांटम कंप्यूटिंग और उभरते इंजीनियरिंग क्षेत्रों जैसे दूरंदेशी विषयों को अपर्याप्त रूप से कवर किया गया है; (4) रैंकिंग प्रस्तुत करना और समीक्षा एक स्वायत्त तंत्र पर निर्भर करती है, और विभिन्न मॉडलों के बीच स्कोर की तुलना मूल्यांकन सेटिंग्स में अंतर से प्रभावित होती है।
भविष्य की दिशाएँ: डेटा प्रदूषण की समस्या को कम करने के लिए समुदाय पहले से ही सी-इवल के गतिशील प्रश्न बैंक संस्करण (जैसे गैर-सार्वजनिक प्रश्न पूल, अनुकूली प्रश्न सेटिंग) की खोज कर रहा है; साथ ही, मल्टी-मोडल संस्करण और चीनी-अंग्रेजी द्विभाषी विस्तार भी प्राकृतिक विस्तार दिशाएँ हैं। सी-इवल की बेंचमार्क स्थिति को बनाए रखने के लिए निरंतर सामुदायिक रखरखाव और विषय अपडेट महत्वपूर्ण हैं।
खरीद/गोद लेने का जोखिम मूल्यांकन: उन टीमों के लिए जो बुनियादी मॉडल या स्व-विकसित बड़े मॉडल का मूल्यांकन कर रहे हैं, सी-इवल एक कम लागत वाला, उच्च-सिग्नल-टू-शोर अनुपात प्रवेश-स्तर मूल्यांकन उपकरण है - शून्य लाइसेंस शुल्क, खुला स्रोत और प्रतिलिपि प्रस्तुत करने योग्य, और विषय-ग्रैनुलर डायग्नोस्टिक फ़ंक्शन सीधे प्रशिक्षण का मार्गदर्शन कर सकते हैं। लेकिन इसका उपयोग एकमात्र मूल्यांकन मानदंड के रूप में नहीं किया जाना चाहिए। एकल बेंचमार्क विचलन के कारण होने वाले चयन जोखिम को कम करने के लिए मॉडल चयन या आर एंड डी पुनरावृत्तियों के दौरान "सी-इवल + कई परिदृश्य-आधारित आंतरिक मूल्यांकन + छोटे पैमाने पर मैनुअल मूल्यांकन" के बहु-आयामी मूल्यांकन संयोजन का उपयोग करने की अनुशंसा की जाती है। जब टीमें क्षैतिज तुलना के लिए सी-इवल स्कोर का उपयोग करती हैं, तो उन्हें यह पुष्टि करनी होगी कि सेटिंग्स में अंतर के कारण भ्रामक निष्कर्षों से बचने के लिए सभी स्कोर समान मूल्यांकन सेटिंग्स (5-शॉट/0-शॉट, समान प्रॉम्प्ट टेम्पलेट) के तहत प्राप्त किए गए हैं।
संबंधित टूल: <एक्सलिंक टाइप='टूल' स्लग='हगिंग-फेस'>, <एक्सलिंक टाइप='टूल' स्लग='रेप्लिकेट'>
संस्करण जानकारी
- सी-एवल मूल्यांकन किट (2023) :सार्वजनिक रूप से जारी चीनी बड़े मॉडल बहु-विषयक मूल्यांकन किट में 52 विषयों और चार कठिनाई स्तरों में 13,948 बहुविकल्पीय प्रश्न शामिल हैं, और मॉडल परिणामों को लगातार रिकॉर्ड करने के लिए ऑनलाइन रैंकिंग प्रदान करता है। आधिकारिक पृष्ठ पर वर्ष 2023 अंकित है, और सटीक तारीख कागज़ और गोदाम के अधीन है।
- सी-इवल पेपर और डेटा सेट पहली बार जारी किया गया :सी-इवल पहली बार पेपर और डेटा सेट के साथ जारी किया जाएगा, एक प्रश्न बैंक, विषय प्रभाग और मूल्यांकन प्रोटोकॉल स्थापित किया जाएगा, और रैंकिंग ऑनलाइन लॉन्च की जाएगी। बाद के छोटे संस्करण संख्याओं की कोई आधिकारिक आधिकारिक सूची नहीं है, और पुनरावृत्ति मुख्य रूप से रैंकिंग के निरंतर अद्यतन में परिलक्षित होती है।
उपयोगकर्ता समीक्षाएं