सीएमएमएलयू मुफ्त

-

सीएमएमएलयू एक व्यापक चीनी बड़े मॉडल मूल्यांकन बेंचमार्क है, जो मानविकी, सामाजिक विज्ञान, विज्ञान और इंजीनियरिंग और चीनी-विशिष्ट ज्ञान जैसे कई क्षेत्रों में बहुविकल्पीय प्रश्नों को कवर करता है। इसका उपयोग चीनी संदर्भ में बड़े भाषा मॉडल के ज्ञान भंडार और तर्क क्षमताओं को मापने के लिए किया जाता है। डेटा सेट और मूल्यांकन कोड GitHub पर खुला स्रोत हैं।

सीएमएमएलयू उत्पाद इंटरफेस

सीएमएमएलयू

सीएमएमएलयू के मुख्य पैरामीटर और आँकड़े

सीएमएमएलयू (चाइनीज मैसिव मल्टीटास्क लैंग्वेज अंडरस्टैंडिंग) चीनी बड़े भाषा मॉडल के लिए मल्टी-डोमेन ज्ञान मूल्यांकन बेंचमार्क का एक सेट है, जिसे 2023 में एक अकादमिक शोध टीम द्वारा प्रकाशित किया जाएगा। यह अंतिम उपयोगकर्ताओं के लिए चैट या पीढ़ी के कार्य प्रदान नहीं करता है, लेकिन चीनी संदर्भ में मॉडल के तथ्यात्मक ज्ञान भंडार और तर्क सटीकता को मापने के लिए 67 विषयों को कवर करने वाले एक मानकीकृत चीनी ज्ञान प्रश्न बैंक के साथ शोधकर्ताओं और मॉडल विकास टीमों को प्रदान करता है।

पैरामीटर आइटम मूल्य
बेंचमार्क का पूरा नाम सीएमएमएलयू (चीनी मैसिव मल्टीटास्क लैंग्वेज अंडरस्टैंडिंग)
प्रश्नों की कुल संख्या ~11,500 बहुविकल्पीय प्रश्न
विषय कवरेज 67 विषयों को चार श्रेणियों में विभाजित किया गया है: मानविकी, सामाजिक विज्ञान, विज्ञान और इंजीनियरिंग, और चीनी अद्वितीय ज्ञान
विकल्प संरचना चार (ए/बी/सी/डी) में से एक चुनें
प्रश्न प्रकार ज्ञान आधारित बहुविकल्पीय प्रश्न (तथ्य स्मृति + तर्क और निर्णय)
आउटपुट संकेतक प्रत्येक विषय की सटीकता (सटीकता) और समग्र औसत सटीकता
लाइसेंस समझौता ओपन सोर्स (गिटहब पब्लिक रिपॉजिटरी)
पहला पेपर arXiv 2023
मूल्यांकन विधि स्थानीय अनुमान + स्क्रिप्ट स्कोरिंग, कुछ-शॉट और शून्य-शॉट सेटिंग्स का समर्थन
निर्भरताएँ PyTorch / ट्रांसफॉर्मर + मूल्यांकन स्क्रिप्ट

पैरामीटर अर्थ की व्याख्या: 67 विषयों की डिवीजन ग्रैन्युलैरिटी एमएमएलयू (57 विषयों) और सी-इवल (52 विषयों) की तुलना में बहुत बेहतर है, जिसका अर्थ है कि सीएमएमएलयू विषय आयाम में अधिक सूक्ष्म क्षमता नैदानिक ​​​​क्षमताएं प्रदान करता है। हालाँकि लगभग 11,500 प्रश्नों की कुल संख्या दसियों हज़ार प्रश्नों जितनी बड़ी नहीं है, प्रति विषय लगभग 170 प्रश्नों का औसत घनत्व सांख्यिकीय रूप से महत्वपूर्ण विषय-स्तरीय सटीकता तुलनाओं का समर्थन करने के लिए पर्याप्त है। चार-विकल्प प्रारूप यादृच्छिक अनुमान आधार रेखा (25%) को कम कर देता है, जिससे 30% -40% सटीकता अंतराल में अभी भी भेदभावपूर्ण मूल्य होता है, जो कठिन विषयों में मॉडल की कमियों का पता लगाने के लिए उपयुक्त है।

समान बेंचमार्क के साथ पैमाने की तुलना:

बेंचमार्क विषयों की संख्या प्रश्नों की संख्या भाषा चीन-विशिष्ट ज्ञान
एमएमएलयू 57 ~14,000 अंग्रेजी कोई नहीं
सी-एवल 52 ~13,900 चीनी आंशिक
सीएमएमएलयू 67 ~11,500 चीनी मुख्य कवरेज
एजीइवल 20+ ~8,000 चीनी/अंग्रेजी आंशिक

प्रकार निर्धारण: सीएमएमएलयू "बेसिक लार्ज मॉडल/एपीआई इंफ्रास्ट्रक्चर" की श्रेणी के तहत मॉडल मूल्यांकन बुनियादी ढांचे से संबंधित है। मुख्य वितरण योग्य मानकीकृत डेटा सेट + मूल्यांकन प्रोटोकॉल + बेसलाइन स्कोर का एक सेट है। इसमें लगातार चलने वाली एपीआई सेवाएं शामिल नहीं हैं, लेकिन यह मॉडल विकास श्रृंखला में एक अनिवार्य गुणवत्ता गेट नियंत्रण है।

सीएमएमएलयू के उपयोगकर्ता और बाजार की पहचान

  • अकादमिक उद्धरण और प्रभाव: सीएमएमएलयू पेपर को arXiv पर सार्वजनिक किए जाने के बाद, इसे कई चीनी बड़ी मॉडल टीमों द्वारा तकनीकी रिपोर्टों और कागजात में क्षमताओं के सबूत के रूप में उद्धृत किया गया था, जिसमें क्वेन, यी, बाइचुआन, इंटर्नएलएम और मॉडल की अन्य श्रृंखलाओं की रिलीज शामिल थी, जो सभी ने सीएमएमएलयू स्कोर की सूचना दी थी। 2026 के मध्य तक, इसके GitHub रिपॉजिटरी को हजारों सितारे प्राप्त हुए हैं, और सामुदायिक कांटा और मुद्दे पर चर्चा सक्रिय है।

  • औद्योगिक अंगीकरण मॉडल: बड़े घरेलू मॉडल निर्माता आमतौर पर चीनी ज्ञान क्षमता के लिए मानक मूल्यांकन संयोजन के रूप में सीएमएमएलयू और सी-इवल का उपयोग करते हैं। मॉडल क्षमता तुलना तालिका में, सीएमएमएलयू की समग्र सटीकता और प्रत्येक विषय की सटीकता सबसे अधिक उद्धृत चीनी बेंचमार्क संकेतकों में से एक है। कुछ टीमें प्रशिक्षण के दौरान क्षमता में गिरावट का पता लगाने के लिए सीएमएमएलयू को दैनिक प्रतिगमन परीक्षण पाइपलाइनों में शामिल करती हैं।

  • सी-इवल के साथ स्थितिगत अंतर: सी-इवल चीन की कॉलेज प्रवेश परीक्षा/सामान्य विषयों में स्नातकोत्तर प्रवेश परीक्षा के कठिन प्रश्नों पर ध्यान केंद्रित करता है, जबकि सीएमएमएलयू चीन के अद्वितीय ज्ञान (जैसे चीनी इतिहास, भूगोल, कानून, साहित्य) के कवरेज पर अधिक ध्यान केंद्रित करता है। समग्र विषय वितरण में दोनों के बीच लगभग 60% ओवरलैप है, लेकिन चीन-विशिष्ट ज्ञान श्रेणियों में सीएमएमएलयू की गहराई काफी अधिक है। कई टीमें चीनी दक्षता की अधिक संपूर्ण तस्वीर प्राप्त करने के लिए दोनों बेंचमार्क पर एक साथ स्कोर की रिपोर्ट करती हैं।

  • सीमा नोट: बहुविकल्पीय प्रश्न बेंचमार्क में डेटा संदूषण का अंतर्निहित जोखिम होता है - मॉडल ने पूर्व-प्रशिक्षण चरण के दौरान प्रश्न का मूल पाठ देखा होगा, जिसके परिणामस्वरूप गलत तरीके से उच्च अंक प्राप्त होंगे। वर्तमान में, सीएमएमएलयू टीम ने एक स्वतंत्र होल्ड-आउट गोपनीयता सेट या गतिशील प्रश्न निर्माण तंत्र स्थापित नहीं किया है, इसलिए इसके स्कोर का हवाला देते समय, इसे मॉडल के समान बैच के एमएमएलयू/सी-इवल प्रवृत्ति क्रॉस-सत्यापन के साथ जोड़ा जाना चाहिए। इसके अलावा, उच्च अंक केवल तथ्यात्मक ज्ञान की मात्रा को दर्शाते हैं और मॉडल की तर्क की गहराई, बातचीत की गुणवत्ता, या निर्देश का पालन करने की क्षमता का प्रतिनिधित्व नहीं करते हैं।

सीएमएमएलयू की लागत लाभ

सी पक्ष/व्यक्तिगत शोधकर्ता:

  • शून्य प्रत्यक्ष लागत: डेटा सेट और मूल्यांकन स्क्रिप्ट पूरी तरह से खुला स्रोत है, और GitHub रिपॉजिटरी को सीधे क्लोन किया जा सकता है और बिना किसी लाइसेंस शुल्क या सदस्यता शुल्क का भुगतान किए उपयोग किया जा सकता है।
  • चलने की लागत: मूल्यांकन के लिए मॉडल को लोड करना और अपने हार्डवेयर या क्लाउड इंस्टेंस पर अनुमान लगाना आवश्यक है। उदाहरण के तौर पर 7बी पैरामीटर स्केल मॉडल को लेते हुए, एक ए100 पर सभी 67 विषयों के लिए अनुमान पूरा करने में लगभग 30-60 मिनट लगते हैं, और संबंधित क्लाउड कंप्यूटिंग लागत लगभग 1-3 डॉलर (ऑन-डिमांड मूल्य निर्धारण के आधार पर अनुमानित) है। 70बी+ स्केल मॉडल के लिए आवश्यक कंप्यूटिंग शक्ति रैखिक रूप से बढ़ती है, और एकल पूर्ण-स्तरीय मूल्यांकन की अनुमानित लागत $10-30 की सीमा में होती है।

एपीआई डेवलपर/मॉडल सेवा प्रदाता:

  • स्व-निर्मित वैकल्पिक लागत तुलना: यदि आप 67 विषयों और प्रत्येक विषय में लगभग 170 प्रश्नों को शामिल करते हुए एक चीनी मूल्यांकन सेट बनाते हैं, तो आपको प्रश्नों को विकसित करने, समीक्षा करने, परीक्षण करने और कैलिब्रेट करने के लिए विषय विशेषज्ञों को नियुक्त करने की आवश्यकता है। अनुमानित श्रम लागत सैकड़ों हजारों युआन है। सीएमएमएलयू सीधे शून्य लाइसेंस शुल्क पर मान्य प्रश्न बैंक और बेसलाइन प्रदान करके इस लागत को शून्य कर देता है।
  • एकीकरण लागत: मूल्यांकन स्क्रिप्ट हगिंग फेस ट्रांसफार्मर और डेटासेट लाइब्रेरी पर आधारित है, और अतिरिक्त अनुकूलन की आवश्यकता के बिना स्वाभाविक रूप से मुख्यधारा मॉडल ढांचे के साथ संगत है। सीएमएमएलयू मूल्यांकन को एक मॉडल प्रशिक्षण पाइपलाइन में एकीकृत करने की इंजीनियरिंग लागत आम तौर पर 1-2 मानव-दिनों के भीतर होती है।

व्यवसाय/संस्थान:

  • निजी परिनियोजन: डेटा सेट का उपयोग पूरी तरह से ऑफ़लाइन किया जा सकता है और डेटा सुरक्षा और अनुपालन आवश्यकताओं को पूरा करने के लिए किसी बाहरी एपीआई पर निर्भर नहीं होता है। मूल्यांकन के परिणाम स्थानीय क्षेत्र को नहीं छोड़ते हैं और वित्त, चिकित्सा और सरकारी मामलों जैसे उद्योगों के लिए उपयुक्त हैं जिनके डेटा निर्यात पर सख्त प्रतिबंध हैं।
  • छिपी हुई लागत - मूल्यांकन प्रोटोकॉल स्थिरता: शीघ्र टेम्पलेट कुछ-शॉट नमूना चयन और उत्तर निष्कर्षण तर्क में विभिन्न टीमों के बीच छोटे अंतर से स्कोर में 3-5 प्रतिशत अंकों का विचलन हो सकता है। क्षैतिज रूप से तुलनीय परिणाम प्राप्त करने के लिए, आधिकारिक तौर पर अनुशंसित मूल्यांकन मापदंडों (शून्य-शॉट या 5-शॉट, एकीकृत प्रॉम्प्ट प्रारूप) को सख्ती से लागू करने की आवश्यकता है। जब प्रोटोकॉल सुसंगत नहीं होते हैं, तो रिपोर्ट किए गए स्कोर तुलनीय नहीं हो सकते हैं।

सीएमएमएलयू के मुख्य कार्य

  • बहु-विषयक मानकीकृत प्रश्न बैंक: 67 विषयों को शामिल करता है और इसे चार श्रेणियों में व्यवस्थित किया गया है: मानविकी (चीनी साहित्य, इतिहास, दर्शन, आदि), सामाजिक विज्ञान (कानून, अर्थशास्त्र, शिक्षा, आदि), विज्ञान और इंजीनियरिंग (गणित, भौतिकी, कंप्यूटर, आदि), और चीनी-विशिष्ट ज्ञान (चीनी राजनीति, चीनी भूगोल, चीनी लोकगीत, आदि)। प्रत्येक विषय में लगभग 170 प्रश्न हैं, चार-विकल्प प्रारूप और 25% की यादृच्छिक आधार रेखा। उपयोग मूल्य: चीनी ज्ञान क्षमता के लिए एक मानकीकृत माप पैमाना प्रदान करें, जिससे विभिन्न मॉडलों को एक ही पैमाने पर तुलनीय बनाया जा सके।

  • लचीला मूल्यांकन ढांचा: दो मूल्यांकन सेटिंग्स का समर्थन करता है: शून्य-शॉट और कुछ-शॉट (डिफ़ॉल्ट 5-शॉट)। विभिन्न मॉडलों की इष्टतम प्रदर्शन सीमा के अनुकूल होने के लिए उदाहरणों के शीघ्र टेम्पलेट, संख्या और क्रम को समायोजित किया जा सकता है। उपयोग मूल्य: टीम एकल शैली के कारण होने वाले विचलन से बचने के लिए मॉडल प्रकार (आधार बनाम कमांड फाइन-ट्यूनिंग) के आधार पर सबसे उपयुक्त मूल्यांकन सेटिंग्स चुन सकती है।

  • ओपन सोर्स बेसलाइन परिणाम: वेयरहाउस ने जीपीटी-4, क्लाउड, क्वेन, बाइचुआन, इंटर्नएलएम, यी और अन्य श्रृंखलाओं सहित विभिन्न विषयों में कई मुख्यधारा मॉडलों की सटीकता बेसलाइन का खुलासा किया है। उपयोग मूल्य: नई मॉडल टीम शुरू से ही संदर्भ प्रणाली स्थापित किए बिना सीधे आधार रेखा के विरुद्ध क्षमताओं के स्तर का आकलन कर सकती है।

  • विषय-स्तरीय क्षमता निदान: मूल्यांकन स्क्रिप्ट प्रत्येक विषय की स्वतंत्र सटीकता दर को आउटपुट करती है, और क्षैतिज तुलना के लिए स्वचालित रूप से एक रडार चार्ट या हिस्टोग्राम उत्पन्न कर सकती है। उपयोग मूल्य: उन विषयों का सटीक पता लगाएं जिनमें मॉडल मजबूत है (जैसे चीनी इतिहास, साहित्य) और कमजोर (जैसे उन्नत गणित, भौतिकी), और डेटा मिलान और प्रशिक्षण रणनीति समायोजन के लिए मात्रात्मक आधार प्रदान करें।

  • सामुदायिक स्केलेबिलिटी: डेटा सेट और कोड पूरी तरह से जनता के लिए खुले हैं। अनुसंधान टीम विषयों को जोड़ या हटा सकती है, प्रश्नों को संशोधित कर सकती है, नए मॉडल बेसलाइन जोड़ सकती है, या मूल्यांकन स्क्रिप्ट से इंटरफेस निकाल सकती है और उन्हें कस्टम परीक्षण पाइपलाइनों में एम्बेड कर सकती है। उपयोग मूल्य: विशिष्ट उद्योगों (जैसे कानून, चिकित्सा) को लक्षित करने वाली टीमें सीएमएमएलयू के आधार पर ऊर्ध्वाधर क्षेत्र मूल्यांकन सेट बना सकती हैं और तैयार मूल्यांकन उपकरण श्रृंखला का पुन: उपयोग कर सकती हैं।

विशेषज्ञ की राय: सीएमएमएलयू का "विषय-स्तरीय निदान" और "बेसलाइन तुलना" संबंधित हैं - बेसलाइन संदर्भ का एक फ्रेम प्रदान करता है, और विषय स्कोर कमियों का पता लगाता है। दोनों का संयोजन मॉडल टीम को मॉडल की गुणवत्ता मापने के लिए केवल समग्र स्कोर पर निर्भर रहने में सक्षम नहीं बनाता है, बल्कि यह सटीक हो सकता है कि "कौन सा विषय X प्रतिशत अंक से भी बदतर है।" इस लिंक का प्रशिक्षण डेटा अनुपात के अनुकूलन, पाठ्यक्रम सीखने की रणनीतियों के डिजाइन और डोमेन वृद्धि और फाइन-ट्यूनिंग के लिए डेटा चयन के लिए प्रत्यक्ष मार्गदर्शक महत्व है।

सीएमएमएलयू का मॉडल और संस्करण विकास

मेनलाइन रिलीज़

  • पेपर का पहला संस्करण (2023-06): arXiv पेपर सार्वजनिक डेटा सेट v1.0 और मूल्यांकन समझौते के साथ, 67 विषय प्रभाग और 5-शॉट मूल्यांकन विनिर्देश स्थापित किए गए हैं। पेपर GPT-4, ChatGPT और कई शुरुआती चीनी मॉडलों के आधारभूत परिणामों की भी रिपोर्ट करता है। यह सीएमएमएलयू के लिए प्रारंभिक मील का पत्थर है और बाद के सभी अपडेट इस रिलीज़ पर आधारित हैं।

  • डेटासेट अपडेट (~2024): सामुदायिक प्रतिक्रिया के आधार पर, कुछ विषयों में प्रश्न त्रुटियों और उत्तर लेबलिंग मुद्दों को ठीक किया गया है, और कुछ नए विषय प्रश्न जोड़े गए हैं। आधिकारिक संस्करण संख्या अलग से सूचीबद्ध नहीं है, और अद्यतन रिकॉर्ड GitHub प्रतिबद्ध लॉग के अधीन है। परिवर्तन: लगभग दर्जनों त्रुटियों को ठीक कर दिया गया है, और विषयों की कुल संख्या 67 पर अपरिवर्तित बनी हुई है।

  • निरंतर रखरखाव अवधि (2024 से वर्तमान तक): गोदाम समुदाय द्वारा दी गई समस्या रिपोर्टों और सुझावों को प्रबंधित करने के लिए मुद्दे का उपयोग करता है, और नियमित रूप से पीआर का विलय और सुधार करता है। नए मॉडल जारी होने पर बेसलाइन स्कोर तालिका को लगातार अपडेट किया जाता है, लेकिन डेटा सेट ऑन्कोलॉजी में संरचनात्मक परिवर्तन स्थिर होते हैं। परिवर्तन बिंदु: बेसलाइन मॉडल की संख्या में वृद्धि जारी है, और डेटा सेट की मुख्य संरचना में महत्वपूर्ण बदलाव नहीं किया गया है।

संस्करण संदर्भ के मुख्य बिंदु

सीएमएमएलयू की संस्करण विकास सुविधा "डेटा सेट की एक बार रिलीज + बेसलाइन के निरंतर अद्यतन" का अकादमिक बेंचमार्क मॉडल है, जो वाणिज्यिक उत्पादों के सिमेंटिक संस्करण प्रबंधन से अलग है। डेटा सेट को रिलीज़ होने के बाद से केवल इरेटा स्तर पर ही संशोधित किया गया है, और इसमें संरचनात्मक विस्तार या संस्करण संख्या में उछाल का अनुभव नहीं किया गया है। उद्धृत करते समय, पेपर की प्रकाशन तिथि और GitHub कमिट हैश मान्य होगा।

संस्करण मील का पत्थर दिनांक मुख्य परिवर्तन
पेपर का पहला विमोचन ~2023-06 सार्वजनिक 67 विषय डेटा सेट v1.0, मूल्यांकन स्क्रिप्ट, बेसलाइन स्कोर
इरेटा अद्यतन ~2024 कुछ प्रश्न त्रुटियों को ठीक किया गया, पूरक विषय, संस्करण संख्या में कोई उछाल नहीं
सतत रखरखाव 2024 से वर्तमान तक बेसलाइन मॉडल का विस्तार जारी है और डेटा सेट संरचना स्थिर बनी हुई है

सीएमएमएलयू के तकनीकी फायदे

तंत्र: सीएमएमएलयू "स्थैतिक डेटा सेट + स्थानीय मूल्यांकन स्क्रिप्ट" की ऑफ़लाइन मूल्यांकन वास्तुकला को अपनाता है। डेटा सेट JSON प्रारूप में प्रत्येक प्रश्न के प्रश्न मूल, चार विकल्प और सही उत्तर सूचकांक को संग्रहीत करता है; मूल्यांकन स्क्रिप्ट क्रमिक रूप से प्रश्नों को पढ़ती है, संकेतों का निर्माण करती है, मॉडल तर्क को कॉल करती है, उत्तरों की तुलना करती है, और विषय के अनुसार सटीकता की गणना करती है।

प्रभाव:

  • पूरी तरह से प्रतिलिपि प्रस्तुत करने योग्य ऑफ़लाइन: सभी मूल्यांकन तर्क स्थानीय रूप से निष्पादित होते हैं और किसी भी बाहरी सेवाओं पर निर्भर नहीं होते हैं। डेटा सेट और स्क्रिप्ट के समान संस्करण का उपयोग करने वाली कोई भी टीम लगातार परिणाम प्राप्त कर सकती है। यह एपीआई संस्करण अंतर, सेवा अपडेट और ऑनलाइन समीक्षाओं में यादृच्छिक नमूनाकरण जैसे अनियंत्रित कारकों के कारण होने वाले स्कोर पर हस्तक्षेप को समाप्त करता है।

  • सुक्ष्म विषय निदान: 67 विषयों की ग्रैन्युलैरिटी चीनी मूल्यांकन बेंचमार्क में सबसे आगे है। एमएमएलयू के 57 विषयों की सी-इवल के 52 विषयों से तुलना करते हुए, सीएमएमएलयू ने "चीनी-विशिष्ट ज्ञान" श्रेणी में बड़ी संख्या में उपखंड (जैसे चीनी राजनीतिक प्रणाली, चीनी लोककथाएं, प्राचीन चीनी इतिहास, आदि) जोड़े हैं, ताकि मॉडल की चीनी स्थानीय ज्ञान की महारत को व्यक्तिगत रूप से मापा जा सके।

  • एमएमएलयू के साथ पूरक डिजाइन: सीएमएमएलयू और एमएमएलयू की विषय सेटिंग केवल चीनी-अंग्रेजी अनुवाद से संबंधित नहीं है। एमएमएलयू द्वारा कवर किए गए विषय पश्चिमी ज्ञान प्रणाली पर आधारित हैं, जबकि सीएमएमएलयू चीन के लिए अद्वितीय ज्ञान और मूल्यांकन आयामों की एक बड़ी संख्या जोड़ता है। एमएमएलयू और सीएमएमएलयू को एक ही समय में एक ही मॉडल पर चलाकर, "सामान्य ज्ञान क्षमता" और "चीनी प्रासंगिक ज्ञान क्षमता" के दो आयामों में अंतर को अलग किया जा सकता है। उदाहरण के लिए, एक मॉडल जो एमएमएलयू पर अच्छा प्रदर्शन करता है, वह सीएमएमएलयू की चीन-विशिष्ट ज्ञान श्रेणी में कम स्कोर कर सकता है, जिससे पता चलता है कि मॉडल में चीनी पूर्व-प्रशिक्षण डेटा में चीनी संस्कृति का अपर्याप्त कवरेज है।

लागू परिदृश्य: सीएमएमएलयू रिलीज से पहले अंतिम प्रचार संकेतक के बजाय मॉडल विकास चरण में एक क्षमता निदान उपकरण के रूप में अधिक उपयुक्त है। प्रशिक्षण प्रक्रिया के दौरान नियमित रूप से चलने वाले सीएमएमएलयू मूल्यांकन से कुछ विषयों में मॉडल की क्षमता में गिरावट का तुरंत पता लगाया जा सकता है (जैसे कि अति-संरेखण के कारण तथ्यात्मक ज्ञान को भूलना)। रिपोर्ट प्रकाशित करने के लिए, एकल बेंचमार्क के अंकों की अधिक व्याख्या से बचने के लिए एक मूल्यांकन सूट बनाने के लिए सीएमएमएलयू को सी-ईवल, एमएमएलयू, एजीआईईवल आदि के साथ संयोजित करने की सिफारिश की जाती है।

सीएमएमएलयू का उपयोग कैसे करें

प्रवेश नियंत्रण:

प्रवेश उद्देश्य लागत
GitHub रिपॉजिटरी (haonan-li/CMMLU) डेटा सेट डाउनलोड, मूल्यांकन स्क्रिप्ट, आधारभूत परिणाम, दस्तावेज़ीकरण मुफ़्त
आर्क्सिव पेपर विधि विवरण, विषय परिभाषा, प्रारंभिक आधार रेखा मुफ़्त
हगिंग फेस डेटासेट डेटासेट लाइब्रेरी के माध्यम से सीधे सीएमएमएलयू लोड करें मुफ़्त

सामान्य चरण:

  1. डेटासेट प्राप्त करें: git क्लोन https://github.com/haonan-li/CMMLU.git, या इसे सीधे `datasets.load_dataset("haonan-li/cmmlu") के माध्यम से लोड करें।
  2. मॉडल तैयार करें: सुनिश्चित करें कि मूल्यांकन किए जाने वाले मॉडल को हगिंग फेस ट्रांसफार्मर के AutoModelForCausalLM के माध्यम से लोड किया जा सकता है, या एक संगत अनुमान इंटरफ़ेस लागू किया जा सकता है।
  3. मूल्यांकन चलाएँ: मूल्यांकन स्क्रिप्ट निष्पादित करें, मॉडल पथ, मूल्यांकन सेटिंग्स (शून्य-शॉट या 5-शॉट), आउटपुट निर्देशिका और अन्य पैरामीटर निर्दिष्ट करें। उदाहरण आदेश: पायथन eval.py --मॉडल Qwen/Qwen2-7B --shot 5 --आउटपुट ./results
  4. परिणाम देखें: स्क्रिप्ट प्रत्येक विषय की सटीकता दर और समग्र औसत सटीकता दर को आउटपुट करती है, और विषयों के बीच एक दृश्य तुलना चार्ट भी उत्पन्न करती है।

अनुकूलन युक्तियाँ:

  • प्रॉम्प्ट प्रारूप एकीकृत होना चाहिए: अलग-अलग प्रॉम्प्ट टेम्प्लेट (जैसे कि भूमिका विवरण जोड़ना है या नहीं, चीनी कमांड उपसर्गों का उपयोग करना है या नहीं) के कारण स्कोर में 2-5 प्रतिशत अंकों का उतार-चढ़ाव हो सकता है। स्कोर की रिपोर्टिंग करते समय उपयोग किए गए प्रॉम्प्ट के संस्करण पर ध्यान दिया जाना चाहिए, अन्यथा परिणाम तुलनीय नहीं होंगे।
  • कुछ-शॉट नमूनों की यादृच्छिकता: 5-शॉट मूल्यांकन में, जिस क्रम में नमूनों का चयन किया जाता है वह मॉडल के प्रदर्शन को प्रभावित करेगा। एकल नमूने के विचरण को कम करने के लिए यादृच्छिक बीज को ठीक करने और इसे कई रनों में औसत करने की अनुशंसा की जाती है।
  • डिकोडिंग पैरामीटर नियंत्रण: नमूनाकरण रणनीति द्वारा शुरू की गई यादृच्छिकता को सटीकता आंकड़ों में हस्तक्षेप करने से बचाने के लिए मूल्यांकन को लालची डिकोडिंग (तापमान = 0) का उपयोग करना चाहिए।
  • मॉडल टोकननाइज़र संगतता: कुछ मॉडलों के टोकनाइज़र चीनी अक्षरों को अलग-अलग तरीकों से विभाजित करते हैं, जो प्रॉम्प्ट की वास्तविक टोकन लंबाई और विषय की मॉडल की समझ को प्रभावित कर सकते हैं। यह सत्यापित करने की अनुशंसा की जाती है कि औपचारिक मूल्यांकन से पहले संकेत को एक छोटे नमूने पर सही ढंग से एन्कोड किया जा सकता है।

सीएमएमएलयू के लिए उत्पाद मूल्य निर्धारण

  • बिलिंग मॉडल: पूरी तरह से मुफ़्त और खुला स्रोत। कोई लाइसेंस शुल्क नहीं, कोई सदस्यता शुल्क नहीं, कोई भुगतान-प्रति-उपयोग नहीं।
  • शामिल लागत: मूल्यांकन के लिए आवश्यक कंप्यूटिंग शक्ति उपयोगकर्ता द्वारा वहन की जाती है। मॉडल पैमाने के आधार पर, एकल पूर्ण-स्तरीय मूल्यांकन के लिए कंप्यूटिंग पावर लागत $1-30 (मुख्यधारा क्लाउड जीपीयू ऑन-डिमांड मूल्य निर्धारण के आधार पर) के बीच है।
  • एंटरप्राइज़ निजीकरण: डेटा सेट को पूरी तरह से ऑफ़लाइन चलाया जा सकता है, जिसमें कोई आउटबाउंड डेटा ट्रांसफर नहीं होगा और कोई अतिरिक्त SaaS शुल्क नहीं होगा।
  • कोई छिपी हुई शर्तें नहीं: GitHub ओपन सोर्स लाइसेंस व्यावसायिक उपयोग को प्रतिबंधित नहीं करता है, लेकिन सीएमएमएलयू स्कोर उद्धृत करते समय, परिणामों को प्रतिलिपि प्रस्तुत करने योग्य बनाए रखने के लिए डेटा संस्करण और मूल्यांकन सेटिंग्स को इंगित किया जाना चाहिए।

सीएमएमएलयू के अनुप्रयोग परिदृश्य

  • मॉडल विकास चरण में क्षमता निदान: विभिन्न विषयों में मॉडल की क्षमताओं के बदलते रुझानों की निगरानी के लिए पूर्व-प्रशिक्षण या फाइन-ट्यूनिंग प्रक्रिया के दौरान नियमित रूप से सीएमएमएलयू मूल्यांकन चलाएं। वास्तविक लाभ: कुछ विषयों में क्षमता में गिरावट का जल्दी पता लगाया जा सकता है (उदाहरण के लिए, मॉडल अति-संरेखण के बाद चीनी ऐतिहासिक ज्ञान को भूल जाता है), और प्रशिक्षण डेटा अनुपात या प्रशिक्षण रणनीति को समय पर समायोजित किया जा सकता है। स्वीकृति फोकस: चेकपॉइंट अगले चरण में प्रवेश कर सकता है या नहीं, इसके लिए पहुंच शर्त के रूप में एक विषय-स्तरीय सटीकता सीमा निर्धारित करें (उदाहरण के लिए, प्रत्येक विषय बेसलाइन स्तर के 90% से कम नहीं होना चाहिए)।

  • मॉडल रिलीज़ पर योग्यता विवरण: तकनीकी रिपोर्ट में सीएमएमएलयू स्कोर की रिपोर्ट करें या चीनी ज्ञान दक्षता के मात्रात्मक प्रमाण के रूप में घोषणाएँ जारी करें। वास्तविक लाभ: उद्योग के भीतर एक तुलनीय क्षमता पैमाना प्रदान करें और जब उपयोगकर्ता चयन करते हैं तो सूचना विषमता को कम करें। स्वीकृति संबंधी चिंताएं: स्कोर की रिपोर्टिंग करते समय, मूल्यांकन सेटिंग्स (शून्य-शॉट/5-शॉट, शीघ्र संस्करण, डिकोडिंग पैरामीटर) पर भी ध्यान दिया जाना चाहिए, और समान शर्तों के तहत सी-इवल और एमएमएलयू स्कोर को क्रॉस-सत्यापन के लिए पूरक किया जाना चाहिए।

  • अकादमिक अनुसंधान और बेंचमार्क तुलना: एनएलपी शोधकर्ता चीनी भाषा को समझने के लिए एक मूल्यांकन उपकरण के रूप में सीएमएमएलयू का उपयोग करते हैं, कागजात में इस बेंचमार्क पर मॉडल के प्रदर्शन की रिपोर्ट करते हैं, या सीएमएमएलयू के आधार पर मूल्यांकन पद्धति अनुसंधान (जैसे शीघ्र संवेदनशीलता विश्लेषण, डेटा प्रदूषण का पता लगाना, आदि) करते हैं। वास्तविक लाभ: चीनी एनएलपी अनुसंधान के लिए एक मानकीकृत मूल्यांकन मंच प्रदान करें और नए मॉडल और नई विधियों की मूल्यांकन लागत को कम करें।

  • ऊर्ध्वाधर क्षेत्र मॉडल चयन मूल्यांकन: चीनी उद्योगों (कानून, चिकित्सा, वित्त, आदि) में बड़े मॉडल का चयन करते समय, सीएमएमएलयू में संबंधित विषयों (जैसे कानून, चिकित्सा, अर्थशास्त्र) के स्कोर का उपयोग चयन के लिए संदर्भ आयामों में से एक के रूप में किया जाता है। वास्तविक लाभ: ज्ञान कवरेज के दृष्टिकोण से, लक्ष्य क्षेत्र में स्पष्ट लाभ वाले मॉडल को जल्दी से चुना जा सकता है और परीक्षण का दायरा कम किया जा सकता है। स्वीकृति संबंधी चिंताएं: केवल प्रासंगिक विषय अंकों को संदर्भित किया जाएगा, और समग्र औसत स्कोर का उपयोग क्षेत्र-विशिष्ट मूल्यांकन के विकल्प के रूप में नहीं किया जाएगा।

सीएमएमएलयू के लागू समूह

  • बड़े मॉडल एल्गोरिदम इंजीनियर और शोधकर्ता: मॉडल प्रशिक्षण प्रभाव को सत्यापित करने, क्षमता में गिरावट का पता लगाने और विभिन्न प्रशिक्षण रणनीतियों के प्रभाव की तुलना करने के लिए मानकीकृत चीनी ज्ञान मूल्यांकन की आवश्यकता है। सीएमएमएलयू द्वारा प्रदान किया गया विषय-स्तरीय निदान सीधे डेटा आवंटन समायोजन और पाठ्यक्रम सीखने के डिजाइन का मार्गदर्शन कर सकता है। आवश्यक शर्तें: मॉडल तर्क और बुनियादी पायथन स्क्रिप्ट निष्पादन क्षमताएं हों।

  • एनएलपी अकादमिक शोधकर्ता: चीनी भाषा की समझ, मूल्यांकन पद्धति, डेटा प्रदूषण का पता लगाने आदि पर शोध में लगे हुए, एक प्रयोगात्मक मंच के रूप में सार्वजनिक रूप से प्रतिलिपि प्रस्तुत करने योग्य बेंचमार्क के एक सेट की आवश्यकता होती है। सीएमएमएलयू का खुला स्रोत प्रकृति और सूक्ष्म विषय विभाजन प्रयोगात्मक डिजाइन में लचीलापन प्रदान करता है। शर्त: हगिंग फेस इकोसिस्टम और मानक मूल्यांकन प्रक्रिया से परिचित।

  • मॉडल चयन और खरीद निर्णय निर्माता: जब उद्यम बड़े मॉडल खरीदते हैं या ओपन सोर्स मॉडल बेस का चयन करते हैं, तो चीनी ज्ञान क्षमताओं के लिए मात्रात्मक संदर्भ संकेतकों में से एक के रूप में सीएमएमएलयू स्कोर का उपयोग करें। शर्त: बहुविकल्पीय प्रश्न बेंचमार्क की सीमाओं को समझना आवश्यक है और इसे निर्णय लेने के लिए एकमात्र आधार के रूप में उपयोग नहीं करना चाहिए।

  • ❌लोगों के लिए उपयुक्त नहीं:

    • अंतिम उपयोगकर्ता जो बातचीत, लेखन, अनुवाद आदि जैसी उपलब्ध सुविधाओं तक सीधी पहुंच चाहते हैं - सीएमएमएलयू एक समीक्षा उपकरण है न कि कोई एप्लिकेशन उत्पाद।
    • ऐसे परिदृश्य जिनमें मॉडल तर्क की गहराई, रचनात्मकता और संवाद के कई दौरों की गुणवत्ता का आकलन करने की आवश्यकता होती है - ऐसे आयाम जिन्हें बहुविकल्पीय प्रश्न प्रारूप माप नहीं सकता है।
    • निर्णय निर्माता जो मॉडल चयन के लिए केवल एक समग्र स्कोर का उल्लेख करते हैं - बहुविकल्पीय प्रश्न बेंचमार्क डेटा संदूषण से प्रभावित होता है, और समग्र स्कोर प्रमुख विषयों में गंभीर कमियों को कवर कर सकता है। अन्य मूल्यांकनों और वास्तविक मापों के साथ मिलकर व्यापक निर्णय लेने की आवश्यकता है।

सारांश और आउटलुक

मुख्य दक्षताएँ: सीएमएमएलयू 67 विषयों के सुक्ष्म विभाजन, चीन-विशिष्ट ज्ञान की प्रमुख कवरेज और पूरी तरह से ऑफ़लाइन प्रतिलिपि प्रस्तुत करने योग्य ओपन सोर्स आर्किटेक्चर के साथ चीनी बड़े मॉडल मूल्यांकन परिदृश्य का एक अनिवार्य हिस्सा बन गया है। यह सी-एवल का पूरक है - पहला सामान्य विषयों की कठिनाई प्रवणता पर ध्यान केंद्रित करता है, और दूसरा चीनी स्थानीय ज्ञान की गहराई पर ध्यान केंद्रित करता है - और दोनों का संयोजन मॉडल की चीनी ज्ञान क्षमता संरचना को पूरी तरह से चित्रित कर सकता है।

वर्तमान सीमाएँ:

  • डेटा प्रदूषण जोखिम: स्थैतिक सार्वजनिक डेटा सेट को प्री-ट्रेनिंग चरण के दौरान मॉडल द्वारा आसानी से "पहले से देखा" जाता है, जिसके परिणामस्वरूप गलत तरीके से उच्च स्कोर प्राप्त होता है। वर्तमान में, सीएमएमएलयू के पास गतिशील प्रश्न निर्माण या नियमित ताज़ा तंत्र नहीं है, और निश्चित संस्करणों पर दीर्घकालिक निर्भरता अधिक से अधिक प्रदूषण समस्याओं का सामना करेगी।
  • एकल प्रश्न प्रकार: केवल चार बहुविकल्पीय प्रश्न हैं, जो मॉडल की जेनरेटिव रीजनिंग, मल्टी-स्टेप रीजनिंग, खुले प्रश्न और उत्तर क्षमताओं का मूल्यांकन नहीं कर सकते हैं। उच्च अंक केवल याद किए गए तथ्यात्मक ज्ञान की मात्रा को दर्शाते हैं और व्यावहारिक अनुप्रयोगों में प्रदर्शन की गारंटी नहीं देते हैं।
  • विषय कवरेज में अभी भी अंतराल हैं: हालांकि 67 विषय पहले से ही उच्च-घनत्व वाले हैं, उभरते अंतःविषय विषयों (जैसे एआई नैतिकता, कम्प्यूटेशनल सामाजिक विज्ञान) और कुछ लंबवत उद्योगों (जैसे फार्मास्यूटिकल्स, वित्तीय इंजीनियरिंग) में अपर्याप्त कवरेज है।
  • मूल्यांकन प्रोटोकॉल का अपर्याप्त मानकीकरण: विभिन्न टीमों के बीच शीघ्र टेम्पलेट कुछ-शॉट सेटिंग्स और उत्तर निष्कर्षण में अंतर के परिणामस्वरूप अभी भी ऐसे स्कोर प्राप्त होते हैं जो सीधे तुलनीय नहीं हैं। समुदाय को अधिक कठोर मानक मूल्यांकन प्रोटोकॉल की आवश्यकता है।

अनुवर्ती अवलोकन बिंदु:

  • क्या सीएमएमएलयू डेटा प्रदूषण से निपटने के लिए "गोपनीयता सेट" का एक गतिशील मूल्यांकन संस्करण लॉन्च करेगा।
  • क्या उपयोगकर्ताओं को एप्लिकेशन परिदृश्यों में बहुविकल्पीय परीक्षण स्कोर के वास्तविक अर्थ को समझने में मदद करने के लिए इसे वास्तविक कार्य मूल्यांकन (जैसे बाइचुआन-टेक्स्टएवल, सुपरक्लू) के साथ जोड़ा और परिवर्तित किया जा सकता है।
  • क्या समुदाय सीएमएमएलयू ढांचे के आधार पर ऊर्ध्वाधर उद्योग विस्तार सेट (जैसे सीएमएमएलयू-मेड, सीएमएमएलयू-लॉ) का निर्माण करेगा।
  • मुख्यधारा के मॉडलों के स्कोर सीएमएमएलयू पर एकत्रित होने के बाद, क्या बेंचमार्क को कठिनाई बढ़ाने की जरूरत है या भेदभाव बनाए रखने के लिए प्रतिकूल नमूने पेश करने की जरूरत है।

खरीद और गोद लेने का जोखिम मूल्यांकन: सीएमएमएलयू को मूल्यांकन प्रणाली में शामिल करने की योजना बनाने वाली टीमों के लिए, निम्नलिखित कदम उठाने की सिफारिश की जाती है - अल्पकालिक (1-2 सप्ताह) इसे मौजूदा मूल्यांकन पाइपलाइन में एकीकृत करें, इसे एमएमएलयू और सी-इवल के साथ एक साथ चलाएं, और एक आधारभूत तुलना स्थापित करें; मध्यावधि (1-3 महीने) पूर्व-प्रशिक्षण डेटा अनुपात समायोजन का मार्गदर्शन करने के लिए सीएमएमएलयू के विषय-स्तरीय नैदानिक ​​​​आउटपुट पर ध्यान केंद्रित करें; दीर्घकालिक (6 महीने से अधिक) सीएमएमएलयू डेटा संदूषण प्रवृत्तियों पर बारीकी से नज़र रखें, जैसे कि समुदाय द्वारा रिपोर्ट की गई स्कोर मुद्रास्फीति एक उचित सीमा से अधिक हो, को अन्य विषम मूल्यांकन संकेतकों के पूरक के रूप में माना जाना चाहिए। एक वाणिज्यिक मॉडल की क्षमता विवरण के लिए, सीएमएमएलयू के अलावा समान शर्तों के तहत हमेशा एमएमएलयू और सी-इवल स्कोर का खुलासा करने की सिफारिश की जाती है, और असंगत मूल्यांकन के कारण भ्रामक मॉडल चयन से बचने के लिए मूल्यांकन सेटिंग्स (शॉट नंबर, प्रॉम्प्ट संस्करण, डिकोडिंग पैरामीटर) को स्पष्ट रूप से इंगित करें।

संबंधित टूल: <एक्सलिंक टाइप='टूल' स्लग='हगिंग-फेस'>, <एक्सलिंक टाइप='टूल' स्लग='रेप्लिकेट'>

संस्करण जानकारी

  • सीएमएमएलयू मूल्यांकन बेंचमार्क (गिटहब ओपन सोर्स) :ओपन-सोर्स व्यापक चीनी ज्ञान मूल्यांकन बेंचमार्क मानविकी, सामाजिक विज्ञान, विज्ञान और इंजीनियरिंग और चीनी-विशिष्ट ज्ञान में बहुविकल्पीय प्रश्नों को शामिल करता है। यह डेटा सेट, मूल्यांकन स्क्रिप्ट और बेसलाइन स्कोर प्रदान करता है। आधिकारिक संस्करण गोदाम और कागज पर आधारित है। लगातार लघु संस्करण संख्याएँ अलग से सूचीबद्ध नहीं हैं। तारीखें अनुमानित हैं.
  • सीएमएमएलयू पेपर और डेटा सेट सबसे पहले जारी किया गया :पेपर के साथ डेटा सेट और मूल्यांकन प्रोटोकॉल का खुलासा किया जाएगा, और विषय विभाजन और आधारभूत मूल्यांकन पद्धति स्थापित की जाएगी। अनुवर्ती कार्रवाई मुख्य रूप से वेयरहाउस अपडेट और परिणाम अनुपूरकों पर केंद्रित होगी। अधिकारी ने सटीक तारीख का खुलासा नहीं किया है, और तारीख अनुमानित है।

उपयोगकर्ता समीक्षाएं

  • समीक्षाएं लोड हो रही हैं...