OpenAI ने "दो सेटिंग्स" के साथ ARC-AGI-3 स्कोर को तीन गुना कर दिया: बेंचमार्क को विश्वास के संकट का सामना करना पड़ता है
OpenAI ने 29 जुलाई को एक शोध रिपोर्ट जारी की, जिसमें खुलासा किया गया कि "दो सेटिंग्स" ARC-AGI-3 बेंचमार्क पर मॉडल के स्कोर को तीन गुना कर सकती हैं, जिससे पता चलता है कि मूल्यांकन परिणाम अनुमान/डिकोडिंग सेटिंग्स से दृढ़ता से संबंधित हैं, और उद्योग को "मूल्यांकन कॉन्फ़िगरेशन निर्भरता" के कारण होने वाले झूठे उच्च परिणामों से सावधान रहने की याद दिलाते हैं।
29 जुलाई को, OpenAI ने एक शोध रिपोर्ट जारी की जो "अपनी कमियों को उजागर करती हुई" प्रतीत हुई: इसमें पता चला कि "दो सेटिंग्स" के माध्यम से ARC-AGI-3 बेंचमार्क पर मॉडल का स्कोर तीन गुना तक बढ़ाया जा सकता है। यदि "सेटिंग्स" भी तीन गुना अंतर ला सकती है, तो हमें मॉडलों के बीच वास्तविक क्षमता अंतर को कैसे मापना चाहिए?
ARC-AGI-3 क्या है
एआरसी-एजीआई (एजीआई के लिए एब्स्ट्रैक्शन एंड रीजनिंग कॉर्पस) एक मॉडल की "नई समस्याओं/अमूर्त तर्क को हल करने" की क्षमता को मापने के लिए एक महत्वपूर्ण बेंचमार्क है और इसे व्यापक रूप से "मानव-जैसे अमूर्त तर्क" के लिए एक बेंचमार्क माना जाता है। इसकी तीसरी पीढ़ी (ARC-AGI-3) मॉडल की सामान्यीकरण और तर्क क्षमताओं पर उच्च आवश्यकताएं रखती है। OpenAI ने पाया कि कुछ अनुमान/डिकोडिंग सेटिंग्स (आमतौर पर अनुमान बजट, खोज रणनीति, या नमूने से संबंधित) का प्रदर्शन पर भारी प्रभाव पड़ा - केवल दो वस्तुओं को समायोजित करने से तीन गुना उछाल आया।
एक पद्धतिगत अनुस्मारक
इस रिपोर्ट का मुख्य मूल्य परिणामों में नहीं है, बल्कि पद्धतिगत अनुस्मारक में है: मॉडल की "वास्तविक क्षमता" दृढ़ता से "मूल्यांकन सेटिंग" से संबंधित है, और मूल्यांकन परिणाम क्षैतिज रूप से तुलना करने से पहले एक एकीकृत कॉन्फ़िगरेशन के तहत होने चाहिए। यह सीधे तौर पर "एक निश्चित मॉडल स्कोर एक्स" जैसे आख्यानों की नींव को हिला देता है - यदि कोई अन्य व्यक्ति उच्च स्कोर चलाने के लिए एक अलग अनुमान बजट का उपयोग करता है, तो यह स्कोर कितना विश्वसनीय है?
इस अनुस्मारक की प्रासंगिकता बिल्कुल स्पष्ट है। अभी कुछ दिन पहले (जुलाई 24),
उद्योग के दृष्टिकोण से, यह रिपोर्ट एक फैलती हुई उद्योग घटना का खुलासा करती है: जब बेंचमार्क स्कोर एक विपणन हथियार बन जाता है, तो निर्माता "क्षमताओं" के बजाय "कॉन्फ़िगरेशन" का अनुकूलन करेंगे। यह घरेलू बड़े मॉडल मूल्यांकन पारिस्थितिकी तंत्र के लिए एक महत्वपूर्ण चेतावनी है - चाहे वह सार्वजनिक सूची हो या आंतरिक मूल्यांकन, "अनुमान बजट, नमूना सेटिंग्स और मूल्यांकन प्रोटोकॉल" स्पष्ट और एकीकृत होना चाहिए, अन्यथा स्कोर केवल एक अर्थहीन संख्या का खेल बन जाएगा। क्षमताओं की वास्तविक तुलना अंततः "समान परिस्थितियों में प्रतिलिपि प्रस्तुत करने योग्य मूल्यांकन" पर वापस आ जाएगी।
भविष्य में ट्रैकिंग के लायक कई दिशाएँ:
- "दो सेटिंग्स" की विशिष्ट सामग्री: क्या OpenAI पुनरुत्पादन के लिए संपूर्ण सेटिंग विवरण का खुलासा करेगा।
- मूल्यांकन विनिर्देशों पर उद्योग की सहमति: क्या एकीकृत एआरसी-एजीआई-3 मूल्यांकन प्रोटोकॉल होगा।
- एंथ्रोपिक की प्रतिक्रिया: ओपस 5 का एआरसी-एजीआई 3 स्कोर "कॉन्फ़िगरेशन निर्भरता" संदेह के सामने स्व-प्रमाणित कैसे होता है।
- घरेलू मूल्यांकन मानकों का संशोधन: क्या सार्वजनिक सूची मूल्यांकन कॉन्फ़िगरेशन के लिए प्रकटीकरण आवश्यकताओं को कड़ा कर देगी।
समीक्षाएं