अखाड़ा मुफ्त

-

एरिना (पूर्व में LMArena / LMSYS चैटबॉट एरिना) यूसी बर्कले अनुसंधान टीम द्वारा शुरू किया गया एक समुदाय-संचालित AI समीक्षा मंच है। बैटल मोड और सामुदायिक वोटिंग तंत्र के माध्यम से, उपयोगकर्ता वास्तविक परिदृश्यों में विभिन्न मॉडलों की आउटपुट गुणवत्ता की तुलना कर सकते हैं, जिससे 82 मिलियन+ वास्तविक मानव प्राथमिकताओं के आधार पर सार्वजनिक रैंकिंग बन सकती है। पाठ, कोड, चित्र और वीडियो एजेंटों जैसे मल्टी-मोडल मूल्यांकन आयामों को कवर करते हुए, यह उद्यमों और मॉडल प्रयोगशालाओं के लिए वाणिज्यिक मूल्यांकन सेवाएं भी प्रदान करता है।

अखाड़ा उत्पाद इंटरफेस

अखाड़ा

एरेना के मुख्य पैरामीटर और आँकड़े

एरिना (पूर्व में LMArena / LMSYS चैटबॉट एरिना) यूसी बर्कले अनुसंधान टीम द्वारा स्थापित एक समुदाय-संचालित AI मूल्यांकन मंच है। इसे आधिकारिक तौर पर "वास्तविक दुनिया में एआई प्रदर्शन को समझने के लिए समुदाय-संचालित मंच" के रूप में तैनात किया गया है। यह न तो एआई संवाद सहायक है और न ही मॉडल प्रशिक्षण ढांचा है, बल्कि एक मूल्यांकन बुनियादी ढांचा है जो "मॉडल उत्पादकों" और "मॉडल उपभोक्ताओं" को जोड़ता है - 82 मिलियन+ वास्तविक मानव वोटों के माध्यम से, यह टेक्स्ट, कोड, छवियों और वीडियो एजेंटों जैसे मल्टी-मोडल आयामों को कवर करते हुए एक सार्वजनिक रैंकिंग बनाता है।

प्रोजेक्ट्स सार्वजनिक सूचना
आधिकारिक स्थिति समुदाय-संचालित एआई मूल्यांकन मंच
पूर्ववर्ती एलएमएसवाईएस चैटबॉट एरेना → एलएमएरेना (2025) → एरेना (2026)
मूल्यांकन आयाम टेक्स्ट, कोड (वेबडेव/इमेज-टू-वेबडेव), इमेज जेनरेशन/एडिटिंग, वीडियो जेनरेशन/एडिटिंग विजन, डॉक्यूमेंट, सर्च, एजेंट
समुदाय का आकार 10 मिलियन + मासिक सक्रिय विज़िटर 700 मिलियन + वार्तालाप 82 मिलियन + वोट
बिजनेस मॉडल निःशुल्क सामुदायिक स्तर + उद्यम मूल्यांकन सेवा (एआई मूल्यांकन)
वित्त पोषण की स्थिति $100एम बीज (2025.05) → $150एम सीरीज ए (2026.01)
वार्षिक राजस्व $100 मिलियन एआरआर (2026.06 तक, एंटरप्राइज़ सेवाएँ 8 महीनों से ऑनलाइन हैं)
संबंधित स्थान यूएस (बर्कले, कैलिफोर्निया)
समर्थन मंच वेब

एक संक्षिप्त टिप्पणी: एरिना अनिवार्य रूप से एक "एआई मॉडल मूल्यांकन क्षेत्र" है - यह उपयोगकर्ताओं को मॉडल चुनने और चैट करने की अनुमति नहीं देता है, लेकिन बैटल मोड और सामुदायिक वोटिंग के माध्यम से, यह एक व्यक्तिपरक प्रभाव से "कौन सा मॉडल बेहतर है" को एक मात्रात्मक सामुदायिक सहमति में बदल देता है।

मुख्य तंत्र: उपयोगकर्ता द्वारा शीघ्र शब्द इनपुट करने के बाद, सिस्टम गुमनाम रूप से दो मॉडलों का आउटपुट प्रदर्शित करता है, और उपयोगकर्ता अपने निर्णय के आधार पर बेहतर उत्तर के लिए वोट करता है। मतदान के नतीजे सार्वजनिक रैंकिंग को आगे बढ़ाते हैं, जबकि अकादमिक और औद्योगिक अनुसंधान के लिए ओपन सोर्स डेटा सेट उपलब्ध हैं। यह तंत्र मूल्यांकन परिणामों को स्थैतिक बेंचमार्क के ओवरफिटिंग संकेतकों के बजाय वास्तविक मानवीय प्राथमिकताओं के करीब बनाता है।

राजस्व संरचना: उद्यम मूल्यांकन सेवा शुरू होने के केवल 8 महीने बाद, जून 2026 में एरिना $100M वार्षिक राजस्व प्राप्त करेगा। विकास मुख्य रूप से मॉडल लैब की कस्टम मूल्यांकन सेवाओं और उद्यम ग्राहकों के लिए चयन समर्थन से आता है - $150M सीरीज़ A का सह-नेतृत्व फेलिसिस और यूसी इन्वेस्टमेंट्स द्वारा किया गया था, जिसमें a16z, क्लेनर पर्किन्स, लाइटस्पीड और अन्य की भागीदारी थी।

अखाड़े के उपयोगकर्ता और बाज़ार की पहचान

एरिना की बाज़ार पहचान दो स्पष्ट रास्तों से आती है: सामुदायिक पक्ष पर डेटा स्केल प्रभाव और उद्यम पक्ष पर वाणिज्यिक सत्यापन।

समुदाय पक्ष पर डेटा घनत्व: आधिकारिक खुलासे के अनुसार, प्लेटफ़ॉर्म पर कुल 700 मिलियन + 82 मिलियन वार्तालाप + 10 मिलियन + मासिक सक्रिय विज़िटर हैं। इन नंबरों का महत्व ट्रैफ़िक में नहीं, बल्कि "मानव प्राथमिकता डेटा" की कमी में निहित है - मॉडल समीक्षाओं का विशाल बहुमत स्थिर बेंचमार्क या एलएलएम-ए-जज पर निर्भर करता है, जबकि एरेना खुले कार्यों पर वास्तविक उपयोगकर्ताओं के निर्णय को बरकरार रखता है। एरेना ने हगिंगफेस (lmarena-ai) पर सबसे बड़ा मानव प्राथमिकता डेटासेट ओपन सोर्स किया है, जिसे कई मॉडलिंग प्रयोगशालाओं और शैक्षणिक संस्थानों द्वारा उद्धृत किया गया है।

उद्यम पक्ष पर विकास वक्र: उद्यम मूल्यांकन सेवा लॉन्च होने के 8 महीने बाद $100 मिलियन एआरआर तक पहुंच गई, यह दर्शाता है कि मॉडल प्रयोगशालाओं और बड़े उद्यमों में "वास्तविक मानव प्रतिक्रिया के आधार पर स्वतंत्र, पारदर्शी मूल्यांकन" की कठोर मांग है। एरिना के माध्यम से 400+ नए मॉडलों का सार्वजनिक रूप से मूल्यांकन किया गया है, जिसमें ओपन सोर्स और क्लोज्ड सोर्स मॉडल दोनों शामिल हैं। एजेंट मोड अपने लॉन्च के एक महीने के भीतर 5 मिलियन+ मासिक इंटरेक्शन राउंड तक पहुंच गया है, जिसमें सप्ताह-दर-सप्ताह 10% की वृद्धि हुई है, जो साबित करता है कि मल्टी-स्टेप एजेंट मूल्यांकन वर्तमान बाजार में सबसे जरूरी अंतरालों में से एक है।

अकादमिक प्रभाव: एरिना टीम ने ICML 2024 (चैटबॉट एरिना पेपर), NeurIPS 2023 (LLM-ए-जज), ICLR 2025 (रूटLLM), ICML 2025 (प्रॉम्प्ट-टू-लीडरबोर्ड, एरिना-हार्ड) जैसे शीर्ष सम्मेलनों में मूल्यांकन पद्धति पत्र प्रकाशित किए हैं, और इसकी रैंकिंग पद्धति वास्तविक मानकों में से एक बन गई है। समुदाय.

आवश्यकताएँ: मूल्यांकन मंच की विश्वसनीयता मतदान नमूनों की विविधता, त्वरित शब्दों की तटस्थता और रैंकिंग पद्धति की सांख्यिकीय कठोरता पर आधारित है। प्लेटफ़ॉर्म उपयोगकर्ता मुख्य रूप से तकनीकी लोग हैं (एक्स/डिस्कॉर्ड समुदाय सक्रिय है), और नमूना पूर्वाग्रह विशिष्ट उपयोग परिदृश्यों के प्रति पक्षपाती हो सकता है। यह एक ऐसा कारक है जिस पर रैंकिंग की व्याख्या करते समय विचार किया जाना चाहिए।

अखाड़े की लागत का लाभ

  • सी-साइड/व्यक्तिगत: आमतौर पर मुख्य कार्यों का अनुभव करने के लिए एक मुफ्त संस्करण प्रदान किया जाता है, और उच्च आवृत्ति उपयोग के लिए सशुल्क पैकेज सदस्यता की आवश्यकता होती है।
  • एपीआई/डेवलपर: कॉल वॉल्यूम के आधार पर बिल, विकास टीमों के लिए उपयुक्त जिन्हें लचीले ढंग से अपने सिस्टम में एकीकृत किया जा सकता है।
  • उद्यम/निजीकृत: अनुकूलित कोटेशन और तैनाती योजना के लिए व्यवसाय स्वामी से संपर्क करें। विशिष्ट कीमत आधिकारिक वास्तविक समय मूल्य निर्धारण पृष्ठ के अधीन है।

अखाड़े की मुख्य विशेषताएं

एरिना की क्षमता "चैट बॉक्स प्लस रैंकिंग सूची" नहीं है, बल्कि "मूल्यांकन-रूटिंग-रैंकिंग-डेटा फीडबैक" के आसपास निर्मित एक व्यापक प्रणाली है:

  • युद्ध मोड (अनाम मॉडल तुलना): उपयोगकर्ता एक त्वरित शब्द इनपुट करता है, दो अज्ञात मॉडल एक ही समय में इसे आउटपुट करते हैं, और उपयोगकर्ता बेहतर उत्तर चुनने के लिए वोट करता है। यह एरेना का मुख्य डेटा संग्रह तंत्र है। मुख्य डिजाइन ब्रांड पूर्वाग्रह को खत्म करने के लिए गुमनामी है, रैंकिंग शोर को कम करने के लिए यादृच्छिक जोड़ी है, और ईएलओ स्कोरिंग प्रणाली पूरे समय में स्थिर रैंकिंग प्रदान करती है। हिडन लिंकेज: प्रत्येक वोट एक ही समय में तीन मान उत्पन्न करता है - रैंकिंग अपडेट करना, मैक्स रूटिंग मॉडल का प्रशिक्षण, और ओपन सोर्स डेटा सेट का विस्तार करना। यह डेटा संग्रह, रूटिंग अनुकूलन और सामुदायिक योगदान के तीन कार्यों को एक ऑपरेशन में पूरा करता है।

  • बहु-आयामी रैंकिंग प्रणाली: न केवल एक "समग्र रैंकिंग", बल्कि क्षमताओं और मोड के अनुसार 13+ उप-विभाजित रैंकिंग में विभाजित: समग्र, एजेंट, टेक्स्ट, वेबडेव, इमेज-टू-वेबडेव, टेक्स्ट-टू-इमेज, इमेज एडिट, टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो, वीडियो एडिट, विजन, दस्तावेज़, खोज, आदि। विशेषज्ञ दृश्य: विभाजन सूची का मूल्य भ्रम को खत्म करना है - ए समग्र रूप से उच्च रैंक वाला मॉडल वेबडेव परिदृश्यों में औसत दर्जे का प्रदर्शन कर सकता है। विभाजन सूची चयन को "सर्वोत्तम मॉडल का चयन करने" से "उस मॉडल का चयन करने" में बदल देती है जो इस कार्य के लिए सबसे उपयुक्त है।

  • मैक्स मॉडल राउटर: समुदाय के 5 मिलियन से अधिक वोटिंग डेटा पर प्रशिक्षित एक बुद्धिमान रूटिंग इंजन जो स्वचालित रूप से सबसे उपयुक्त मॉडल के लिए उपयोगकर्ता युक्तियों को वितरित करता है। इंजीनियरिंग निहितार्थ: मैक्स अनिवार्य रूप से मानव प्राथमिकता प्रशिक्षण पर आधारित एक "मॉडल अनुशंसा प्रणाली" है। इसके अस्तित्व का मतलब है कि एरेना न केवल एक मूल्यांकन मंच है, बल्कि धीरे-धीरे मॉडल शेड्यूलिंग की निर्णय लेने वाली परत भी बन रहा है।

  • एजेंट मोड (मल्टी-स्टेप टास्क मूल्यांकन): जून 2026 में एक नया मूल्यांकन मोड लॉन्च किया गया, जो एजेंट परिदृश्यों के लिए उद्देश्य कार्य पूरा होने की दर और मतिभ्रम दर को मापता है। पारंपरिक स्थैतिक बेंचमार्क के विपरीत, एजेंट मोड एक खुले संदर्भ में मल्टी-स्टेप अनुमान और टूल इनवोकेशन करने की मॉडल की क्षमता का मूल्यांकन करता है। अपने लॉन्च के एक महीने के भीतर यह 5 मिलियन से अधिक मासिक इंटरैक्शन तक पहुंच गया है, जो दर्शाता है कि एजेंट मूल्यांकन के लिए बाजार की मांग अपेक्षाओं से कहीं अधिक है।

  • एंटरप्राइज़ मूल्यांकन सेवाएँ (एआई मूल्यांकन): मॉडल प्रयोगशालाओं और उद्यमों के लिए अनुकूलित मूल्यांकन प्रदान करें, जिसमें प्री-रिलीज़ मॉडल सत्यापन, प्रतिस्पर्धी उत्पाद तुलना और सूक्ष्म क्षमता विश्लेषण शामिल हों। मुख्य मूल्य: आंतरिक मूल्यांकन टीमों को अक्सर अपर्याप्त नमूना आकार और निश्चित मूल्यांकन आयामों की समस्याओं का सामना करना पड़ता है। एरेना की एंटरप्राइज सेवा वास्तविक मानव वोटिंग पूल तक पहुंच कर इन दो बाधाओं को हल करती है।

एरिना का मॉडल और संस्करण विकास

एरिना स्वयं एआई मॉडल नहीं है, इसलिए इसका संस्करण विकास प्लेटफ़ॉर्म क्षमता परत के निरंतर विस्तार में परिलक्षित होता है:

  • 2025.09 एंटरप्राइज़ मूल्यांकन सेवा लॉन्च की गई: आधिकारिक तौर पर एक शुद्ध सामुदायिक परियोजना से व्यावसायीकरण चरण में प्रवेश करते हुए, एआई मूल्यांकन अनुकूलित मूल्यांकन सेवा लॉन्च की गई।
  • 2025.11 एरिना एक्सपर्ट: विशेषज्ञ-स्तरीय मूल्यांकन मोड पेश किया गया है, मूल्यांकन पद्धति और रैंकिंग एल्गोरिदम को व्यवस्थित रूप से उन्नत किया गया है, और रैंकिंग सूची मॉडलों के बीच छोटे अंतर के प्रति अधिक संवेदनशील है।
  • 2026.01 ब्रांड अपग्रेड + सीरीज ए: एलएमएरेना का नाम बदलकर एरिना कर दिया गया है, जो खुद को "चैटबॉट एरेना" से व्यापक एआई मूल्यांकन प्लेटफॉर्म में बदल रहा है। इसी अवधि के दौरान $150M सीरीज़ A का वित्तपोषण पूरा किया।
  • 2026.02 मैक्स मॉडल राउटर: 5 मिलियन+ सामुदायिक वोटों के आधार पर प्रशिक्षित एक बुद्धिमान रूटिंग इंजन का विमोचन, जो एरेना की क्षमताओं के "निष्क्रिय मूल्यांकन" से "सक्रिय शेड्यूलिंग" में संक्रमण को चिह्नित करता है।
  • 2026.05 मल्टीमॉडल एक्सटेंशन: फुलस्टैक कोड एरिना उपखंड रैंकिंग (वेबडेव, इमेज-टू-वेबडेव, आदि) जोड़ी गई, मल्टीमॉडल मॉडल रूटिंग का समर्थन करने के लिए मल्टीमॉडल मैक्स जारी किया गया।
  • 2026.06 एजेंट मोड: ऑनलाइन एजेंट मूल्यांकन क्षमता, ओपन मल्टी-स्टेप कार्य मूल्यांकन का समर्थन, एजेंट विश्वसनीयता मूल्यांकन के लिए उद्योग की तत्काल आवश्यकता का सीधे जवाब देना।
  • 2026.07 तथ्यात्मक सटीकता रैंकिंग: एआई मॉडल में "मतिभ्रम मूल्यांकन में कठिनाई" के लंबे समय से चले आ रहे दर्द बिंदु के जवाब में, मानवीय प्राथमिकताओं के अलावा वस्तुनिष्ठ तथ्यात्मक शुद्धता के आयाम को पेश करते हुए जोड़ा गया तथ्यात्मक लीडरबोर्ड।

इवोल्यूशन मेन लाइन: "पाठ संवाद मूल्यांकन" से शुरू होकर, यह क्रमिक रूप से कोड, चित्र, वीडियो एजेंट और व्यावहारिकता जैसे आयामों को शामिल करता है, जबकि "शुद्ध मूल्यांकन" से "मूल्यांकन + रूटिंग + एंटरप्राइज़ सेवाओं" के व्यावसायिक संबंध तक विस्तारित होता है। प्रत्येक संस्करण अद्यतन एआई मूल्यांकन के संबंध में उद्योग में चिंता के एक बिंदु से मेल खाता है।

अखाड़े के तकनीकी फायदे

एरेना का तकनीकी मूल्य किसी एक मॉडल के प्रदर्शन में नहीं है, बल्कि मूल्यांकन इंजीनियरिंग प्रणाली की डिजाइन गहराई और डेटा फ्लाईव्हील के पैमाने पर प्रभाव में है:

ईएलओ रैंकिंग प्रणाली की सांख्यिकी कठोरता: अनाम युग्मन, यादृच्छिक क्रम और पर्याप्त नमूने के माध्यम से रैंकिंग पूर्वाग्रह को कम करने के लिए एरेना एक बेहतर ईएलओ स्कोरिंग प्रणाली का उपयोग करता है। इसके रैंकिंग कार्यप्रणाली पेपर की ICML द्वारा सहकर्मी-समीक्षा की गई है और यह साधारण जीत दर या औसत रेटिंग की तुलना में सांख्यिकीय रूप से अधिक विश्वसनीय है। कारण श्रृंखला: कठोर रैंकिंग पद्धति → अधिक विश्वसनीय रैंकिंग → समुदाय मतदान में भाग लेने के लिए अधिक इच्छुक है → अधिक डेटा → अधिक सटीक रैंकिंग।

बड़े पैमाने पर मानव प्राथमिकता डेटा की कमी: 700 मिलियन+ वार्तालाप और 82 मिलियन+ वोट दुनिया में सबसे बड़े खुले मानव प्राथमिकता डेटासेट में से एक बनाते हैं। इन डेटा का मूल्य "खुले कार्यों + वास्तविक उपयोगकर्ताओं + बहु-आयामी प्राथमिकताओं" में निहित है, जो स्थैतिक बेंचमार्क (जैसे एमएमएलयू, जीएसएम8के) के संभावित ओवर-फिटिंग जोखिम से अलग है। हगिंगफेस पर ओपन सोर्स डेटासेट कई मॉडल प्रयोगशालाओं के लिए एक मूल्यांकन सहायता संसाधन बन गया है।

मैक्स रूटिंग इंजन का इंजीनियरिंग पुन: उपयोग: मैक्स का अनुशंसा मॉडल अनिवार्य रूप से सामुदायिक वोटिंग डेटा का उप-उत्पाद है - एक ही डेटा स्ट्रीम रैंकिंग अपडेट और रूटिंग मॉडल प्रशिक्षण दोनों का कार्य करता है। यह "अधिक वोट → अधिक सटीक रूटिंग → बेहतर उपयोगकर्ता अनुभव → अधिक उपयोगकर्ता वोट" का एक सकारात्मक फीडबैक लूप बनाता है। लागत के नजरिए से, रूटिंग क्षमताओं की सीमांत प्रशिक्षण लागत बेहद कम है क्योंकि प्रशिक्षण डेटा हर पल मुफ्त उपयोगकर्ताओं द्वारा उत्पन्न होता है।

मल्टी-मोडल मूल्यांकन के लिए एकीकृत वास्तुकला: पाठ, कोड, छवि और वीडियो एजेंट जैसे विभिन्न तौर-तरीके "अनाम तुलना + मानव मतदान + ईएलओ रैंकिंग" के समान बुनियादी ढांचे को साझा करते हैं, जो नए मूल्यांकन आयामों को जोड़ने की इंजीनियरिंग लागत को कम करता है। एजेंट मोड की विशेष विशेषता वस्तुनिष्ठ पूर्णता दर माप की शुरूआत है, जो व्यक्तिपरक प्राथमिकताओं के अलावा मात्रात्मक कार्य सफलता दर को जोड़ती है। यह डिज़ाइन विचार बाद के मूल्यांकन मानकीकरण के लिए एक संदर्भ प्रदान करता है।

तकनीकी बाधाएं: मूल्यांकन प्रणाली की मुख्य बाधा तकनीकी कार्यान्वयन नहीं है, बल्कि प्रतिकूल हेरफेर का शासन है - विशिष्ट त्वरित शब्दों के लक्षित अनुकूलन के माध्यम से मॉडल प्रयोगशाला को रैंकिंग में हेरफेर करने से कैसे रोका जाए, वोट ब्रशिंग का पता कैसे लगाया जाए, और त्वरित शब्दावली की तटस्थता और ताजगी को कैसे बनाए रखा जाए। जैसे-जैसे समुदायों का आकार बढ़ता रहेगा, ये मुद्दे और अधिक प्रमुख होते जाएंगे।

एरेना का उपयोग कैसे करें

एरेना तक मुख्य रूप से वेब के माध्यम से पहुंच बनाई जाती है, जो विभिन्न भूमिकाओं की आवश्यकताओं के अनुरूप कई प्रवेश द्वार प्रदान करता है:

कैसे उपयोग करें भीड़ के लिए उपयुक्त ऑपरेशन पथ विशिष्ट चरण
युद्ध मोड सभी उपयोगकर्ता Arena.ai होमपेज → कार्य प्रकार चुनें → शीघ्र शब्द दर्ज करें → अनाम आउटपुट की तुलना करें → वोट करें 1 मिनट के भीतर मॉडल तुलना पूरी करें
सीधी बातचीत जिन उपयोगकर्ताओं को एक विशिष्ट मॉडल की आवश्यकता है Arena.ai → डायरेक्ट मोड → मॉडल चुनें → बातचीत दर्ज करें मल्टी-मॉडल चैट क्लाइंट के समतुल्य
रैंकिंग देखें तकनीकी निर्णयकर्ता Arena.ai/leaderboard → आयाम चुनें (कुल मिलाकर/एजेंट/कोड, आदि) बिना पंजीकरण के देखें
अधिकतम रूटिंग जो उपयोगकर्ता स्वचालित रूप से सर्वोत्तम उत्तर प्राप्त करना चाहते हैं Arena.ai → अधिकतम मोड → शीघ्र शब्द दर्ज करें सिस्टम स्वचालित रूप से सबसे उपयुक्त मॉडल का चयन करता है
एजेंट मोड बहु-चरणीय कार्यों का मूल्यांकन करें Arena.ai/agent → कार्य लक्ष्यों को परिभाषित करें → मॉडल निष्पादन प्रक्रिया का निरीक्षण करें खुले लंबे कार्य मूल्यांकन का समर्थन करें

कार्यकारियों के लिए त्वरित शुरुआत: जब तकनीकी निर्णय-निर्माता मूल्यांकन करते हैं कि क्या एरेना को एक मूल्यांकन उपकरण के रूप में इस्तेमाल किया जा सकता है, तो केवल तीन चरणों की आवश्यकता होती है - ① यह देखने के लिए एरेना.एआई/लीडरबोर्ड पर जाएं कि क्या खंडित रैंकिंग की संरचना उन क्षमता आयामों को कवर करती है जिनकी आप परवाह करते हैं; ② यह महसूस करने के लिए कि परिणामों में अंतर वास्तविक अनुभव के अनुरूप है या नहीं, युद्ध मोड में 10-20 बार तुलना करने के लिए अपने स्वयं के व्यावसायिक संकेत शब्दों (सामान्य संकेत शब्दों के बजाय) का उपयोग करें; ③ उद्यम मूल्यांकन के अनुकूलन दायरे और डेटा अलगाव योजना के बारे में जानने के लिए [email protected] से संपर्क करें।

डेटा खपत पथ: शोधकर्ता और प्रतिस्पर्धी उत्पाद विश्लेषण टीमें सीधे हगिंगफेस पर ओपन सोर्स डेटासेट (एलमेरेना-एआई) डाउनलोड कर सकती हैं, जिसमें पूर्ण गुमनाम वोटिंग रिकॉर्ड और माध्यमिक विश्लेषण और कस्टम रैंकिंग गणना के लिए मॉडल आउटपुट शामिल हैं।

अखाड़ा उत्पाद मूल्य निर्धारण

मूल्य निर्धारण मॉडल आधिकारिक वास्तविक समय पृष्ठ के अधीन है। आमतौर पर फ्रीमियम या सदस्यता प्रणाली अपनाई जाती है। बुनियादी कार्यों का उपयोग निःशुल्क किया जा सकता है, जबकि उन्नत कार्यों या उच्च-आवृत्ति उपयोग के लिए सशुल्क सदस्यता की आवश्यकता होती है। यह अनुशंसा की जाती है कि उपयोगकर्ता वास्तविक उपयोग के आधार पर इष्टतम समाधान का मूल्यांकन करें।

अखाड़ा अनुप्रयोग परिदृश्य

एरेना की मूल्यांकन अवसंरचना क्षमताओं को विभिन्न प्रकार के निर्णय लेने वाले लिंक में एम्बेड किया जा सकता है:

  • मॉडल चयन और खरीद निर्णय: एआई मॉडल खरीदने या उन तक पहुंचने से पहले, उद्यम एरिना रैंकिंग और कस्टम तुलना के माध्यम से उम्मीदवारों को जल्दी से सीमित कर सकते हैं। कार्यान्वयन युक्ति: खंडित रैंकिंग का मूल्य समग्र रैंकिंग से अधिक है - उदाहरण के लिए, यदि मुख्य परिदृश्य फ्रंट-एंड कोड पीढ़ी है, तो आपको समग्र रैंकिंग के बजाय वेबडेव और इमेज-टू-वेबडेव रैंकिंग पर ध्यान केंद्रित करना चाहिए। यह अनुशंसा की जाती है कि पहले प्रारंभिक स्क्रीनिंग के लिए एरेना का उपयोग करें, और फिर अंतिम निर्णय लेने के लिए अपने स्वयं के व्यावसायिक डेटा पर छोटे पैमाने पर ए/बी परीक्षण करने के लिए उम्मीदवार मॉडल का उपयोग करें।

  • मॉडल लैब में पुनरावृत्त सत्यापन: मॉडल विकास टीम संस्करण सुधारों के प्रभाव को सत्यापित करने के लिए रिलीज़ से पहले एरेना की एंटरप्राइज़ मूल्यांकन सेवा के माध्यम से स्वतंत्र, तृतीय-पक्ष मानव वरीयता मूल्यांकन प्राप्त करती है। लागत में कमी और दक्षता में सुधार: पारंपरिक मॉडलों को जारी करने से पहले अपनी स्वयं की मूल्यांकन टीम और एनोटेशन प्लेटफ़ॉर्म बनाने की आवश्यकता होती है, और स्थापना से आउटपुट तक आमतौर पर 3-6 महीने लगते हैं। एरेना एंटरप्राइज़ समीक्षाओं का उपयोग करके, इस चक्र को 2-4 सप्ताह तक संपीड़ित किया जा सकता है, और समीक्षाओं की लागत सैकड़ों हजारों डॉलर से घटाकर अनुबंध में सहमत वार्षिक शुल्क स्तर तक कर दी जाती है।

  • एजेंट और मल्टी-स्टेप कार्य विश्वसनीयता मूल्यांकन: एजेंट उत्पादों के विस्फोट के साथ, पारंपरिक एकल-राउंड मूल्यांकन अब मल्टी-स्टेप तर्क और टूल कॉलिंग परिदृश्यों को कवर नहीं कर सकता है। एरेना का एजेंट मोड खुले कार्य संदर्भ प्रदान करता है, जिसका उपयोग ग्राहक सेवा एजेंटों की ऑर्डर पूर्णता दर और कोड एजेंटों की निर्माण सफलता दर जैसे उद्देश्य संकेतकों का मूल्यांकन करने के लिए किया जा सकता है। परिदृश्य दर्द बिंदु: एजेंट मूल्यांकन में सबसे बड़ी कठिनाई यह है कि "स्वर्ण मानक" को परिभाषित करना मुश्किल है - एक ही कार्य के लिए, अलग-अलग निष्पादन पथ सही हो सकते हैं। एरेना एजेंट मोड मानव निर्णय + उद्देश्य पूर्णता दर का एक मिश्रित मूल्यांकन शुरू करके इस समस्या को कम करता है।

  • शिक्षा और प्रौद्योगिकी इंजीलवाद: शिक्षण परिदृश्यों में, एरेना का बैटल मोड दृश्य रूप से अंतर प्रदर्शित कर सकता है कि विभिन्न मॉडल एक ही संकेत शब्द को कैसे संसाधित करते हैं, जिससे छात्रों को मॉडल की क्षमताओं की सीमाओं को समझने में मदद मिलती है। 10.1 मिलियन से अधिक मासिक सक्रिय आगंतुकों का समुदाय आकार भी शिक्षा क्षेत्र में इसकी पैठ को दर्शाता है।

अखाड़े के लिए उपयुक्त लोग

एरेना की बहुस्तरीय क्षमता डिज़ाइन चार अलग-अलग प्रकार की भूमिकाएँ निभाती है, प्रत्येक परत में उपयोग और लाभों की अलग-अलग गहराई होती है:

  • एआई उत्पाद प्रबंधक और तकनीकी निर्णयकर्ता: वे लोग जिन्हें मॉडल चयन करने की आवश्यकता है। एरेना का मुख्य मूल्य मॉडल निर्माताओं से स्वतंत्र तृतीय-पक्ष मूल्यांकन डेटा प्रदान करना है। अनुशंसित पथ: पहले उम्मीदवार के दायरे को कम करने के लिए रैंकिंग सूची का उपयोग करें (1 दिन), फिर अपने स्वयं के दृश्य डेटा (3-5 दिन) के साथ छोटे पैमाने पर सत्यापन करने के लिए बैटल मोड का उपयोग करें, और अंत में गहन मूल्यांकन (1-2 सप्ताह) के लिए उद्यम मूल्यांकन से संपर्क करें। अनुपयुक्त सीमा: यदि आपका दृश्य अत्यधिक ऊर्ध्वाधर है (जैसे कि चिकित्सा इमेजिंग निदान, कानूनी दस्तावेज़ समीक्षा), तो एरेना का सामान्य मूल्यांकन डेटा पर्याप्त रूप से सुव्यवस्थित नहीं हो सकता है, और आपको अपने स्वयं के डेटा सेट पर अनुकूलित मूल्यांकन करने की आवश्यकता है।

  • मॉडल डेवलपर्स और एआई शोधकर्ता: वे लोग जिन्हें मॉडल संस्करणों के पुनरावृत्ति प्रभाव को सत्यापित करने की आवश्यकता है। एरेना की उद्यम समीक्षाएँ वास्तविक जीवन के मानवीय प्राथमिकता आयामों की पूरक हैं जिन्हें कवर करना इन-हाउस समीक्षा टीमों के लिए मुश्किल है। रैंकिंग पद्धतियों, वरीयता संरेखण और मॉडल मूल्यांकन तकनीकों पर शोध के लिए ओपन सोर्स डेटासेट भी एक मूल्यवान संसाधन हैं।

  • उद्यम खरीद और अनुपालन टीम: लोगों का समूह जिन्हें संगठन के लिए एआई विक्रेता का चयन करने की आवश्यकता होती है। एरिना की खंडित रैंकिंग और सार्वजनिक कार्यप्रणाली पुन: प्रयोज्य चयन प्रदर्शन सामग्री प्रदान करती है। सीमा के लिए उपयुक्त नहीं: मूल्यांकन मंच का डेटा मॉडल की सुरक्षा का पूर्ण मूल्यांकन नहीं करता है - यदि आपके परिदृश्य में संवेदनशील डेटा या सख्त अनुपालन आवश्यकताएं (जैसे एचआईपीएए, जीडीपीआर) शामिल हैं, तो स्वतंत्र सुरक्षा ऑडिट और अनुपालन समीक्षा अभी भी आवश्यक हैं।

  • एआई उत्साही और शुरुआती अपनाने वाले: कई मॉडलों तक मुफ्त पहुंच के साथ, बैटल मोड के माध्यम से अत्याधुनिक मॉडल क्षमताओं में अंतर के बारे में जानें। ऐसे उपयोगकर्ता प्लेटफ़ॉर्म के वोटिंग डेटा में भी प्रमुख योगदानकर्ता हैं।

अखाड़े का सारांश और आउटलुक

एरिना की मुख्य प्रतिस्पर्धात्मकता "समुदाय-संचालित डेटा फ्लाईव्हील + वाणिज्यिक मूल्यांकन सेवा" के दो-पहिया मॉडल में निहित है - 82 मिलियन+ वास्तविक मानव वोट एक अत्यंत उच्च डेटा बाधा का गठन करते हैं, और उद्यम मूल्यांकन सेवाओं की तीव्र वृद्धि (8 महीनों में $ 100M एआरआर) वाणिज्यिक पक्ष पर इस संपत्ति की मुद्रीकरण क्षमता की पुष्टि करती है। टेक्स्ट से एजेंट और तथ्यों तक क्षमता विस्तार पथ से पता चलता है कि एरेना एक "मॉडल चैट क्षेत्र" से "एआई क्षमताओं के लिए व्यापक मूल्यांकन बुनियादी ढांचे" में विकसित हो रहा है।

वर्तमान सीमाएँ और अनिश्चितताएँ: ① रैंकिंग का नमूना पूर्वाग्रह - सक्रिय उपयोगकर्ता मुख्य रूप से तकनीकी और प्रारंभिक अपनाने वाले होते हैं, और सार्वभौमिक उपयोगकर्ताओं की प्राथमिकताओं का प्रतिनिधित्व नहीं कर सकते हैं; ② प्रतिकूल हेरफेर का जोखिम - जैसे-जैसे रैंकिंग का व्यावसायिक प्रभाव बढ़ता है, मॉडल प्रयोगशाला को रैंकिंग के त्वरित शब्दों को अनुकूलित करने के लिए प्रोत्साहन मिलता है, और इस गुडहार्ट प्रभाव से निपटने के लिए रैंकिंग पद्धति को जारी रखने की आवश्यकता होती है; ③ निजीकृत परिनियोजन क्षमता का खुलासा नहीं किया गया है - डेटा संप्रभुता के लिए उच्च आवश्यकताओं वाले उद्यमों को यह पुष्टि करने की आवश्यकता है कि क्या एरेना पूरी तरह से पृथक मूल्यांकन संदर्भों का समर्थन करता है; ④ बहुभाषी कवरेज - वर्तमान मूल्यांकन डेटा मुख्य रूप से अंग्रेजी में है, और चीनी जैसे गैर-अंग्रेजी परिदृश्यों में रैंकिंग की विश्वसनीयता को सत्यापित करने की आवश्यकता है।

खरीद/गोद लेने का जोखिम मूल्यांकन: मॉडल तुलना के लिए एक संदर्भ उपकरण के रूप में, एरिना बेहद लागत प्रभावी है - फ्री टियर पहले से ही मुख्य तुलना कार्यक्षमता को कवर करता है। हालाँकि, एंटरप्राइज़-स्तरीय खरीद के लिए, तीन चरणों में आगे बढ़ने की अनुशंसा की जाती है: ① पहले 2-3 मुख्य परिदृश्यों (1 महीने) में रैंकिंग डेटा और वास्तविक अनुभव की स्थिरता को सत्यापित करने के लिए फ्री टियर का उपयोग करें; ② यदि अधिक सूक्ष्म मूल्यांकन क्षमताओं की आवश्यकता है, तो अनुकूलित समाधान और संदर्भ ग्राहक मामलों का अनुरोध करने के लिए उद्यम मूल्यांकन टीम से संपर्क करें; ③ अनुबंध पर हस्ताक्षर करने से पहले, डेटा अलगाव, परिणाम एट्रिब्यूशन और विशिष्टता शर्तों की पुष्टि करने पर ध्यान केंद्रित करें, और मूल्यांकन प्रतिक्रिया समय और डेटा उपलब्धता गारंटी को कवर करने वाले एसएलए की आवश्यकता होती है। अंतिम चयन निर्णय न केवल एरेना के मूल्यांकन डेटा पर निर्भर होना चाहिए, बल्कि इसे अपने स्वयं के व्यावसायिक परिदृश्यों और स्वतंत्र सुरक्षा आकलन के वास्तविक माप परिणामों के साथ भी जोड़ा जाना चाहिए।

संबंधित टूल: deepseek, chatgpt

एरेना का उपयोग कैसे करें

  • वेब क्लाइंट: आप आधिकारिक वेबसाइट पर जाकर और खाता पंजीकृत करके इसका उपयोग कर सकते हैं। अधिकांश फ़ंक्शनों को इंस्टॉलेशन की आवश्यकता नहीं होती है.
  • एपीआई एक्सेस: रेस्टफुल एपीआई प्रदान करता है, डेवलपर्स एपीआई कुंजी प्राप्त कर सकते हैं और इसे अपने स्वयं के अनुप्रयोगों में एकीकृत कर सकते हैं।

संस्करण जानकारी

  • एरिना प्लेटफार्म (एजेंट मोड + तथ्यपरक लीडरबोर्ड) :एक नया तथ्यपरक लीडरबोर्ड जोड़ा गया, एजेंट मोड मूल्यांकन क्षमताओं को 5 मिलियन+ मासिक इंटरैक्शन राउंड तक विस्तारित किया गया, और मल्टी-मोडल मूल्यांकन कवरेज में सुधार जारी रखा गया।
  • एजेंट मोड + फुलस्टैक कोड एरिना :बहु-चरणीय जटिल कार्यों के उद्देश्य पूर्णता दर और मतिभ्रम दर मूल्यांकन का समर्थन करने के लिए जारी एजेंट मोड; फुलस्टैक कोड एरिना रैंकिंग लॉन्च की गई।
  • नई श्रेणियाँ + मल्टीमॉडल मैक्स :कोड एरिना उपविभाजन रैंकिंग जोड़ी गई (वेबडेव/इमेज-टू-वेबडेव, आदि); मल्टीमॉडल मैक्स मल्टी-मॉडल मॉडल रूटिंग क्षमताएं जारी की गईं।
  • मैक्स मॉडल राउटर :मैक्स मॉडल रूटिंग इंजन जारी किया गया है जो 5 मिलियन से अधिक सामुदायिक वोटों के आधार पर उपयोगकर्ता के संकेतों को स्वचालित रूप से सबसे उपयुक्त मॉडल पर रूट करता है।
  • एलएमएरेना रीब्रांड → एरिना :LMArena ने ब्रांड अपग्रेड और उत्पाद विस्तार को पूरा करते हुए आधिकारिक तौर पर अपना नाम बदलकर Arena कर लिया। इसी अवधि के दौरान, इसने 150 मिलियन अमेरिकी डॉलर का सीरीज ए वित्तपोषण पूरा किया।
  • अखाड़ा विशेषज्ञ :एरिना एक्सपर्ट विशेषज्ञ-स्तरीय मूल्यांकन मोड लॉन्च किया और अधिक परिष्कृत डोमेन क्षमता मूल्यांकन आयाम और रैंकिंग पद्धति अपडेट पेश किए।
  • उद्यम मूल्यांकन लॉन्च :उद्यमों और मॉडल प्रयोगशालाओं के लिए अनुकूलित मॉडल मूल्यांकन प्रदान करने के लिए आधिकारिक तौर पर वाणिज्यिक मूल्यांकन सेवा (एआई मूल्यांकन) शुरू की गई।

उपयोगकर्ता समीक्षाएं

  • समीक्षाएं लोड हो रही हैं...