ऐस-अहंकार
मुफ्त
एसीई-ईगो सन्निहित बुद्धिमत्ता और रोबोट संचालन पूर्व-प्रशिक्षण के लिए एक खुला स्रोत अनुसंधान परियोजना है। यह रूपात्मक स्थिति कोडिंग के माध्यम से एक ही वीएलए मॉडल को विभिन्न रोबोट ऑन्कोलॉजी में अनुकूलित करने के लिए एक विधि का प्रस्ताव करता है, और दोहरे हाथ वाले सहयोगी ऑपरेशन परिदृश्यों में अच्छा प्रदर्शन करता है।
ACE-Ego की पूर्ण समीक्षा
मुख्य पैरामीटर और आँकड़े
| प्रोजेक्ट | विशेष विवरण |
|---|---|
| उत्पाद स्थिति | क्रॉस-ऑन्टोलॉजी सन्निहित ऑपरेशन वीएलए अनुसंधान परियोजना |
| विकास एजेंसी | एसीई रोबोटिक्स रिसर्च टीम |
| कोर टेक्नोलॉजी | एकीकृत कैमरा स्पेस एक्शन + रूपात्मक स्थिति कोडिंग |
| प्रशिक्षण डेटा | 6.0K+ घंटे का मानव प्रथम-व्यक्ति वीडियो + रोबोट/सिमुलेशन डेटा |
| मूल्यांकन बेंचमार्क | रोबोट्विन 2.0 आसान/कठिन |
| मूल्यांकन स्कोर | 91.12% / 90.62% |
| कोड स्थिति | जल्द ही आ रहा है |
ACE-Ego एक व्यावहारिक प्रश्न का उत्तर देता है: विभिन्न रोबोटों की संयुक्त संख्या, हाथ की लंबाई और ग्रिपर प्रकार अलग-अलग होते हैं। पारंपरिक दृष्टिकोण प्रत्येक रोबोट के लिए एक अलग मॉडल को प्रशिक्षित करना है। एसीई-ईगो का विचार सभी रोबोटों को अनुकूलित करने के लिए एक मॉडल का उपयोग करना है, जो मॉडल को सशर्त जानकारी के रूप में "रोबोट कैसा दिखता है" खिलाने पर निर्भर करता है।
प्रचार सत्यापन: "91.12%/90.62% सटीकता" - ये संख्याएं विशिष्ट बेंचमार्क कार्यों पर हासिल की जाती हैं, जिनमें प्लास्टिक बैग पैकेजिंग, जूता बॉक्सिंग और अन्य खुदरा संचालन परिदृश्य शामिल हैं। विभिन्न परिदृश्यों और रोबोटों के वास्तविक प्रदर्शन में उतार-चढ़ाव होगा, और बेंचमार्क परीक्षण वातावरण और वास्तविक उत्पादन लाइन वातावरण के बीच एक अंतर है।
उपयोगकर्ता और बाज़ार की पहचान
एसीई-ईगो अभी भी अकादमिक अनुसंधान चरण में है और कागजात और परियोजना पृष्ठों के माध्यम से सार्वजनिक रूप से उपलब्ध है। इसका तकनीकी मूल्य एक स्केलेबल क्रॉस-ऑन्टोलॉजी वीएलए प्री-ट्रेनिंग फ्रेमवर्क के प्रस्ताव में निहित है, जो रोबोट्विन 2.0 बेंचमार्क पर 90%+ परिणाम प्राप्त करता है। प्रोजेक्ट कोड अभी तक खुला स्रोत नहीं है, लेकिन पेपर में वर्णित समाधान मल्टी-रोबोट ऑपरेशन सीखने के लिए एक नया तकनीकी मार्ग प्रदान करता है।
प्रचार सत्यापन: "91.12%/90.62% सटीकता" - ये संख्याएं विशिष्ट बेंचमार्क कार्यों पर हासिल की जाती हैं, जिनमें प्लास्टिक बैग पैकेजिंग, जूता बॉक्सिंग और अन्य खुदरा संचालन परिदृश्य शामिल हैं। विभिन्न परिदृश्यों और रोबोटों के वास्तविक प्रदर्शन में उतार-चढ़ाव होगा, और बेंचमार्क परीक्षण वातावरण और वास्तविक उत्पादन लाइन वातावरण के बीच एक अंतर है।
लागत लाभ
| आयाम | विवरण |
|---|---|
| पेपर और प्रोजेक्ट पेज | जनता के लिए निःशुल्क |
| कोड | जल्द ही आ रहा है (खुला स्रोत होने की उम्मीद है) |
| एपीआई सेवा | प्रदान नहीं किया गया |
| व्यावसायिक लाइसेंस | अज्ञात |
निःशुल्क सत्य: शोध पत्र और परियोजना पृष्ठ निःशुल्क हैं, लेकिन परिणामों को पुन: प्रस्तुत करने के लिए आपके स्वयं के रोबोट हार्डवेयर और प्रशिक्षण कंप्यूटिंग शक्ति की आवश्यकता होती है। एक डुअल-आर्म रोबोट प्लेटफ़ॉर्म की लागत $50K-200K है, और VLA मॉडल को प्रशिक्षित करने के लिए मल्टी-कार्ड GPU क्लस्टर की आवश्यकता होती है। हार्डवेयर स्थितियों के बिना अनुसंधान टीमों के लिए, सत्यापन की लागत पेपर पढ़ने की शून्य लागत से बहुत अधिक है।
मुख्य कार्य
- ऑन्टोलॉजी में एकीकृत वीएलए: एक ही मॉडल प्रत्येक प्रकार के रोबोट के लिए अलग प्रशिक्षण की आवश्यकता के बिना, रूपात्मक स्थिति एन्कोडिंग के माध्यम से विभिन्न रोबोटों की गतिक संरचनाओं (यूआरडीएफ जानकारी) को अनुकूलित करता है। "एक रोबोट, एक मॉडल" से "एक मॉडल साझा करने वाले कई रोबोट" तक, मॉडल रखरखाव लागत बहुत कम हो जाती है।
- दोनों हथियारों के सहयोग से जटिल संचालन: खुदरा संचालन परिदृश्यों का समर्थन करता है जिनमें दोनों हथियारों के सहयोग की आवश्यकता होती है, जैसे प्लास्टिक बैग पैकेजिंग और जूता बॉक्सिंग। रोबोट संचालन में दोनों भुजाओं का समन्वय एक कठिन बिंदु है - बायां हाथ वस्तु को ठीक करता है और दाहिना हाथ ऑपरेशन करता है। गतिज श्रृंखलाओं के दो सेटों को समय और स्थान में सटीक रूप से संरेखित करने की आवश्यकता है।
- मिश्रित डेटा पूर्व-प्रशिक्षण: मानव प्रथम-व्यक्ति परिप्रेक्ष्य वीडियो (6.0K+ घंटे), रोबोट टेलीऑपरेशन डेटा और संयुक्त पूर्व-प्रशिक्षण के लिए सिमुलेशन रोलआउट डेटा का संलयन। मानव वीडियो समृद्ध परिचालन विविधता प्रदान करते हैं, रोबोट डेटा सटीक कार्रवाई एनोटेशन प्रदान करते हैं, और सिमुलेशन डेटा खोजपूर्ण संचालन प्रक्षेप पथ को पूरक करते हैं।
मॉडल और संस्करण विकास
मेनलाइन रिलीज़
- ~2026-06: एसीई-ईगो पेपर और प्रोजेक्ट पेज पहली बार प्रकाशित हुआ है, कोड जल्द ही आ रहा है।
तकनीकी लाभ
ACE-Ego की मुख्य तकनीकी सफलता यह है कि "किसी मॉडल को यह कैसे समझा जाए कि वह कैसा दिखता है।" पारंपरिक वीएलए विधि मानती है कि रोबोट का शरीर स्थिर है। ACE-Ego दो प्रमुख डिज़ाइनों के माध्यम से इस धारणा को तोड़ता है:
-
एकसमान कैमरा स्पेस क्रियाएँ: अलग-अलग रोबोटों की यांत्रिक भुजा की लंबाई और संयुक्त कोण की अलग-अलग सीमाएँ होती हैं। एक ही "आगे पकड़ो" क्रिया का संयुक्त स्थान में पूरी तरह से अलग-अलग प्रतिनिधित्व है। एसीई-ईगो कैमरा समन्वय प्रणाली में समान रूप से क्रियाओं का प्रतिनिधित्व करता है - इससे कोई फर्क नहीं पड़ता कि रोबोट कैसा दिखता है, "हाथ को स्क्रीन के सामने दाईं ओर 10 सेंटीमीटर ले जाने" का लक्ष्य कैमरा स्पेस में लगातार दर्शाया जाता है।
-
मॉर्फोलॉजिकल कंडीशन कोडिंग: रोबोट की यूआरडीएफ (यूनिफाइड रोबोट डिस्क्रिप्शन फॉर्मेट) संरचना और गतिज बाधा जानकारी को मॉडल इनपुट में जोड़ें, ताकि मॉडल को पता चले कि "मैं अब किस रोबोट का उपयोग कर रहा हूं और उसके जोड़ कैसे घूमते हैं।" इसका प्रभाव यह है कि नेटवर्क मापदंडों का एक ही सेट विभिन्न रोबोटों पर विभिन्न उप-नेटवर्क पथों को सक्रिय करता है।
कैसे उपयोग करें
ACE-Ego वर्तमान में एक शोध पत्र के रूप में सार्वजनिक रूप से उपलब्ध है, और कोड अभी तक जारी नहीं किया गया है। अनुमानित उपयोग प्रक्रिया:
- तकनीकी समाधानों के बारे में जानने के लिए प्रोजेक्ट पृष्ठ पर जाएँ
- GitHub कोड के ओपन सोर्स होने की प्रतीक्षा करें और इसे डाउनलोड करें
- दस्तावेज़ीकरण के अनुसार प्रशिक्षण वातावरण और रोबोट हार्डवेयर को कॉन्फ़िगर करें
- प्रशिक्षण-पूर्व डेटा तैयार करें या डाउनलोड करें
- लक्षित रोबोट को फाइन-ट्यून करें या सीधे उस पर तैनात करें
उत्पाद का मूल्य निर्धारण
वर्तमान में इसका कोई व्यावसायिक रूप नहीं है और यह पूरी तरह से अनुसंधान समुदाय के लिए है। यह उम्मीद की जाती है कि कोड एक अकादमिक ओपन सोर्स लाइसेंस (जैसे एमआईटी/अपाचे 2.0) के तहत खुला स्रोत होगा, और व्यावसायिक उपयोग के लिए विशिष्ट लाइसेंस शर्तों की पुष्टि की आवश्यकता होती है।
मानव-मशीन सहयोग सीमा: 100% स्वचालन: मॉडल अनुमान और रोबोटिक संचालन निष्पादन। मैन्युअल हस्तक्षेप आवश्यक है: गुणवत्ता निरीक्षण और ऑपरेशन परिणामों का यादृच्छिक निरीक्षण, असामान्य स्थितियों के लिए मैन्युअल हस्तक्षेप, और प्रशिक्षण डेटा और दृश्य डिजाइन का समायोजन। ऑन्कोलॉजी में माइग्रेट करते समय, आपको मैन्युअल रूप से पुष्टि करनी होगी कि माइग्रेशन प्रभाव अपेक्षा के अनुरूप है या नहीं।
अनुप्रयोग परिदृश्य
- रिटेल वेयरहाउसिंग संचालन का स्वचालन: प्लास्टिक बैग पैकिंग, जूता बॉक्सिंग, उत्पाद सॉर्टिंग इत्यादि जैसे दोनों हाथों का सहयोगात्मक संचालन। एसीई-ईगो की क्रॉस-ऑन्टोलॉजी क्षमता का मतलब है कि मॉडल का एक ही सेट विभिन्न प्रकार के रोबोटों पर तैनात किया जा सकता है, जो उन परिदृश्यों के लिए उपयुक्त है जहां गोदामों में कई रोबोट एक साथ चल रहे हैं।
- कई रोबोटों की एकीकृत तैनाती: रोबोट के विभिन्न ब्रांड और मॉडल कारखानों या गोदामों में मिश्रित होते हैं। ACE-Ego संचालन और रखरखाव टीम को सभी रोबोटों को प्रबंधित करने के लिए मॉडलों के एक ही सेट का उपयोग करने की अनुमति देता है, जिससे "प्रत्येक रोबोट के लिए एक AI मॉडल" के रखरखाव का बोझ कम हो जाता है।
- रोबोट कौशल हस्तांतरण अनुसंधान: एक रोबोट पर प्रशिक्षित कौशल को मॉडल की क्रॉस-ऑन्टोलॉजी क्षमता के माध्यम से दूसरे रोबोट में स्थानांतरित किया जाता है। अनुसंधान एवं विकास टीमों के लिए उपयुक्त जिन्हें विभिन्न हार्डवेयर प्लेटफार्मों के बीच परिचालन कौशल को स्थानांतरित करने की आवश्यकता होती है।
निराश परिदृश्य: यदि आपके रोबोट में केवल एक ही मॉडल है और अल्पावधि में प्रतिस्थापित नहीं किया जाएगा, तो एक विशेष रूप से प्रशिक्षित एकल वीएलए मॉडल आमतौर पर क्रॉस-ऑन्टोलॉजी मॉडल की तुलना में बेहतर प्रदर्शन करेगा - सामान्यीकरण क्षमताओं में सुधार एक विशिष्ट रोबोट पर सटीकता की कीमत पर आता है। एसीई-ईगो का मूल्य पूरी तरह से उन परिदृश्यों में परिलक्षित होता है जहां "कई मॉडलों के एकीकृत प्रबंधन" की आवश्यकता होती है।
वर्तमान सीमाएँ: कोड अभी तक खुला स्रोत नहीं है (जल्द ही आ रहा है), और तकनीकी समाधानों का मूल्यांकन केवल कागजात के माध्यम से किया जा सकता है। रोबोट्विन 2.0 का परीक्षण परिदृश्य खुदरा परिचालन है, और अन्य परिदृश्यों (जैसे सटीक असेंबली, मेडिकल सर्जरी) में सामान्यीकरण क्षमता को सत्यापित नहीं किया गया है।
लागू लोग
- सन्निहित इंटेलिजेंस शोधकर्ता: अकादमिक शोधकर्ता वीएलए, क्रॉस-ऑन्टोलॉजी सामान्यीकरण और मल्टी-टास्क रोबोट लर्निंग पर ध्यान केंद्रित कर रहे हैं।
- रोबोट एल्गोरिथम टीम: एल्गोरिथम इंजीनियर जिन्हें एक ही समय में कई रोबोट ऑन्कोलॉजी का प्रबंधन करने और क्रॉस-ऑन्टोलॉजी मॉडल और सिंगल-बॉडी मॉडल के लागत प्रदर्शन का मूल्यांकन करने की आवश्यकता होती है।
- रिटेल और वेयरहाउसिंग ऑटोमेशन टीम: वास्तविक ऑपरेशन परिदृश्य में एक इंजीनियरिंग टीम शामिल होती है जो कई प्रकार के रोबोटों के साथ सहयोग करती है।
सारांश और आउटलुक
यह अपने क्षेत्र में प्रतिस्पर्धी समाधान प्रदान करता है, और इसका मुख्य मूल्य इस क्षेत्र में एआई के उपयोग की सीमा को कम करने में निहित है।
वर्तमान सीमाएँ: कुछ उन्नत सुविधाओं के लिए सशुल्क सदस्यता की आवश्यकता होती है, और मुफ़्त संस्करण में फ़ंक्शन या उपयोग प्रतिबंध हैं; विशिष्ट तकनीकी विवरण और प्रदर्शन बेंचमार्क अभी तक पूरी तरह से प्रकट नहीं किए गए हैं।
संबंधित टूल: <एक्सलिंक टाइप='टूल' स्लग='हगिंग-फेस'>, <एक्सलिंक टाइप='टूल' स्लग='रेप्लिकेट'>
संस्करण जानकारी
- ऐस-अहंकार :पहला सार्वजनिक पेपर और प्रोजेक्ट पेज, GitHub कोड जल्द ही आ रहा है, अभी तक कोई आधिकारिक सटीक तारीख नहीं है।
- ऐस-अहंकार :पहली सार्वजनिक रिलीज़, अभी तक कोई आधिकारिक सटीक तारीख़ नहीं।
उपयोगकर्ता समीक्षाएं