ACE-Ego
Gratuit
ACE-Ego est un projet de recherche open source pour la pré-formation en intelligence incarnée et en fonctionnement des robots. Il propose une méthode pour adapter le même modèle VLA à différentes ontologies de robots grâce au codage des conditions morphologiques, et fonctionne bien dans les scénarios d'opérations collaboratives à deux bras.
Revue complète de #ACE-Ego
Paramètres et statistiques de base
| Projet | Spécifications |
|---|---|
| Positionnement du produit | Projet de recherche VLA sur l'opération incarnée de l'ontologie croisée |
| Agence de développement | Équipe de recherche en robotique ACE |
| Technologie de base | Action spatiale de caméra unifiée + codage des conditions morphologiques |
| Données de formation | Plus de 6 000 heures de vidéo humaine à la première personne + données de robot/simulation |
| Référence d'évaluation | RoboTwin 2.0 Facile/Difficile |
| Note d'évaluation | 91,12% / 90,62% |
| Statut du code | À venir |
ACE-Ego répond à une question pratique : différents robots ont des numéros d'articulation, des longueurs de bras et des types de pinces différents. L'approche traditionnelle consiste à former un modèle distinct pour chaque robot. L'idée d'ACE-Ego est d'utiliser un modèle pour s'adapter à tous les robots, en s'appuyant sur l'alimentation "à quoi ressemble le robot" comme information conditionnelle au modèle.
Vérification de la publicité : « Précision de 91,12 %/90,62 % » - ces chiffres sont obtenus sur des tâches de référence spécifiques, notamment l'emballage de sacs en plastique, la mise en boîte de chaussures et d'autres scénarios d'opérations de vente au détail. Les performances réelles des différents scénarios et robots fluctueront et il existe un écart entre l'environnement de test de référence et l'environnement réel de la chaîne de production.
Reconnaissance des utilisateurs et du marché
ACE-Ego est encore au stade de la recherche universitaire et est accessible au public via des articles et des pages de projets. Sa valeur technique réside dans la proposition d'un cadre de pré-formation VLA inter-ontologies évolutif, qui atteint plus de 90 % de résultats sur le benchmark RoboTwin 2.0. Le code du projet n'est pas encore open source, mais la solution décrite dans le document offre une nouvelle voie technique pour l'apprentissage du fonctionnement de plusieurs robots.
Vérification de la publicité : « Précision de 91,12 %/90,62 % » - ces chiffres sont obtenus sur des tâches de référence spécifiques, notamment l'emballage de sacs en plastique, la mise en boîte de chaussures et d'autres scénarios d'opérations de vente au détail. Les performances réelles des différents scénarios et robots fluctueront et il existe un écart entre l'environnement de test de référence et l'environnement réel de la chaîne de production.
Avantage de coût
| Dimensions | Descriptif |
|---|---|
| Page article et projet | Gratuit pour le public |
| Code | Bientôt disponible (devrait être open source) |
| Service API | Non fourni |
| Licence commerciale | Non divulgué |
Vérité gratuite : les documents de recherche et les pages de projets sont gratuits, mais la reproduction des résultats nécessite votre propre matériel robotique et votre propre puissance de calcul d'entraînement. Le coût d'une plate-forme robotique à deux bras est compris entre 50 000 et 200 000 dollars, et la formation du modèle VLA nécessite un cluster GPU multi-cartes. Pour les équipes de recherche sans conditions matérielles, le coût de la vérification est bien supérieur au coût nul de la lecture des articles.
Fonctions principales
- VLA unifié sur toute l'ontologie : le même modèle s'adapte aux structures cinématiques (informations URDF) de différents robots grâce à un codage des conditions morphologiques, sans avoir besoin d'une formation séparée pour chaque type de robot. De « un robot, un modèle » à « plusieurs robots partageant un modèle », les coûts de maintenance des modèles sont considérablement réduits.
- Opérations complexes avec coopération des deux armes : prend en charge les scénarios d'opérations de vente au détail qui nécessitent la coopération des deux armes, tels que l'emballage de sacs en plastique et la mise en boîte de chaussures. La coordination des deux bras est un point difficile dans le fonctionnement du robot : la main gauche fixe l'objet et la main droite effectue l'opération. Les deux ensembles de chaînes cinématiques doivent être alignés avec précision dans le temps et dans l’espace.
- Pré-formation à données mixtes : Fusion de vidéos en perspective humaine à la première personne (plus de 6 000 heures), de données de téléopération de robot et de données de déploiement de simulation pour une pré-formation conjointe. Les vidéos humaines offrent une riche diversité opérationnelle, les données des robots fournissent des annotations d'actions précises et les données de simulation complètent les trajectoires opérationnelles exploratoires.
Evolution du modèle et de la version
Version principale
- ~2026-06 : L'article et la page du projet ACE-Ego sont publiés pour la première fois, code Coming Soon.
Avantages techniques
La principale avancée technologique d'ACE-Ego est de « comment faire comprendre à un modèle à quoi il ressemble ». La méthode VLA traditionnelle suppose que le corps du robot est fixe. ACE-Ego brise cette hypothèse à travers deux conceptions clés :
-
Actions spatiales uniformes de la caméra : différents robots ont différentes longueurs de bras mécaniques et différentes plages d'angles d'articulation. La même action « saisir en avant » a des représentations complètement différentes dans l’espace articulaire. ACE-Ego représente les actions de manière uniforme dans le système de coordonnées de la caméra : quelle que soit l'apparence du robot, l'objectif de « déplacer la main de 10 centimètres vers l'avant droit de l'écran » est systématiquement représenté dans l'espace de la caméra.
-
Codage des conditions morphologiques : ajoutez la structure URDF (Unified Robot Description Format) du robot et les informations de contrainte cinématique à l'entrée du modèle, afin que le modèle sache "quel robot j'utilise actuellement et comment ses articulations tournent". L’effet est que le même ensemble de paramètres réseau active différents chemins de sous-réseau sur différents robots.
Comment utiliser
ACE-Ego est actuellement accessible au public sous forme de document de recherche et le code n'a pas encore été publié. Processus d'utilisation estimé :
- Visitez la page du projet pour en savoir plus sur les solutions techniques
- Attendez que le code GitHub soit open source et téléchargez-le
- Configurez l'environnement de formation et le matériel du robot conformément à la documentation
- Préparez ou téléchargez les données de pré-entraînement
- Affiner ou déployer directement sur le robot cible
Prix des produits
Il n’existe actuellement aucune forme commerciale et elle est entièrement destinée à la communauté des chercheurs. Il est prévu que le code soit open source sous une licence académique open source (telle que MIT/Apache 2.0), et son utilisation commerciale nécessite la confirmation des conditions de licence spécifiques.
Limite de collaboration homme-machine : 100 % d'automatisation : inférence de modèle et exécution d'opérations robotiques. Une intervention manuelle est nécessaire : inspection de la qualité et inspection aléatoire des résultats de l'opération, intervention manuelle en cas de situations anormales et ajustement des données de formation et de la conception des scènes. Lors de la migration entre ontologies, vous devez confirmer manuellement si l'effet de migration est comme prévu.
Scénarios d'application
- Automatisation des opérations d'entreposage de détail : opérations collaboratives des deux bras telles que l'emballage de sacs en plastique, la mise en boîte de chaussures, le tri de produits, etc. La capacité d'ontologie croisée d'ACE-Ego signifie que le même ensemble de modèles peut être déployé sur différents types de robots, ce qui convient aux scénarios dans lesquels plusieurs robots fonctionnent simultanément dans les entrepôts.
- Déploiement unifié de plusieurs robots : Différentes marques et modèles de robots sont mélangés dans les usines ou les entrepôts. ACE-Ego permet à l'équipe d'exploitation et de maintenance d'utiliser le même ensemble de modèles pour gérer tous les robots, réduisant ainsi la charge de maintenance d'« un modèle d'IA pour chaque robot ».
- Recherche sur le transfert de compétences des robots : les compétences formées sur un robot sont transférées à un autre robot grâce à la capacité d'ontologie croisée du modèle. Convient aux équipes R&D qui ont besoin de migrer leurs compétences opérationnelles entre différentes plates-formes matérielles.
Scénario de dissuasion : si votre robot n'a qu'un seul modèle et ne sera pas remplacé à court terme, un modèle VLA unique spécialement formé fonctionnera généralement mieux qu'un modèle multi-ontologie - l'amélioration des capacités de généralisation se fait au détriment de la précision sur un robot spécifique. La valeur d'ACE-Ego se reflète pleinement dans les scénarios où une « gestion unifiée de plusieurs modèles » est requise.
Limites actuelles : Le code n'est pas encore open source (à venir) et les solutions techniques ne peuvent être évaluées que par le biais d'articles. Le scénario de test de RoboTwin 2.0 concerne les opérations de vente au détail, et la capacité de généralisation dans d'autres scénarios (tels que l'assemblage de précision, la chirurgie médicale) n'a pas été vérifiée.
Personnes concernées
- Chercheurs en intelligence incorporée : chercheurs universitaires se concentrant sur le VLA, la généralisation inter-ontologies et l'apprentissage robotique multitâche.
- Équipe d'algorithmes de robots : ingénieurs en algorithmes qui doivent gérer plusieurs ontologies de robots en même temps et évaluer le rapport coût-performance des modèles inter-ontologies et des modèles à corps unique.
- Équipe d'automatisation de la vente au détail et de l'entreposage : le scénario de fonctionnement réel implique une équipe d'ingénierie coopérant avec plusieurs types de robots.
Résumé et Outlook
Elle propose des solutions compétitives dans son domaine et sa valeur fondamentale réside dans l’abaissement du seuil d’utilisation de l’IA dans ce domaine.
Limites actuelles : Certaines fonctionnalités avancées nécessitent un abonnement payant et la version gratuite comporte des restrictions de fonction ou d'utilisation ; les détails techniques spécifiques et les critères de performance n’ont pas encore été entièrement divulgués.
Outils associés : hugging-face, replicate
Informations de version
- ACE-Ego :Premier article public et page du projet, code GitHub Coming Soon, pas encore de date officielle précise.
- ACE-Ego :Première sortie publique, pas encore de date officielle précise.
Avis des utilisateurs