HMA (autorégression masquée hétérogène) Gratuit

-

HMA (Heterogeneous Masked Autoregression) est une méthode de modélisation dynamique d'action-vidéo de robot proposée conjointement par le MIT, Meta FAIR et l'UIUC. Grâce à un pré-entraînement autorégressif à masque hétérogène, la distribution conjointe de vidéos d'action et d'action inter-domaines est apprise sur plus de 40 ensembles de données et plus de 3 millions de trajectoires pour obtenir une simulation vidéo de robot haute fidélité en temps réel. Par rapport au SOTA précédent, la vitesse d'inférence est multipliée par 15 et peut être largement utilisée dans l'évaluation stratégique, la génération de données synthétiques et la simulation vidéo interactive.

HMA (autorégression masquée hétérogène) Interface du produit

HMA : Action de robot pour le monde réel - Modélisation dynamique vidéo

Paramètres et statistiques de base

Projet Détails
Nom du produit HMA (Autorégression masquée hétérogène)
Type de produit Modèle de recherche Open Source / Modèle du monde robotique
Formulaire de livraison Code open source (GitHub) + poids pré-entraînés (HuggingFace)
Échelle du modèle HMA-MagVit : 362 millions de paramètres ; HMA-MAR : paramètres 1B
Données de formation Plus de 40 ensembles de données, plus de 3 millions de trajectoires
Vitesse d'inférence 15 fois plus rapide que SOTA (fonctionnement en temps réel)
Licence Open Source Apache-2.0
Langues prises en charge Anglais
Utilisateurs cibles Chercheurs en robots, ingénieurs en intelligence incarnée, développeurs de simulation d'IA
Papier de base arXiv 2502.04296 (février 2025)
Page d'accueil du projet https://liruiw.github.io/hma

Interprétation des paramètres : la taille des paramètres de HMA se situe dans la plage « moyenne à grande » : la version MagVit (362M) est adaptée à l'inférence sur un seul GPU et à l'itération rapide, et la version MAR (1B) a encore amélioré la fidélité vidéo. Par rapport aux précédentes solutions de modèles de diffusion grand public (telles que UniPi et VideoPoet), HMA adopte la voie autorégressive masquée, qui présente un avantage d'un ordre de grandeur en termes de vitesse de génération (accélération 15 fois supérieure). C'est sa principale valeur d'ingénierie : pour la première fois, elle pousse la simulation vidéo robotique au seuil du « temps réel interactif ».

Reconnaissance des utilisateurs et du marché

Academic Adoption Signal : HMA a rapidement attiré l'attention de la communauté d'apprentissage en robotique après avoir été publié sur arXiv en février 2025. Les auteurs de l'article viennent du MIT CSAIL, Meta AI (FAIR) et de l'UIUC. Cette combinaison elle-même confère une forte crédibilité académique. Le référentiel GitHub du projet (github.com/liruiw/HMA) affiche actuellement 41 étoiles. Bien qu’il ne s’agisse pas d’un projet communautaire à grande échelle, compte tenu de son professionnalisme (modélisation dynamique de vidéos robotisées), ces données sont conformes aux attentes des premiers projets de recherche.

Communication tierce : HMA a été inclus dans la station de navigation de l'ensemble d'outils d'IA (ai-bot.cn), et plusieurs vidéos d'interprétation technique sont apparues sur Bilibili et d'autres plates-formes (telles que « Dernières recherches du MIT ! HMA : génération de données d'action de robot 15 fois plus rapide et de haute qualité ! »), indiquant qu'il a également attiré l'attention de la communauté technologique chinoise. L'article est classé sous cs.RO (Robotics) sur arXiv, avec des références croisées à cs.CV (Computer Vision) et cs.LG (Machine Learning), reflétant une influence interdisciplinaire.

Performances de référence : par rapport à plusieurs modèles de génération vidéo SOTA, HMA prend la tête à la fois en termes de fidélité visuelle (indicateur FVD) et de contrôlabilité (précision du suivi des actions). L'article présente des résultats qualitatifs et quantitatifs sur plusieurs ensembles de données de robots réels tels que Bridge, Dobb-E, Kaist, etc. La vidéo générée par HMA est nettement meilleure que la méthode de base en termes de rationalité physique (interaction d'objet, ombre, traitement d'occlusion).

Limites actuelles : en tant que projet de recherche universitaire, HMA ne dispose pas encore de version commerciale ni de support au niveau de l'entreprise. Sa base d’utilisateurs est principalement limitée aux équipes de recherche disposant de formations en deep learning et de capacités de déploiement de robots. Le nombre d'étoiles GitHub et l'activité de la communauté en sont à leurs débuts, et un écosystème de documentation complet et une communauté d'utilisateurs n'ont pas encore été formés.

Avantage de coût

Le modèle entièrement open source de HMA place sa structure de coûts en contraste frappant avec les outils commerciaux de simulation de robots :

Dimension du coût HMA (open source) Simulateurs de robots commerciaux (tels que NVIDIA Isaac Sim) API de génération de vidéo cloud
C-side/chercheur Entièrement gratuit, code + poids open source La version communautaire gratuite a des fonctions limitées, la version complète nécessite une licence d'entreprise Facturées au Token/seconde, les vidéos longues coûtent cher
API / Développeur Pas de couche API, vous devez déployer l'inférence par vous-même SDK Python fourni, cluster GPU requis Facturé sur demande, typique 0,01-0,10 $/seconde
Entreprise/Privé Auto-hébergé, pas de frais de licence, uniquement du matériel GPU Isaac Sim Enterprise Edition coûte plus de 10 000 $ par an Pas de soutien à la privatisation

Coût côté C : les chercheurs peuvent cloner le référentiel directement via GitHub, télécharger les poids pré-entraînés (0,4 B/1B) sur HuggingFace et exécuter une inférence et une démonstration interactive sur un seul RTX 3090/4090. Le coût du matériel est la seule véritable dépense.

Coût pour le développeur : HMA ne fournit pas d'API commerciale. Pour s'intégrer dans le flux de travail, l'équipe doit terminer elle-même la configuration de l'environnement (Python 3.10+, PyTorch, Accelerate et autres dépendances), le déploiement du modèle et la construction du pipeline d'inférence. Le coût de déploiement initial est d'environ 2 à 5 jours-homme, adapté aux équipes disposant de capacités DL Ops.

Coût d'entreprise : par rapport aux simulateurs commerciaux (NVIDIA Isaac Sim Enterprise Edition 10 000 $+/an, Amazon RoboMaker facturé à l'heure), HMA présente un avantage significatif en termes de TCO : aucune licence logicielle, mais nécessite une équipe disposant de capacités de déploiement et de réglage de modèles. Les coûts cachés se reflètent principalement dans : la préparation des données (les données de trajectoire du robot doivent être converties au format RLDS), l'adaptation du modèle après la formation (mise au point des expériences pour une ontologie de robot spécifique) et le manque de support commercial.

La vérité gratuite : HMA est entièrement gratuit et open source, mais le principe du « gratuit » est que l'utilisateur a la possibilité de créer un environnement de développement d'apprentissage profond Python et la possibilité d'obtenir des données de fonctionnement du robot. Pour les équipes sans accumulation de données robotiques, le coût de la collecte de trajectoires à partir de zéro peut dépasser le coût annuel des outils commerciaux.

Fonctions principales

  • Prédiction vidéo autorégressive masquée hétérogène : étant donné une image initiale et une séquence d'action, HMA génère de manière autorégressive les images vidéo suivantes. Contrairement au modèle de diffusion, qui est généré indépendamment image par image, le mécanisme autorégressif masqué modélise les dépendances temporelles au niveau du jeton et peut prédire plusieurs jetons futurs en une seule étape, améliorant ainsi considérablement l'efficacité de l'inférence. Tâches applicables : évaluation rapide de la restauration vidéo des stratégies du robot et visualisation des résultats de la planification.

  • Pré-formation hétérogène inter-ontologie et inter-domaines : HMA est formé conjointement sur plus de 40 ensembles de données, et les sources de données incluent de véritables téléopérations de robots (Bridge, Dobb-E, Kaist), des vidéos d'opérations humaines (EpicKitchens), des données de simulation (RLBench, MetaWorld), etc. Valeur d'usage : abaissez le seuil de déploiement de modèles dans de nouveaux scénarios de robots, en compressant la collecte de données de quelques semaines à la formation et à l'adaptation après les heures d'ouverture.

  • Génération bimodale - jeton discret et jeton continu : HMA-MagVit utilise la discrétisation VQ-VAE (362 millions de paramètres) pour générer des séquences de jetons vidéo discrets, adaptés à un contrôle précis et à une évaluation structurée ; HMA-MAR utilise une représentation continue autorégressive masquée (paramètres 1B) pour générer des jetons logiciels, dont la qualité visuelle est meilleure. Les deux partagent le même cadre de formation et peuvent être commutés en fonction des exigences de la tâche. Valeur d'utilisation : choisissez le modèle discret pour les scénarios sensibles à la précision (évaluation de la stratégie) et choisissez le modèle continu pour les scénarios priorisés en qualité visuelle (génération de démonstration).

  • Démo de simulation vidéo interactive en temps réel : Le projet fournit une démo interactive basée sur Pygame (python -m sim.app). Les utilisateurs peuvent sélectionner l'image initiale dans la galerie, utiliser les touches fléchées du clavier pour contrôler les mouvements du robot et observer les résultats de la génération vidéo en temps réel. Valeur d'usage : comprenez intuitivement le comportement du modèle et vérifiez rapidement la correspondance causale entre les actions et le retour visuel.

  • Pipeline d'évaluation des politiques et de génération de données synthétiques : HMA dispose d'un pipeline d'évaluation complet intégré qui peut calculer FVD, PSNR, SSIM et d'autres indicateurs de vidéos générées et de vidéos réelles ; il prend également en charge la génération d'un grand nombre de trajectoires synthétiques à partir d'un échantillonnage de modèles entraînés pour l'amélioration des données ou la pré-formation aux politiques. Valeur d'utilisation : compressez le cycle d'itération de la politique de « déploiement dans un environnement réel → collecte de données → recyclage » à « déploiement de simulation → données synthétiques → mise à jour de la politique », réduisant ainsi la dépendance à l'égard du matériel de robot réel et des annotations manuelles.

  • Mécanisme post-formation : HMA prend en charge le réglage fin post-formation des modèles pré-entraînés sur des ensembles de données spécifiques, et un script de réglage fin (run_langtable_finetuning.sh) pour l'ensemble de données de la table de langues a été fourni. Valeur d'usage : Adaptez-vous rapidement à des plates-formes robotiques spécifiques et à des tâches spécifiques (telles que pousser des blocs et saisir) sans formation à partir de zéro.

Evolution du modèle et de la version

Le contexte de version de HMA est basé sur des prépublications papier et la publication du code :

Version Dates Changements fondamentaux
Préimpression arXiv 2025-02-06 Le document est rendu public pour la première fois, synchronisant le référentiel de code open source GitHub et les pondérations du modèle HuggingFace
Soumission initiale du code 2025-02 (environ) Contient des pipelines complets de formation, de génération, d'évaluation et de visualisation, prenant en charge plus de 40 ensembles de données
HMA-MagVit (362M) Identique au code initial Modèle de jeton discret, basé sur VQ-VAE + autorégression masquée
HMA-MAR (1B) Identique au code initial Modèle de jeton continu, basé sur une autorégression masquée, avec un plus grand nombre de paramètres

Description de l'évolution de la version : HMA est actuellement au stade "papier open source". Le référentiel de code est une soumission initiale unique (premier commit), et il n'y a pas encore d'étiquette de version ni de version officielle. L'auteur a noté « Qualité du code : étudiant diplômé fatigué » dans le README, indiquant que le code prend la reproductibilité comme objectif principal et n'effectue pas de packaging technique. Les orientations d'évolution ultérieures devraient inclure : une plus grande adaptation des ensembles de données, une accélération de la quantification des modèles et des interfaces de packaging plus conviviales (telles que l'intégration ROS, le packaging de l'environnement Gym).

Avantages techniques

Démantèlement de la chaîne causale Mécanisme → Effet → Scénario :

  1. L'autorégression masquée remplace le modèle de diffusion : les méthodes traditionnelles de génération de vidéos robotisées (telles que UniPi) utilisent le modèle de diffusion pour générer image par image. Chaque trame nécessite un débruitage en plusieurs étapes et le délai d'inférence est élevé. HMA adopte une stratégie autorégressive masquée : masquant de manière aléatoire une partie des jetons vidéo pendant la formation, permettant au modèle de prédire le contenu masqué ; prédire tous les jetons masqués à la fois pendant l'inférence, puis affiner de manière itérative et autorégressive. Effet : réduisez le nombre d'étapes d'inférence de 50 à 1 000 étapes dans le modèle de diffusion à 8 à 16 étapes, ce qui permet d'obtenir une accélération de bout en bout 15 fois supérieure. Scénarios applicables : simulation interactive et évaluation de stratégie en ligne qui nécessitent un retour en temps réel.

  2. La formation hétérogène surmonte la rareté des données : le domaine de la robotique est depuis longtemps confronté aux problèmes de sources de données dispersées, d'ontologies différentes et de tâches diverses. HMA permet aux modèles d'être pré-entraînés conjointement sur plus de 40 ensembles de données hétérogènes via une interface de tokenisation unifiée (codage unifié de vidéos de différentes résolutions et de séquences d'action de différentes fréquences en séquences de jetons de longueur fixe). Effet : le modèle pré-entraîné démontre des capacités de planification sans échantillon sur des corps et des tâches de robot invisibles, et la post-formation peut générer plus de 100 images de données efficaces sur de nouvelles scènes avec seulement 200 trajectoires. Scénarios applicables : Déploiement rapide de nouvelles plates-formes robotiques et migration des connaissances entre ontologies.

  3. Le conditionnement d'action permet un contrôle précis : HMA non seulement épisse les jetons d'action dans l'entrée, mais utilise également un mécanisme de modulation pour permettre au signal d'action d'affecter la représentation intermédiaire de chaque couche du transformateur, plutôt que de simplement l'injecter à l'extrémité d'entrée. Effet : La vidéo générée suit strictement la séquence d'action d'entrée : la direction et la force du bloc poussoir, la trajectoire du bras robotique, etc. sont reflétées avec précision dans les résultats générés. Par rapport au modèle de génération vidéo inconditionnelle, la contrôlabilité du HMA est considérablement améliorée. Scénarios applicables : vérification de stratégie qui nécessite des contraintes de mouvement précises (telles que « Si une force dans la direction x est appliquée, comment l'objet se déplacera-t-il ? »).

  4. Le double pipeline VQ-VAE + MAR prend en compte la précision et la qualité : la branche discrète (MagVit) utilise VQ-VAE pour compresser les images vidéo en jetons discrets, garantissant la contrôlabilité du processus de génération et la répétabilité de l'évaluation ; la branche continue (MAR) exploite directement l'espace latent continu pour conserver des informations plus détaillées. Les deux partagent le même réseau fédérateur Transformer et ont de faibles coûts de commutation. Effet : Le modèle discret est meilleur pour les indicateurs quantitatifs tels que FVD et convient à une comparaison de référence ; le modèle continu est plus naturel dans l'évaluation visuelle humaine et convient à la démonstration et à la visualisation. Scénarios applicables : choisissez discret pour l'évaluation des articles académiques et choisissez continu pour la démonstration de prototype de produit.

Comment utiliser

Configuration de l'environnement

HMA nécessite Python 3.10+ et l'environnement CUDA. Il est recommandé d'utiliser Conda ou venv pour gérer les dépendances :

# Cloner le dépôt
clone git https://github.com/liruiw/HMA.git
cdHMA

#Installer les dépendances et télécharger les données (venv sera automatiquement créé)
./build.sh

# Activer l'environnement Python
source venv/bin/activer

Démo interactive

# Démarrer la démo interactive de l'interface graphique
python -m sim.app

Après le démarrage, sélectionnez l'image initiale dans la galerie, utilisez les touches fléchées du clavier pour contrôler les actions et observez les images vidéo générées par HMA en temps réel. Il s'agit du moyen le plus rapide de découvrir les capacités HMA sans pré-entraîner le modèle.

Inférence de modèle pré-entraîné

# Téléchargez le modèle pré-entraîné (doit être obtenu manuellement depuis HuggingFace)
#Inférence d'un ensemble de données unique pour générer une vidéo
python hma/generate.py \
  --checkpoint_dir data/model/step_100/ \
  --val_data_dir data/kaist_nonprehensile_converted_externally_to_rlds_magvit_max1000000_val

Évaluation du modèle

# Évaluation de modèles discrets
accélérer le lancement hma/evaluate.py \
  --checkpoint_dir "data/${RUN_NAME}/final_checkpt" \
  --val_data_dir "data/${dataset}_magvit_traj1000000_val" \
  --wandb_run_name "${RUN_NAME}"

# Évaluation continue du modèle
accélérer le lancement hma/evaluate_feature.py \
  --checkpoint_dir "data/${RUN_NAME}/final_checkpt" \
  --val_data_dir "data/${dataset}_magvit_traj1000000_val"

Pré-formation (plusieurs ensembles de données)

# Modèle de jetons VQ (discrets)
bash expériences/scripts/discrete_model/run_40datasets_waction.sh

# Modèle de jetons logiciels (continu)
bash expériences/scripts/continuous_model/run_30datasets_mar_waction.sh

Résumé de l'entrée

Entrée Objectif Exigences techniques
Dépôt GitHub Code source, scripts de formation, pipeline d'évaluation Python 3.10+, CUDA, PyTorch
Bibliothèque de modèles HuggingFace Téléchargement du poids de pré-entraînement Aucun (le téléchargement peut être utilisé à des fins d'inférence)
Page d'accueil du projet (Démo) Démonstration interactive en ligne Accès au navigateur, aucun environnement local requis
papier arXiv Principes techniques et détails expérimentaux Aucun
Démo interactive (locale) Expérience de simulation locale en temps réel Python 3.10+, Pygame, GPU recommandé

Prix des produits

HMA est un projet purement open source et la structure tarifaire est extrêmement simple :

  • Poids du modèle : licence Apache-2.0 gratuite sous la licence MIT
  • Code source : gratuit, licence Apache-2.0
  • Papiers : accès gratuit et ouvert sur arXiv
  • Démo en ligne : gratuite, la page d'accueil du projet offre une expérience en ligne HuggingFace Spaces

Il n'existe actuellement aucun niveau payant. En termes de licence commerciale, Apache-2.0 permet une utilisation, une modification et une redistribution gratuites. Cependant, pour savoir si les pondérations du modèle incluent des restrictions d'utilisation supplémentaires sur les ensembles de données tiers, il faut vérifier le contrat de licence original de chaque ensemble de données (comme les conditions d'utilisation de l'ensemble de données Bridge).

Comparaison des prix avec des produits concurrents :

Projets HMA NVIDIA Isaac Sim Google Génie Intelligence physique π0
Tarification des logiciels Gratuit L'édition communautaire est gratuite, l'édition entreprise coûte 10 000 $+/an Non divulgué Non divulgué
Coût d'inférence GPU unique auto-hébergé GPU cloud à la demande Facturation spéculative de l'API Cloud Non divulgué
Exigences en matière de données Trajectoire du robot auto-préparée Environnement de simulation intégré Aucune donnée externe requise Coopération commerciale requise
Personnalisation Entièrement ouvert Source modulaire, partiellement fermée API boîte noire Limité aux clients coopératifs

Scénarios d'application

  • Évaluation et itération rapides de la stratégie robotique : l'évaluation de la stratégie traditionnelle nécessite des déploiements répétés sur des robots réels, ce qui prend du temps et implique un risque d'usure du matériel. HMA peut être utilisé comme « modèle du monde vidéo » pour recevoir la séquence d'action produite par la stratégie, générer les résultats de prédiction vidéo correspondants et vérifier rapidement les performances qualitatives de la stratégie (si l'objectif est atteint, si l'action est fluide et si l'interaction est physiquement raisonnable). Avantages de la déduction : de « chaque évaluation nécessite un déploiement de 30 minutes du robot réel » à « 2 minutes pour terminer l'évaluation de la simulation HMA », le cycle d'itération unique est raccourci de plus de 90 %, ce qui est particulièrement adapté à la phase de sélection préliminaire précoce de la stratégie.

  • Génération de données synthétiques pour la pré-formation aux politiques : lorsque les données réelles sont limitées, la HMA est utilisée pour partir d'un petit nombre de trajectoires réelles, s'adapter à la scène cible via la post-formation, puis générer des paires vidéo-action synthétiques grâce à un échantillonnage à grande échelle. Ces données synthétiques peuvent être utilisées pour pré-entraîner l'encodeur visuel backend du modèle de politique ou comme moyen d'augmentation des données. Conseil de mise en œuvre : L'article HMA montre que l'utilisation de seulement 200 trajectoires réelles pour la post-formation peut générer plus de 100 images de données synthétiques efficaces, couvrant les cas extrêmes qui ne sont pas entièrement échantillonnés dans la distribution des données d'origine (tels que différents modes d'occlusion, changements d'éclairage).

  • Analyse et enseignement interactifs du comportement des robots : dans la recherche scientifique ou l'enseignement, les chercheurs peuvent utiliser la démo interactive de HMA pour démontrer intuitivement le retour visuel correspondant à différentes actions (telles que pousser, tirer et tourner) afin de comprendre les lois physiques de l'interaction robot-environnement. Aucun matériel robotique réel n'est requis, juste un ordinateur portable avec un GPU. Avantages de la déduction : abaissez la barrière à l'entrée pour les robots - de « la nécessité d'acheter et de maintenir une plate-forme matérielle » à « seulement un environnement logiciel », réduisant ainsi le coût de l'enseignement des robots dans les cours universitaires et de la collaboration à distance d'un ordre de grandeur.

  • Pré-recherche sur le transfert de connaissances inter-ontologiques : lorsque l'équipe doit passer d'une plate-forme robotique existante (telle que Franka) à une nouvelle plate-forme (telle que UR5), elle peut utiliser les capacités hétérogènes de pré-formation de HMA pour effectuer une post-formation avec une petite quantité de données de trajectoire de la nouvelle plate-forme afin d'évaluer rapidement si la solution de migration est réalisable sans investir dans des coûts complets de déploiement matériel. Avantages de déduction : compressez la vérification préliminaire de faisabilité sur la nouvelle plate-forme de semaines de préparation de matériel et de données à plusieurs jours d'expériences de simulation.

  • Simulation collaborative multi-robots : étant donné que la conception conditionnelle à l'action de HMA prend en charge des scénarios d'interaction multi-entités (tels que plusieurs bras de robot collaborant pour pousser des boîtes), elle peut être utilisée pour la vérification de stratégie collaborative multi-robots au-delà de la ligne de vue. La démo actuelle a démontré la capacité de simulation interactive permettant de contrôler plusieurs objets en même temps.

Personnes concernées

  • Chercheurs en algorithmes de robots : le groupe d'utilisateurs principal de HMA. Équipes qui doivent évaluer de nouvelles stratégies, générer des visualisations d’expériences comparatives ou mener des études d’ablation. HMA permet de « remplacer une partie du déploiement réel par une vidéo de simulation », réduisant ainsi directement les coûts expérimentaux. Prérequis : Familier avec PyTorch et le processus de formation en deep learning ; avoir la capacité de lire et de traiter les données de trajectoire du robot (format RLDS).

  • Étudiants diplômés en intelligence incorporée/robotique : dans les reproductions papier, les projets de cours ou les contributions open source, HMA fournit des modèles pré-entraînés prêts à l'emploi et des pipelines de formation complets qui peuvent être utilisés comme références de recherche ou méthodes de comparaison. Les démos interactives conviennent également comme outils de démonstration pédagogique. Prérequis : Avoir des capacités de configuration de base de l'environnement Python et CUDA.

  • Équipe d'algorithmes de la start-up robotique : au début du développement d'un produit, HMA peut être utilisé comme un « modèle mondial libre » pour le prototypage rapide de stratégies, réduisant ainsi la dépendance à l'égard du matériel physique du robot. Utilisation recommandée : utilisez d'abord l'ensemble de données publiques pour charger le modèle pré-entraîné et exécuter la démo, puis collectez vos propres données de robot pour une adaptation post-entraînement.

  • Constructeur de plateforme de simulation IA : une équipe technique qui doit fournir un environnement de simulation visuelle diversifié pour les robots. Les fonctionnalités hétérogènes de pré-formation de HMA et la licence Apache-2.0 le rendent adapté à l'intégration dans des plates-formes de flux de travail de niveau supérieur.

  • Ne convient pas à la foule :

    • Utilisateurs professionnels purs (aucune expérience en programmation) : HMA n'a pas d'application GUI ni d'interface sans code, toutes les opérations sont basées sur la ligne de commande et des scripts Python.
    • Utilisateurs industriels qui ont besoin d'un support commercial stable : HMA n'a aucun SLA, aucun support technique, aucune documentation au niveau de l'entreprise et n'est pas adapté aux chemins critiques dans les environnements de production.
    • Développeurs et concepteurs généraux dans des domaines non robotiques : HMA se concentre sur la modélisation de vidéos d'action de robots et ne peut pas être utilisé pour la génération vidéo générale, la création de contenu et d'autres scénarios.

Résumé et Outlook

Compétences de base : La principale contribution de HMA réside dans "l'introduction pour la première fois du paradigme autorégressif masqué dans la modélisation dynamique de la vidéo robotisée et la réalisation de percées dans l'échelle du pré-entraînement de données hétérogènes et de la vitesse d'inférence en temps réel". L'accélération 15x le fait passer de la catégorie « outil de génération hors ligne » à la catégorie « simulation interactive en temps réel », ce qui constitue une différence essentielle par rapport aux solutions de modèle de diffusion précédentes. Le modèle de licence entièrement open source (Apache-2.0) lui confère un avantage naturel en matière de diffusion dans la communauté universitaire.

Limites actuelles : (1) Faible degré d'ingénierie de code - l'auteur a auto-évalué "Qualité du code : étudiant diplômé fatigué", pas de version finale, pas de CI/CD, pas d'image Docker, le déploiement nécessite une certaine expérience technique ; (2) Préparation d'ensembles de données complexes : les ensembles de données d'action vidéo au format RLDS nécessitent des pipelines de tokenisation spécifiques ; (3) Limitations à l'échelle du modèle : les paramètres 1 B peuvent être exécutés sur des GPU grand public, mais la pré-formation complète de plus de 40 ensembles de données nécessite plusieurs clusters GPU ; (4) L'écologie communautaire n'a pas encore été formée - les documents sont principalement des papiers + README, il n'y a pas de forum et il n'y a pas d'intégration tierce connue.

Points d'observation de suivi : (1) Si l'entrepôt publiera une version officielle et la fréquence des mises à jour des points de contrôle versionnés ; (2) Existe-t-il une prise en charge intégrée des interfaces standard des robots telles que ROS/Gym ; (3) si l'équipe d'auteurs publiera une version de modèle plus grande ou affinera les poids pour des scénarios spécifiques (tels qu'une opération adroite) ; (4) si des packages tiers (tels que des images Docker, des API d'inférence HuggingFace, des blocs-notes Colab) apparaîtront dans la communauté pour abaisser le seuil d'utilisation.

Évaluation des risques d'approvisionnement/d'adoption : HMA convient comme « outil d'accélération de la pré-recherche et de l'évaluation technologique » et n'est pas recommandé comme seule dépendance de simulation pour les environnements de production à ce stade. Il est recommandé d'adopter des stratégies : (1) Tout d'abord, parcourir l'ensemble du processus avec une démonstration interactive et des ensembles de données prédéfinis pour évaluer la fidélité réelle du modèle dans son propre scénario ; (2) Commencer avec 200 propres trajectoires pour mener des expériences post-formation afin de quantifier l'effet du volant d'inertie des données ; (3) Avant de procéder à une vérification complète, maintenez un canal de sauvegarde pour le déploiement réel du robot. Pour les entreprises nécessitant un support de qualité commerciale, il est recommandé d'attendre que la version communautaire mûrisse ou d'évaluer des alternatives commerciales (telles que NVIDIA Isaac Sim, π0 de Physical Intelligence).

Outils associés : ÉquipageAI, langchain

Informations de version

  • Version initiale HMA :Il comprend deux spécifications de modèle : HMA-MagVit (paramètres 362M) et HMA-MAR (paramètres 1B), prend en charge deux modes de génération de jeton discret et de jeton continu, et fournit un code de processus complet de pré-formation, post-formation, évaluation et visualisation.
  • prépublications arXiv :L'article a été publié pour la première fois sur arXiv (2502.04296), synchronisant le code open source et les poids du modèle.

Avis des utilisateurs

  • Chargement des avis...