Zéro absolu
Gratuit
Absolute Zero est un paradigme de formation de modèle d'inférence de données artificielles zéro proposé par l'Université Tsinghua et d'autres institutions. L'idée principale est d'utiliser un modèle de langage à la fois comme proposant et comme solveur, fournissant des signaux de récompense vérifiables via l'exécuteur de code et améliorant continuellement les capacités de code et de raisonnement mathématique sans avoir besoin d'annotation manuelle.
Revue complète d'Absolute Zero
Paramètres et statistiques de base
| Projet | Spécifications |
|---|---|
| Positionnement du produit | Paradigme de formation du modèle d'inférence sans données |
| Agence de développement | LeapLab de l'Université Tsinghua, BIGAI, Université d'État de Pennsylvanie |
| Licence Open Source | Licence MIT |
| Parcours technique | Auto-jeu d'apprentissage par renforcement + vérification de l'exécuteur de code |
| Taille du modèle | 3B / 7B / 14B (contrôle public prévu) |
| Ressources de formation | GPU 3B ≈ 2 × 80 Go ; GPU 7B ≈ 4 × 80 Go ; 14B ≈ 8×80 Go GPU |
| Mode d'inférence | Déduction, enlèvement, induction |
| Adresse papier | arxiv.org/abs/2505.03335 |
Vous vous demandez peut-être : Absolute Zero est-il un produit ? Non, il s'agit plutôt d'une méthode de formation « laisser le modèle apprendre tout seul ». C'est comme si un étudiant rédigeait ses propres copies de test, répondait aux questions, les corrigeait lui-même, puis apprenait de ses erreurs - l'ensemble du processus ne nécessite pas la participation d'un enseignant (annotateur humain).
Reconnaissance des utilisateurs et du marché
Absolute Zero a été rendu public via un article arXiv en mai 2025, et la mise en œuvre complète était open source sur GitHub et Hugging Face au cours de la même période. Bien qu'il ne s'agisse pas d'un produit SaaS destiné au grand public, il a attiré l'attention de la communauté des chercheurs car il répond à une question fondamentale dans le domaine du LLM : comment les modèles peuvent-ils s'améliorer lorsqu'ils manquent de données étiquetées par l'homme ? **
- Influence académique : Le paradigme du « raisonnement sans données » proposé dans l'article remet directement en question la voie traditionnelle du RLHF reposant sur des préférences artificielles et fournit une nouvelle voie pratique pour le RLVR (apprentissage par renforcement avec des récompenses vérifiables).
- Activité communautaire : le référentiel GitHub est très complet (comprenant le code de formation, les évaluations, les outils de conversion de poids du modèle et les journaux W&B), et les chercheurs peuvent reproduire directement les résultats de l'article. Le nombre spécifique d'étoiles est soumis aux données en temps réel de l'entrepôt.
- Analyse comparative de l'industrie : complémentaire à la formation au raisonnement par apprentissage par renforcement de DeepSeek-R1 et à l'idée de raisonnement en chaîne d'OpenAI o1 - mais Absolute Zero est plus radical en insistant sur "zéro données artificielles".
Avantage de coût
| Dimensions de facturation | Statut actuel |
|---|---|
| Cadre et code | MIT open source et gratuit |
| Point de contrôle du modèle | Hugging Face téléchargement public |
| Service API | Non fourni |
| Support technique d'entreprise | Non divulgué |
La vérité gratuite : le code et les modèles sont gratuits, mais la formation nécessite un véritable GPU. Les configurations de référence officielles (environ 2 A100-80 Go pour le modèle 3B et 8 pour le modèle 14B) signifient que le coût du GPU cloud pour une expérience typique varie de plusieurs milliers à plusieurs dizaines de milliers de dollars. Ce qui est « gratuit », c'est le logiciel, ce qui est cher, c'est la puissance de calcul.
Stratification des coûts
- Chercheurs côté C/individuels : vous pouvez utiliser le point de contrôle 3B officiellement fourni pour des expériences d'inférence et de réglage fin. 8 A100-80 Go coûte environ 16 à 24 $ US/heure. Si vous avez uniquement besoin de faire de l'inférence plutôt que de procéder à un recyclage, une seule carte dotée de 24 Go de mémoire vidéo peut exécuter un modèle 3B.
- Développeur/API : Pas d'API publique, vous devez créer votre propre service d'inférence.
- Entreprise/Institution : Si vous devez reproduire le processus de formation sur des données internes, vous devez préparer votre propre cluster GPU. La licence MIT autorise une utilisation commerciale, mais le README indique clairement que l'exécuteur Python est limité à une utilisation en recherche et que la sécurité de la production doit être renforcée par vous-même.
Avantages cachés : Pour les équipes recherchant des méthodes de formation par inférence, Absolute Zero fournit une base de référence hautement technique : code de formation/évaluation complet, contexte de jeu personnel et système de journalisation, permettant à l'équipe de réaliser une expérience de formation par inférence de données nulles de bout en bout en quelques jours, alors qu'il faut environ plusieurs mois pour créer la même charge de travail à partir de zéro.
Vérification de la publicité : l'article revendique « zéro donnée artificielle » - « zéro donnée » fait ici référence à des paires de questions et réponses qui ne reposent pas sur une annotation manuelle, mais le modèle nécessite toujours un corpus de pré-formation massif et un contexte d'exécution de code comme connaissances préalables. « Zéro donnée » n’équivaut pas à « zéro coût ». Il faut distinguer les dépendances entre la phase de formation et la phase de pré-formation.
Fonctions principales
- Génération de tâches autonomes (Proposer) : le modèle génère lui-même des tâches de programmation ou de mathématiques « apprenables », plutôt que de s'appuyer sur une sélection manuelle des banques de questions. La difficulté des tâches s'ajuste dynamiquement avec les progrès de l'apprentissage - des simples opérations sur une seule ligne en Python aux problèmes complexes d'algorithmes en plusieurs étapes.
- Task Autonomous Solver (Solver) : Le modèle résout les tâches qu'il propose et vérifie l'exactitude des réponses via l'exécuteur Python. La « définition de problèmes » et la « résolution de problèmes » sont complétées par différents modes de raisonnement du même modèle, et les paramètres partagés sont optimisés conjointement.
- Mode de raisonnement triple : prend en charge le raisonnement déductif (dérivant des conclusions à partir de règles), le raisonnement abductif (déduisant les causes à partir d'observations) et le raisonnement inductif (résumant les règles à partir d'exemples). Les trois modes couvrent les principaux types de raisonnement humain, faisant du modèle plus qu'un simple « calcul rapide ».
- Processus de formation sans données : ne repose sur aucune donnée étiquetée manuellement ni sur des paires de questions et réponses prédéfinies. Le modèle obtient des signaux de récompense vérifiables grâce à une interaction contextuelle avec l'exécution de code et continue de s'améliorer au cours du cycle d'auto-jeu.
Evolution du modèle et de la version
Version principale
- ~2025-05 : Première version publique d'Absolute Zero Reasoner. L'article arXiv (2505.03335) explique la théorie du paradigme d'inférence sans données. GitHub synchronise open source le référentiel de code complet, y compris les points de contrôle de formation et d'évaluation.
Le projet en est à ses premiers stades de recherche et n'a pas encore formé de système d'itération multi-versions. L'évolution ultérieure peut inclure : des exécuteurs de code plus sécurisés, la prise en charge d'un plus grand nombre de types de tâches (tels que le raisonnement scientifique, le raisonnement logique) et des expériences de formation pour des modèles à plus grande échelle.
Avantages techniques
Analyse des mécanismes : Comment le modèle s'apprend-il ?
Le lien technologique de base d'Absolute Zero se compose de quatre rôles :
┌──────────────────────────── ────────────────────────────┐
│ Proposeur (questionnaire) ← → Solveur (résolveur de problèmes) │
│ ↓ ↓ │
│ Générer une description de tâche, générer un processus de résolution de problèmes et des réponses │
│ ↓ ↓ │
│ ┌──────────────── Exécuteur de code ──────────────────┐ │
│ │ ① Vérifier si la tâche est exécutable et non triviale │ │
│ │ ② Exécutez le code de résolution de problèmes et vérifiez si le résultat est correct │ │
│ │ ③ Renvoie un signal de récompense vérifiable (récompense d'apprentissage + récompense d'exactitude) │ │
│ └──────────────────────── ─────────────────────────┘ │
│ ↓ │
│ Optimiseur TRR++ → mettre à jour conjointement les paramètres Proposer et Solver │
└─────────────────────────── ────────────────────────────┘
-
Les récompenses vérifiables remplacent les préférences artificielles : le RLHF traditionnel s'appuie sur des annotateurs humains pour classer les préférences de sortie du modèle, tandis qu'Absolute Zero utilise la réussite/l'échec des exécuteurs de code comme récompenses objectives. L'effet est de supprimer la subjectivité et l'incohérence des préférences humaines, rendant le signal d'entraînement plus propre et plus évolutif. Convient aux domaines où les règles peuvent être vérifiées par des programmes (code, mathématiques).
-
Apprentissage de cours en auto-jeu : le proposant génère automatiquement des tâches de « difficulté optimale » proches de la limite de capacité actuelle - les questions trop faciles ne seront pas récompensées (car elles n'ont aucune valeur d'apprentissage) et les questions trop difficiles ne seront pas résolues et ne seront pas récompensées. L'effet est que le processus de formation forme automatiquement une courbe d'apprentissage du programme et que le modèle est toujours formé au « bord de la zone de confort ». Convient aux modèles d'inférence qui nécessitent une grande diversité pour la formation.
-
Optimisation conjointe TRR++ : améliorée sur la base du GRPO/PPO traditionnel, tout en optimisant la stratégie de génération de tâches du proposant et la stratégie de résolution de problèmes du solveur. L'effet est que les deux personnages progressent ensemble dans la confrontation - celui qui pose les questions devient de plus en plus "rusé", et celui qui résout le problème devient de plus en plus "fort", formant ainsi une spirale de rétroaction positive.
-
Comportement de raisonnement émergent : dans l'affichage officiel, après l'entraînement, le modèle a spontanément montré des comportements de raisonnement d'ordre élevé tels que la planification des annotations (écrire d'abord les étapes de planification des annotations, puis écrire le code), le retour en arrière par essais et erreurs (revenir à une nouvelle tentative en cas d'erreur), l'auto-vérification (vérification automatique après résolution du problème), et ces comportements n'ont pas été explicitement démontrés dans les données d'entraînement.
Comment utiliser
Absolute Zero s’adresse aux chercheurs. L'entrée est le référentiel GitHub et les outils de ligne de commande. Il n'y a pas d'interface graphique.
Reproduire les résultats de l'article :
clone git https://github.com/LeapLabTHU/Absolute-Zero-Reasoner
cd Absolu-Zéro-Raisonneur
# Configurer le contexte Conda selon README
conda env créer -f environnement.yaml
conda active le zéro absolu
# Télécharger le point de contrôle pré-formation
# Référez-vous à la collection Hugging Face : https://huggingface.co/collections/andrewzh/absolute-zero-reasoner
#Exécuter une évaluation d'inférence
python eval.py --model Absolute-zero-3b --code de référence
# Démarrez l'entraînement en auto-jeu (nécessite un GPU ≥ 4 × 80 Go)
python train_selfplay.py --model base-3b --output ./experiment
Puisqu'il s'agit d'un cadre de recherche, les utilisateurs doivent avoir des connaissances de base en gestion de cluster GPU, en développement Python et en apprentissage par renforcement. Les actionneurs fournis par le projet ne sont pas adaptés aux environnements de production. Si vous devez exécuter du code utilisateur en toute sécurité, vous devez le renforcer vous-même.
Prix des produits
| Projet | Descriptif |
|---|---|
| Licence logicielle | Licence MIT, gratuite et open source |
| Matériel de formation | Minimum 2 × A100-80 Go (expérience sur le modèle 3B) |
| Matériel d'inférence | Une seule carte avec 24 Go de mémoire vidéo peut exécuter le point de contrôle 3B |
| Coût du GPU Cloud | Environ 1 500 à 8 000 $ pour une expérience de reproduction complète |
| API métier | Non disponible |
Scénarios d'application
- Recherche sur les modèles d'inférence : les équipes de recherche peuvent utiliser Absolute Zero comme cadre de base pour la formation à l'inférence sans données. Par rapport à la mise en œuvre d'un système de formation en auto-jeu à partir de zéro, un pipeline complet basé sur Absolute Zero peut réduire le temps de démarrage de l'expérience de plusieurs mois à quelques jours - il suffit de créer l'entrepôt, de configurer le contexte et d'ajuster les hyperparamètres.
- Model Capability Boundary Exploration : Étudier « jusqu'où un modèle peut aller sans apport de données humaines » et évaluer les conditions et les limites de l'émergence de capacités de raisonnement. Il convient aux expériences de recherche sur la sécurité de l’IA, les limites des capacités et les orientations comportementales émergentes.
- Expérience de méthode de formation par apprentissage par renforcement : testez l'impact de différentes conceptions de récompenses, stratégies de jeu personnel et combinaisons de modes de raisonnement sur la capacité de raisonnement du modèle. La conception modulaire du projet (actionneurs remplaçables, fonctions de récompense, stratégies d'inférence) facilite les variations expérimentales.
Ne convient pas aux limites : Ne convient pas comme bac à sable d'exécution de code lié à la production (l'exécuteur intégré est marqué pour une utilisation en recherche) ; ne convient pas à une utilisation directe par des développeurs individuels sans ressources GPU ; ne convient pas aux scénarios commerciaux qui nécessitent des services d'inférence prêts à l'emploi.
Personnes concernées
- Chercheurs en formation LLM : les chercheurs qui se concentrent sur l'apprentissage par renforcement et l'auto-jeu de la capacité de raisonnement peuvent utiliser Absolute Zero comme base expérimentale et comme base de référence papier.
- Frontier Model Team Engineer : une équipe technique qui essaie la méthode de formation par inférence de données nulles basée sur des modèles existants pour évaluer si la méthode est adaptée à sa propre échelle de modèle et à ses propres scénarios de tâches.
- Chercheur en sécurité et alignement de l'IA : recherchez si le comportement du modèle est contrôlable dans le cadre du paradigme « d'auto-apprentissage et d'auto-apprentissage », si les récompenses sont piratées et si les comportements émergents sont prévisibles.
Ne convient pas aux personnes : Chefs de produit ou utilisateurs professionnels ayant une formation non technique (expérience en programmation et en ingénierie ML requise) ; les développeurs individuels qui manquent de budget de cluster GPU ; équipes d'ingénierie qui ont besoin d'API d'inférence de niveau production.
Résumé et Outlook
Absolute Zero représente une voie technique complètement différente du RLHF traditionnel : remplacer le feedback humain par un feedback contextuel. Cela prouve que dans le domaine du code et du raisonnement mathématique, les modèles peuvent continuer à s'améliorer grâce au processus « d'auto-génération, d'auto-résolution et d'auto-vérification » sans avoir besoin d'un flux constant d'annotations manuelles. En tant que prototype de recherche, la version actuelle est exceptionnelle en termes d'exhaustivité de la chaîne d'outils de formation, mais il existe encore un écart technique entre la méthodologie de laboratoire et le cadre de formation réalisable.
Limites actuelles : Le seuil de ressources de formation est élevé (le modèle 14B nécessite 8 cartes de A100) ; l'exécuteur de code intégré est destiné à un usage de recherche et n'est pas sûr pour la production ; le projet en est à ses débuts et le soutien et la documentation de la communauté doivent être améliorés ; l'effet des capacités de raisonnement dans des domaines autres que le code/mathématiques (raisonnement de bon sens, réponse à des questions dans le domaine ouvert) n'a pas été entièrement vérifié.
Évaluation des risques d'acquisition/adoption : en tant que projet universitaire open source, Absolute Zero n'a aucun engagement de commercialisation. Il est recommandé à l’équipe de recherche de l’utiliser comme référence technique et base expérimentale ; la sélection d'une plate-forme de formation de qualité industrielle doit évaluer la compatibilité avec le système MLOps interne, le coût du renforcement de la sécurité des actionneurs et l'investissement humain dans la maintenance à long terme. La licence MIT est compatible avec une utilisation commerciale, mais il est recommandé de confirmer les conditions de conformité des modèles dérivés avant de former votre propre modèle.
Outils associés : hugging-face, replicate
Informations de version
- Raisonneur du zéro absolu :La première implémentation publique complète, comprenant le code de formation, le modèle de point de contrôle, le mode de raisonnement (déduction/abduction/induction) et le script d'évaluation, pas encore de date officielle précise.
- Raisonneur du zéro absolu :L'implémentation complète est divulguée pour la première fois, y compris le code de formation, le point de contrôle du modèle, le mode d'inférence et le script d'évaluation. Il n’y a pas encore de date officielle précise.
Avis des utilisateurs