Absoluter Nullpunkt
Kostenlos
Absolute Zero ist ein Trainingsparadigma für ein Modell ohne künstliche Dateninferenz, das von der Tsinghua-Universität und anderen Institutionen vorgeschlagen wurde. Die Kernidee besteht darin, ein Sprachmodell sowohl als Vorschlager als auch als Löser zu verwenden, überprüfbare Belohnungssignale durch den Code-Executor bereitzustellen und die Code- und mathematischen Argumentationsfähigkeiten kontinuierlich zu verbessern, ohne dass manuelle Anmerkungen erforderlich sind.
Vollständige Rezension von Absolute Zero
Kernparameter und Statistiken
| Projekt | Spezifikationen |
|---|---|
| Produktpositionierung | Trainingsparadigma für Null-Daten-Inferenzmodelle |
| Entwicklungsagentur | Tsinghua University LeapLab, BIGAI, Pennsylvania State University |
| Open-Source-Lizenz | MIT-Lizenz |
| Technische Route | Reinforcement Learning Self-Game + Code-Executor-Verifizierung |
| Modellgröße | 3B / 7B / 14B (öffentlicher Kontrollpunkt vorhanden) |
| Schulungsressourcen | 3B ≈ 2×80GB GPU; 7B ≈ 4×80GB GPU; 14B ≈ 8×80GB GPU |
| Inferenzmodus | Abzug, Abduktion, Induktion |
| Papieradresse | arxiv.org/abs/2505.03335 |
Sie fragen sich vielleicht: Ist Absolute Zero ein Produkt? Nein, es ist eher eine Trainingsmethode, bei der sich das Modell selbst etwas beibringen lässt. Es ist so, als würde ein Schüler seine eigenen Prüfungsarbeiten schreiben, die Fragen beantworten, sie selbst korrigieren und dann aus seinen Fehlern lernen – der gesamte Prozess erfordert nicht die Beteiligung eines Lehrers (menschlicher Annotator).
Benutzer- und Markterkennung
Absolute Zero wurde im Mai 2025 durch ein arXiv-Papier öffentlich veröffentlicht, und die vollständige Implementierung wurde im gleichen Zeitraum als Open Source auf GitHub und Hugging Face bereitgestellt. Obwohl es sich nicht um ein SaaS-Produkt für die breite Öffentlichkeit handelt, hat es in der Forschungsgemeinschaft Aufmerksamkeit erregt, weil es eine grundlegende Frage im Bereich LLM beantwortet: Wie können sich Modelle verbessern, wenn ihnen die vom Menschen markierten Daten ausgehen? **
- Akademischer Einfluss: Das im Papier vorgeschlagene „Zero Data Reasoning“-Paradigma stellt den traditionellen Weg des RLHF, der auf künstlichen Präferenzen basiert, direkt in Frage und bietet einen neuen praktischen Weg für RLVR (Reinforcement Learning mit überprüfbaren Belohnungen).
- Community-Aktivität: Das GitHub-Repository ist sehr vollständig (einschließlich Trainingscode, Auswertungen, Tools zur Modellgewichtsumrechnung und W&B-Protokollen), und Forscher können die Ergebnisse des Papiers direkt reproduzieren. Die genaue Anzahl der Sterne unterliegt den Echtzeitdaten aus dem Lager.
- Branchen-Benchmarking: Ergänzt das Reinforcement Learning Reasoning-Training von DeepSeek-R1 und die Chain Reasoning-Idee von OpenAI o1 – aber Absolute Zero ist radikaler und besteht auf „null künstlichen Daten“.
Kostenvorteil
| Abrechnungsdimensionen | Aktueller Stand |
|---|---|
| Framework und Code | MIT Open Source und kostenlos |
| Modellprüfpunkt | Hugging Face öffentlicher Download |
| API-Dienst | Nicht bereitgestellt |
| Technischer Support für Unternehmen | Nicht bekannt gegeben |
Die freie Wahrheit: Der Code und die Modelle sind kostenlos, aber das Training erfordert eine echte GPU. Die offiziellen Referenzkonfigurationen – etwa 2 A100-80 GB für das 3B-Modell und 8 für das 14B-Modell – bedeuten, dass die Cloud-GPU-Kosten für ein typisches Experiment zwischen Tausenden und Zehntausenden Dollar liegen. Das „Kostenlose“ ist die Software, das Teure ist die Rechenleistung.
Kostenschichtung
- C-seitige/einzelne Forscher: Sie können den offiziell bereitgestellten 3B-Checkpoint für Inferenz- und Feinabstimmungsexperimente verwenden. 8 A100-80 GB kosten etwa 16–24 US-Dollar/Stunde. Wenn Sie nur Inferenzen durchführen und nicht erneut trainieren müssen, kann eine einzelne Karte mit 24 GB Videospeicher ein 3B-Modell ausführen.
- Entwickler/API: Keine öffentliche API, Sie müssen Ihren eigenen Inferenzdienst erstellen.
- Unternehmen/Institution: Wenn Sie den Trainingsprozess anhand interner Daten reproduzieren müssen, müssen Sie Ihren eigenen GPU-Cluster vorbereiten. Die MIT-Lizenz erlaubt die kommerzielle Nutzung, aber in der README-Datei heißt es eindeutig, dass der Python-Executor auf Forschungszwecke beschränkt ist und die Produktionssicherheit von Ihnen selbst verstärkt werden muss.
Versteckte Vorteile: Für Teams, die Inferenztrainingsmethoden erforschen, bietet Absolute Zero eine hochentwickelte Basis – vollständigen Trainings-/Bewertungscode, Selbstspielkontext und Protokollsystem, die es dem Team ermöglicht, in wenigen Tagen ein End-to-End-Inferenztrainingsexperiment ohne Daten durchzuführen, während es etwa mehrere Monate dauert, die gleiche Arbeitslast von Grund auf aufzubauen.
Verifizierung der Veröffentlichung: Das Papier behauptet „keine künstlichen Daten“ – „null Daten“ bezieht sich hier auf Frage-Antwort-Paare, die nicht auf manueller Annotation beruhen, aber das Modell erfordert dennoch umfangreiches Vortrainingskorpus und Codeausführungskontext als Vorwissen. „Null Daten“ ist nicht gleich „Null Kosten“. Es ist notwendig, die Abhängigkeiten zwischen der Trainingsphase und der Vortrainingsphase zu unterscheiden.
Hauptfunktionen
- Autonome Aufgabengenerierung (Proposer): Das Modell generiert selbst „lernbare“ Programmier- oder Mathematikaufgaben, anstatt sich auf die manuelle Überprüfung von Fragendatenbanken zu verlassen. Der Schwierigkeitsgrad von Aufgaben passt sich dynamisch dem Lernfortschritt an – von einfachen einzeiligen Operationen in Python bis hin zu komplexen mehrstufigen Algorithmusproblemen.
- Aufgabenautonomer Löser (Solver): Das Modell löst die von ihm vorgeschlagenen Aufgaben und überprüft die Richtigkeit der Antworten über den Python-Executor. „Problemstellung“ und „Problemlösung“ werden durch unterschiedliche Argumentationsmodi desselben Modells vervollständigt und gemeinsame Parameter werden gemeinsam optimiert.
- Triple Reasoning Mode: Unterstützt deduktives Denken (Ableiten von Schlussfolgerungen aus Regeln), abduktives Denken (Ableiten von Ursachen aus Beobachtungen) und induktives Denken (Zusammenfassen von Regeln aus Beispielen). Die drei Modi decken die Kerntypen des menschlichen Denkens ab und machen das Modell zu mehr als nur „schnellem Rechnen“.
- Null-Daten-Trainingsprozess: Verlässt sich nicht auf manuell beschriftete Daten oder vordefinierte Frage-Antwort-Paare. Das Modell erhält überprüfbare Belohnungssignale durch kontextbezogene Interaktion mit der Codeausführung und verbessert sich während des Selbstspielzyklus weiter.
Modell- und Versionsentwicklung
Hauptversion
- ~2025-05: Erste öffentliche Veröffentlichung von Absolute Zero Reasoner. Das arXiv-Papier (2505.03335) erläutert die Theorie des Null-Daten-Inferenzparadigmas. GitHub synchronisiert Open Source das komplette Code-Repository einschließlich Trainings- und Evaluierungskontrollpunkten.
Das Projekt befindet sich in einem frühen Forschungsstadium und hat noch kein Iterationssystem mit mehreren Versionen gebildet. Die spätere Weiterentwicklung könnte Folgendes umfassen: sicherere Code-Ausführer, Unterstützung für mehr Aufgabentypen (z. B. wissenschaftliches Denken, logisches Denken) und Trainingsexperimente für Modelle in größerem Maßstab.
Technische Vorteile
Mechanismusanalyse: Wie lehrt sich das Modell selbst?
Die zentrale Technologieverbindung von Absolute Zero besteht aus vier Rollen:
„ ┌──────────────────────────── ────────────────────────────┐ │ Proposer (Fragesteller) ←→ Solver (Problemlöser) │ │ ↓ ↓ │ │ Aufgabenbeschreibung generieren, Problemlösungsprozess und Antworten generieren │ │ ↓ ↓ │ │ ┌──────────────── Code-Executor ──────────────────┐ │ │ │ ① Überprüfen Sie, ob die Aufgabe ausführbar und nicht trivial ist │ │ │ │ ② Führen Sie den Problemlösungscode aus und überprüfen Sie, ob die Ausgabe korrekt ist │ │ │ │ ③ Überprüfbares Belohnungssignal zurückgeben (Lernbarkeitsbelohnung + Korrektheitsbelohnung) │ │ │ └──────────────────────── ─────────────────────────┘ │ │ ↓ │ │ TRR++-Optimierer → Proposer- und Solver-Parameter gemeinsam aktualisieren │ └─────────────────────────── ────────────────────────────┘ „
-
Überprüfbare Belohnungen ersetzen künstliche Präferenzen: Traditionelles RLHF verlässt sich auf menschliche Annotatoren, um Modellausgabepräferenzen zu bewerten, während Absolute Zero das Bestehen/Nichtbestehen von Code-Ausführern als objektive Belohnungen verwendet. Der Effekt besteht darin, die Subjektivität und Inkonsistenz menschlicher Vorlieben zu beseitigen und das Trainingssignal sauberer und skalierbarer zu machen. Geeignet für Bereiche, in denen Regeln durch Programme überprüft werden können (Code, Mathematik).
-
Selbstgesteuertes Lernen des Kurses: Der Antragsteller generiert automatisch Aufgaben mit „optimalem Schwierigkeitsgrad“ in der Nähe der aktuellen Fähigkeitsgrenze – zu einfache Fragen werden nicht belohnt (da sie keinen Lernwert haben), und zu schwierige Fragen werden nicht gelöst und nicht belohnt. Der Effekt besteht darin, dass der Trainingsprozess automatisch eine Curriculum-Lernkurve bildet und das Modell immer am „Rand der Komfortzone“ trainiert wird. Geeignet für Inferenzmodelle, die für das Training ein hohes Maß an Diversität erfordern.
-
TRR++-Gemeinschaftsoptimierung: Verbessert auf der Grundlage des herkömmlichen GRPO/PPO, während gleichzeitig die Aufgabengenerierungsstrategie des Proposer und die Problemlösungsstrategie des Solvers optimiert werden. Der Effekt besteht darin, dass die beiden Charaktere in der Konfrontation gemeinsam Fortschritte machen – der Fragesteller wird immer „listiger“ und der Problemlöser immer „starker“, wodurch eine positive Rückkopplungsspirale entsteht.
-
Emergentes Argumentationsverhalten: In der offiziellen Anzeige zeigte das Modell nach dem Training spontan Denkverhalten höherer Ordnung wie Annotationsplanung (schreiben Sie zuerst die Annotationsplanungsschritte und dann den Code), Trial-and-Error-Backtracking (zurück zum erneuten Versuch, wenn ein Fehler auftritt), Selbstverifizierung (automatische Überprüfung nach Lösung des Problems), und diese Verhaltensweisen wurden in den Trainingsdaten nicht explizit demonstriert.
Wie man es benutzt
Absolute Zero richtet sich an Forscher. Der Eingang ist das GitHub-Repository und die Befehlszeilentools. Es gibt keine grafische Oberfläche.
Reproduzieren Sie die Ergebnisse der Arbeit: „Bash Git-Klon https://github.com/LeapLabTHU/Absolute-Zero-Reasoner cd Absolute-Zero-Reasoner
Conda-Kontext gemäß README konfigurieren
conda env create -f ambient.yaml Conda aktiviert den absoluten Nullpunkt
Laden Sie den Checkpoint vor dem Training herunter
Weitere Informationen finden Sie in der Hugging Face-Sammlung: https://huggingface.co/collections/andrewzh/absolute-zero-reasoner
Inferenzauswertung ausführen
python eval.py --model absolute-zero-3b --benchmark code
Starten Sie das Selbstspieltraining (erfordert ≥4×80 GB GPU)
python train_selfplay.py --model base-3b --output ./experiment „
Da es sich um ein Forschungsframework handelt, müssen Benutzer über Grundkenntnisse in GPU-Cluster-Management, Python-Entwicklung und Reinforcement Learning verfügen. Die vom Projekt bereitgestellten Aktoren sind nicht für Produktionsumgebungen geeignet. Wenn Sie Benutzercode sicher ausführen müssen, müssen Sie ihn selbst stärken.
Produktpreise
| Projekt | Beschreibung | |
|---|---|---|
| Softwarelizenz | MIT-Lizenz, kostenlos und Open Source | |
| Trainingshardware | Mindestens 2×A100-80GB (3B-Modellversuch) | |
| Inferenz-Hardware | Eine einzelne Karte mit 24 GB Videospeicher kann 3B Checkpoint | ausführen |
| Cloud-GPU-Kosten | Ungefähr 1.500–8.000 US-Dollar für ein vollständiges Reproduktionsexperiment | |
| Geschäfts-API | Nicht verfügbar |
Anwendungsszenarien
- Inferenzmodellforschung: Forschungsteams können Absolute Zero als Basisrahmen für das Null-Daten-Inferenztraining verwenden. Im Vergleich zur Implementierung eines Self-Game-Trainingssystems von Grund auf kann eine vollständige Pipeline auf Basis von Absolute Zero die Startzeit des Experiments von Monaten auf Tage verkürzen – einfach das Warehouse teilen, den Kontext konfigurieren und die Hyperparameter anpassen.
- Erforschung der Modellfähigkeitsgrenzen: Untersuchen Sie, „wie weit ein Modell ohne Eingabe menschlicher Daten kommen kann“ und bewerten Sie die Bedingungen und Einschränkungen für die Entstehung von Denkfähigkeiten. Es eignet sich für Forschungsexperimente zur KI-Sicherheit, zu Fähigkeitsgrenzen und zu neuen Verhaltensrichtungen.
- Reinforcement Learning Training Method Experiment: Testen Sie den Einfluss verschiedener Belohnungsdesigns, Selbstspielstrategien und Argumentationsmoduskombinationen auf die Argumentationsfähigkeit des Modells. Der modulare Aufbau des Projekts (austauschbare Aktoren, Belohnungsfunktionen, Inferenzstrategien) ermöglicht experimentelle Variationen.
Nicht für Grenzen geeignet: Nicht als produktionsgebundene Codeausführungs-Sandbox geeignet (der integrierte Executor ist für Forschungszwecke gekennzeichnet); nicht für die direkte Nutzung durch einzelne Entwickler ohne GPU-Ressourcen geeignet; Nicht geeignet für Geschäftsszenarien, die sofort einsatzbereite Inferenzdienste erfordern.
Anwendbare Personen
- LLM-Ausbildungsforscher: Forscher, die sich auf verstärkendes Lernen und selbständiges Denken konzentrieren, können Absolute Zero als experimentelle Basis und Papiergrundlage verwenden.
- Frontier Model Team Engineer: Ein technisches Team, das die Zero-Data-Inferenz-Trainingsmethode auf der Grundlage vorhandener Modelle ausprobiert, um zu bewerten, ob die Methode für den eigenen Modellmaßstab und die eigenen Aufgabenszenarien geeignet ist.
- KI-Sicherheits- und Ausrichtungsforscher: Untersuchen Sie, ob das Verhalten des Modells unter dem Paradigma „Selbstlehre und Selbstlernen“ kontrollierbar ist, ob die Belohnungen gehackt werden und wie vorhersehbares Verhalten ist.
Nicht geeignet für Personen: Produktmanager oder Geschäftsanwender mit nicht-technischem Hintergrund (Erfahrung in Programmierung und ML-Engineering erforderlich); einzelne Entwickler, denen das GPU-Cluster-Budget fehlt; Entwicklungsteams, die Inferenz-APIs in Produktionsqualität benötigen.
Zusammenfassung und Ausblick
Absolute Zero stellt einen völlig anderen technischen Weg als das Mainstream-RLHF dar: Ersetzen von menschlichem Feedback durch kontextbezogenes Feedback. Es beweist, dass sich Modelle im Bereich Code und mathematisches Denken durch den Prozess der „Selbstgenerierung, Selbstlösung und Selbstverifizierung“ weiter verbessern können, ohne dass ein stetiger Strom manueller Anmerkungen erforderlich ist. Als Forschungsprototyp ist die aktuelle Version hinsichtlich der Vollständigkeit der Trainingstoolkette herausragend, es besteht jedoch immer noch eine technische Lücke zwischen Labormethodik und umsetzbarem Trainingsrahmen.
Aktuelle Einschränkungen: Der Schwellenwert für die Trainingsressourcen ist hoch (14B-Modell erfordert 8 Karten von A100); Der integrierte Code-Executor ist für Forschungszwecke gekennzeichnet und für die Produktion nicht sicher. Das Projekt befindet sich in einem frühen Stadium und die Unterstützung und Dokumentation durch die Gemeinschaft muss verbessert werden. Die Auswirkung von Denkfähigkeiten in anderen Bereichen als Code/Mathematik (logisches Denken, Beantwortung offener Fragen) wurde nicht vollständig überprüft.
Risikobewertung der Übernahme/Annahme: Als akademisches Open-Source-Projekt hat Absolute Zero keine Kommerzialisierungsverpflichtungen. Es wird empfohlen, dass das Forschungsteam es als technische Referenz und experimentelle Grundlage verwendet. Bei der Auswahl einer industrietauglichen Trainingsplattform müssen die Kompatibilität mit dem internen MLOps-System, die Kosten für die Verstärkung der Aktuatorsicherheit und die menschliche Investition in die langfristige Wartung bewertet werden. Die MIT-Lizenz ist mit der kommerziellen Nutzung kompatibel, es wird jedoch empfohlen, die Konformitätsbedingungen abgeleiteter Modelle zu bestätigen, bevor Sie Ihr eigenes Modell trainieren.
Verwandte Tools: hugging-face, replicate
Versionsinfo
- Absoluter Null-Denker :Die erste öffentliche vollständige Implementierung, einschließlich Trainingscode, Modellprüfpunkt, Argumentationsmodus (Abzug/Abduktion/Induktion) und Bewertungsskript, noch kein offizielles genaues Datum.
- Absoluter Null-Denker :Zum ersten Mal wird die vollständige Implementierung offengelegt, einschließlich Trainingscode, Modellprüfpunkt, Inferenzmodus und Bewertungsskript. Einen offiziellen genauen Termin gibt es noch nicht.
Benutzerbewertungen