절대 영도 무료

-

Absolute Zero는 Tsinghua University 및 기타 기관에서 제안한 제로 인공 데이터 추론 모델 교육 패러다임입니다. 핵심 아이디어는 언어 모델을 제안자와 해결자 모두로 사용하고, 코드 실행기를 통해 검증 가능한 보상 신호를 제공하고, 수동 주석 없이 코드 및 수학적 추론 기능을 지속적으로 개선하는 것입니다.

절대 영도 제품 인터페이스

앱솔루트 제로 전체 리뷰

핵심 매개변수 및 통계

프로젝트 사양
제품 포지셔닝 제로 데이터 추론 모델 훈련 패러다임
개발 기관 청화대학교 LeapLab, BIGAI, 펜실베니아 주립대학교
오픈 소스 라이센스 MIT 라이센스
기술적 경로 강화학습 셀프게임 + 코드 실행자 검증
모델 크기 3B / 7B / 14B (공공체크포인트 제공)
교육 리소스 3B ≒ 2×80GB GPU; 7B ≒ 4×80GB GPU; 14B ≒ 8×80GB GPU
추론 모드 추론, 납치, 유도
서류 주소 arxiv.org/abs/2505.03335

당신은 질문할 수 있습니다: Absolute Zero는 제품입니까? 아니요, 이는 "모델이 스스로 학습하도록 하는" 훈련 방법에 가깝습니다. 이는 마치 학생이 스스로 시험지를 작성하고, 질문에 답하고, 스스로 수정하고, 실수로부터 배우는 것과 같습니다. 전체 과정에 교사(인간 주석가)의 참여가 필요하지 않습니다.

사용자 및 시장 인지도

Absolute Zero는 2025년 5월 arXiv 논문을 통해 공개되었으며, 전체 구현은 같은 기간 GitHub 및 Hugging Face에서 오픈 소스로 공개되었습니다. 일반 대중을 위한 SaaS 제품은 아니지만, LLM 분야의 근본적인 질문인 '사람이 라벨링한 데이터가 부족할 때 모델을 어떻게 개선할 수 있습니까?'에 답한다는 점에서 연구 커뮤니티에서 주목을 받았습니다. **

  • 학술적 영향: 논문에서 제안된 "제로 데이터 추론" 패러다임은 인위적인 선호도에 의존하는 RLHF의 전통적인 경로에 직접적으로 도전하고 RLVR(검증 가능한 보상을 통한 강화 학습)을 위한 새로운 실용적인 경로를 제공합니다.
  • 커뮤니티 활동: GitHub 저장소는 매우 완벽하며(훈련 코드, 평가, 모델 가중치 변환 도구, W&B 로그 포함) 연구원이 논문 결과를 직접 재현할 수 있습니다. 구체적인 별 개수는 창고의 실시간 데이터에 따라 달라집니다.
  • 산업 벤치마킹: DeepSeek-R1의 강화 학습 추론 훈련 및 OpenAI o1의 연쇄 추론 아이디어를 보완하지만 Absolute Zero는 "인공 데이터 제로"를 주장하는 데 더 급진적입니다.

비용 이점

청구 차원 현황
프레임워크 및 코드 MIT 오픈 소스 및 무료
모델 체크포인트 포옹 얼굴 공개 다운로드
API 서비스 제공되지 않음
엔터프라이즈 기술 지원 비공개

자유로운 진실: 코드와 모델은 무료이지만 훈련에는 실제 GPU가 필요합니다. 공식 참조 구성(3B 모델의 경우 A100-80GB 약 2개, 14B 모델의 경우 8개)은 일반적인 실험에 대한 클라우드 GPU 비용이 수천 달러에서 수만 달러에 달함을 의미합니다. "무료"는 소프트웨어이고, 비싼 것은 컴퓨팅 성능입니다.

비용 계층화

  • C측/개인 연구원: 추론 및 미세 조정 실험을 위해 공식적으로 제공되는 3B 체크포인트를 사용할 수 있습니다. 8 A100-80GB 비용은 시간당 약 US$16-24입니다. 재교육이 아닌 추론만 수행해야 하는 경우 24GB 비디오 메모리를 갖춘 단일 카드로 3B 모델을 실행할 수 있습니다.
  • 개발자/API: 공개 API가 없으므로 자체 추론 서비스를 구축해야 합니다.
  • 기업/기관: 내부 데이터로 학습 과정을 재현해야 하는 경우 자체 GPU 클러스터를 준비해야 합니다. MIT 라이선스는 상업적 사용을 허용하지만 README에는 Python 실행 프로그램이 연구용으로 제한되어 있으며 프로덕션 보안을 직접 강화해야 한다고 명시되어 있습니다.

숨겨진 이점: 추론 훈련 방법을 연구하는 팀을 위해 Absolute Zero는 고도로 엔지니어링된 기준(완벽한 훈련/평가 코드, 자체 게임 컨텍스트 및 로그 시스템)을 제공하여 팀이 며칠 만에 엔드투엔드 제로 데이터 추론 훈련 실험을 실행할 수 있도록 해줍니다. 반면 동일한 워크로드를 처음부터 구축하는 데는 몇 달 정도 걸립니다.

공개 검증: 논문에서는 "인공 데이터 제로"라고 주장합니다. 여기서 "제로 데이터"는 수동 주석에 의존하지 않는 질문과 답변 쌍을 의미하지만, 모델에는 여전히 사전 지식으로 대규모 사전 학습 코퍼스와 코드 실행 컨텍스트가 필요합니다. "제로 데이터"는 "제로 비용"과 같지 않습니다. 훈련 단계와 사전 훈련 단계 사이의 종속성을 구별하는 것이 필요합니다.

주요 기능

  • 자율 작업 생성(제안자): 모델은 문제 은행의 수동 심사에 의존하지 않고 자체적으로 "학습 가능한" 프로그래밍 또는 수학 작업을 생성합니다. 작업의 난이도는 Python의 간단한 한 줄 작업부터 복잡한 다단계 알고리즘 문제까지 학습 진행 상황에 따라 동적으로 조정됩니다.
  • Task Autonomous Solver(Solver): 모델이 제안한 작업을 해결하고, Python 실행기를 통해 답변의 정확성을 검증합니다. "문제 설정"과 "문제 해결"은 동일한 모델의 서로 다른 추론 모드를 통해 완료되며 공유 매개변수는 공동으로 최적화됩니다.
  • 삼중 추론 모드: 연역적 추론(규칙에서 결론 도출), 귀납적 추론(관찰에서 원인 추론), 귀납적 추론(예를 통해 규칙 요약)을 지원합니다. 세 가지 모드는 인간 추론의 핵심 유형을 다루며 모델을 "빠른 계산" 그 이상으로 만듭니다.
  • 제로 데이터 교육 프로세스: 수동으로 레이블이 지정된 데이터나 사전 정의된 질문 및 답변 쌍에 의존하지 않습니다. 모델은 코드 실행과의 상황별 상호 작용을 통해 검증 가능한 보상 신호를 얻고 자체 게임 주기 동안 계속해서 개선됩니다.

모델 및 버전의 진화

메인라인 출시

  • ~2025-05: Absolute Zero Reasoner 최초 공개 출시. arXiv 논문(2505.03335)은 제로 데이터 추론 패러다임의 이론을 설명합니다. GitHub는 교육 및 평가 체크포인트를 포함한 전체 코드 저장소를 오픈 소스로 동기화합니다.

이 프로젝트는 초기 연구 단계에 있으며 아직 다중 버전 반복 시스템을 구성하지 않았습니다. 후속 진화에는 더 안전한 코드 실행기, 더 많은 작업 유형(과학적 추론, 논리적 추론 등)에 대한 지원, 대규모 모델을 위한 훈련 실험이 포함될 수 있습니다.

기술적인 장점

메커니즘 분석: 모델은 어떻게 스스로 학습합니까?

앱솔루트제로의 핵심기술 연계는 4가지 역할로 구성됩니다.

┌─────────────────────────────────────────────────────┐
│ 제안자(질문 제시자) ←→ 해결자(문제 해결사) │
│ ↓ ↓ │
│ 작업 설명 생성, 문제 해결 프로세스 및 답변 생성 │
│ ↓ ↓ │
│ ┌──────────────── 코드 실행자 ─────────────────┐ │
│ │ ① 작업이 실행 가능하고 사소한지 확인 │ │
│ │ ② 문제 해결 코드를 실행하고 출력이 올바른지 확인 │ │
│ │ ③ 검증 가능한 보상 신호 반환(학습성 보상 + 정확성 보상) │ │
│ └──────────────────────────────────────────────┘ │
│ ↓ │
│ TRR++ 최적화 프로그램 → Proposer 및 Solver 매개변수 공동 업데이트 │
└─────────────────────────────────────────────────────┘
  1. 검증 가능한 보상이 인위적인 선호를 대체합니다: 기존 RLHF는 인간 주석자를 사용하여 모델 출력 선호도의 순위를 매기는 반면 Absolute Zero는 코드 실행자의 통과/실패를 객관적인 보상으로 사용합니다. 그 효과는 인간 선호의 주관성과 불일치를 제거하여 훈련 신호를 더 명확하고 확장 가능하게 만드는 것입니다. 프로그램(코드, 수학)으로 규칙을 검증할 수 있는 분야에 적합합니다.

  2. 셀프 게임 코스 학습: 제안자는 현재 능력 경계에 가까운 "최적 난이도" 작업을 자동으로 생성합니다. 너무 쉬운 질문은 보상되지 않으며(학습 가치가 없기 때문에), 너무 어려운 질문은 해결되지 않고 보상되지 않습니다. 그 결과 훈련 과정이 자동으로 커리큘럼 학습 곡선을 형성하고 모델은 항상 "편안함 영역의 가장자리"에서 훈련됩니다. 훈련을 위해 많은 양의 다양성이 필요한 추론 모델에 적합합니다.

  3. TRR++ 공동 최적화: Proposer의 작업 생성 전략과 Solver의 문제 해결 전략을 최적화하는 동시에 기존 GRPO/PPO를 기반으로 개선되었습니다. 그 효과는 두 캐릭터가 대결에서 함께 발전한다는 것입니다. 질문을 만드는 사람은 점점 더 "교활"해지고, 문제 해결자는 점점 더 "강해"져서 긍정적인 피드백 나선을 형성합니다.

  4. 신발 추론 동작: 공식 디스플레이에서 훈련 후 모델은 주석 계획(주석 계획 단계를 먼저 작성한 후 코드 작성), 시행착오 역추적(오류 발생 시 재시도로 되돌아가기), 자체 검증(문제 해결 후 자동 확인)과 같은 고차 추론 동작을 자발적으로 보여 주었지만 이러한 동작은 훈련 데이터에서 명시적으로 입증되지 않았습니다.

사용방법

Absolute Zero는 연구원을 대상으로 합니다. 입구는 GitHub 저장소와 명령줄 도구입니다. 그래픽 인터페이스가 없습니다.

논문 결과 재현: ``배쉬 자식 클론 https://github.com/LeapLabTHU/Absolute-Zero-Reasoner cd 절대 영점 추론자

README에 따라 Conda 컨텍스트를 구성합니다.

conda env create -f 환경.yaml conda는 절대 영점을 활성화합니다

사전 훈련 체크포인트 다운로드

포옹 얼굴 컬렉션 참조: https://huggingface.co/collections/andrewzh/absolute-zero-reasoner

추론 평가 실행

python eval.py --model 절대 제로-3b --벤치마크 코드

자체 게임 훈련 시작(≥4×80GB GPU 필요)

python train_selfplay.py --model base-3b --output ./experiment



연구 프레임워크이므로 사용자는 GPU 클러스터 관리, Python 개발 및 강화 학습에 대한 기본 지식이 필요합니다. 프로젝트에서 제공하는 액추에이터는 생산 환경에 적합하지 않습니다. 사용자 코드를 안전하게 실행하려면 직접 강화해야 합니다.

## 제품 가격

| 프로젝트 | 설명 |
|---|---|
| **소프트웨어 라이센스** | MIT 라이센스, 무료 오픈 소스 |
| **교육 하드웨어** | 최소 2×A100-80GB(3B 모델 실험) |
| **추론 하드웨어** | 24GB 비디오 메모리를 갖춘 단일 카드로 3B 체크포인트 |
| **클라우드 GPU 비용** | 완전한 재생산 실험에 약 $1,500-8,000 |
| **비즈니스 API** | 사용할 수 없음 |

## 애플리케이션 시나리오

- **추론 모델 연구**: 연구팀은 제로 데이터 추론 훈련을 위한 기본 프레임워크로 Absolute Zero를 사용할 수 있습니다. 자체 게임 훈련 시스템을 처음부터 구현하는 것과 비교할 때 Absolute Zero를 기반으로 하는 완전한 파이프라인은 실험 시작 시간을 몇 개월에서 며칠로 단축할 수 있습니다. 즉, 웨어하우스를 분기하고 컨텍스트를 구성하고 하이퍼 매개변수를 조정하기만 하면 됩니다.
- **모델 능력 경계 탐구**: "인간의 데이터 입력 없이 모델이 어디까지 갈 수 있는지"를 연구하고 추론 능력 출현의 조건과 한계를 평가합니다. AI 안전, 능력 경계, 창발적 행동 방향에 대한 연구 실험에 적합합니다.
- **강화 학습 훈련 방법 실험**: 다양한 보상 디자인, 자체 게임 전략, 추론 모드 조합이 모델의 추론 능력에 미치는 영향을 테스트합니다. 프로젝트의 모듈식 설계(교체 가능한 액추에이터, 보상 기능, 추론 전략)는 실험적 변형을 용이하게 합니다.

**경계에 적합하지 않음**: 프로덕션 바인딩 코드 실행 샌드박스로 적합하지 않습니다(내장 실행기는 연구용으로 표시됨). GPU 리소스가 없는 개별 개발자가 직접 사용하기에는 적합하지 않습니다. 즉시 사용 가능한 추론 서비스가 필요한 비즈니스 시나리오에는 적합하지 않습니다.

## 해당자

- **LLM 교육 연구원**: 강화 학습 및 자가 플레이 추론 능력에 중점을 두는 연구원은 Absolute Zero를 실험 기반 및 종이 기준으로 사용할 수 있습니다.
- **프론티어 모델팀 엔지니어**: 기존 모델을 기반으로 제로 데이터 추론 훈련 방법을 시도하여 해당 방법이 자체 모델 규모 및 작업 시나리오에 적합한지 평가하는 기술팀입니다.
- **AI 보안 및 정렬 연구원**: "자기 학습 및 자가 학습" 패러다임 하에서 모델의 동작을 제어할 수 있는지, 보상이 해킹되는지 여부, 긴급 동작의 예측 가능성을 연구합니다.

**사람에게 적합하지 않음**: 비기술적 배경을 가진 제품 관리자 또는 비즈니스 사용자(프로그래밍 및 ML 엔지니어링 경험 필요) GPU 클러스터 예산이 부족한 개인 개발자; 프로덕션급 추론 API가 필요한 엔지니어링 팀.

## 요약 및 전망

Absolute Zero는 주류 RLHF와는 완전히 다른 기술 경로를 나타냅니다. 인간의 피드백을 상황에 맞는 피드백으로 대체합니다. 이는 코드 및 수학적 추론 분야에서 수동 주석을 꾸준히 작성할 필요 없이 "자체 생성, 자가 해결 및 자가 검증" 프로세스를 통해 모델이 지속적으로 개선될 수 있음을 입증합니다. 연구 프로토타입으로서 현재 버전은 훈련 도구 체인의 완성도 측면에서 탁월하지만, 실험실 방법론과 구현 가능한 훈련 프레임워크 사이에는 여전히 엔지니어링 격차가 있습니다.

**현재 제한 사항**: 교육 리소스 임계값이 높습니다(14B 모델에는 A100 카드 8개가 필요함). 내장된 코드 실행기는 연구용으로 표시되어 있으며 생산에는 안전하지 않습니다. 프로젝트가 초기 단계에 있으며 커뮤니티 지원 및 문서화를 개선해야 합니다. 코드/수학 이외의 영역(상식추론, 오픈도메인 질문답변)에서의 추론능력의 효과는 충분히 검증되지 않았습니다.

**인수/채택 위험 평가**: 학술 오픈 소스 프로젝트인 Absolute Zero에는 상용화 약속이 없습니다. 연구팀은 이를 기술 참조 및 실험 기준으로 사용하는 것이 좋습니다. 산업용 등급 교육 플랫폼을 선택하려면 내부 MLOps 시스템과의 호환성, 액추에이터 안전 강화 비용, 장기 유지 관리에 대한 인적 투자를 평가해야 합니다. MIT 라이선스는 상업적 용도와 호환되지만, 자신의 모델을 학습시키기 전에 파생 모델의 준수 조건을 확인하는 것이 좋습니다.

관련 도구: hugging-face, replicate

버전 정보

  • 절대영도 추론자 :훈련 코드, 모델 체크포인트, 추론 모드(추론/유추/유도) 및 평가 스크립트를 포함한 최초의 공개 완전한 구현은 아직 공식적으로 정확한 날짜는 없습니다.
  • 절대영도 추론자 :훈련 코드, 모델 체크포인트, 추론 모드, 평가 스크립트를 포함한 전체 구현이 처음으로 공개됩니다. 아직 공식적인 정확한 날짜는 없습니다.

사용자 후기

  • 후기를 불러오는 중...