한 줄 요약
AZR은 외부 데이터 없이 자가 생성 학습을 통해 수학 및 코드 추론에서 최신 성능을 달성한 RLVR 모델이다.
핵심 기여도
- **Absolute Zero**라는 새로운 RLVR 패러다임 제안: 외부 데이터 없이 모델이 자체적으로 학습 과제를 생성하고 해결함.
- **AZR (Absolute Zero Reasoner)**: 코드 실행기와 연동하여 학습 곡선을 자가 진화하며, 수학 및 코드 추론에서 기존 zero-setting 모델을 1.8 점 이상 초과함.
- **AZR-7B Coder 모델**이 수학 정확도를 15.2 점 향상시키며, 크로스 도메인 전이 성능이 두드러짐.
- **Qwen-Coder-7b** 기반 AZR 모델이 Qwen-7b 기반 모델보다 0.7 점 높은 수학 성능을 보임.
핵심 아이디어
기존 RLVR 연구는 인간이 생성한 질문-답변 쌍에 의존해 학습 곡선을 구성하지만, 이는 확장성에 한계가 있다. 본 연구는 외부 데이터 없이 모델이 스스로 학습 과제를 생성하고 이를 해결함으로써 추론 능력을 향상시키는 새로운 패러다임인 **Absolute Zero**를 제안한다. AZR은 코드 실행기와 연동되어 생성된 코드 추론 과제를 검증하고, 이를 통해 **verifiable reward**를 생성한다. 이는 인간 감독 없이도 안정적인 학습을 가능하게 하며, **AlphaZero**와 유사한 self-play 학습 방식을 채택한다. 핵심 아이디어는 모델이 스스로 학습 과제를 생성하고 이를 해결함으로써 추론 능력을 자가 진화시키는 점이다.
기술적 접근법
- **AZR (Absolute Zero Reasoner)**: 코드 실행기와 연동된 모델로, 코드 추론 과제를 생성하고 검증함.
- **3가지 추론 모드** (induction, abduction, deduction)를 기반으로 코드-입력-출력 트리플릿을 생성.
- **Reinforcement Learning Advantage Estimator**: 멀티태스크 학습을 위한 새로운 추정기 사용.
- **Qwen-Coder-7b** 및 **Qwen-7b** 기반 모델 사용.
- **Greedy decoding**으로 모든 실험 수행.
- **Evalplus**, **HumanEval+**, **MBPP+**, **LiveCodeBench**, **AIME**, **OlympiadBench**, **Math500**, **AMC** 등 다양한 데이터셋 사용.
주요 결과
- **AZR-7B Coder**는 수학 정확도를 15.2 점 향상시키며, 기존 zero-setting 모델을 평균 1.8 점 이상 초과함.
- **AZR-3B, 7B, 14B Coder 모델**은 각각 +5.7, +10.2, +13.2 점의 성능 향상.
- **AZR-7B Coder**는 수학 정확도를 10.9 점 향상시키며, 기존 전용 코드 모델보다 0.65 점 높은 성능.
- **Qwen-Coder-7b** 기반 AZR 모델은 Qwen-7b 기반 모델보다 0.7 점 높은 수학 성능.
의의 및 한계
AZR은 인간 감독 없이도 추론 능력을 자가 진화시키는 새로운 RLVR 패러다임으로, 추론 모델의 자율성과 확장성을 높이는 데 기여한다. 특히, 코드 실행기와 연동된 학습 환경은 verifiable reward를 생성하여 안정적인 학습을 가능하게 한다. 그러나 AZR은 외부 데이터 없이 학습하기 때문에 초기 학습 곡선이 불안정할 수 있으며, 복잡한 추론 과제에서는 오랜 학습 시간이 필요할 수 있다. 또한, AZR의 성능은 모델 크기와 비선형적으로 상관관계가 있으므로, 모델 확장에 따른 성능 향상은 추가 연구가 필요하다.
실용적 활용
AZR은 코드 및 수학 추론을 포함한 다양한 추론 과제에 적용 가능하며, 인간 감독 없이도 모델이 자가 진화하는 시스템 개발에 활용될 수 있다. 특히, AI가 인간 지능을 초월하는 상황에서 자율 학습을 지속할 수 있는 기반 기술로 활용될 수 있다.