한 줄 요약
ProRL은 KL divergence 제어와 reference policy reset을 통해 기존 모델 분포를 벗어난 새로운 추론 전략을 발견하는 장기 강화학습 방법이다.
핵심 기여도
- ProRL을 통해 기존 모델에서 도출되지 않은 새로운 추론 경로를 2,000단계 이상의 훈련을 통해 발견함.
- DeepSeek-R1-1.5B 기반 모델에서 ProRL 훈련 후 수학, 코드, 논리 퍼즐 등에서 평균 14.7%~54.8%의 pass@1 개선.
- 기존 RL 훈련이 100~수백 단계에 머물렀던 반면, ProRL은 2,000단계 이상 훈련 가능함.
- Creativity Index를 통해 ProRL 모델이 훈련 전 텍스트와의 중복률이 낮아진, 즉 새로운 추론 패턴을 생성함을 입증함.
핵심 아이디어
ProRL은 기존 강화학습이 단기간 훈련 내에서 기존 모델 분포 내의 최적화만 수행한다는 한계를 극복하기 위해, 훈련 시간을 2,000단계 이상으로 확장하고, KL divergence 제어와 reference policy reset을 도입한 새로운 훈련 프레임워크이다. 기존 연구는 대부분 수학 분야에 집중되어 있었고, 훈련 단계가 짧아 모델이 새로운 추론 전략을 탐색할 시간이 부족했다. ProRL은 다양한 STEM, 코드, 논리 퍼즐, 명령 수행 등 다분야 데이터셋을 사용하여 모델이 보다 일반화된 추론 능력을 개발하도록 유도한다. 특히, 기존 모델이 실패하는 상황에서도 ProRL 모델은 100% pass@1 성능을 달성하는 경우가 있으며, 이는 기존 훈련 데이터와의 중복률이 낮은 새로운 추론 경로를 생성했음을 시사한다.
기술적 접근법
- **ProRL 훈련 프레임워크**: KL divergence 제어, reference policy reset, 다양한 STEM 및 코드 태스크를 포함한 데이터셋을 사용.
- **KL divergence 제어**: 훈련 중 기반 정책과의 차이를 제한하여 안정성 유지.
- **Reference policy reset**: 일정 주기마다 기반 정책을 재설정하여 훈련 발산 방지.
- **데이터셋**: AIME, AMC, MATH, APPS, Codeforces, TACO, GPQA Diamond, IFEval 등 다양한 추론 태스크.
- **훈련 단계**: 최소 2,000단계 이상의 훈련을 수행하여 기존 RL 연구(수백 단계)를 훨씬 초과.
- **모델**: Nemotron-Research-Reasoning-Qwen-1.5B (1.5B 파라미터)로, DeepSeek-R1-1.5B 기반.
주요 결과
- **수학**: AIME, AMC, MATH 등에서 평균 15.7%의 pass@1 개선.
- **코드**: APPS, Codeforces 등에서 14.4%의 pass@1 개선.
- **논리 퍼즐**: Reasoning Gym에서 54.8%의 pass@1 개선.
- **STEM 추론**: GPQA Diamond에서 25.9% 개선.
- **명령 수행**: IFEval에서 22.0% 개선.
- **OOD 태스크**: Reasoning Gym의 out-of-distribution 태스크에서 3개 태스크에서 100% pass@1 달성.
- **Creativity Index**: 훈련 전 텍스트와의 중복률이 낮아진 추론 경로 생성.
의의 및 한계
ProRL은 기존 강화학습이 단기간 훈련 내에서 기존 모델 분포 내의 최적화만 수행한다는 관점을 재정의하며, 장기 훈련을 통해 새로운 추론 경로를 생성할 수 있음을 입증한다. 이는 추가적인 학습 데이터 없이도 모델의 추론 능력을 확장할 수 있음을 시사하며, 추론 중심 모델 개발에 중요한 기초를 제공한다. 그러나 ProRL은 1.5B 파라미터 모델에만 적용되었으며, 더 큰 모델에서의 효과는 아직 검증되지 않았다. 또한, 훈련 시간이 2,000단계 이상으로 길어지므로 컴퓨팅 자원이 제한된 환경에서는 적용이 어려울 수 있다.
실용적 활용
ProRL은 수학, 코드 생성, STEM 추론, 명령 수행 등 다양한 분야에서 고성능 추론 모델을 개발하는 데 활용될 수 있다. 특히, 기존 모델이 실패하는 복잡한 문제 해결에 효과적일 것으로 기대되며, AI 기반 교육, 자동 프로그래밍, 과학 연구 지원 등에 적용 가능하다.