한 줄 요약
Light-R1은 공개 데이터와 모델을 활용해 재현 가능한 방식으로 장기 추론 모델을 학습하는 오픈소스 툴킷으로, 14B 모델에서 AIME24 점수 74.0을 달성했다.
핵심 기여도
- **Light-R1-32B** 모델은 **Qwen2.5-32B-Instruct** 기반으로 학습되어 **DeepSeek-R1-Distill-Qwen-32B**를 수학 추론에서 초과.
- **3,000개의 과제 데이터셋**을 사용한 **2단계 SFT + DPO** 학습으로 **7B 및 14B 모델**에서 최고 성능 달성.
- **Light-R1-14B-DS**는 **AIME24** 74.0, **AIME25** 60.2 점수로 **32B 모델**과 **DeepSeek-R1-Distill-Llama-70B**를 초과.
- **GRPO**를 장기 추론 모델에 적용한 최초 사례로, **14B 모델에서 2%의 절대 성능 향상** 기록.
핵심 아이디어
Light-R1은 **DeepSeek-R1 시리즈의 프로퍼티 데이터 의존성**을 극복하기 위해 **공개 데이터와 모델만을 사용한 재현 가능한 학습 전략**을 제시한다. 핵심은 **커리큘럼 학습**(curriculum training)과 **다단계 포스트 트레이닝**(multi-staged post-training)의 결합이다. 학습 초기에는 쉬운 문제부터 점진적으로 어려운 문제로 이동하며, **SFT-Stage 1 → SFT-Stage 2 → DPO**의 단계별 학습을 통해 모델의 추론 능력을 구축한다. 특히, **3,000개의 과제 데이터셋**은 **DeepSeek-R1-Distill 모델**의 성능을 크게 향상시키며, **Light-R1-7B-DS**가 최고 성능 7B 모델로 등장하게 만든다. 또한, **GRPO**(Gradient-based Reward Policy Optimization)를 장기 추론 모델에 적용한 것은 **14B 모델에서 안정적인 응답 길이 증가와 동시에 성능 향상**을 가능하게 했다는 점에서 혁신적이다.
기술적 접근법
- **모델 기반**: Qwen2.5-32B-Instruct, DeepSeek-R1-Distill-Qwen-32B, DeepSeek-R1-Distill-Llama-70B.
- **데이터셋**: 3,000개의 과제 데이터셋 (주로 수학 문제), **DeepScaleR-1.5B-Preview**와 **DeepSeek-R1-Distill-Qwen-32B**를 사용한 2단계 난이도 필터링.
- **학습 전략**:
- **SFT-Stage 1 → SFT-Stage 2 → DPO**의 3단계 학습.
- **TIES-merging**을 사용한 모델 병합 (SFT-Stage 2, DPO, DPO 변형 모델).
- **하드웨어**: 12×H800 GPU, 6시간, 약 $1,000의 학습 비용.
주요 결과
- **Light-R1-32B**는 **DeepSeek-R1-Distill-Qwen-32B**를 수학 추론에서 초과.
- **3,000개 과제 데이터셋**을 사용한 **SFT-Stage 2** 학습으로 **Light-R1-7B-DS**가 7B 모델 중 최고 성능 달성.
- **Light-R1-14B-DS**는 **AIME24** 74.0, **AIME25** 60.2 점수로 **32B 모델**과 **DeepSeek-R1-Distill-Llama-70B**를 초과.
- **GRPO 적용**으로 **14B 모델에서 2%의 절대 성능 향상** 기록.
의의 및 한계
Light-R1은 **프로퍼티 데이터 없이도 장기 추론 모델을 학습**할 수 있다는 점에서 학술적·실용적 의의가 크다. 특히, **14B 모델에서 32B 수준의 성능**을 달성한 것은 **자원 제약 환경에서의 추론 모델 개발**에 중요한 단서를 제공한다. 또한, **커리큘럼 학습과 GRPO의 결합**은 **장기 추론 모델의 학습 효율성과 확장성**을 증명한다. 그러나, **수학 중심 학습으로 인한 과외 도메인 성능 저하**(예: GPQA)는 한계로 지적된다. 이는 **다양한 도메인의 데이터를 통합한 학습 전략**이 필요함을 시사한다.
실용적 활용
Light-R1은 **자원 제약이 있는 엣지 기기나 실시간 응용**에서 활용 가능한 **고성능 추론 모델 개발**에 기여할 수 있다. 특히, **수학 문제 해결, 알고리즘 설계, 과학 분석** 등에서 활용 가능하며, **교육, 연구, 산업 분석** 분야에서 실용적 가치가 높다. 공개된 코드와 데이터셋은 **저비용으로 장기 추론 모델을 학습하고 개선**하려는 연구자와 엔지니어들에게 유용한 자산이다.