한 줄 요약
DAPO는 AIME 2024에서 50점 달성한 Qwen2.5-32B 기반의 대규모 LLM 강화 학습 시스템이다.
핵심 기여도
- DAPO 알고리즘 제안: Decoupled Clip과 Dynamic Sampling Policy Optimization을 결합한 새로운 강화 학습 알고리즘.
- AIME 2024에서 Qwen2.5-32B 기반으로 50점 달성 (기존 DeepSeek-R1-Zero-Qwen-32B 대비 +3점).
- verl 프레임워크 기반으로 훈련 코드 및 데이터셋을 완전 오픈소스화.
- 4가지 핵심 기술 제시: Clip-Higher, Dynamic Sampling, Token-Level Policy Gradient Loss, Overlong Reward Shaping.
핵심 아이디어
기존 강화 학습 기반 LLM 시스템은 훈련 세부 사항이 비공개되어 재현이 어려웠다. 예를 들어, OpenAI o1 및 DeepSeek R1 기술 보고서는 핵심 알고리즘을 공개하지 않았다. DAPO는 이 문제를 해결하기 위해 훈련 과정을 완전히 오픈소스화하고, 4가지 핵심 기술을 제시함으로써 대규모 LLM 강화 학습의 재현성을 높였다. 특히, Token-Level Policy Gradient Loss는 긴 Chain-of-Thought(장기 추론) 시나리오에서 학습 안정성을 향상시키는 핵심 요소로 작용한다. Overlong Reward Shaping은 보상 노이즈를 줄이고 훈련 안정성을 높이는 데 기여한다.
기술적 접근법
- **DAPO 알고리즘**: Decoupled Clip과 Dynamic Sampling Policy Optimization을 결합한 새로운 강화 학습 알고리즘.
- **4가지 핵심 기술**:
- **Clip-Higher**: 엔트로피 붕괴 방지 및 시스템 다양성 증대.
- **Dynamic Sampling**: 훈련 효율성과 안정성 향상.
- **Token-Level Policy Gradient Loss**: 장기 추론 시나리오에서 학습 안정성 향상.
- **Overlong Reward Shaping**: 보상 노이즈 감소 및 훈련 안정화.
- **프레임워크**: verl (https://github.com/volcengine/verl) 기반으로 구현.
- **모델**: Qwen2.5-32B를 기반으로 훈련.
- **데이터셋**: 신중하게 정리 및 처리된 데이터셋 제공.
주요 결과
- **AIME 2024 데이터셋에서 50점 달성** (기존 DeepSeek-R1-Zero-Qwen-32B 대비 +3점, 50% 훈련 스텝으로 달성).
- **초기 GRPO 기반 훈련 시 AIME 30점** (DAPO 도입 후 20점 개선).
- **DAPO 알고리즘은 훈련 안정성과 추론 성능을 동시에 향상**.
의의 및 한계
DAPO는 대규모 LLM 강화 학습의 재현성을 높이고, 학계와 산업계에서의 활용 가능성을 확장한다. 특히, 훈련 코드와 데이터셋의 완전 오픈소스화는 연구 재현과 발전에 기여한다. 그러나, DAPO의 성능은 Qwen2.5-32B 모델에 의존적이며, 다른 모델 아키텍처나 데이터셋에서의 일반화 가능성은 명시되지 않았다. 또한, 훈련 과정에서 사용된 하이퍼파라미터 세부 사항도 공개되지 않았다.
실용적 활용
DAPO는 수학 및 코딩 경쟁 분야에서 뛰어난 성능을 보이며, AIME와 같은 문제 해결 시스템 개발에 활용 가능하다. 또한, verl 기반의 오픈소스 훈련 코드는 연구자들이 대규모 LLM 강화 학습을 쉽게 구현할 수 있도록 지원한다. 산업적으로는 자동화된 추론 시스템 및 복잡한 의사결정 지원 시스템 개발에 활용될 수 있다.