한 줄 요약
U-OPSD는 외부 지도 없이 모델 자체의 생성물만으로 이루어지는 비지도 온-폴리시 자기-디스틸레이션 방법이다.
핵심 기여도
- U-OPSD는 외부 지도(ground-truth, 환경 피드백, 강력한 모델의 가이드) 없이 모델 스스로 자기 교정을 수행한다.
- 다중 롤아웃을 기반으로 의사결정 일관성을 기준으로 의사결정을 생성하고, 이에 기반한 투표 기반 의사결정을 투사하여 학습한다.
- Qwen3 4B 및 8B 모델에서 AIME24, AIME25, HMMT25, MATH500, AMC23 5개 수학 추론 벤치마크에서 기반 모델 대비 8.5%~10.7% 개선.
- OPSD 대비 평균 3.2%~2.3% 개선, GRPO 대비 0.7%~1.1% 개선.
핵심 아이디어
기존 온-폴리시 디스틸레이션(OPD/OPSD)는 외부 지도(예: ground-truth, 강력한 teacher 모델)에 의존하여 ‘진정한’ 자기-디스틸레이션이 아니었다. 본 연구는 모델이 자체적으로 생성한 여러 롤아웃을 기반으로 내부 일관성을 활용하여 투표를 통해 의사결정을 생성하고, 이 투표 결과를 기반으로 모델 스스로 교정할 수 있음을 제시한다. 이는 모델이 자신이 확신하는 오류를 스스로 수정할 수 있는 구조를 만든다. 핵심 아이디어는 다음과 같다:
1. **다중 롤아웃 샘플링**: 문제 x에 대해 G개의 독립 롤아웃을 샘플링한다.
2. **투표 기반 의사결정 생성**: 각 롤아웃의 최종 답변을 추출하고, 다수결로 의사결정을 생성한다.
3. **일관성 기준 적용**: 투표 비율이 임계값 τ 이상일 경우, 가장 긴 일치 롤아웃을 투사된 ‘가짜 해법’으로 사용하고, 일치하지 않는 롤아웃을 학습 데이터로 활용한다.
4. **자기-디스틸레이션**: 투사된 해법을 조건으로 하여, 일치하지 않는 롤아웃의 prefix에 대해 KL-divergence 기반의 토큰 수준 디스틸레이션을 수행한다.
기술적 접근법
- **모델**: Qwen3 4B, 8B, Qwen3-4B-Instruct-2507, Qwen3-30B-A3B-Instruct-2507.
- **데이터**: AIME24, AIME25, HMMT25, MATH500, AMC23 5개 수학 추론 벤치마크.
- **알고리즘**:
- **샘플링**: 문제 x에 대해 G개의 독립 롤아웃 $ y^{(1)}, \ldots, y^{(G)} \sim \bar{\pi}(\cdot \mid x) $ 생성.
- **답변 추출**: 각 롤아웃에서 $ a^{(g)} = \text{Ans}(y^{(g)}) $ 추출.
- **가짜 해법 생성**: $ \tilde{a}(x) = \arg\max_a \sum_{g=1}^G \mathbbm{1}[a^{(g)} = a] $, $ \tau $ 기준 만족 시 가장 긴 일치 롤아웃 $ y^+ $를 선정.
- **디스틸레이션**: $ D_\beta(P\,\|\,Q) $, 특히 forward KL divergence $ D_{\text{KL}}(P\,\|\,Q) $를 사용하여 일치하지 않는 롤아웃의 prefix $ y^{-}_{<n} $에 대해 학습.
주요 결과
- **Qwen3 4B/8B non-thinking 모드**: 기반 모델 대비 8.5%~10.7% 개선.
- **OPSD 대비 개선 평균**: 3.2% (4B), 2.3% (8B).
- **GRPO 대비 개선 평균**: 0.7% (4B), 1.1% (8B).
- **Qwen3 thinking 모드**: OPSD 대비 0.9% (4B), 동일 (8B). GRPO 대비 0.7%~1.1% 개선.
- **기존 자기-보상 RL 대비 개선 평균**: non-thinking 모드 7.0%~11.3%, thinking 모드 0.8%~1.4%.
의의 및 한계
U-OPSD는 외부 지도 없이도 모델 스스로 자기 교정을 수행할 수 있음을 보여주며, 기존 지도 기반 온-폴리시 디스틸레이션과 동등 또는 우수한 성능을 달성한다. 특히, 투표 기반 의사결정과 내부 일관성 기준을 통해 모델의 오류를 효과적으로 식별하고 교정할 수 있다는 점에서 학술적·실용적 의의가 있다.
그러나, U-OPSD는 투표 기반 의사결정이 일정 수준의 일관성을 요구하므로, 모델이 생성한 롤아웃이 모두 불일치할 경우 학습이 어려울 수 있다. 또한, 투표 기준인 τ가 너무 낮거나 높을 경우, 잘못된 의사결정이 학습에 반영될 수 있다. 따라서 τ의 적절한 설정이 필요하며, 이는 모델과 문제에 따라 달라질 수 있다.
실용적 활용
U-OPSD는 외부 지도가 제한된 환경(예: 비정형 데이터, 비용이 높은 라벨링)에서 모델의 자기-개선을 가능하게 하므로, 대규모 언어 모델의 비지도 학습 및 자가 진단 시스템 구