한 줄 요약
On-Policy Self-Distillation(자기 교사 정제)은 외부 교사 모델 없이 자기 자신을 교사로 사용하는 학습 방식으로, 수학적 추론에서 성능을 유지하면서 생성 토큰 수를 줄이는 가능성을 제시하지만, 추론 경로의 다양성 감소(콜랩스)라는 주요 문제를 동반한다.
핵심 기여도
- OPSD는 외부 교사 모델 없이 자기 자신을 교사로 사용하여, 생성 토큰 수를 RL 대비 줄일 수 있음.
- 콜랩스는 토큰 가중치, 교사가 보는 정보, 가이던스 감소 시점의 세 가지 레버에 의해 조절됨.
- 기존 연구에서 산재한 현상을 통일된 용어로 정리하고, 학습 이론과 연결함.
- 현재는 외부 교사 없이 토큰 생성을 줄이는 후기 SFT 조정 기법으로, 턴키 솔루션은 아님.
핵심 아이디어
On-Policy Self-Distillation(자기 교사 정제)은 기존 On-Policy Distillation(OPD)에서 요구되는 외부 교사 모델을 제거하고, 학습 중에 학습자가 보지 못하는 특권 정보(privileged information)를 조건으로 학습자 자신을 교사로 사용하는 방식이다. 예를 들어, 학습자는 테스트 시점에 알 수 없는 참조 해법(reference solution)이나 환경 피드백을 조건으로 학습한다. 이는 교사가 학습자보다 정보가 더 많지만 능력은 같다는 점에서 차별화된다. 이 접근법은 토큰 단위의 밀집된 피드백을 제공하면서도, RL의 독립성과 OPD의 밀집 학습을 결합한다. 그러나 이 정보 비대칭성은 콜랩스라는 실패 모드를 유발할 수 있다. 콜랩스는 추론 경로가 점점 줄어드는 현상으로, 토큰 생성 수가 줄어들더라도 모델의 다양성이 낮아지는 문제를 야기한다.
기술적 접근법
- **On-Policy Self-Distillation (OPSD)**: 학습자는 자신을 교사로 사용하며, 교사는 학습자가 테스트 시 알 수 없는 정보(예: 참조 해법, 환경 피드백)를 조건으로 학습한다.
- **Self-Distillation Policy Optimization (SDPO)**: 환경 피드백을 기반으로 교사 역할을 수행.
- **GRPO-style 알고리즘**: RLVR에서 사용되는 정책 업데이트 알고리즘.
- **Privileged Information**: 참조 해법, 계획, 환경 피드백 등.
- **Token-level Scoring**: 교사가 토큰 단위로 학습자의 생성물을 평가.
- **Guidance Decay**: 교사의 가이던스가 훈련 중 감소하는 방식.
- **Pass@k Metric**: 생성된 추론 경로 중 정답을 포함하는 비율을 측정하는 지표.
주요 결과
- **수학적 추론 모델에서 콜랩스 발생**: 토큰 생성 수는 줄어들지만, 추론 경로의 다양성이 감소.
- **Pass@k 지표에서 콜랩스 감지**: 평균 점수나 엔트로피가 높아도, Pass@k가 낮아지면 콜랩스 발생.
- **참조 해법은 전이 성능 저하**: 테스트 시 참조 해법이 제공되지 않으면 성능 저하.
- **SDPO와 RL 비교**: SDPO는 RL보다 토큰 생성 수가 적지만, 콜랩스 위험은 높음.
의의 및 한계
OPSD는 외부 교사 모델 없이 토큰 생성 수를 줄이는 경제적인 학습 방식으로, 수학적 추론 분야에서 초기 성능이 뛰어났다. 그러나 콜랩스 문제로 인해 추론 경로의 다양성이 감소하고, 참조 해법에 의존하면 전이 성능이 저하되는 한계가 있다. 또한, 연구는 대부분 단일 모델 패밀리(예: DeepSeek-R1)와 수십억 파라미터 이하의 모델에서 수행되었으며, 멀티모달이나 에이전트 기반 연구는 제외되어 있어 일반화 가능성에 제약이 있다. 현재로서는 외부 교사 없이 토큰 생성을 줄이는 후기 SFT 조정 기법으로, 턴키 솔루션은 아님.
실용적 활용
OPSD는 기업이 자체적으로 소형 모델을 개발하고자 할 때, 외부 교사 모델 없이 토큰 생성을 줄이는 경제적인 방법으로 활용 가능하다. 그러나 콜랩스 방지를 위한 안전장치(예: 가이던스 감소, 정보 비대칭 제어)가 필요하며, 테스트 시점에 특권 정보가 제공되지 않는 상황에서는 주의가 필요하다. 수학적 추론 외의 분야(예: 멀티모달, 에이전트)에서는 추가 연구가 필요하다.