한 줄 요약
Mixed SFT는 next-chunk reasoning RL보다 훨씬 저렴하면서도 높은 post-RLVR 성능을 달성한다.
핵심 기여도
- Mixed SFT는 next-chunk reasoning RL 대비 60배 이상 적은 학습 컴퓨트로 더 높은 post-RLVR 성능을 달성함.
- Mixed SFT는 pre-RLVR 정확도가 낮아도 post-RLVR 정확도가 가장 높아, 평가 시 전체 파이프라인을 고려해야 함.
- NTR의 엔트로피 필터는 실제 추론 어려움을 반영하지 않으며, 추론 추적은 로컬 완성으로 퇴화됨.
- Sequential SFT는 no-CoT 데이터 학습 후 long-CoT 데이터 학습으로 인해 이전 지식이 상쇄됨.
핵심 아이디어
기존 연구는 no-CoT 데이터를 활용하기 위해 next-chunk reasoning RL을 제안했으나, 이는 학습 비용이 높고, 실제 성능 향상이 RL 자체인지, no-CoT 데이터 노출 효과인지 구분되지 않았다. 본 연구는 이 문제를 해결하기 위해 Mixed SFT라는 간단한 대안을 제시한다. Mixed SFT는 no-CoT 데이터와 long-CoT 데이터를 단일 단계에서 결합하여 학습함으로써, RLVR 단계에서 더 높은 성능을 발휘할 수 있는 초기 모델을 제공한다. 이는 next-chunk reasoning RL이 추론 추적을 생성하는 과정에서 로컬 패턴에 의존하고, 엔트로피 기반 필터가 실제 추론 어려움을 반영하지 못한다는 분석을 통해 입증된다.
기술적 접근법
- **NTR (Next-Token Reasoning)**: 고엔트로피 토큰을 선택하여 추론 추적을 생성하고, 다음 토큰 예측 능력으로 보상함.
- **NSR (Next-Sentence Reasoning)**: 다음 문장 또는 텍스트 스팬을 예측하는 방식으로, NTR과 유사한 문제점 발생.
- **Mixed SFT**: no-CoT 데이터와 long-CoT 데이터를 단일 단계에서 결합하여 학습.
- **Sequential SFT**: no-CoT 데이터로 먼저 학습한 후, long-CoT 데이터로 학습을 이어감.
- **RLVR (Reinforcement Learning with Verifiable Rewards)**: 추론 추적을 생성하고, 그 추적의 정확도로 보상을 주는 RL 단계.
- **엔트로피 분석**: NTR에서 선택된 토큰의 엔트로피가 일정하게 유지되며, 추론 정확도는 높아지지만 엔트로피는 변화하지 않음.
- **로컬 완성 분석**: NTR 추적은 반복적 템플릿으로 수렴하며, 추론 능력이 제한됨.
주요 결과
- Mixed SFT는 post-RLVR에서 in-domain math와 out-of-domain reasoning 모두에서 가장 높은 정확도를 달성함. 예: 61.1% (Mixed SFT), 48.8% (NTR).
- Mixed SFT는 pre-RLVR 정확도가 27.5%로 가장 낮았으나, post-RLVR에서는 33.7% 증가하며, 다른 방법들보다 3배 이상 높은 개선 폭을 기록함.
- NTR은 60배 이상 적은 학습 컴퓨트를 요구하는 Mixed SFT보다 post-RLVR 성능이 낮음.
- Sequential SFT는 no-CoT 단계에서 학습한 지식이 long-CoT 단계에서 상쇄되어, Mixed SFT보다 낮은 post-RLVR 성능을 보임.
의의 및 한계
Mixed SFT는 next-chunk reasoning RL의 복잡성과 비용을 줄이며, no-CoT 데이터를 효과적으로 활용할 수 있는 간단한 대안을 제시한다. 또한, pre-RLVR 단계의 성능이 post-RLVR 단계의 성능을 정확히 예측하지 못함을 보여주어, no-CoT 학습 전략 평가 시 전체 파이프라인을 고려해야 함을 강조한다. 그러나 Mixed SFT는 no-CoT 데이터와 long-CoT 데이터를 모두 사용해야 하므로, long-CoT 데이터가 부족한 상황에서는 한계가 있을 수 있다. 또한, Mixed SFT가 no-CoT 데이터의 내재적 구조를 어떻게 효과적으로 학습하는지에 대한 이론적 해석이 부족하다는 점도 한계로 지적된다.
실용적 활용
Mixed SFT는 no-CoT 데이터가 풍부한 산업 분야(예: 교육, 연구, 법률 분석)에서 추론 모델 초기 학습에 적용할 수 있으며, 학습 비용을 줄이면서도 높은 추론 성능을 달성할 수 있다. 특히, long-CoT 데이터가 제한적인 상황에서 no-CoT 데이터를 효과적으로 활용할 수 있는 방법으로 활용 가능하다.