한 줄 요약
RLVR로 인한 추론 다양성 감소는 계산 시작 단계에서 발생하며, 이는 정확도 향상과 상충하는 문제다.
핵심 기여도
- RLVR로 인한 추론 다양성 감소가 **계산 시작 단계**(entrance)에서 집중적으로 발생함을 밝힘 (PPO, GRPO에서 각각 16×, 11×의 확률 변화).
- **PPO**에서 low-access 계산 패턴의 완료율을 0.018 → 0.212로 10배 이상 회복하는 **entrance prefix 제공** 기법 제시.
- **late-layer parameter interpolation**을 통해 solution coverage 37% 증가시키면서 pass@1 손실 없음.
- 7B 및 14B 모델에서 **6개 수학 벤치마크**에서 early-step entropy collapse가 반복됨을 확인.
핵심 아이디어
RLVR는 단일 샘플 정확도(pass@1)를 향상시키지만, 추론 다양성을 감소시킨다. 이 연구는 이 다양성 감소가 **계산 시작**(entrance) 단계에서 발생하는지, 아니면 계산 중간**(execution)** 단계에서 발생하는지를 구분하기 위해 **Countdown task**를 사용한다. 이 태스크는 **entrance families**로 분류할 수 있으며, 이는 첫 번째 피연산자와 연산자에 의해 정의된다. 연구는 RLVR가 **entrance 단계에서 확률 분포가 급격히 수축**(likelihood shift 11×–16× 증가)함을 밝힘으로써, 추론 다양성 감소의 근본 원인이 **초기 선택**에 있음을 입증한다. 이는 단순히 계산 능력이 저하된 것이 아니라, **다양한 계산 경로를 시작하지 못하는 문제**임을 의미한다.
기술적 접근법
- **Countdown task**를 사용하여 solution space를 **entrance families**로 분할.
- **PPO**와 **GRPO**를 기반으로 Qwen2.5-3B 모델에서 RLVR 훈련 효과 분석.
- **Entrance-clamped rollout**을 통해 execution 단계의 능력을 별도로 평가.
- **Per-token likelihood shift**를 계산하여 entrance 단계의 확률 변화를 측정 (PPO: 16×, GRPO: 11×).
- **Late-layer parameter interpolation** (레이어 20–28)을 통해 solution coverage 37% 증가.
- **SFT–DPO–RLVR** 파이프라인을 사용하여 early-step entropy 유지 가능성 검증.
주요 결과
- **PPO**에서 solution coverage는 0.337 → 0.111로 67% 감소.
- **GRPO**에서는 solution coverage 43% 감소.
- **Low-access families**에서 completion rate는 entrance prefix 제공으로 0.018 → 0.212로 10배 이상 회복.
- **Late-layer parameter interpolation**으로 solution coverage 37% 증가 (pass@1 유지).
- **6개 수학 벤치마크**(GSM8K, MATH500 등)에서 early-step entropy collapse가 7B, 14B 모델에서 반복됨.
- **SFT baseline**은 RLVR 대비 solution coverage가 2배 이상 유지됨.
의의 및 한계
이 연구는 RLVR로 인한 추론 다양성 감소가 **계산 시작 단계에서 발생**함을 명확히 밝힘으로써, 추론 정확도 향상과 다양성 유지 간의 균형 문제를 새로운 관점에서 접근할 수 있도록 한다. 특히, **entrance 단계의 확률 수축**이 주요 원인임을 밝힘으로써, 추론 다양성을 회복하기 위한 **초기 선택에 집중된 개입**이 효과적임을 입증한다. 그러나 이 연구는 **Countdown task**에 기반한 분석이므로, 다른 유형의 추론 문제에 일반화 가능성을 추가 연구가 필요하다. 또한, **모델 크기**(7B, 14B)에 따른 entrance narrowing 현상은 확인되었으나, **더 큰 모델**(예: 100B 이상)에서의 동작은 명시되지 않음.
실용적 활용
이 연구는 **수학 문제 해결**이나 **복잡한 추론 시스템**에서 RLVR로 인한 추론 다양성 감소를 방지하기 위해 **초기 선택 단계에 대한 개입**이 필요함을 보여준다. 예를 들어, **parameter interpolation**이나 **structured entrance sampling**은 추론 정확도를 유지하면서도 다양한 경로를 유지할 수 있는 방법으로, **교육 AI**, **자동화된 수학 문제 풀이 시스템**, **복합 추론 엔진** 등에 적용 가능하다.