한 줄 요약
OPD에서 길이 과장 문제를 유발하는 EOS 토큰 불일치를 분석하고, 이를 해결하기 위한 종단 동작 정렬 전략을 제안한다.
핵심 기여도
- Qwen3, Llama, Gemma 모델에서 EOS 토큰 불일치가 길이 과장을 유발함을 밝힘.
- 단순한 디코딩 정지 집합 정렬은 불충분하며, 의미적 EOS 집약이 길이 과장을 3가지 모델에서 완화함을 실험적으로 검증.
- K2-Horizon 훈련 단계를 활용한 단계별 분석을 통해 훈련 중 종단 선호도 변화와 후기 단계 길이 과장 현상을 밝힘.
- 종단 처리 정렬 방법과 평가 프로토콜을 포함한 구현을 공개.
핵심 아이디어
기존 OPD 연구는 길이 과장의 원인을 훈련 목적이나 롤아웃 안정성에 주로 집중했으나, 본 연구는 종단 토큰 불일치가 직접적인 원인일 수 있음을 제시한다. 학습된 종단 확률이 동일한 EOS 집합 내에서도 모델 간 다르게 분포될 수 있으며, 이는 학생 모델의 종단 동작이 교사 모델의 종단 토큰과 일치하지 않을 경우, 학생의 종단 토큰이 부정적 디스틸레이션 신호로 간주되어 억제되는 현상을 유발한다. 예를 들어 Qwen3에서 학생의 종단 확률이 10⁻¹¹ 수준으로 감소하는 현상이 관찰되었다. 이에 따라, 단순한 디코딩 정지 집합 정렬 대신, 의미적으로 동등한 EOS 토큰을 하나의 종단 동작으로 집약하는 전략이 효과적임을 보인다.
기술적 접근법
- **EOS 토큰 불일치 분석**: Qwen3, Llama, Gemma 모델에서 학생과 교사가 동일한 종단 집합을 선언하더라도 학습된 종단 확률이 다른 EOS 토큰에 분포됨을 확인.
- **종단 정렬 전략 비교**: 디코딩 정지 집합 정렬, 의미적 EOS 집약, 종단 토큰 병합 등 4가지 전략을 Qwen3에서 비교.
- **K2-Horizon 단계별 분석**: 사전 훈련, 중간 훈련, 지도 미세조정, 최종 후 훈련 단계에서 종단 선호도 변화를 추적.
- **하이퍼파라미터**: 평가 시 각 문제에 대해 16개 샘플 응답의 평균 정확도를 계산하고, AIME24, AIME25, AMC23 데이터셋에서 종단률, 형식 준수, 정답 추출 성공률을 측정.
주요 결과
- Qwen3에서 학생의 종단 확률이 10⁻¹¹ 수준으로 감소하는 현상이 발생.
- 의미적 EOS 집약 전략은 Qwen3, Llama, Gemma에서 길이 과장을 각각 15%, 12%, 10% 개선.
- K2-Horizon 단계 분석에서 훈련 후기 단계(Phase 3)에서 종단 정렬 이후에도 길이 과장이 지속됨을 밝힘.
- 평가 형식 변화가 정확도 측정에 큰 영향을 미침을 확인 (예: 평가 형식 변화로 정확도 ±5% 변동).
의의 및 한계
본 연구는 OPD에서 종단 토큰 불일치가 길이 과장의 주요 원인임을 밝히며, 종단 동작 정렬이 학습 효과에 중요한 역할을 함을 실증적으로 입증한다. 특히, 단순한 디코딩 인터페이스 정렬이 부족하다는 점을 강조하며, 의미적 EOS 집약이 효과적임을 보인다. 그러나 이는 길이 과장의 유일한 원인이 아니며, 훈련 후기 단계에서 나타나는 추가적인 메커니즘은 아직 명확하지 않다. 또한, 다턴 및 에이전트 기반 환경으로의 확장 가능성은 제시되었으나, 구체적 실험은 수행되지 않았다.
실용적 활용
본 연구의 종단 처리 정렬 전략은 OPD 기반의 모델 축소 및 행동 전이 작업에서 길이 과장을 방지하는 데 유용하게 활용될 수 있다. 특히, Qwen3, Llama, Gemma와 같은 대형 언어 모델의 후 훈련 과정에서 종단 토큰 불일치를 진단하고 해결하는 데 적용 가능하다. 또한, 평가 형식의 영향을 고려한 정확도 측정 프로토콜은 모델 평가의 신뢰성을 높이는 데 기여할 수 있다.