한 줄 요약
Open-MOPD는 다중 전문가 정책 증류에서 발생하는 능력 불균형을 진단하고 해결하는 프레임워크로, 토큰 수준 최적화 예산의 부적절한 할당 문제를 해결하여 성능 회복률을 35.6%에서 83.4%로 향상시킨다.
핵심 기여도
- **SmolLM3-3B-Base** 기반의 오라클 라우팅 테스트베드를 구축하여 라우팅 오류를 분리하고, 능력 통합 갭을 정량적으로 진단.
- **토큰 수준 최적화 예산의 부적절한 할당**이 주요 문제임을 밝히고, **3가지 독립적 요인**(시퀀스 길이 차이, 수렴 속도 불균형, 보상 오래됨)을 분리.
- **Open-MOPD** 프레임워크를 제안: **토큰-쉐어 밸런싱**, **가프-어웨어 동적 예산 할당**, **학생 보상 리프레시**를 결합하여 성능 회복률 83.4% 달성.
- **8 × A100-80GB** 환경에서 완전 오픈소스로 구현하여 재현 가능성을 확보.
핵심 아이디어
기존의 다중 교사 정책 증류(M-OPD)는 토큰 수준의 보상으로 학습을 지도하지만, 이 과정에서 토큰 수량에 따라 도메인 간 학습 기회가 불균형하게 분배되는 문제가 발생한다. 예를 들어, 짧은 응답을 요구하는 지시사항 따르기(IF) 태스크는 전체 입력 프롬프트의 20.3%를 차지하지만, 학습에 기여하는 **그라디언트 토큰 비중은 0.99%에 불과**하다. 이는 단순히 라우팅 오류가 아닌, **최적화 예산의 구조적 부조화**에서 비롯된다.
이를 해결하기 위해 Open-MOPD는 **3가지 독립적 메커니즘**을 도입한다. 첫째, **토큰-쉐어 밸런싱**은 시퀀스 길이에 따른 토큰 수량 차이를 해소하고, 둘째, **가프-어웨어 할당**은 학생-교사 간 성능 차이가 큰 도메인에 더 많은 예산을 할당하며, 셋째, **학생 보상 리프레시**는 반복된 미니배치에서 학생 보상이 오래되지 않도록 재계산하여 **샘플 오래됨 문제**를 해결한다. 이 3가지 메커니즘은 각각 **3개의 독립적 실패 원인**에 대응하며, 이를 통해 **단일 학생 모델 내에서 83.4%의 성능 회복률**을 달성한다.
기술적 접근법
- **모델**: SmolLM3-3B-Base를 기반으로, 32,768 토큰 길이 제한을 지원하여 긴 응답 학습 가능.
- **데이터**: 수학, 코드, 지시사항 따르기(IF) 3개 도메인의 전문가 정책을 사용.
- **알고리즘**:
- **토큰-쉐어 밸런싱**: 토큰 수량에 따라 최적화 예산을 동적으로 조정.
- **가프-어웨어 할당**: 학생-교사 간 성능 차이가 큰 도메인에 더 많은 학습 기회 제공.
- **학생 보상 리프레시**: 각 그라디언트 스텝 전에 학생 로그 확률 재계산.
- **하드웨어**: 8 × A100-80GB 환경에서 재현 가능하도록 설계.
주요 결과
- **기존 M-OPD**: RouteRL 대비 35.6%의 성능 회복.
- **Open-MOPD**: RouteRL 대비 83.4%의 성능 회복 (35.6% → 83.4% 향상).
- **IF 태스크**: RouteOPD 대비 6.16 포인트 낮은 성능, 수학 대비 3.3배 더 큰 저하.
- **토큰-쉐어 밸런싱**: 짧은 응답 도메인의 토큰 기여도를 0.99% → 20.3%로 균형 조정.
- **가프-어웨어 할당**: 수렴된 도메인에 예산 낭비 방지, 74스텝에서 학습 붕괴 방지.
- **학생 보상 리프레시**: 샘플 오래됨 문제 해결, 추가 오버헤드 없이 성능 향상.
의의 및 한계
Open-MOPD는 다중 전문가 정책 증류에서 발생하는 **도메인 간 성능 불균형** 문제를 체계적으로 진단하고 해결하는 첫 사례로, **재현 가능한 오픈소스 파이프라인**을 제공하여 연구 재현성과 확장성을 높인다. 특히, **단일 학생 모델 내에서 3개 도메인의 전문성을 통합**하는 데 성공하며, **실용적 모델 합성**에 기여한다.
그러나, **모델 크기**가 충분하지 않으면 **응답 길이 제한으로 학습이 실패**할 수 있다. 예를 들어, Qwen3-1.7B-Base는 69.17–80.42%의 응답이 잘려 학습 효과가 낮았다. 따라서, **충분한 모델 용량**이 필요하며, 이는 연구 및 산업적 적용 시 고려해야 할 한계이다.
실용적 활용
Open-MOPD는 **다중 전문가 모델을 하나의