한 줄 요약
DN-MOPD는 전문가 모델들의 피드백 스케일을 정규화하여 MOPD의 성능 한계를 극복하고, 수학 능력 향상과 다중 태스크 성능 향상을 달성한다.
핵심 기여도
- MOPD는 라벨 기반 라우팅만 사용할 때 Qwen3.5 9B, 4B, 2B 모델에서 단일 전문가 학습 모델보다 성능이 낮고, 수학 전문가의 이점을 거의 전달하지 못함.
- MOPD의 피드백은 불균형: 인스트럭션 팔로잉 전문가의 로그-비율 분산은 수학 전문가의 2.3~4.4배이며, 초기 4B 학습자의 경우 94%의 합성 그라디언트가 인스트럭션 팔로잉 손실에서 나옴.
- DN-MOPD는 도메인별 피드백을 배치별 로그-비율 분산으로 정규화하여, 8K 및 16K 평가 예산에서 6개 태스크 평균 성능을 MOPD 대비 1.17~3.08% 향상.
- 고정 가중치 제어 실험에서 DN-MOPD의 성능 개선은 주로 인스트럭션 팔로잉 피드백 억제에서 비롯됨.
핵심 아이디어
MOPD는 도메인별 전문가가 학습자의 응답에 대해 토큰 단위 피드백을 제공하는 방식으로 전문가 모델을 통합하지만, 피드백의 스케일 차이를 고려하지 않아 학습 불균형이 발생한다. 예를 들어, 인스트럭션 팔로잉 전문가의 로그-비율 분산은 수학 전문가의 2.3~4.4배이며, 이는 학습자의 합성 그라디언트에 94%를 차지한다. 이는 단순히 어떤 전문가가 피드백을 제공하는지(라우팅)가 아니라, 그 피드백이 얼마나 강하게 반영되는지도 결정해야 한다는 점을 드러낸다. DN-MOPD는 도메인별 피드백의 로그-비율 분산을 배치별로 측정하고, 이를 기반으로 스케일을 조정하여 불균형을 해소한다. 이는 추가적인 모델이나 라우터 없이 MOPD에 단일 연산만 추가하는 방식으로, MOPD는 모든 스케일러가 1인 특별한 경우가 된다.
기술적 접근법
- **MOPD**: 라벨 기반 라우팅(Label)을 사용하여 도메인에 맞는 전문가가 학습자의 응답에 대해 토큰 단위 로그-확률을 피드백.
- **DN-MOPD**: 도메인별 로그-비율 분산을 측정하고, 이를 기반으로 스케일 조정. 각 도메인의 피드백은 `(전체 분산 / 도메인 분산)` 비율로 클리핑된 곱셈자와 곱함.
- **모델**: Qwen3.5-9B, 4B, 2B.
- **학습 설정**: 8,192 토큰 응답 제한, 80 업데이트, 학습자 시드 42.
- **평가**: AIME25/AIME26(수학), LiveCodeBench(코드), IFEval/IFBench(인스트럭션 팔로잉) 등 6개 태스크.
- **수치**: 8K 평가 예산에서 6개 태스크 평균 성능 향상 2.47~3.08%, 16K에서는 1.17~2.36%.
주요 결과
- **수학**: MOPD는 수학 전문가의 이점을 거의 전달하지 못했으나, DN-MOPD는 대부분의 이점을 회복.
- **6개 태스크 평균**: 8K 평가 예산에서 2.47~3.08% 향상, 16K에서는 1.17~2.36% 향상.
- **인스트럭션 팔로잉**: 고정 가중치 제어 실험에서 DN-MOPD의 성능 개선은 주로 인스트럭션 팔로잉 피드백 억제에서 비롯됨.
- **학습자 시드**: 3개의 시드에서 모두 DN-MOPD가 MOPD를 상회.
의의 및 한계
DN-MOPD는 전문가 모델 통합에서 피드백 스케일 불균형 문제를 해결함으로써, MOPD의 성능 한계를 극복하고 수학 및 다중 태스크 성능을 향상시킨다. 특히, 인스트럭션 팔로잉 전문가의 지나친 영향력을 억제함으로써 학습 불균형을 해소하는 점이 학술적·실용적 가치가 있다. 그러나 본 연구는 Qwen3.5 모델 내에서 한정된 전문가 풀을 사용했으며, 학습자 재훈련 없이 비교했기 때문에 일반화 가능성에 한계가 있다. 또한, 스케일 추정은 도메인 구성과 응답 길이에 따라 달라지고, 클리핑 경계는 크기별로 조정되지 않았다.
실용적 활용
DN-MOPD는 수학, 코드 생성, 인스트럭션 팔로잉 등 다양한 도메인에서 전문가 모델을 통합해야 하는 대형 언어 모델의 후처리 단계에 적용 가능하다. 특히, 인스트럭션 팔로잉 전문가의 지나친 영향력이 학습 불균형을 유발하는 경우, DN-MOPD는 모델 성능을 안정적으로 향상시키는 데 유용하다.