한 줄 요약
Muon이 GiGPO 기반의 장기적 희소보상 에이전트 강화학습에서 AdamW 대비 88% 성능 향상을 보인다.
핵심 기여도
- GiGPO 알고리즘 하에서 Muon을 히든 가중치 행렬에만 적용한 결과, ALFWorld에서 최종 윈도우 검증 성공률이 0.290 → 0.546 (+88%) 증가.
- AdamW의 학습률 1e-5, 3e-5에서 Muon은 200 업데이트까지 지속적인 성능 유지, AdamW는 0 성능 유지.
- GRPO에서 Muon은 0.161 → 0.268 성공률 향상, GraphGPO에서는 정규화된 AUC 0.399 → 0.556 향상.
- Muon의 효과는 advantage estimator와 학습률에 따라 달라짐.
핵심 아이디어
Muon은 Adam 계열 최적화기의 요소별 적응 스케일링을 Newton–Schulz (NS) 반복을 통한 모멘텀 행렬의 스펙트럼 정규화로 대체한다. 이는 업데이트 방향의 약한 성분을 강화하는 효과가 있다. 기존 연구에서는 Muon이 단일턴 RLVR에서 실패하는 경우가 많았는데, 이는 샘플링 노이즈가 약한 방향을 지배했기 때문으로 추정된다. 본 연구는 Muon이 장기적 희소보상 에이전트 강화학습에서 성능을 향상시킬 수 있음을 보여주며, 이는 advantage estimator의 구조와 최적화기의 상호작용에 의존한다는 점을 강조한다.
기술적 접근법
- **모델**: Qwen2.5-0.5B-Instruct
- **강화학습 알고리즘**: GRPO, GiGPO, GraphGPO
- **Advantage Estimator**:
- GRPO: 에피소드 수준
- GiGPO: 에피소드 수준 + 스텝 수준 (A = A^E + ωA^S)
- GraphGPO: 상태 전이 그래프 기반
- **최적화기**: Muon (히든 가중치 행렬에만 적용), AdamW (기타 파라미터)
- **학습률**: 1e-5, 3e-5
- **데이터셋**: ALFWorld (장기적 희소보상 태스크)
주요 결과
- **GiGPO + Muon**: ALFWorld 최종 윈도우 검증 성공률 0.290 → 0.546 (+88%)
- **GRPO + Muon**: 0.161 → 0.268 성공률 향상
- **GraphGPO + Muon (1e-5)**: 정규화된 AUC 0.399 → 0.556, 0.5/0.75 성공률 도달 시점 30/60 업데이트 앞당김
- **AdamW 대비 Muon**: 3e-5에서 200 업데이트까지 지속적인 성능 유지, AdamW는 0 성능 유지
의의 및 한계
- Muon은 장기적 희소보상 에이전트 강화학습에서 성능 향상 가능성을 보여주며, advantage estimator와 최적화기의 상호작용이 학습 효과에 큰 영향을 미친다는 점을 강조한다.
- 그러나 실험은 단일 시드, 단일 모델, 단일 환경에서 수행되었으며, 다중 시드, 다양한 모델 및 환경에서의 일반화 가능성은 여전히 열린 문제이다.
- Muon의 효과는 advantage estimator의 구조와 학습률에 매우 민감하며, 이는 최적화기 선택 시 고려해야 할 중요한 요소이다.
실용적 활용
- Muon은 장기적 희소보상 태스크를 다루는 에이전트 강화학습 시스템에서 성능 향상을 위한 최적화기로 활용 가능하다.
- 특히, GiGPO와 같은 복합 advantage estimator와 함께 사용할 경우, 성능 개선 폭이 커질 수 있다.
- 학습률 조정과 함께 Muon 적용이 중요한 성능 요인으로 작용할 수 있으므로, 실제 시스템 개발 시 실험적 검증이 필요하다.