한 줄 요약
QwenGyre는 xLong-horizon RL에서 GPU 재할당과 트래젝토리 처리를 통해 1.85× 가속을 달성한 엘라스틱 RL 프레임워크이다.
핵심 기여도
- **Elastic Scheduler**를 도입하여 GPU를 롤아웃과 훈련 간 실시간 재할당함.
- **Trajectory Processor**를 통해 복잡한 분기 트래젝토리를 재구성하고 중복 경로를 제거함.
- Qwen 3.8 2.4T 모델에서 NL2RepoBench에서 6.0% 절대 성능 향상 (52.5% → 58.5%)를 48 스텝 만에 달성함.
- Colocate 대비 최대 1.85×, Async 대비 최대 1.78×의 속도 향상을 보임.
핵심 아이디어
기존 온라인 RL은 xLong-horizon 작업에서 GPU 활용률 저하와 트래젝토리 중복 문제를 겪는다. QwenGyre는 이를 해결하기 위해 **Elastic Scheduler**와 **Trajectory Processor**를 결합한 새로운 프레임워크를 제안한다. Elastic Scheduler는 GPU 수요에 따라 롤아웃과 훈련 간 자원을 동적으로 재할당하며, 훈련 중에도 롤아웃이 중단되지 않도록 보장한다. Trajectory Processor는 분기된 트래젝토리를 트리 구조로 재구성하고, 공통된 경로를 제거함으로써 훈련 비용을 제어한다. 이는 특히 1M 토큰 이상의 롤아웃에서 효과적이다.
기술적 접근법
- **Elastic Scheduler**: GPU를 롤아웃과 훈련 간 실시간 재할당하며, 새로운 GPU가 훈련 배치에 즉시 참여할 수 있도록 허용.
- **Streaming Training**: 데이터 병렬 그룹 간 작업 분배를 통해 훈련 지연 최소화.
- **Trajectory Processor**: 트래젝토리 트리 구조로 분기 경로를 저장하고, 공유된 출력은 1회만 계산.
- **Token Loss Averaging**: 각 실행 내 토큰 손실을 평균화하여 경로 수에 따른 과중 가중치 방지.
- **Dataset**: NL2RepoBench, DeepSWE, TerminalBench 사용.
- **Model**: Qwen 3.6 122B 및 Qwen 3.8 2.4T.
주요 결과
- **NL2RepoBench**: Qwen 3.8 2.4T 모델에서 48 훈련 스텝 후 점수 52.5% → 58.5% (6.0% 절대 개선).
- **Speedup**: Colocate 대비 최대 1.85×, Async 대비 최대 1.78×.
- **Training Cost**: 중복 경로 제거로 훈련 샘플 수 감소 및 토큰 손실 최적화.
의의 및 한계
QwenGyre는 xLong-horizon 작업에서 GPU 활용률을 극대화하고, 복잡한 트래젝토리 처리를 효율적으로 수행함으로써 온라인 RL의 확장성을 높인다. 특히, 1M 토큰 이상의 롤아웃에서 성능 향상이 두드러지며, 대규모 모델(Qwen 3.8 2.4T)에서도 안정적으로 작동함을 입증했다. 그러나 본 논문은 특정 도메인(NL2RepoBench 등)에 국한된 실험을 수행했으며, 다른 유형의 xLong-horizon 작업에서의 일반화 가능성은 명시되지 않았다.
실용적 활용
QwenGyre는 소프트웨어 개발 자동화, 대규모 코드베이스 리팩토링, 복잡한 시스템 재구현 등 장기 실행이 필요한 AI 에이전트 개발에 적용 가능하다. 특히, GPU 자원을 효율적으로 관리해야 하는 클라우드 기반 RL 훈련 환경에서 유용하다.