한 줄 요약
GEPO는 GRPO를 확장한 그룹 기반 정책 최적화 알고리즘으로, 이질적 태스크의 탐색-활용 균형을 개선한다.
핵심 기여도
- GRPO의 정규화된 advantage가 그룹 차이에 따라 통계적으로 비비교 가능하다는 문제를 제시.
- 그룹 기반 비대칭 advantage 조정을 통해 저 그룹의 과활용과 고 그룹의 탐색 감소를 동시에 억제.
- Intern-S1-mini와 Qwen3.5-9B 기반 13개 벤치마크에서 GRPO 및 최근 제어 방법보다 일관된 성능 향상.
- 추가 샘플링 없이 기존 그룹 기반 정책 최적화 방법에 바로 통합 가능.
핵심 아이디어
기존 GRPO는 prompt 그룹 내에서 reward를 표준화하여 상대적 advantage를 계산하지만, 이는 그룹 간 차이가 클 경우 bias를 유발한다. 저 그룹은 과활용이, 고 그룹은 탐색 부족이 문제가 되는데, 기존 제어는 이러한 차이를 무시한다. GEPO는 그룹을 진단 신호로 활용하여, 각 그룹의 수준에 따라 advantage를 비대칭적으로 조정한다. 예를 들어, 저 그룹의 긍정적 advantage는 과활용을 억제하기 위해 감소시키고, 고 그룹의 부정적 advantage는 탐색을 유지하기 위해 감소시킨다. 이는 그룹 기반 적응적 threshold를 사용하여 실현되며, 이 threshold는 지수 이동 평균을 통해 매끄럽게 업데이트된다.
기술적 접근법
- **알고리즘**: GRPO를 확장한 **Group Entropy-Controlled Policy Optimization (GEPO)**.
- **그룹 추정**: 기존 rollout 데이터에서 그룹을 추정.
- **비대칭 advantage 조정**:
- 저 그룹: 긍정적 advantage 감소 → 과활용 억제.
- 고 그룹: 부정적 advantage 감소 → 탐색 유지.
- **적응적 threshold**: 지수 이동 평균(EWM)을 사용해 그룹 기반 threshold를 자동 조정.
- **추가 비용**: 샘플링 없이 기존 그룹 기반 정책 최적화 방법에 바로 적용 가능.
주요 결과
- **데이터셋**: 13개 벤치마크 (수학, 물리, 과학, 코드 생성, 지시어 수행 등).
- **모델**: Intern-S1-mini, Qwen3.5-9B.
- **성능**: GRPO 및 최근 제어 방법 대비 **일관된 평균 성능 향상**.
- **태스크 간 균형**: 태스크별 탐색 수준 유지하면서 **균형 잡힌 개선**.
- **추가 비용**: 0% 샘플링 비용 증가.
의의 및 한계
GEPO는 이질적 태스크의 차이를 반영한 정책 최적화를 가능하게 하며, 기존 그룹 기반 방법에 추가 비용 없이 적용 가능한 경량화된 확장이다. 특히, 태스크별 탐색 패턴을 일관되게 유지하면서도 성능을 개선하는 점에서 실용적 가치가 있다. 다만, 모든 태스크에서 동일한 기반 조정이 최적이라는 보장은 없으며, 특정 태스크에 대한 세부 조정이 필요한 경우 한계가 있을 수 있다. 또한, 그룹 추정의 정확성에 따라 성능이 달라질 수 있으므로, 추후 더 정밀한 추정 방법 연구가 필요하다.
실용적 활용
GEPO는 다태스크 학습 환경에서 특히 유용하며, 대규모 언어 모델의 정책 최적화 과정에서 탐색-활용 균형을 유지해야 하는 상황에 적용 가능하다. 예를 들어, 코드 생성, 수학 문제 풀이, 지시어 수행 등 탐색 요구도가 다른 태스크를 동시에 학습하는 RL 기반 모델 개발에 활용할 수 있다.