한 줄 요약
DRACO는 GRPO 내에서 동적 루브릭을 생성하고 이를 기반으로 단계별 보상을 할당하여, AppWorld에서 기존 방법 대비 15.9점 개선된 성능을 달성한 신규 신용 할당 방법이다.
핵심 기여도
- **동적 루브릭 생성**: 정책 롤아웃에 따라 생성된 루브릭이 기존 고정 루브릭 대비 더 유연한 평가를 가능하게 함.
- **GRPO 내 단계별 신용 할당**: 단일 트레젝토리 스칼라를 기반으로 단계별 보상을 할당하며, 학습 모듈 없이 폐형식으로 수행.
- **AppWorld TN에서 15.9점 개선**: 기존 기반 모델 대비 15.9점, GRPO(스파스 보상) 대비 5.3점 성능 향상.
- **τ-bench에서 5.3점 개선**: Frontier judge 없이도 기존 방법을 초과하는 성능.
핵심 아이디어
기존의 RLVR(Verifiable Rewards 기반 강화학습)는 단계별 신용 할당에 있어 종단 보상에 의존하지만, 장기적 환경에서는 단일 스칼라가 단계별 학습에 부적합하다는 문제가 있다. DRACO는 **outcome-blind** 설정에서, 정책의 진화에 따라 **동적 루브릭**(dynamic per-trajectory rubric)을 생성하고, 이를 기반으로 **단계별 신용 할당**(step-level credit assignment)을 수행한다. 이는 GRPO 내에서 루브릭 기반의 단계별 보상을 할당하는 방식으로, 폐형식 분포를 통해 학습 모듈 없이도 신용을 할당한다. 핵심 아이디어는 루브릭 생성과 신용 할당의 두 축을 결합하여, **task-adaptive coverage**와 **faithful per-step attribution**을 동시에 달성하는 것이다.
기술적 접근법
- **동적 루브릭 생성**: 정책의 롤아웃에 따라 생성된 루브릭은 트레젝토리별로 고유하며, 정책의 능력 변화를 반영.
- **단계별 신용 할당**: 루브릭 판정을 기반으로 단계별 보상을 할당. GRPO 내에서 사용되며, 폐형식 분포를 통해 수행.
- **학습 설정**: Qwen3.6-27B는 100스텝(20에포크), Qwen2.5-32B-Instruct는 75스텝(15에포크) 학습.
- **평가 프로토콜**: AppWorld TN/TC, τ-bench에서 각각 50/100턴 제한.
- **모델**: Simplified ReAct Code Agent 스킵프레임워크 사용.
주요 결과
- **AppWorld TN**: DRACO는 기반 모델 대비 15.9점, GRPO(스파스 보상) 대비 5.3점 개선. TGC 85.3 달성.
- **τ-bench**: 기반 모델 대비 5.3점 개선, Frontier judge 없이도 기존 방법을 초과.
- **비용 효율성**: AppWorld TN에서 8.27달러에 85.3점 달성, 기반 모델은 10.77달러에 69.4점.
- **에피소드 길이**: AppWorld TN에서 18.7턴 → 14.7턴으로 단축.
의의 및 한계
DRACO는 **outcome-blind** 설정에서 신뢰성 있는 단계별 신용 할당을 가능하게 하며, AppWorld와 τ-bench에서 기존 방법을 상회하는 성능을 보인다. 특히, 루브릭 생성과 신용 할당을 결합한 방식은 장기적 환경에서의 학습 효율성을 높이는 데 기여한다. 그러나 루브릭의 질이 최종 성능에 큰 영향을 미치며, 루브릭 생성 시 정책의 초기 성능이 낮아지면 신용 할당이 어려울 수 있다. 또한, τ-bench에서는 성능 향상이 비용 증가와 동반되어 있어, 효율성 측면에서 한계가 존재한다.
실용적 활용
DRACO는 고객 지원, 개방형 연구, 복잡한 도구 사용 환경 등에서 **장기적 정책 학습**에 활용 가능하다. 특히, 정량적 성공 기준이 부재하거나, 단계별 신용 할당이 필요한 상황에서 유용하며, **AppWorld**와 유사한 도메인에서 즉시 적용할 수 있다.