한 줄 요약
WHALE은 모델 가중치와 실행 가능한 헤이븐 코드를 번갈아 최적화함으로써 에이전트 성능을 향상시키는 모듈식 프레임워크이다.
핵심 기여도
- WHALE은 가중치 업데이트와 헤이븐 검색을 번갈아 수행하는 새로운 조인트 최적화 전략을 제안한다.
- 가중치 업데이트는 온라인 거부 샘플링 미세조정(RSFT), 헤이븐 검색은 Meta-Harness를 사용한다.
- Qwen3.5-2B/4B 에이전트를 사용한 3개 도메인에서 WHALE이 단일 성분 기반 베이스라인 대비 7.67–24.38%포인트 개선을 달성한다.
- 적응형 WHALE은 고정된 일정 대비 성능을 개선한다.
핵심 아이디어
기존 연구는 텍스트 프롬프트만 최적화하고, 헤이븐 코드는 고정한 상태로 모델과 헤이븐을 조인트로 학습하지만, 이는 헤이븐이 모델의 능력을 제한하거나 반대로 모델이 헤이븐의 효과를 무력화할 수 있다. WHALE은 이 문제를 해결하기 위해 가중치 업데이트와 헤이븐 검색을 번갈아 수행함으로써, 두 성분이 서로의 변화에 적응하도록 설계되었다. 이 접근법은 모델과 헤이븐이 서로의 변화에 따라 성능이 달라지는 상호작용을 고려한 것이다. 예를 들어, SearchQA에서는 헤이븐 검색만으로도 최대 가중치 업데이트 성능을 달성할 수 있지만, 수학 문제에서는 가중치 업데이트가 먼저 이루어져야 헤이븐 검색이 효과를 발휘한다.
기술적 접근법
- **가중치 업데이트**: 온라인 거부 샘플링 미세조정(RSFT)을 사용하여 현재 헤이븐 하에서 모델을 업데이트.
- **헤이븐 검색**: Meta-Harness 알고리즘을 사용하여 업데이트된 모델 하에서 더 나은 헤이븐을 검색.
- **업데이트 일정**: 고정된 상수(E=0.6, I=6) 또는 적응형 인내 규칙(patience rule)을 사용하여 언제 업데이트를 전환할지 결정.
- **초기화**: 도메인별 (θ₀, h₀)에서 시작하며, 모든 메서드는 동일한 초기 설정과 업데이트 예산을 사용.
- **샘플링 파라미터**: 온도 1.0, top-p 1.0, top-k 20, 응답 길이 8,192~16,384 토큰.
주요 결과
- **SearchQA**: WHALE은 단일 성분 기반 베이스라인 대비 7.67–24.38%포인트, Fast-Slow Training 대비 4.15–13.00%포인트 개선.
- **Math**: 헤이븐 검색은 가중치 업데이트 없이는 거의 효과 없으나, 가중치 업데이트 후 헤이븐 검색이 성능을 크게 향상.
- **Chess Puzzles**: WHALE은 단계적 최적화(stagewise) 대비 5.32–9.16%포인트 개선, rollout 수는 29–49% 절감.
- **적응형 WHALE**: 고정 일정 대비 성능 개선 관찰됨.
의의 및 한계
WHALE은 모델과 헤이븐을 별도로 최적화하는 기존 접근법의 한계를 극복하고, 두 성분이 서로의 변화에 적응하도록 설계한 첫 번째 모듈식 프레임워크이다. 이는 에이전트 시스템의 전체적인 성능을 향상시키는 데 기여하며, 헤이븐 검색의 표현력이 텍스트 프롬프트에 제한된 기존 연구와 비교해 더 넓은 최적화 가능성을 제시한다. 그러나 WHALE은 특정 도메인에서 헤이븐 또는 가중치가 한쪽으로 치우쳐 병목이 되는 경우를 해결하지 못하며, 헤이븐 검색 알고리즘의 선택이 최종 성능에 큰 영향을 미친다는 점이 한계이다.
실용적 활용
WHALE은 검색 기반 질문 답변, 수학적 추론, 체스 퍼즐 등 다양한 도메인에서 실행 가능한 헤이븐 코드와 모델 가중치를 조합적으로 최적화할 수 있어, 복잡한 에이전트 시스템 설계에 활용 가능하다. 특히, 헤이븐이 모델의 능력을 제한하는 경우에 유용하며, 효율적인 rollout 예산 관리가 필요한 실시간 시스템 개발에도 적용 가능하다.