한 줄 요약
AREX는 재귀적 자기 개선을 통해 깊은 연구 성능을 향상시키는 대형 언어 에이전트 시스템이다.
핵심 기여도
- AREX는 **Recursively Self-Improving (RSI)** 프레임워크를 도입하여, **inner research loop**와 **outer self-improvement loop**를 번갈아 수행함으로써 연구 상태를 반복적으로 개선.
- **context-update tool**을 학습하여, **interaction history**를 **improvement state**로 압축, **verified evidence**와 **unresolved constraints**를 보존.
- **4B** 및 **122B-A10B Mixture-of-Experts** 모델을 구현, **BrowseComp**, **WideSearch**, **DeepSearchQA**, **Humanity’s Last Exam (HLE)** 등에서 기존 베이스라인 대비 **성능 향상**.
- **key steps** 강조를 통한 **long-horizon reinforcement learning**으로 희소 보상 문제를 완화.
핵심 아이디어
AREX는 **discovery–verification asymmetry**를 활용한 새로운 연구 에이전트 프레임워크이다. 깊은 연구는 단순히 더 오래 탐색하는 것보다, **중간 결과를 검증**하고 **부분적으로 검증된 상태**를 다음 단계로 전달하는 것이 중요하다는 통찰에서 출발한다. AREX는 **inner research loop**에서 증거를 수집하고 임시 답변을 생성한 후, **outer self-improvement loop**에서 제약 조건별로 답변을 검토하고 미해결 주장에 대한 **targeted follow-up research**를 수행한다. 이 과정에서 **context-update tool**이 **interaction history**를 **improvement state**로 압축하여, **verified evidence**와 **unresolved constraints**를 보존하면서도 불필요한 정보는 제거한다. 이는 외부 모델에 의존하지 않는 자율적인 상태 관리를 가능하게 한다.
기술적 접근법
- **AREX**는 **inner research loop**와 **outer self-improvement loop**를 번갈아 수행.
- **context-update tool**은 **interaction history**를 **improvement state**로 압축, **verified evidence**, **unresolved constraints**, **constraint-satisfaction status**, **next research plan**을 포함.
- 학습은 **verified synthetic tasks**와 **high-quality trajectories**를 통해 이루어짐.
- **long-horizon reinforcement learning**을 사용, **key steps**에서 **decisive evidence** 또는 **erroneous research directions**를 강조.
- **4B** 및 **122B-A10B Mixture-of-Experts** 모델 구현.
- **step-aware training**을 통해 **decision-critical steps** 강화.
주요 결과
- **BrowseComp**, **WideSearch**, **DeepSearchQA**, **Humanity’s Last Exam (HLE)** 등에서 **AREX**가 **comparable-scale baselines** 대비 **성능 향상**.
- **122B-A10B Mixture-of-Experts** 모델은 **substantially more activated parameters**를 사용하는 모델과도 **경쟁력 있음**.
- **key steps** 강조 학습을 통해 **long-horizon research**에서 **final reward**의 희소성 문제 완화.
의의 및 한계
AREX는 **deep research**에서 **multi-constraint satisfaction**을 위한 새로운 프레임워크를 제시하며, **verification-guided state refinement**와 **step-aware optimization**을 통해 **long-horizon research**의 효율성과 신뢰성을 높인다. 특히, **context-update tool**은 **autonomous context management**를 가능하게 하여, 외부 모델에 의존하지 않는 **자체 학습 능력**을 강화한다. 그러나, **step utility estimation** 및 **fine-grained training signal assignment**는 아직 **추가 연구 필요**. 또한, **real-world research tasks**에서의 **robustness**와 **scalability**는 **추후 평가 대상**이다.
실용적 활용
AREX는 **복잡한 다중 제약을 갖는 연구 과제**, **도구 사용이 필요한 추론 작업**, **장기적 탐색이 필요한 정보 수집 시스템** 등에 적용 가능하다. 특히, **자율 연구 에이전트**, **지식 기반 시스템**, **AI 기반 학술 연구 지원 플랫폼** 등에서 활용도가 높다.