한 줄 요약
Agentic ESOpt는 GPU 메모리 소요가 적은 진화 전략 기반의 대형 언어 모델 최적화 프레임워크로, WebArena-Lite에서 Qwen3.5-27B 모델을 기반으로 No Skill 기준 대비 6.69% 개선.
핵심 기여도
- Agentic ESOpt는 backpropagation 없이 full-parameter 최적화를 수행하여, Qwen3.5-27B 모델을 4개의 H100 GPU에서 fine-tuning 가능.
- Long-horizon Sudoku에서 Agentic ESOpt는 Qwen3.5-4B 기반의 Agentic RL 대비 12.50% 성능 개선.
- WebArena-Lite에서 Trace2Skill 기준 대비 2.42% 추가 성능 향상.
- 36개 설정 중 28개에서 test-time heuristic design 성능 개선.
핵심 아이디어
Agentic ESOpt는 기존 Agentic RL의 한계를 극복하기 위해 진화 전략(Evolution Strategy, ES)을 기반으로 설계된 full-parameter 최적화 프레임워크이다. RL은 backpropagation을 통해 경로별로 보상을 할당해야 하므로, long-horizon 상황에서는 credit assignment가 어려워지고, 대형 모델 fine-tuning 시 GPU 메모리 부담이 크다. 반면, ES는 black-box 방식으로 parameter perturbation을 샘플링하고, trajectory-level reward를 기반으로 reward-weighted update를 적용함으로써, backpropagation 없이도 full-parameter 최적화가 가능하다. 특히, ES는 trajectory-level parameter attribution을 통해 long-horizon 상황에서도 보상 할당이 용이하며, cosine decay schedule을 도입하여 exploration과 adaptation의 균형을 조절한다.
기술적 접근법
- Agentic ESOpt는 매 스텝마다 현재 LLM 파라미터 주변에서 perturbation을 샘플링하고, 해당 agent를 reward로 평가한 후, reward-weighted update를 적용.
- Perturbation scale σ는 cosine decay schedule을 사용하여, train-time에는 σ_T를 유지해 smoothing regularization을, test-time에는 σ_T를 0으로 감소시켜 점진적 adaptation을 유도.
- Qwen3.5-27B 모델을 WebArena-Lite에서 full-parameter fine-tuning 시, 4개의 H100 GPU에서 수행 가능.
- Prompt-space evolution과 결합하여 skill optimization 및 test-time compute를 지원.
주요 결과
- WebArena-Lite에서 Qwen3.5-27B 모델의 full-parameter 최적화로 No Skill 기준 대비 6.69% 성능 향상.
- Trace2Skill 기준 대비 2.42% 추가 개선.
- Long-horizon Sudoku에서 Qwen3.5-4B 기반 Agentic ESOpt는 Agentic RL 대비 12.50% 성능 향상.
- Test-time 자동 휴리스틱 설계에서 36개 설정 중 28개에서 baseline 대비 성능 개선.
의의 및 한계
Agentic ESOpt는 대형 LLM의 long-horizon fine-tuning에서 RL 대비 GPU 메모리 효율성과 성능 개선을 동시에 달성하며, prompt-space와 parameter-space의 유연한 결합을 가능하게 한다. 특히, backpropagation이 필요 없는 black-box 방식은 복잡한 상호작용 환경에서의 최적화를 용이하게 한다. 그러나 본 연구는 특정 모델(Qwen3.5)과 데이터셋(WebArena-Lite, Sudoku)에 국한된 실험 결과를 기반으로 하며, 다양한 도메인에서의 일반화 가능성은 추가 연구가 필요하다. 또한, population size와 perturbation 스케줄링의 최적화에 대한 심층적 분석도 미흡한 측면이 있다.
실용적 활용
Agentic ESOpt는 웹 탐색, 문서 처리, 수학 문제 해결 등 복잡한 long-horizon task를 수행하는 대형 언어 모델의 fine-tuning에 적용 가능하다. 특히, GPU 메모리 제약이 있는 환경에서 대형 모델의 실시간 최적화 및 test-time 휴리스틱 설계에 유용하게 활용될 수 있다.