WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning

Zhepei Wei, Wenlin Yao, Yao Liu, Weizhi Zhang, Qin Lu, Liang Qiu, Changlong Yu, Puyang Xu, Chao Zhang, Bing Yin, Hyokun Yun, Lihong Li

arXiv:2505.16421 · 2026-07-27 공개 · arXiv · PDF

reinforcement-learning chain-of-thought llama qwen end-to-end web-agents behavior-cloning multi-turn-rl

Abstract

While reinforcement learning (RL) has demonstrated remarkable success in enhancing large language models (LLMs), it has primarily focused on single-turn tasks such as solving math problems. Training effective web agents for multi-turn interactions remains challenging due to the complexity of long-horizon decision-making across dynamic web interfaces. In this work, we present WebAgent-R1, a simple yet effective end-to-end multi-turn RL framework for training web agents. It learns directly from online interactions with web environments by asynchronously generating diverse trajectories, entirely guided by binary rewards depending on task success. Experiments on the WebArena-Lite benchmark demonstrate the effectiveness of WebAgent-R1, boosting the task success rate of Qwen-2.5-3B from 6.1% to 33.9% and Llama-3.1-8B from 8.5% to 44.8%, significantly outperforming existing state-of-the-art methods and strong proprietary models such as OpenAI o3. In-depth analyses reveal the effectiveness of the thinking-based prompting strategy and test-time scaling through increased interactions for web tasks. We further investigate different RL initialization policies by introducing two variants, namely WebAgent-R1-Zero and WebAgent-R1-CoT, which highlight the importance of the warm-up training stage (i.e., behavior cloning) and provide insights on incorporating long chain-of-thought (CoT) reasoning in web agents.

한국어 요약

한 줄 요약

WebAgent-R1은 다중 턴 웹 에이전트 학습을 위한 엔드투엔드 강화학습 프레임워크로, WebArena-Lite 벤치마크에서 Llama-3.1-8B의 성공률을 44.8%까지 끌어올렸다.

핵심 기여도

핵심 아이디어

기존 강화학습은 단일 턴 작업에 집중했으나, 웹 환경은 다중 턴, 장거리 결정 과정이 필요하다. WebAgent-R1은 웹 환경과 직접 상호작용하며 이진 보상(성공/실패)만을 사용해 정책을 업데이트하는 방식을 채택했다. 이는 기존 오프-정책 RL이 필요로 하는 복잡한 트레이젝토리 필터링, 보상 모델 학습 등을 생략하고, 온-정책 RL을 통해 실시간 상호작용을 반영하는 학습을 가능하게 한다. 특히, M-GRPO 알고리즘을 다중 턴 환경으로 확장하고, 비동기 트레이젝토리 롤아웃을 통해 학습 효율성을 높였다. 또한, 웹 환경의 동적 변화를 반영하기 위해 HTML 등 수천 토큰의 컨텍스트를 동적으로 압축하는 메커니즘을 도입했다.

기술적 접근법

주요 결과

의의 및 한계

WebAgent-R1은 웹 환경에서의 장거리 다중 턴 상호작용을 효과적으로 학습할 수 있는 엔드투엔드 강화학습 프레임워크로, 기존 오프-정책 RL이 가지던 복잡성과 오버헤드를 줄이고 실시간 학습을 가능하게 한다는 점에서 학술적·실용적 의의가 있다. 특히, 행동 클로닝을 초기화 단계로 활용하고, CoT 추론을 통한 테스트 타임 스케일링 전략을 제시함으로써 웹 에이전트 학습의 새로운 방향을 제시한다. 그러나 웹 환경의 동적 변화에 따라 학습이 불안정해질 수 있으며, 멀티모달 입력이나 GUI 기반 작업으로의 확장 가능성은 아직 검증되지 않았다.

실용적 활용

WebAgent-R1은 웹 브라우징, 온라인 서비스 자동화, 고객 지원 챗봇 등 다중 턴 상호작용이 필요한 웹 기반 시스템에 적용 가능하다. 특히, 웹 환경의 동적 변화에 적응하면서 장거리 결정을 요구하는 상황에서 유용하며, CoT 추론을 통한 테스트 타임 스케일링 전략은 실제 서비스 환경에서 성능을 지속적으로 개선하는 데 활용될 수 있다.