한 줄 요약
WebVoyager는 실제 웹사이트와 상호작용하여 사용자 지시를 end-to-end로 처리하는 LMM 기반 웹 에이전트로, 59.1%의 태스크 성공률을 달성했다.
핵심 기여도
- WebVoyager는 실제 웹사이트와 상호작용하는 end-to-end 웹 에이전트로, 15개 인기 웹사이트에서 수집한 643개의 웹 태스크를 기반으로 평가되었다.
- GPT-4V를 활용한 자동 평가 프로토콜을 제안하여, 인간 평가와 85.3%의 일치율을 달성했다.
- WebVoyager는 GPT-4 (All Tools) (30.8%)와 텍스트 전용 설정 (40.1%) 대비 59.1%의 태스크 성공률을 기록하며 우수한 성능을 보였다.
핵심 아이디어
기존 웹 에이전트는 텍스트 또는 시뮬레이션 환경에서만 작동하며, 실제 웹 환경에서의 시각적 요소를 고려하지 못하는 한계가 있었다. WebVoyager는 사용자의 질의를 처리하기 위해 스크린샷과 텍스트를 동시에 분석하고, 클릭, 타이핑, 스크롤링 등의 행동을 실행하는 end-to-end 웹 에이전트이다. Set-of-Mark Prompting 기법을 활용하여 스크린샷 상의 상호작용 요소를 표시해 의사결정을 돕는다. 이는 인간의 웹 탐색 행동을 모방하여, 실제 웹 환경에서의 태스크 수행 능력을 향상시키는 핵심 아이디어이다.
기술적 접근법
- **모델**: WebVoyager는 Large Multimodal Model (LMM)을 기반으로 하며, 스크린샷과 텍스트를 동시에 처리한다.
- **입력 처리**: 사용자 질의와 웹사이트 스크린샷, 텍스트 요소를 결합하여 행동을 결정한다.
- **평가 프로토콜**: GPT-4V를 활용한 자동 평가 시스템을 도입하여, 탐색 과정의 스크린샷과 최종 결과를 기반으로 성공 여부를 판단한다.
- **데이터셋**: 15개 인기 웹사이트에서 수집한 643개의 웹 태스크를 포함한 새로운 벤치마크를 제안했다.
- **비교 대상**: GPT-4 (All Tools)와 WebVoyager 텍스트 전용 버전과 비교 실험을 수행했다.
주요 결과
- WebVoyager는 제안된 벤치마크에서 59.1%의 태스크 성공률을 달성했다.
- GPT-4 (All Tools) (30.8%) 대비 +28.3%, WebVoyager 텍스트 전용 (40.1%) 대비 +19.0% 개선.
- GPT-4V 기반 자동 평가 시스템은 인간 평가와 85.3%의 일치율을 기록했다.
의의 및 한계
WebVoyager는 실제 웹 환경에서의 시각적 요소를 고려한 end-to-end 웹 에이전트로서, 웹 자동화 분야의 기술 발전에 기여한다. 특히, GPT-4V를 활용한 자동 평가 프로토콜은 웹 에이전트 평가의 신뢰성을 높이는 데 기여한다. 그러나, 일부 복잡한 태스크에서는 여전히 성공률이 낮으며, 다양한 웹사이트의 동적 변화에 대한 적응력 향상이 필요하다.
실용적 활용
WebVoyager는 웹 기반 자동화, 온라인 고객 지원, 데이터 수집 및 분석 등 다양한 산업 분야에서 활용 가능하다. 특히, 실제 웹 환경에서의 태스크 수행 능력을 갖춘 웹 에이전트는 기업의 디지털 트랜스포메이션을 지원하는 데 유용하다.