한 줄 요약
GPT-4V를 기반으로 한 웹 에이전트 SeeAct는 50%의 실시간 웹사이트 작업 성공률을 기록했으나, 정확한 시각적 접지(grounding)는 여전히 주요 과제이다.
핵심 기여도
- GPT-4V 기반 웹 에이전트 SeeAct를 제안, MIND2WEB 벤치마크에서 50%의 실시간 웹사이트 작업 성공률 달성.
- 기존 텍스트 기반 LLM(GPT-4, FLAN-T5) 대비 최대 30% 성능 개선.
- 실시간 웹사이트를 대상으로 한 새로운 온라인 평가 환경 구축.
- HTML 구조와 시각 정보를 결합한 접지 전략 제안, 기존 set-of-mark prompting 대비 30% 성능 향상.
핵심 아이디어
본 연구는 GPT-4V와 같은 대규모 다중 모달 모델(LMM)이 웹 에이전트로 활용될 수 있는 잠재력을 탐구한다. 기존 웹 에이전트 연구는 HTML 텍스트를 기반으로 텍스트 기반 LLM(GPT-4, FLAN-T5)을 사용했으나, HTML은 시각 정보를 누락시키고 정보 밀도가 낮다. 예를 들어, GPT-4V는 423개의 HTML 요소를 1,445개의 시각 토큰으로 처리할 수 있어 GPT-2 토크나이저 기준 186,490개의 텍스트 토큰 대비 효율적이다. 따라서 본 연구는 시각 정보를 활용한 웹 에이전트 SeeAct를 제안하며, GPT-4V가 웹사이트의 시각적 렌더링을 정확히 이해하고 텍스트 계획을 생성할 수 있음을 보여준다. 그러나 텍스트 계획을 웹사이트의 정확한 HTML 요소와 동작으로 변환하는 접지(grounding)는 여전히 주요 과제로 남는다.
기술적 접근법
- **SeeAct**: GPT-4V를 활용한 웹 에이전트.
- **접지 전략**:
- 이미지 어노테이션과 텍스트 선택을 결합한 DeBERTa-base 크로스-인코더를 사용하여 상위 50개 요소를 랭킹.
- HTML 구조와 시각 정보를 결합한 접지 전략이 기존 set-of-mark prompting 대비 30% 성능 향상.
- **비교 모델**:
- 텍스트 기반 LLM: GPT-3.5, GPT-4, FLAN-T5.
- 다중 모달 모델: BLIP-2.
- **학습 전략**:
- FLAN-T5는 왼쪽에서 오른쪽 언어 모델링을 기반으로 훈련.
- BLIP-2는 ViT-L/14 이미지 인코더와 FLAN-T5 언어 모델을 결합한 형태로 훈련.
주요 결과
- GPT-4V 기반 SeeAct는 **MIND2WEB** 데이터셋에서 **실시간 웹사이트 작업 성공률 50%** 달성.
- GPT-4(20%) 및 FLAN-T5(18%) 대비 **최대 30% 성능 개선**.
- HTML 구조와 시각 정보를 결합한 접지 전략은 기존 이미지 어노테이션 전략 대비 **최대 30% 성능 향상**.
- 온라인 평가에서 **오프라인 평가 대비 20-25% 성능 차이** 발생, 웹사이트 동적성 반영.
의의 및 한계
본 연구는 GPT-4V가 웹 에이전트로서의 잠재력을 입증하며, 특히 시각 정보를 활용한 웹 이해와 계획 생성 능력이 뛰어나다는 점을 보여준다. 또한, 기존 텍스트 기반 LLM 대비 웹 에이전트 성능이 현저히 향상되었으며, 온라인 평가 환경을 도입함으로써 웹사이트의 동적성을 반영한 평가 기준을 제시한다. 그러나 **접지(grounding)**는 여전히 주요 과제로, 최고 성능 전략도 오라클 접지 대비 **20-25% 성능 차이**가 남는다. 이는 LMM이 복잡한 웹사이트의 시각적 요소를 정확히 해석하지 못하는 한계를 드러낸다.
실용적 활용
SeeAct는 웹사이트 자동화, 웹 기반 고객 지원, 웹 크롤링 및 검색 등 다양한 웹 상호작용 시스템에 적용 가능하다. 특히, GPT-4V의 시각 이해 능력을 활용해 복잡한 웹사이트 탐색을 자동화할 수 있으며, HTML과 시각 정보를 결합한 접지 전략은 웹 에이전트의 정확도를 높이는 데 활용될 수 있다.