한 줄 요약
HyperBrowseComp는 13개 언어와 8개 모달성을 포함한 다국어·다모달 웹 탐색 벤치마크로, 423개의 수작업 질문을 통해 웹 에이전트의 정보 탐색 능력을 테스트한다.
핵심 기여도
- 13개 언어, 8개 모달성을 포함한 423개의 수작업 질문으로 구성된 HyperBrowseComp 벤치마크 제시.
- Gemini 3.7 Flash가 31.68%의 정확도를 기록하며 가장 높은 성능을 보임.
- Exa와 OWL을 포함한 3가지 검색 통합 방법을 비교, Gemini 모델이 내장 검색에 강하게 의존함을 밝힘.
- OWL 기반 허네스에서 93개의 종단 실패 발생, 11,486개의 외부 도구 호출 기록.
핵심 아이디어
HyperBrowseComp는 기존 웹 탐색 벤치마크가 다국어 및 다모달성을 충분히 반영하지 못한다는 점을 문제 삼아, 13개 언어와 8개 모달성을 결합한 새로운 테스트 환경을 제시한다. 질문은 문화적 맥락과 언어적 특성을 반영하며, 비문자적 증거(이미지, 영상, 스캔 문서 등)를 해석하고 연결하는 능력을 요구한다. 예를 들어, 게임 플레이 영상에서 언급된 장소에 가까운 은행 정보를 찾기 위해 영상, 지도, 지리적 데이터를 종합적으로 분석해야 한다. 이는 단순한 엔티티 검색을 넘어, 복합적 추론과 다중 단계 탐색을 요구하는 해석적 검색(interpretive search)을 강조한다.
기술적 접근법
- **데이터셋**: 423개의 수작업 질문, 13개 언어, 8개 모달성(텍스트, 이미지, 영상, 오디오, 스캔 문서, 지도 등).
- **평가 방법**: 5개 웹 검색 기능이 있는 최신 LLM을 3가지 검색 통합 방법(내장 검색, Exa, OWL)으로 평가.
- **실험 설정**: OWL 기반 허네스에서 56,342개의 모델 호출, 11,486개의 외부 도구 호출(6,953개의 DuckDuckGo 검색 포함).
- **실패 분석**: OWL 기반 허네스에서 93개의 종단 실패 발생(51개는 타임아웃, 28개는 250번의 모델 호출 제한 초과 등).
주요 결과
- **Gemini 3.7 Flash**: 31.68% 정확도 (5개 모델 중 최고).
- **Exa 허네스**: Gemini 모델의 정확도가 급격히 하락 (내장 검색 대비 16.15% 감소).
- **OWL 허네스**: 462,000 토큰/질문 평균 사용량, Exa 대비 3배 이상 저비용.
- **실패율**: 57.68%의 질문은 5개 모델 모두에서 정답 없음.
의의 및 한계
HyperBrowseComp는 웹 에이전트가 다국어 및 비문자적 증거를 해석하고 연결하는 능력을 체계적으로 평가할 수 있는 테스트베드로, 기존 벤치마크가 다루지 못한 복합적 탐색 과제를 제시한다. 특히, Exa 허네스에서 Gemini 모델의 성능 저하는 내장 검색에 대한 의존도를 드러내며, 허네스 설계가 성능과 비용에 동시에 영향을 미친다는 점을 강조한다. 그러나 일부 질문이 특정 언어나 문화에 지나치게 의존할 수 있으며, 허네스 간 비교가 모델 종속적이라는 한계도 존재한다.
실용적 활용
HyperBrowseComp는 다국어 및 다모달 웹 탐색 에이전트의 개발과 평가에 활용될 수 있으며, 특히 글로벌 정보 검색, 언어별 문화적 맥락 해석, 비문자적 증거 추론 등이 필요한 산업 분야(예: 국제 정보 분석, 언론, 교육)에서 유용할 수 있다.