HyperBrowseComp: A Multilingual and Multimodal Stress Test for Web-Browsing Agents

Alham Fikri Aji, Faiz Rizki Ramadhan, Zayd M. K. Zuhri, Seung Hun Eddie Han, Ryandito Diandaru, Qinrong Cui, Jan Christian Blaise Cruz, Badrinath Chandana, Peerawat Chomphooyod, Ahmed Attia, Jonibek Mansurov, Emilio Villa-Cueva, Canh Duong Nguyen, Imran Turganov, Minghao Wu, Peerat Limkonchotiwat, Irina Nikishina

arXiv:2610.03574 · 2026-10-05 공개 · arXiv · PDF

agent-evaluation multimodal-reasoning multilingual cross-lingual web-browsing information-seeking retrieval-harness evidence-discovery

Abstract

We introduce HyperBrowseComp, a multilingual and multimodal browsing benchmark comprising 423 manually authored and human-validated questions across 13 languages, written by native or highly proficient speakers. Questions are designed to be extremely challenging. Each question targets a concise, publicly verifiable answer whose discovery requires locating obscure evidence, following multi-step clue chains, or inspecting heterogeneous sources such as videos, scanned documents, images, or maps. Easier questions are filtered out by evaluating them with models without internet access to reduce the likelihood that they can be answered with parametric knowledge alone. We evaluate several models using provider-native search and a shared external retrieval harness under a common agent protocol. To contextualize model performance and effort, we also conduct a human evaluation on a sample of the questions. HyperBrowseComp provides a challenging testbed for persistent information seeking across languages and evidence modalities, with difficulty arising from discovering and connecting evidence on the open web.

한국어 요약

한 줄 요약

HyperBrowseComp는 13개 언어와 8개 모달성을 포함한 다국어·다모달 웹 탐색 벤치마크로, 423개의 수작업 질문을 통해 웹 에이전트의 정보 탐색 능력을 테스트한다.

핵심 기여도

핵심 아이디어

HyperBrowseComp는 기존 웹 탐색 벤치마크가 다국어 및 다모달성을 충분히 반영하지 못한다는 점을 문제 삼아, 13개 언어와 8개 모달성을 결합한 새로운 테스트 환경을 제시한다. 질문은 문화적 맥락과 언어적 특성을 반영하며, 비문자적 증거(이미지, 영상, 스캔 문서 등)를 해석하고 연결하는 능력을 요구한다. 예를 들어, 게임 플레이 영상에서 언급된 장소에 가까운 은행 정보를 찾기 위해 영상, 지도, 지리적 데이터를 종합적으로 분석해야 한다. 이는 단순한 엔티티 검색을 넘어, 복합적 추론과 다중 단계 탐색을 요구하는 해석적 검색(interpretive search)을 강조한다.

기술적 접근법

주요 결과

의의 및 한계

HyperBrowseComp는 웹 에이전트가 다국어 및 비문자적 증거를 해석하고 연결하는 능력을 체계적으로 평가할 수 있는 테스트베드로, 기존 벤치마크가 다루지 못한 복합적 탐색 과제를 제시한다. 특히, Exa 허네스에서 Gemini 모델의 성능 저하는 내장 검색에 대한 의존도를 드러내며, 허네스 설계가 성능과 비용에 동시에 영향을 미친다는 점을 강조한다. 그러나 일부 질문이 특정 언어나 문화에 지나치게 의존할 수 있으며, 허네스 간 비교가 모델 종속적이라는 한계도 존재한다.

실용적 활용

HyperBrowseComp는 다국어 및 다모달 웹 탐색 에이전트의 개발과 평가에 활용될 수 있으며, 특히 글로벌 정보 검색, 언어별 문화적 맥락 해석, 비문자적 증거 추론 등이 필요한 산업 분야(예: 국제 정보 분석, 언론, 교육)에서 유용할 수 있다.