한 줄 요약
VideoGAIA는 MLLM의 다단계, 도구 활용형 비디오 이해 능력을 평가하는 새로운 벤치마크로, 기존 90% 정확도에 가까운 단일 질문 대답 평가를 넘어서는 새로운 패러다임을 제시한다.
핵심 기여도
- 기존 단일 질문 대답 평가에서 벗어난 다단계, 도구 활용형 비디오 이해 평가 프레임워크 제시.
- 271개의 인간 전문가 검증된 비디오-질문-답변 인스턴스를 포함한 6개 분야의 실제 세계 시나리오를 기반으로 구성.
- GPT-5.5, Kimi-K3 등 최첨단 MLLM이 60% 미만의 정확도를 기록하며, 기존 평가 체계의 한계를 드러냄.
- ReAct 프레임워크 기반의 통일된 평가 환경에서 20개 MLLM을 평가하여, 30~60% 범위의 정확도를 기록.
핵심 아이디어
VideoGAIA는 단일 질문 대답 중심의 비디오 이해 평가에서 벗어나, 비디오 인지, 외부 도구 사용, 다중 턴 간 정보 통합을 요구하는 새로운 평가 패러다임을 제시한다. 이는 비디오 에이전트가 단순히 질문에 답하는 것을 넘어, 비디오를 증거로 활용하여 실제 세계 문제를 해결할 수 있는 능력을 평가하는 것을 목표로 한다.
이를 위해, VideoGAIA는 인간 전문가와 모델이 협업하여 설계한 271개의 비디오-질문-답변 인스턴스를 포함하며, 각 인스턴스는 3명의 전문가에 의해 검증되어 정확성과 적절한 난이도를 보장한다. 평가 시에는 ReAct 프레임워크를 기반으로, 모델이 웹 검색, 페이지 방문, 비디오 재검토 등의 도구를 활용하여 정보를 수집하고 통합하는 과정을 평가한다.
기술적 접근법
- **데이터셋 구성**: 인터넷에서 수집한 10만 개의 공개 비디오를 기반으로, Gemini-3.1-Pro, GPT-5.5 등의 최첨단 모델을 활용한 프레임 레벨 캡션 생성, 증거 기반 태스크 생성, 퀄리티 컨트롤, 크로스-모달 필터링, 도구 필요성 평가, 인간 주석 등 다단계 프로세스를 거쳐 271개의 고질량 비디오 에이전트 태스크를 생성.
- **평가 프로토콜**: ReAct 프레임워크 기반의 통일된 에이전트 루프를 사용. 각 모델은 질문과 20개의 균일하게 샘플링된 프레임을 제공받고, 최대 40개의 에이전트 스텝 동안 웹 검색, 페이지 방문, 비디오 재검토 도구를 활용.
- **도구 사용**: 웹 검색, 페이지 방문, 비디오 재검토 (최대 20개 추가 프레임 샘플링).
- **정확도 평가**: GPT-5.5가 인간 검증된 참조 답과 비교하며, DeepSeek-V4-Pro가 보조 평가자로 사용됨.
- **모델 평가**: 20개의 최첨단 MLLM을 동일 조건에서 평가.
주요 결과
- **모델 성능**: 20개의 최첨단 MLLM이 평가되었으며, 모든 모델의 정확도는 30~60% 범위에 머무름.
- **최고 성능 모델**: Seed2.0-Pro가 58.30%의 정확도를 기록.
- **기존 벤치마크 대비 성능 차이**: GPT-5.5, Kimi-K3 등이 60% 미만의 정확도를 기록하며, 기존 90%에 가까운 Video-MME 등과 비교해 현저히 낮은 성능을 보임.
- **도구 사용 효과**: 도구 호출 횟수 증가가 반드시 성능 향상으로 이어지지 않음. 적응적 증거 수집과 검증이 성공에 핵심.
의의 및 한계
VideoGAIA는 단일 질문 대답 중심의 비디오 이해 평가에서 벗어나, 비디오를 증거로 활용하는 에이전트 중심의 평가 체계를 제시함으로써, MLLM의 진정한 비디오 이해 능력을 평가할 수 있는 새로운 기준을 제시한다. 특히, 271개의 고질량 인스턴스와 ReAct 기반 평가 프로토콜은 비디오 에이전트 연구의 발전에 기여할 것으로 기대된다.
그러나, VideoGAIA는 아직 초기 단계의 벤치마크이며, 도구 사용의 효과성, 비디오-텍스트 간의 일관성, 모델의 장기적 추론 능력 등에 대한 추가 연구가 필요하다. 또한, 도구 사용 시 모델이 제공하는 요약 정보의 질이 최종 성능에 영향을 줄 수 있다는 점도 한계로 지적된다.
실용적 활용
VideoGAIA는 비디오 에이전트가 실제 세계 문제를 해결하는 능력을 평가하는 데 활용될 수 있으며, 특히 교육, 엔터테인먼트, 보안, 의료 등 비디오 기반 정보를 활용하는 산업 분야에서 모델의 신뢰성과 실용성을 평가하는 데 유용할 수 있다. 또한, MLLM의 도구 활용 능력과 장기적 추론 능력을 개선하기 위한 연구에도 기여할 수 있다.