한 줄 요약
MMBench-Video는 장시간 영상과 다양한 능력을 기반으로 LVLM의 비디오 이해력을 체계적으로 평가하는 새로운 벤치마크이다.
핵심 기여도
- MMBench-Video는 YouTube에서 수집한 600개 이상의 장시간 영상(30초~6분)을 포함하며, 26개의 세부 능력에 걸친 2,000개 이상의 QA 쌍을 제공.
- 기존 GPT-3.5 기반 평가의 한계를 극복하기 위해 GPT-4를 도입하여 자동 평가 시 정확도와 일관성을 개선.
- 다양한 오픈소스 및 프로퍼티어리 LVLM(예: Idefics2, InternVL-Chat-v1.5)을 평가하여 Video-LLMs가 기존 LVLM들에 비해 상당한 성능 차이를 보임을 밝힘.
- VLMEvalKit에 통합될 평가 코드를 제공하여 연구자들이 쉽게 활용할 수 있도록 개방.
핵심 아이디어
기존 VideoQA 벤치마크는 대부분 짧은 영상(1분 미만)에 초점을 맞추고, 시간적 맥락을 제대로 평가하지 못한다는 한계가 있었다. MMBench-Video는 이 문제를 해결하기 위해 실제 웹 사용자들이 접하는 30초에서 6분까지의 장시간 영상을 사용하며, 시간적 추론 능력을 평가하는 ‘temporal indispensable’ 질문을 포함시켰다. 또한, 기존 GPT-3.5 기반 평가가 인간 판단과의 일치도가 낮다는 문제를 인식하고, GPT-4를 도입하여 평가의 신뢰도를 높였다. 이는 특히 QA 쌍의 길이와 스타일이 다양하기 때문에 의미 있는 평가를 가능하게 한다는 점에서 혁신적이다.
기술적 접근법
- **영상 데이터**: YouTube에서 수집한 600개 이상의 영상, 평균 길이 30초~6분, 16개 주요 카테고리(예: 뉴스, 스포츠).
- **질문 생성**: 2,000개 이상의 QA 쌍, 26개의 세부 능력(예: 시간적 추론, 객체 관계 인식)을 기반으로 봉사자에 의해 작성.
- **평가 방법**: GPT-4 기반 자동 평가 시스템을 도입, GPT-3.5 대비 정확도와 일관성 향상.
- **모델 평가**: Video-LLMs 및 이미지 기반 LVLMs(예: Idefics2, InternVL-Chat-v1.5)를 VLMEvalKit을 통해 평가. 최대 512 토큰으로 제한, 그리디 디코딩 사용.
주요 결과
- **Video-LLMs 성능**: MMBench-Video에서 기존 Video-LLMs는 프로퍼티어리 LVLMs 및 일부 오픈소스 LVLMs(예: Idefics2)에 비해 상당히 낮은 성능을 보임.
- **GPT-4 평가**: GPT-4 기반 평가가 GPT-3.5 기반 평가 대비 정확도와 인간 판단과의 일치도가 향상됨.
- **영상 이해력 차이**: Video-LLMs는 공간적 이해력(이미지 VQA)에서도 LVLMs에 비해 뒤처져 있음.
- **세부 능력 평가**: 26개의 세부 능력에서 LVLMs 간 성능 차이가 명확히 드러남.
의의 및 한계
MMBench-Video는 기존 VideoQA 벤치마크의 한계를 극복하고, 장시간 영상과 다양한 능력을 기반으로 LVLM의 비디오 이해력을 체계적으로 평가할 수 있는 중요한 도구로 기능한다. 특히, GPT-4 기반 평가 시스템은 인간 판단과의 일치도를 높여 평가의 신뢰도를 향상시켰다. 그러나, 일부 영상의 품질이나 질문의 다양성에 대한 한계는 여전히 존재하며, 더 많은 데이터와 평가 방법의 개선이 필요하다. 또한, 일부 프로퍼티어리 모델의 평가 결과는 공개되지 않았다.
실용적 활용
MMBench-Video는 영상 기반 대화형 AI, 영상 요약, 콘텐츠 추천 시스템 등에서 LVLM의 성능을 정확히 평가하는 데 활용될 수 있다. 특히, 시간적 맥락을 강조하는 영상 콘텐츠(예: 뉴스, 교육 영상) 분석에 적합하며, 연구자들이 모델의 시간적 추론 능력을 개선하는 데 중요한 기준이 될 수 있다.