MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI

Kaining Ying, Fanqing Meng, Jin Wang, Zhiqiang Li, Han Lin, Yue Yang, Hao Zhang, Wenbo Zhang, Yuqi Lin, Shuo Liu, Jiayi Lei, Quanfeng Lu, Runjian Chen, Peng Xu, Renrui Zhang, Haozhen Zhang, Peng Gao, Yali Wang, Yuning Qiao, Ping Luo, Kaipeng Zhang, Wenqi Shao

arXiv:2404.16006 · 2026-07-27 공개 · arXiv · PDF

vision-language model-evaluation multimodal-understanding multimodal-benchmark large-vision-language-models embodied-navigation multitask-agi task-map

Abstract

Large Vision-Language Models (LVLMs) show significant strides in general-purpose multimodal applications such as visual dialogue and embodied navigation. However, existing multimodal evaluation benchmarks cover a limited number of multimodal tasks testing rudimentary capabilities, falling short in tracking LVLM development. In this study, we present MMT-Bench, a comprehensive benchmark designed to assess LVLMs across massive multimodal tasks requiring expert knowledge and deliberate visual recognition, localization, reasoning, and planning. MMT-Bench comprises $31,325$ meticulously curated multi-choice visual questions from various multimodal scenarios such as vehicle driving and embodied navigation, covering $32$ core meta-tasks and $162$ subtasks in multimodal understanding. Due to its extensive task coverage, MMT-Bench enables the evaluation of LVLMs using a task map, facilitating the discovery of in- and out-of-domain tasks. Evaluation results involving $30$ LVLMs such as the proprietary GPT-4V, GeminiProVision, and open-sourced InternVL-Chat, underscore the significant challenges posed by MMT-Bench. We anticipate that MMT-Bench will inspire the community to develop next-generation multimodal foundation models aimed at achieving general-purpose multimodal intelligence.

한국어 요약

한 줄 요약

MMT-Bench는 31,325개의 다중 선택형 시각 질문을 포함한 종합적인 다모달 벤치마크로, LVLM의 다태스크 AGI 평가를 위한 새로운 기준을 제시한다.

핵심 기여도

핵심 아이디어

기존 다모달 평가 벤치마크는 시각 인식, OCR 등 기본 능력만 평가하며, 다태스크 AGI 달성을 위한 폭넓은 평가가 부족하다는 문제를 지적한다. MMT-Bench는 13가지 이미지 유형(자연 장면, 합성 이미지, 의료 이미지 등)과 14가지 다모달 능력(시각 인식, 위치 추정, 추론, 3D 인식 등)을 포함하여 LVLM의 전반적인 능력을 평가한다. 특히, 도메인 내/외 태스크를 구분하는 태스크 맵을 도입하여 모델의 일반화 능력을 정량적으로 평가할 수 있도록 설계되었다. 이는 LVLM이 실제 세계에서 다양한 상황에 대응할 수 있는지 판단하는 데 중요한 통찰을 제공한다.

기술적 접근법

주요 결과

의의 및 한계

MMT-Bench는 LVLM의 다태스크 AGI 평가를 위한 체계적인 기준을 제시하며, 도메인 내/외 태스크를 구분하는 태스크 맵을 통해 모델의 일반화 능력을 정량적으로 평가할 수 있다. 이는 LVLM의 실용적 적용 가능성과 연구 방향 설정에 기여할 것으로 기대된다. 그러나 MMT-Bench는 모든 다모달 태스크를 포함하지 못하며, 일부 메타태스크는 하위태스크 수가 다르기 때문에 평균 점수가 편향될 수 있다는 한계가 있다. 또한, 데이터셋이 큐레이션된 것이기 때문에 특정 인구나 상황에 편향될 가능성도 언급된다.

실용적 활용

MMT-Bench는 자율 주행, GUI 네비게이션, 의료 영상 분석 등 다양한 실용 분야에서 LVLM의 성능을 평가하는 데 활용될 수 있다. 또한, 모델 개선 방향을 제시하고, 다태스크 AGI 달성을 위한 연구를 촉진하는 데 기여할 것으로 기대된다.