한 줄 요약
MMT-Bench는 31,325개의 다중 선택형 시각 질문을 포함한 종합적인 다모달 벤치마크로, LVLM의 다태스크 AGI 평가를 위한 새로운 기준을 제시한다.
핵심 기여도
- MMT-Bench는 32개의 핵심 메타태스크와 162개의 하위태스크를 포함하며, 기존 MM-Bench 대비 8.1배 더 많은 태스크를 제공.
- 30개 LVLM (예: GPT-4V, GeminiProVision, InternVL-Chat) 평가 결과, GPT-4V는 62.0/100, 55.6/100의 점수로 다태스크 AGI 달성에 큰 여지가 있음.
- 태스크 맵 기반 평가를 통해 도메인 내/외 태스크를 식별할 수 있으며, InternVL-Chat이 폐쇄형 모델을 앞선 성능을 보임.
- 지시 학습 데이터가 많은 모델이 오히려 일반화 능력이 떨어지는 현상을 분석.
핵심 아이디어
기존 다모달 평가 벤치마크는 시각 인식, OCR 등 기본 능력만 평가하며, 다태스크 AGI 달성을 위한 폭넓은 평가가 부족하다는 문제를 지적한다. MMT-Bench는 13가지 이미지 유형(자연 장면, 합성 이미지, 의료 이미지 등)과 14가지 다모달 능력(시각 인식, 위치 추정, 추론, 3D 인식 등)을 포함하여 LVLM의 전반적인 능력을 평가한다. 특히, 도메인 내/외 태스크를 구분하는 태스크 맵을 도입하여 모델의 일반화 능력을 정량적으로 평가할 수 있도록 설계되었다. 이는 LVLM이 실제 세계에서 다양한 상황에 대응할 수 있는지 판단하는 데 중요한 통찰을 제공한다.
기술적 접근법
- **데이터셋**: 31,325개의 다중 선택형 시각 질문, 32개 메타태스크, 162개 하위태스크.
- **이미지 유형**: 13가지 (자연 장면, 합성 이미지, 깊이 맵, 텍스트 풍부 이미지 등).
- **평가 방법**: OpenCompass 프로토콜을 따르며, 정답 추출 단계는 3단계 (옵션 문자, 내용, ChatGPT 추출).
- **모델**: 30개 LVLM (예: InternVL-Chat, GPT-4V, GeminiProVision) 평가.
- **메타태스크 평가**: 각 메타태스크별 정확도를 평균하여 종합 점수 산출.
주요 결과
- GPT-4V는 전체 하위태스크에서 62.0/100, 시각 인식 제외 55.6/100의 점수를 기록.
- InternVL-Chat이 GPT-4V, GeminiProVision을 앞선 성능을 보임.
- BLIP2는 지시 학습 없이도 대부분의 지시 학습 모델을 앞서는 성능을 보임.
- 모델 크기 증가 (7B → 13B)는 LLaVA-v1.5, LLaVA-v1.5-Xtuner의 성능 향상에 기여.
- 특정 프롬프트 (다중 이미지, 좌표 관련)는 일부 모델의 성능을 개선하지만, 대부분의 모델은 시각 프롬프트에서 개선 없음.
의의 및 한계
MMT-Bench는 LVLM의 다태스크 AGI 평가를 위한 체계적인 기준을 제시하며, 도메인 내/외 태스크를 구분하는 태스크 맵을 통해 모델의 일반화 능력을 정량적으로 평가할 수 있다. 이는 LVLM의 실용적 적용 가능성과 연구 방향 설정에 기여할 것으로 기대된다. 그러나 MMT-Bench는 모든 다모달 태스크를 포함하지 못하며, 일부 메타태스크는 하위태스크 수가 다르기 때문에 평균 점수가 편향될 수 있다는 한계가 있다. 또한, 데이터셋이 큐레이션된 것이기 때문에 특정 인구나 상황에 편향될 가능성도 언급된다.
실용적 활용
MMT-Bench는 자율 주행, GUI 네비게이션, 의료 영상 분석 등 다양한 실용 분야에서 LVLM의 성능을 평가하는 데 활용될 수 있다. 또한, 모델 개선 방향을 제시하고, 다태스크 AGI 달성을 위한 연구를 촉진하는 데 기여할 것으로 기대된다.