한 줄 요약
MMMU-Pro는 MMMU 벤치마크를 기반으로, 시각-언어 통합 능력을 엄격히 평가하는 새로운 멀티모달 평가 기준이다.
핵심 기여도
- MMMU-Pro는 MMMU 기반으로 세 단계(질문 필터링, 선택지 증강, 시각 입력 설정)를 거쳐 더 엄격한 평가를 제공.
- 시각 입력 설정에서 모델 성능이 MMMU 대비 최대 26.9% 감소함을 확인.
- Chain of Thought(CoT)는 성능 향상에 도움이 되나, OCR 프롬프트는 거의 효과 없음.
- 1,730개의 표준 질문과 1,730개의 시각 입력 질문으로 구성됨.
핵심 아이디어
MMMU-Pro는 기존 MMMU 벤치마크가 단순히 통계적 패턴을 학습한 모델을 과도하게 평가할 수 있다는 문제를 해결하기 위해 설계되었다. 특히, 모델이 단순히 텍스트만으로 답할 수 있는 질문을 필터링하고, 선택지를 4개에서 10개로 증가시켜 추측을 어렵게 만든다. 가장 중요한 혁신은 **시각 입력 설정**(vision-only input setting)을 도입한 점이다. 이 설정에서는 질문이 이미지 내에 포함되어 있어 모델이 동시에 "보기"와 "읽기"를 수행해야 하며, 이는 인간의 핵심 인지 능력인 시각-언어 통합을 시뮬레이션한다. 이는 과학 다이어그램 해석, GUI 탐색 등 실제 세계의 복잡한 시나리오를 반영한다.
기술적 접근법
- **질문 필터링**: Llama3-70B-Instruct, Qwen2-72B-Instruct, Yi-1.5-34B-Chat, Mixtral-8×22B-Instruct 4개 모델로 텍스트만으로 답할 수 있는 질문을 10회 반복 실험 후 제거.
- **선택지 증강**: GPT-4o와 Claude 3.5를 활용해 선택지를 4개에서 10개로 증가시키고, 2단계 인적 검토를 통해 질적 다양성 보장.
- **시각 입력 설정**: 사용자가 실제 화면에서 캡처한 스크린샷 또는 사진으로 질문을 제공. 배경, 폰트 스타일, 크기 등을 다양화해 실제 조건을 반영.
- **최종 데이터셋**: 3,460개 질문 (표준 1,730개, 시각 입력 1,730개).
주요 결과
- MMMU-Pro에서 모델 성능은 MMMU 대비 16.8%에서 26.9%까지 감소.
- CoT 프롬프팅은 성능 향상에 도움이 되나, OCR 프롬프트는 대부분의 모델에서 효과 미미.
- 시각 입력 설정은 텍스트와 이미지의 통합 이해를 요구하며, 모델이 단순 OCR 이상의 능력이 필요함을 보여줌.
의의 및 한계
MMMU-Pro는 기존 MMMU가 단순 패턴 학습에 의존하는 모델을 과도하게 평가하는 문제를 해결하며, 실제 세계 시나리오에 더 가까운 평가를 가능하게 한다. 특히, 시각-텍스트 통합 능력을 시험하는 설정은 인간 인지 능력에 근접한 평가 기준을 제시한다. 그러나 MMMU-Pro는 기존 MMMU의 질문을 기반으로 하므로, 새로운 질문 생성 능력을 평가하지는 못한다. 또한, OCR 기술이 발전함에 따라 OCR 프롬프트의 효과가 줄어들고 있어, 단순 텍스트 인식 이상의 능력을 평가하는 새로운 지표 개발이 필요하다.
실용적 활용
MMMU-Pro는 과학, 교육, UI/UX 분야에서 시각-텍스트 통합 능력을 필요로 하는 AI 시스템 개발에 유용한 평가 도구로 활용될 수 있다. 특히, 복잡한 다이어그램 해석, 그래픽 사용자 인터페이스 내 질문 처리, 실제 환경에서의 스크린샷 기반 질의 응답 등에 적용 가능하다.