한 줄 요약
MathVerse는 MLLMs가 수학 문제의 다중 모달 정보를 얼마나 정확히 해석하는지를 평가하기 위한 새로운 수학 시각적 벤치마크이다.
핵심 기여도
- MathVerse는 2,612개의 고질량 수학 문제를 기반으로 15K개의 테스트 샘플을 생성하여, MLLMs의 시각 수학 문제 해결 능력을 체계적으로 평가한다.
- 각 문제는 6가지 버전으로 변환되어, 텍스트 정보의 양을 조절함으로써 MLLMs가 시각 정보를 얼마나 의존하는지를 측정한다.
- CoT(Coordinate of Thought) 평가 전략을 제안하여, 단순 정답 여부가 아닌 중간 추론 과정을 GPT-4(V)를 활용해 세부적으로 분석한다.
- 실험 결과, Qwen-VL-Max와 InternLM-XComposer2는 시각 정보 없이도 5% 이상 정확도가 높아지는 것으로 나타나, MLLMs가 시각 정보를 제대로 해석하지 못함을 드러낸다.
핵심 아이디어
기존의 시각 수학 문제 벤치마크는 텍스트에 과도한 정보가 포함되어 있어, MLLMs가 실제 시각 정보를 해석하지 않고 텍스트만으로 정답을 유추할 수 있는 문제가 있었다. 이를 해결하기 위해 MathVerse는 문제의 텍스트 정보를 점진적으로 제거하고, 대신 시각 정보를 강화한 6가지 버전을 생성하여, MLLMs가 얼마나 시각 정보를 해석하는지를 정확히 평가한다. 또한, CoT 평가 전략을 통해 단순 정답 여부가 아닌 추론 과정을 세부적으로 분석함으로써, MLLMs의 추론 품질을 정량적으로 평가한다. 이는 기존의 이진 평가 방식보다 훨씬 세밀한 분석이 가능하다.
기술적 접근법
- **데이터셋**: 2,612개의 수학 문제를 공개 자료에서 수집, 15K개의 테스트 샘플 생성.
- **문제 변환**: 각 문제는 6가지 버전으로 변환되며, 텍스트 정보를 점진적으로 제거하고 시각 정보를 강화함.
- **CoT 평가 전략**: GPT-4(V)를 사용해 추론 단계를 추출하고, 각 단계를 세부적으로 평가.
- **평가 모델**: ChatGPT, GPT-4, Qwen-VL-Max, InternLM-XComposer2, GPT-4V, ShareGPT4V 등 20개 이상의 MLLMs 평가.
- **분석 방법**: 각 문제는 12개의 세부 카테고리로 분류되어, 다양한 수학적 추론 능력을 평가.
주요 결과
- Qwen-VL-Max는 시각 정보 없이도 5% 이상 정확도가 높아지는 것으로 나타남 (5%+ higher accuracy without visual input).
- GPT-4V와 ShareGPT4V는 다른 MLLMs에 비해 시각 정보 해석 능력이 상대적으로 우수함.
- Gemini-Pro는 전체 정확도 35.3%로, 평균적으로 상위권 성능을 보임.
- LLaVA-NeXT는 17.2%의 전체 정확도를 기록, Open-source MLLMs 중 상대적으로 높은 성능.
- Human 정확도는 64.9%로, MLLMs의 성능과 비교하여 상당한 격차가 있음.
의의 및 한계
MathVerse는 기존의 시각 수학 문제 벤치마크가 텍스트 정보에 의존하는 문제를 해결하고, MLLMs가 실제 시각 정보를 해석하는 능력을 체계적으로 평가할 수 있는 새로운 평가 프레임워크를 제시한다. CoT 평가 전략은 단순 정답 평가를 넘어, 추론 과정을 세부적으로 분석함으로써 MLLMs의 추론 품질을 정량적으로 평가할 수 있는 기반을 제공한다. 그러나 MathVerse는 수학 문제에만 집중하며, 다른 분야의 다중 모달 추론 능력을 평가하지는 않는다. 또한, 일부 MLLMs는 여전히 시각 정보를 제대로 해석하지 못하는 것으로 나타나, MLLMs의 시각 이해 능력 향상이 필요하다.
실용적 활용
MathVerse는 MLLMs의 시각 수학 문제 해결 능력을 평가하는 데 활용될 수 있으며, 교육 분야에서 시각 수학 문제를 다루는 AI 도구 개발에 기여할 수 있다. 또한, MLLMs의 추론 과정을 세부적으로 분석할 수 있는 CoT 평가 전략은, 의료, 공학 등 다양한 분야에서 복잡한 추론 과정을 평가하는 데도 활용될 수 있다.