한 줄 요약
MLLM-as-a-Judge 벤치마크를 통해 MLLM의 판단 능력을 평가하고, 인간 기준과의 차이를 분석한다.
핵심 기여도
- MLLM-as-a-Judge라는 새로운 벤치마크를 제안하여, Scoring Evaluation, Pair Comparison, Batch Ranking 세 가지 평가 설정에서 MLLM의 판단 능력을 평가.
- GPT-4V, Gemini, LLaVA-1.6-34b 등 11개 MLLM 모델을 평가하여, Pair Comparison에서는 높은 인간 유사도를 보이지만, Scoring Evaluation과 Batch Ranking에서는 인간 기준과 큰 차이가 있음.
- MLLM-as-a-Judge-HQ와 MLLM-as-a-Judge-Hard라는 두 개의 데이터셋을 공개하여 향후 연구를 지원.
- CoT와 Vision Expert System를 활용하여 MLLM의 판단 편향(egocentric, position, length bias)과 hallucination을 완화할 수 있음.
핵심 아이디어
기존 LLM-as-a-Judge 개념을 다중 모달로 확장한 MLLM-as-a-Judge 벤치마크를 제안함. 이는 MLLM이 인간과 얼마나 유사한 판단을 할 수 있는지를 평가하기 위한 체계적인 프레임워크를 제공한다. 특히, Pair Comparison에서는 GPT-4V가 높은 인간 유사도를 보였지만, Scoring Evaluation과 Batch Ranking에서는 MLLM들이 인간 기준과 큰 차이를 보임. 이는 MLLM이 단순한 비교보다는 정량적 평가나 다중 항목 순위 매기기에서 어려움을 겪는다는 점을 시사한다. 연구는 CoT와 Vision Expert System를 도입함으로써 판단 편향과 hallucination을 줄이는 방안을 제시함.
기술적 접근법
- **데이터셋**: 14개의 데이터셋에서 4,414개의 image-instruction pair를 수집.
- **모델**: GPT-4V, Gemini, LLaVA-1.5-13b, LLaVA-1.6-34b, CogVLM, Qwen-VL-Max 등 11개 MLLM을 평가.
- **평가 설정**: Scoring Evaluation, Pair Comparison, Batch Ranking 세 가지 태스크에서 평가.
- **추가 기법**: CoT(Chain-of-Thought)와 Vision Expert System을 도입하여 판단 편향과 hallucination을 완화.
- **인간 평가**: MLLM의 판단 결과를 엄격한 기준으로 인간 평가자에 의해 재검토.
주요 결과
- **Pair Comparison**: GPT-4V가 높은 인간 유사도를 보임.
- **Scoring Evaluation**: MLLM들이 인간 기준과 큰 차이를 보임.
- **Batch Ranking**: MLLM들의 평가 결과가 인간 기준과 불일치.
- **Hallucination 및 편향**: MLLM들이 egocentric bias, position bias, length bias 등 다양한 편향을 보임.
- **CoT 적용**: CoT를 사용하면 일부 편향과 hallucination을 줄일 수 있음.
의의 및 한계
이 연구는 MLLM을 인간과 유사한 판단을 할 수 있는 평가자로 사용할 수 있는지에 대한 체계적인 평가를 제공하며, MLLM의 판단 능력 한계를 명확히 드러냄. 특히, Pair Comparison에서의 성능은 MLLM의 잠재력을 보여주지만, Scoring Evaluation과 Batch Ranking에서의 부족함은 MLLM을 신뢰할 수 있는 평가자로 삼기에는 아직 한계가 있음을 시사함. 한계로는 MLLM의 내재적 편향과 hallucination 문제가 지적되며, CoT나 Vision Expert System을 도입하는 등의 기법이 필요함.
실용적 활용
MLLM-as-a-Judge는 디지털 콘텐츠 생성, 자동 평가 시스템, AI 기반 검토 도구 등에서 활용될 수 있음. 특히, 인간 평가자 대체나 대규모 평가 자동화에 유용할 수 있으며, CoT와 Vision Expert System을 결합한 방식은 MLLM의 신뢰도를 높이는 데 기여할 수 있음.