한 줄 요약
MMLU-Pro는 기존 MMLU 대비 16~33% 낮은 정확도를 기록하며, 추론 능력을 더 잘 평가하는 다분야 언어이해 벤치마크이다.
핵심 기여도
- MMLU-Pro는 선택지를 4개에서 10개로 확장하여 추측 가능성을 낮췄다.
- MMLU-Pro는 CoT(Chain of Thought) 추론을 요구하는 문제를 포함하여 모델의 추론 능력을 더 잘 평가한다.
- 24개의 다양한 프롬프트 스타일에서 모델 점수의 민감도가 MMLU 대비 4-5%에서 2%로 감소했다.
- GPT-4o가 MMLU-Pro에서 72.6%의 정확도를 기록하며, MMLU 대비 16% 가량 낮아진 것으로 나타났다.
핵심 아이디어
MMLU-Pro는 기존 MMLU 벤치마크가 모델 성능 향상에 따라 포화 상태에 도달했고, 질문의 선택지 수가 적어 모델이 단서를 활용해 정답을 유추할 수 있다는 문제점을 해결하기 위해 설계되었다. MMLU-Pro는 선택지를 4개에서 10개로 확장하고, 더 복잡한 대학 수준 문제를 포함하여 추론 능력을 평가하는 데 초점을 맞추고 있다. 또한, 전문가 검토와 최신 LLM을 활용한 오류 탐지 과정을 거쳐 데이터셋의 신뢰도를 높였다. CoT 추론이 MMLU-Pro에서 성능 향상에 기여하는 반면, MMLU에서는 오히려 성능을 저하시키는 경향이 있어, MMLU-Pro가 추론 기반 평가에 적합함을 보여준다.
기술적 접근법
- **데이터셋 구성**: MMLU-Pro는 14개 분야(수학, 물리, 법학 등)에 걸쳐 12,000개 이상의 문제를 포함하며, 선택지를 4개에서 10개로 확장했다.
- **질문 필터링**: 두 차례의 전문가 검토와 최신 LLM을 활용한 오류 탐지를 통해 노이즈 질문을 제거했다.
- **평가 방법**: 50개 이상의 LLM(예: GPT-4o, Claude-3-Opus, LLaMA-3-70B-Instruct)을 사용해 MMLU-Pro에서 성능을 평가했으며, CoT 추론과 직접 답변 방식을 비교했다.
- **프롬프트 민감도 분석**: 24개의 프롬프트 스타일을 테스트하여 모델 점수의 변동성을 측정했다.
주요 결과
- GPT-4o는 MMLU-Pro에서 72.6%의 정확도를 기록했으며, 이는 MMLU(87.4%) 대비 16% 가량 낮다.
- MMLU-Pro에서 CoT 추론은 GPT-4o의 성능을 19% 향상시켰으나, MMLU에서는 CoT가 성능을 저하시켰다.
- MMLU-Pro에서 GPT-4o와 GPT-4-Turbo의 성능 차이는 9%로, MMLU(1%) 대비 훨씬 큰 차이를 보였다.
- GPT-4o의 오류 분석에서 39%는 추론 과정의 결함, 35%는 특정 분야 지식 부족, 12%는 계산 오류로 나타났다.
의의 및 한계
MMLU-Pro는 기존 MMLU가 모델 성능 향상에 따라 포화 상태에 도달한 문제를 해결하고, 추론 능력을 더 잘 평가할 수 있는 새로운 벤치마크로 제시된다. 특히, CoT 추론이 성능 향상에 기여하는 점은 MMLU-Pro가 단순 지식 기반 질문이 아닌 복잡한 추론을 요구함을 보여준다. 또한, 프롬프트 변화에 대한 민감도가 낮아 평가의 안정성을 높였다. 그러나 MMLU-Pro는 여전히 일부 분야에서 모델이 정답을 유추할 수 있는 가능성은 남아 있으며, 더 많은 데이터셋 확장과 오류 검증이 필요하다.
실용적 활용
MMLU-Pro는 대형 언어 모델의 추론 능력을 평가하는 데 적합한 벤치마크로, 연구자들이 모델의 실제 지능 수준을 더 정확히 측정할 수 있도록 지원한다. 특히, 교육, 법률, 공학 등 전문 분야에서 모델의 전문성과 추론 능력을 평가할 때 유용하게 활용될 수 있다.