한 줄 요약
RobustMAD는 산업 현장에서 사용 가능한 MSLM의 실무적 안정성을 평가하기 위한 첫 번째 벤치마크로, GPT-5 Nano를 초과하는 성능을 보이지만 여전히 안전 기준 미달.
핵심 기여도
- RobustMAD: 산업 현장 적용을 목표로 한 첫 번째 MSLM 안정성 평가 벤치마크 개발.
- 4,510개 MCQ, 7,380개 open-ended 질문으로 구성, MVTec AD 및 VisA 데이터셋 기반.
- MSLM이 GPT-5 Nano를 초과하는 성능을 보이지만, 세 가지 주요 실패 모드를 드러냄.
- 기술 정확도, 포괄성, 관련성, 스타일, 종합 점수 5차원 평가 체계 제안.
핵심 아이디어
기존 MLLM은 클라우드 기반 추론으로 인해 산업 현장에서 실용성이 낮고, MSLM은 현장 배포 가능하지만 실무적 안정성 평가가 부족했다. RobustMAD는 MSLM의 실제 산업 환경에서의 안정성을 평가하기 위해 설계된 벤치마크로, 다양한 시각 품질 저하, 비표준 질문, 비결정적 응답 등을 반영한 4개의 핵심 범주(General Object Understanding, Stand-alone Anomaly Detection, Pair-wise Anomaly Detection, Unanswerable or Ill-posed Query Detection)를 포함한다. 특히, 기존 평가가 단일 정답 기반 MCQ에 집중한 반면, RobustMAD는 open-ended 질문을 통해 모델의 설명력과 논리적 근거를 평가한다. 이는 산업 검사에서 요구되는 정확성과 설명력에 대한 깊은 이해를 측정하는 데 기여한다.
기술적 접근법
- **데이터셋**: MVTec AD, VisA에서 410개 이미지 추출, 4,510개 MCQ, 7,380개 open-ended 질문 생성.
- **평가 설정**: zero-shot, 통일된 프롬프트 템플릿, MCQ는 temperature=0, open-ended는 temperature=0.2 사용.
- **평가 지표**: 5차원 점수 체계 (Technical Accuracy, Comprehensiveness, Relevance, Style and Clarity, Overall Score)로 GPT-5를 LLM judge로 활용.
- **인간 평가**: 5% 샘플에 대해 5명의 전문가 평가, 인간-LLM 일치율 93.8%.
- **모델 비교**: Phi-4-Multimodal-Instruct (6B), GPT-5 Nano 포함.
주요 결과
- **MCQ 평가**: 상위 MSLM이 GPT-5 Nano를 초과하는 정확도를 보임.
- **Open-ended 평가**: MSLM이 기술 정확도 3.2 (1-5), 포괄성 2.8, 관련성 3.1, 종합 점수 2.9를 기록.
- **실패 모드**: (i) 세부 시각 정보 처리 실패, (ii) 설명력 부족, (iii) 비정상 질문 처리 시 hallucination 발생.
- **LLM judge 일치율**: 93.8%로 인간 평가와 높은 일치도.
의의 및 한계
RobustMAD는 MSLM의 실무적 안정성을 체계적으로 평가할 수 있는 첫 번째 벤치마크로, 현장 배포 가능성에 대한 기준을 제시한다. 특히, open-ended 질문을 통해 모델의 설명력과 논리적 근거를 평가함으로써 기존 평가 체계의 한계를 보완한다. 그러나 MSLM은 산업 안전 기준에 비해 여전히 낮은 안정성을 보이며, 세 가지 주요 실패 모드가 운영 위험으로 작용할 수 있다. 또한, 평가 데이터셋은 MVTec AD 및 VisA에 의존적이며, 더 다양한 산업 환경을 반영한 확장이 필요하다.
실용적 활용
RobustMAD는 제조 현장에서 사용되는 MSLM 기반 이상 탐지 보조 시스템의 설계와 평가에 활용 가능하다. 특히, 현장에서의 시각 품질 저하, 비표준 질문 처리, 설명력 강화 등이 요구되는 상황에서 모델 개선 방향을 제시할 수 있다. 또한, open-ended 평가 체계는 산업 검사 외에도 의료, 보안 등 다른 분야의 MSLM 평가에도 적용 가능하다.