한 줄 요약
OmniMedVQA는 73개 의료 데이터셋을 기반으로 구성된 대규모 의료 VQA 벤치마크로, LVLM의 의료 분야 성능 평가에 기여한다.
핵심 기여도
- OmniMedVQA는 12개 의료 이미지 모달리티와 20개 이상의 해부학적 부위를 포함한 118,010개의 이미지와 127,995개의 QA 항목을 가진 대규모 VQA 데이터셋.
- 8개 일반 LVLM과 4개 의료 전용 LVLM을 포함한 12개 모델을 평가하여 의료 전용 모델이 일반 모델보다 성능이 낮은 점을 밝힘.
- QA 점수와 Prefix-based 점수 두 가지 평가 지표를 사용하여 LVLM의 의료 이미지 이해 능력을 종합적으로 평가.
- 의료 전용 LVLM이 CT, MRI 등 특정 모달리티에서는 우수하지만, 일반 이미지와 유사한 분포를 가진 모달리티에서는 일반 모델 못지 않음.
핵심 아이디어
기존 LVLM이 의료 분야에서의 평가가 부족하고, 특히 다양한 모달리티와 해부학적 부위를 아우르는 데이터셋이 부족한 점을 문제로 삼았다. OmniMedVQA는 73개 의료 데이터셋을 기반으로 12개의 모달리티(MRI, CT, X-Ray 등)와 20개 이상의 해부학적 부위를 포함한 QA 형식으로 전환하여, LVLM의 의료 이미지 이해 능력을 종합적으로 평가할 수 있는 벤치마크를 제시한다. 특히, GPT의 강력한 추론 능력을 활용해 분류 데이터를 VQA 형식으로 전환함으로써 데이터 수집 비용을 줄이고, 실제 의료 시나리오와 밀접하게 연계된 데이터를 구축했다.
기술적 접근법
- **데이터셋 구성**: 73개 의료 데이터셋에서 12개 모달리티(예: MRI, CT, X-Ray, fundus photography 등)와 20개 이상의 해부학적 부위를 포함한 118,010개 이미지와 127,995개 QA 항목.
- **평가 형식**: QA 쌍에 잘못된 선택지를 추가하여 다중 선택형 VQA 형식으로 전환.
- **평가 지표**: QA 점수와 Prefix-based 점수를 사용하여 모델의 응답 능력과 문맥 이해력을 평가.
- **평가 모델**: 8개 일반 LVLM (예: BILP2, MiniGPT-4, LLaVA 등)과 4개 의료 전용 LVLM (예: Med-Flamingo, RadFM, LLaVA-Med 등)을 포함한 총 12개 모델 평가.
주요 결과
- **RadFM**: CT와 X-Ray에서 가장 높은 QA 점수(73.2%)를 기록.
- **의료 전용 LVLM**: CT, MRI 등 특정 모달리티에서는 일반 모델보다 우수하지만, 일반 이미지와 유사한 분포를 가진 모달리티에서는 일반 모델과 유사하거나 낮은 성능.
- **의료 전용 LVLM vs 일반 LVLM**: 전체적으로 의료 전용 모델이 일반 모델보다 낮은 정확도를 보임 (예: 전체 QA 점수 58.4% vs 62.1%).
의의 및 한계
OmniMedVQA는 의료 분야에서 LVLM의 성능을 종합적으로 평가할 수 있는 첫 번째 대규모 VQA 벤치마크로, 의료 이미지 이해 능력의 한계를 드러내며, 의료 전용 LVLM의 개선 필요성을 강조한다. 특히, CT, MRI 등 일부 모달리티에서는 의료 전용 모델이 우수하지만, 다른 모달리티에서는 일반 모델 못지 않다는 점은 LVLM이 다양한 의료 이미지에 대한 일반화 능력을 갖추어야 한다는 점을 시사한다. 한계로는 일부 의료 전용 모델이 다중 선택형 평가 형식에 적응하지 못하는 문제가 있으며, 이는 평가 형식에 따른 성능 차이를 반영할 수 있다.
실용적 활용
OmniMedVQA는 의료 분야에서 LVLM의 성능 평가 및 모델 개선에 활용될 수 있으며, 특히 의료 이미지 분석, 진단 지원 시스템, 의료 교육 등에서 모델의 신뢰도를 높이는 데 기여할 수 있다. 또한, 다양한 모달리티와 해부학적 부위를 아우르는 데이터셋은 의료 AI 연구자들이 모델의 일반화 능력을 평가하는 데 유용한 기준이 될 수 있다.