한 줄 요약
최근 멀티모달 LLMs는 CLIP 기반 시각 인코더의 한계로 인해 기본적인 시각 패턴을 인식하지 못하는 문제가 있음을 밝혀냈다.
핵심 기여도
- CLIP 기반 시각 인코더의 한계를 드러내는 "CLIP-blind pairs"를 정의하고, 이를 기반으로 MMVP 벤치마크를 제안.
- MMVP에서 GPT-4V 포함 주요 MLLMs가 50% 이상의 성능 격차를 보이는 것을 실험적으로 입증.
- DINOv2 기반의 Mixture of Features (MoF)를 제안하여 시각 정착 능력을 개선.
- CLIP 기반 모델의 확장성과 성능 한계를 분석, 시각 표현 학습의 새로운 평가 지표 필요성을 제시.
핵심 아이디어
CLIP 기반 시각 인코더는 언어-이미지 대비 학습을 통해 강력한 표현력을 가지지만, 실제 시각 패턴 인식에서는 한계가 있다. 연구팀은 CLIP이 시각적으로 유사한 이미지를 동일하게 인식하는 "CLIP-blind pairs"를 발견하고, 이를 통해 MLLMs의 시각 인식 문제를 분석했다. CLIP과 DINOv2의 시각 임베딩 차이를 비교함으로써, CLIP이 시각 정보를 정확히 포착하지 못하는 구체적인 패턴을 규명했다. 이는 MLLMs가 단순한 시각 질문에도 실패하는 근본 원인으로 작용한다. 연구팀은 CLIP과 DINOv2의 특징을 결합하는 MoF 접근법을 제안하며, 시각 정착 능력을 향상시키는 방향을 제시했다.
기술적 접근법
- **CLIP-blind pairs**: CLIP 임베딩이 유사하지만 DINOv2 임베딩이 다른 이미지 쌍을 정의.
- **MMVP 벤치마크**: 9가지 시각 패턴(예: orientation, counting, viewpoint)을 기반으로 MLLMs의 시각 능력을 평가.
- **MoF (Mixture of Features)**: CLIP과 DINOv2의 특징을 결합. Additive-MoF (A-MoF)와 Interleaved-MoF (I-MoF) 두 가지 방식 사용.
- **LLaVA 프레임워크**: CLIP-ViT-L-14와 DINOV2-ViT-L-14를 비교 실험.
- **실험 설정**: 동일한 하이퍼파라미터와 훈련 설정을 사용하여 공정한 비교 수행.
주요 결과
- GPT-4V는 MMVP에서 인간 대비 50% 이상의 성능 격차를 보임.
- 9가지 시각 패턴 중 7개는 CLIP 기반 모델로 해결 불가.
- MoF 적용 시 시각 정착 능력 향상, 특히 I-MoF는 시각 능력 향상과 지시 수행 능력 유지 가능.
- CLIP 기반 모델의 확장성과 데이터 확장이 모든 시각 패턴 문제를 해결하지 못함.
의의 및 한계
이 연구는 CLIP 기반 시각 인코더가 멀티모달 시스템의 병목 현상이 될 수 있음을 밝히며, 시각 표현 학습의 새로운 방향성을 제시한다. MMVP 벤치마크는 기존 평가 지표(예: ImageNet zero-shot 정확도)를 넘어 시각 인식의 핵심 문제를 평가할 수 있는 도구로 활용 가능하다. 그러나 MoF는 CLIP과 DINOv2의 단점을 보완하는 일시적 해결책일 뿐, 근본적인 시각 인코더 개선이 필요하다는 한계가 있다. 또한, CLIP의 확장성과 DINOv2의 정확성 사이의 균형을 맞추는 새로운 학습 프레임워크 개발이 요구된다.
실용적 활용
이 연구는 멀티모달 시스템이 의존하는 CLIP 기반 인코더의 한계를 명확히 밝히며, 의료 영상 분석, 자율주행, AR/VR 등 시각 정보가 중요한 산업 분야에서 보다 정확한 시각 인식 모델 개발을 촉진할 수 있다. 또한, 연구 결과는 CLIP과 DINOv2의 결합을 통해 시각 정착 능력을 향상시키는 실용적 접근법을 제시한다.