한 줄 요약
VLM2Vec은 대규모 다모달 임베딩 벤치마크 MMEB와 함께, 임베딩 성능을 10~20% 개선하는 새로운 대비 학습 프레임워크를 제시한다.
핵심 기여도
- MMEB: 4개 메타태스크(분류, 시각질의응답, 다모달 검색, 시각적 정착)와 36개 데이터셋(20개 학습, 16개 평가)을 포함한 대규모 다모달 임베딩 벤치마크.
- VLM2Vec: 임베딩 벡터를 생성하는 대비 학습 프레임워크로, Phi-3.5-V, LLaVA-1.6 등 최신 VLM을 활용.
- LoRA를 사용한 미세 조정으로 기존 다모달 임베딩 모델 대비 평균 10~20% 성능 향상.
- 16개 OOD 데이터셋에서 15.4점(41.7 → 57.1)의 점수 상승을 기록.
핵심 아이디어
기존 다모달 임베딩 모델(CLIP, BLIP 등)은 텍스트와 이미지를 독립적으로 인코딩하거나 얕은 융합을 수행하여, 모달 간 관계를 완전히 포착하지 못하였다. VLM2Vec은 VLM(Phi-3.5-V, LLaVA-1.6)을 활용하여, 텍스트와 이미지 정보를 트랜스포머 아키텍처 내에서 깊이 융합함으로써, 임베딩 벡터가 모달 간 관계를 더 잘 반영하도록 설계되었다. 이는 기존 모델에서 볼 수 없었던 **instruction-based processing**을 통해, 임의의 텍스트-이미지 조합을 처리할 수 있게 한다.
또한, MMEB는 기존 연구에서 다루지 않았던 다양한 메타태스크와 OOD 데이터셋을 포함하여, 임베딩 모델의 일반화 능력을 체계적으로 평가할 수 있는 기반을 제공한다.
기술적 접근법
- **VLM2Vec**: Phi-3.5-V, LLaVA-1.6 등 최신 VLM을 백본으로 사용.
- **대비 학습(Contrastive Learning)**: MMEB의 20개 학습 데이터셋을 기반으로 학습.
- **LoRA 미세 조정**: LoRA 랭크 8을 사용하여, 1,024 배치 크기, 2,000 학습 스텝, 0.02의 온도 파라미터로 학습.
- **이미지 크롭 설정**: Phi-3.5-V 기반 VLM2Vec은 4개의 서브 이미지 크롭을 사용.
- **이미지 해상도**: LLaVA-1.6 기반 모델은 1344×1344(고해상도)와 336×336(저해상도) 두 가지 설정 사용.
- **GradCache 활용**: 4개의 서브배치 크기로 전체 모델 튜닝을 가능하게 함.
주요 결과
- MMEB 평가 분할에서 기존 최고 기반 모델 대비 **18.2점(44.7 → 62.9)** 개선.
- OOD 데이터셋(16개)에서 **15.4점(41.7 → 57.1)** 개선.
- 미세 조정 기반 최고 기반 모델 대비 **15.7점(47.2 → 62.9)** 개선.
- OOD 데이터셋에서 미세 조정 기반 최고 기반 모델 대비 **14.0점(43.1 → 57.1)** 개선.
- Flickr30K에서 T2I, I2T 성능도 기존 CLIP 유사 모델과 경쟁력 있음.
의의 및 한계
VLM2Vec은 기존 다모달 임베딩 모델의 한계를 극복하고, 임의의 텍스트-이미지 조합을 처리할 수 있는 유연한 임베딩 벡터를 생성한다. MMEB는 다모달 임베딩 연구의 표준 평가 기준을 제시하며, 학술적·실용적 가치가 높다. 그러나, VLM2Vec은 기존 VLM에 의존하므로, VLM 자체의 편향이나 데이터 품질에 영향을 받을 수 있다. 또한, MMEB는 특정 메타태스크에만 국한되지 않지만, 모든 실제 응용 상황을 포괄하지는 못한다.
실용적 활용
VLM2Vec은 이미지-텍스트 검색, 시각 질의 응답, 시맨틱 클러스터링 등 다양한 다모달 응용 분야에 활용 가능하다. 특히, OOD 데이터셋에서 높은 성능을 보이므로, 실제 산업 환경에서 예측 불가능한 데이터에 대한 일반화 능력이 필요한 경우 유용하다.