한 줄 요약
UEmbed는 단일 모델로 텍스트 및 다중 모달의 밀집형과 희소형 임베딩을 동시에 생성하는 디코더 전용 모델이다.
핵심 기여도
- 디코더 전용 아키텍처를 기반으로, 단일 모델에서 희소 및 밀집 임베딩을 생성 (UEmbed).
- MMEB-v2에서 UEmbed-9B가 71.8 (밀집), 71.0 (희소)를 달성하며, 희소 모델로서 최고 성능 기록.
- 희소 임베딩을 기반으로 한 하이브리드 점수화, 빠른 서빙, 에이전트 검색에서 실용적 이점 증명.
- 기존 희소 모델이 다중 모달을 처리하지 못한 문제를 해결하며, 첫 MMEB-v2 희소 모델 평가 수행.
핵심 아이디어
UEmbed는 기존 희소 검색(LSR)이 인코더 기반 아키텍처에 의존하고, 다중 모달 확장 시 보조 크로스-모달 모듈에 의존하는 한계를 해결하기 위해 디코더 전용 아키텍처를 도입했다. UEmbed는 입력에 N개의 학습 가능한 특수 토큰을 추가하고, 어휘를 N개의 서로 다른 서브셋으로 분할하여 각 토큰의 인과적 은닉 상태가 해당 서브셋에 대한 희소 가중치를 예측하도록 설계되었다. 이는 단일 토큰 기반의 표현력 한계를 우회하며, k-means 클러스터링을 통해 각 서브셋이 서로 다른 공간 방향을 나타내도록 유도한다. 결과적으로, UEmbed는 희소 및 밀집 임베딩을 동시에 생성하며, 기존 인코더 기반 모델과는 다른 새로운 패러다임을 제시한다.
기술적 접근법
- **모델 아키텍처**: 디코더 전용 MLLM (Multimodal Large Language Model) 기반.
- **토큰 분할**: 입력에 N개의 학습 가능한 특수 토큰 추가, 어휘를 N개의 disjoint 서브셋으로 분할.
- **가중치 예측**: 각 특수 토큰의 인과적 은닉 상태가 해당 서브셋에 대한 희소 가중치를 예측.
- **임베딩 생성**: N개의 서브셋을 결합하여 전체 희소 벡터 생성. 밀집 임베딩은 특수 토큰 이전의 EOS 토큰의 은닉 상태에서 추출.
- **학습 데이터**: 공개 데이터 기반 학습.
- **모델 규모**: 2B, 4B, 9B 파라미터 버전 제공.
주요 결과
- **MMEB-v2**: UEmbed-9B는 71.8 (밀집), 71.0 (희소)를 달성. 희소 모델로서 최고 성능.
- **BEIR**: UEmbed는 강력한 밀집 및 희소 기반 모델과 경쟁력 있음.
- **BrowseComp-Plus**: 희소 모드는 도구 호출 비용을 줄이며 유사한 재현률 유지.
- **하이브리드 점수화**: 밀집 및 희소 모드를 결합한 점수화가 텍스트 및 시각 문서 검색 성능을 개선.
의의 및 한계
UEmbed는 희소 및 밀집 임베딩을 단일 모델에서 생성하며, 기존 인코더 기반 희소 모델의 아키텍처 및 모달 제한을 극복하였다. 특히, 희소 임베딩이 빠른 서빙, 인버티드 인덱스 검색, 에이전트 검색 등 실용적 장점을 가지는 점이 입증되었다. 그러나, UEmbed는 공개 데이터만을 사용하여 학습되었으며, 프로퍼티 데이터나 커스터마이징된 도메인에 대한 성능은 명시되지 않았다. 또한, N개의 서브셋 분할 방식은 모델 복잡도를 증가시키며, 서브셋 수(N)에 따른 최적화 전략은 추가 연구가 필요하다.
실용적 활용
UEmbed는 웹 검색, 검색 증강 생성, 시각 문서 검색 등 다양한 검색 시스템에 적용 가능하다. 특히, 빠른 서빙과 인버티드 인덱스 검색을 지원하며, 에이전트 기반 검색에서 비용 효율성을 높이는 데 유용하다.