한 줄 요약
VisionZip은 시각 토큰의 중복을 줄여 모델 성능을 유지하면서 추론 속도를 8× 향상시키는 간단한 방법이다.
핵심 기여도
- CLIP 및 SigLIP에서 생성된 시각 토큰의 중복을 분석하고, VisionZip이라는 간단한 토큰 선택 방법을 제안.
- VisionZip은 훈련 없이도 기존 최고 성능 모델 대비 최소 5% 성능 향상.
- LLaVA-Next 13B 모델이 7B 모델보다 빠르면서도 더 높은 성능을 달성.
- 토큰 수를 줄이면서 95% 성능 유지, prefilling 시간 8× 개선.
핵심 아이디어
기존 VLM(Vision Language Model)은 시각 토큰 수를 늘려 성능을 향상시키지만, 이는 높은 계산 비용과 메모리 소비를 초래한다. 본 연구는 CLIP 및 SigLIP에서 생성된 시각 토큰이 실제로 대부분 정보를 담지 않는다는 점을 발견하고, VisionZip이라는 토큰 선택 기법을 제안한다. VisionZip은 주요 정보를 담은 토큰을 선별하고, 유사한 토큰은 병합함으로써 중복을 제거한다. 이는 훈련 없이도 적용 가능하며, 토큰 수를 줄이면서 성능을 유지하거나 향상시킨다. 특히, VisionZip은 다중 대화 턴(multi-turn dialogue)과 같은 실용적 상황에서 기존 방법보다 우수한 성능을 보인다.
기술적 접근법
- **VisionZip**: 시각 토큰 중 정보가 풍부한 토큰을 선택하고, 유사한 토큰을 병합하는 두 단계 접근법.
- **Training-free mode**: 주요 토큰을 선정한 후, 유사도 기반 병합 전략을 통해 추가 정보를 추출.
- **Fine-tuning mode**: 토큰 수가 줄어들어 발생하는 정렬 문제를 해결하기 위해 projector layer를 30분간 미세 조정.
- **적용 모델**: LLaVA-Next 7B 및 13B.
- **성능 개선**: 토큰 수 감소, prefilling 시간 8× 향상, 95% 성능 유지.
주요 결과
- **LLaVA-Next 7B**: prefilling 시간 8× 개선, 95% 성능 유지.
- **LLaVA-Next 13B**: 7B 모델보다 빠르면서도 더 높은 성능 달성.
- **성능 향상**: 기존 최고 성능 모델 대비 최소 5% 개선.
- **적용 범위**: 이미지 및 동영상 이해, 실용적 다중 대화 시나리오.
의의 및 한계
VisionZip은 시각 토큰의 중복 문제를 해결함으로써 VLM의 효율성을 크게 향상시키며, 훈련 없이도 적용 가능하다는 점에서 실용적 가치가 높다. 또한, 토큰 수를 줄이면서 성능을 유지함으로써 에지 컴퓨팅, 자율 주행, 로봇 등 실시간 처리가 필요한 분야에 유용하다. 그러나 본 연구는 기존 시각 인코더의 개선 방향을 제시하지는 않으며, 토큰 선택 기준이 완전히 텍스트 무관(text-agnostic)이라는 점에서 일부 상황에서는 한계가 있을 수 있다.
실용적 활용
VisionZip은 에지 기기에서의 실시간 이미지/동영상 분석, 자율 주행 시스템, 로봇 비전, 그리고 사용자와의 다중 대화(multi-turn dialogue)를 지원하는 챗봇 등 다양한 분야에서 적용 가능하다. 특히, 메모리 및 계산 자원이 제한된 환경에서 유용하며, 대규모 모델의 성능과 속도를 동시에 향상시킬 수 있다.