한 줄 요약
LongVU는 장시간 동영상 이해를 위해 시공간 적응형 압축 기법을 도입한 MLLM 모델로, DINOv2와 텍스트 유도 쿼리를 활용해 토큰 수를 줄이며 정확도를 유지한다.
핵심 기여도
- DINOv2 기반의 **시계열 프레임 제거**를 통해 시공간 중복을 제거.
- **텍스트 유도 쿼리**를 활용한 선택적 프레임 특징 축소를 도입.
- **시간 의존성 기반 공간 토큰 축소**를 통해 8k 컨텍스트 내 1fps 샘플링 처리 가능.
- 8k 컨텍스트에서 평균 2개의 토큰으로 압축하면서도 **VideoMME에서 +5%**, **MLVU에서 +3.4%** 성능 향상.
핵심 아이디어
LongVU는 장시간 동영상의 처리를 위해 **시공간 적응형 압축**을 제안한다. 기존 연구는 고정된 프레임 샘플링을 사용해 동영상의 비균일한 내용(예: 정적 vs 동적 장면)을 무시했으나, LongVU는 **DINOv2**의 시각적 특징을 활용해 유사한 프레임을 제거함으로써 **시계열 중복**을 줄인다. 또한, 텍스트 쿼리에 따라 중요한 프레임은 **전체 토큰(144개)**을 유지하고, 나머지는 **공간 풀링**을 통해 **64개 토큰**으로 축소한다. 이는 시각 정보 손실을 최소화하면서도 컨텍스트 길이 내에서 더 많은 프레임을 처리할 수 있도록 한다. 마지막으로, **시간 의존성 기반 공간 토큰 축소(STC)**를 통해 토큰 수를 동적으로 조절한다.
기술적 접근법
- **DINOv2 기반 시계열 압축**: 유사한 프레임 제거를 통해 **시간적 중복** 제거.
- **텍스트 유도 쿼리**: 관련성 있는 프레임은 144 토큰 유지, 나머지는 64 토큰으로 축소.
- **STC (Spatial Token Compression)**: 시간 의존성에 따라 토큰 수를 동적으로 조절.
- **하이퍼파라미터**: 8k 컨텍스트 길이, 평균 2개의 토큰/프레임, 1fps 샘플링.
주요 결과
- **VideoMME**: LongVU는 LLaVA-OneVision 대비 **+5%** 정확도 향상.
- **MLVU**: Llama3.2-3B 기반의 가벼운 모델로 Phi-3.5-vision-instruct-4B 대비 **+3.4%** 개선.
- **EgoSchema**: DINO + Query + STC 적용 시 **67.62%** 달성.
- **MLVU 하위 태스크**: needle detection에서 **+10%**, counting에서 **+4.8%** 향상.
의의 및 한계
LongVU는 기존 MLLM이 처리하지 못한 **1시간 길이 동영상**을 8k 컨텍스트 내에서 처리할 수 있게 하며, **시공간 적응형 압축**을 통해 토큰 수를 줄이면서도 시각 정보 손실을 최소화하는 데 성공했다. 특히, **DINOv2**의 시각적 특징이 **SigLIP**보다 효과적임을 실험적으로 입증했다. 그러나, **16k 컨텍스트**를 지원하는 모델과 비교하면 일부 성능 저하가 발생하며, **복잡한 장면**에서는 압축 과정에서 정보 손실이 발생할 수 있다.
실용적 활용
LongVU는 **장시간 동영상 분석**, **비디오 QA 시스템**, **교육용 콘텐츠 이해** 등에 적용 가능하다. 특히, **가벼운 LLM 기반 모델**로도 뛰어난 성능을 보여주어 **자원 제한 환경**에서 유용하게 활용될 수 있다.