한 줄 요약
FastV는 LVLM에서 이미지 토큰의 불필요한 어텐션 계산을 제거하여 추론 비용을 45%까지 절감하는 플러그 앤 플레이 방식의 효율화 기법이다.
핵심 기여도
- LLaVA-1.5, QwenVL-Chat, Video-LLaVA 등 대규모 LVLM에서 이미지 토큰의 어텐션 비효율성을 분석.
- FastV를 제안: 초기 레이어에서 어텐션 패턴을 학습하고, 이후 레이어에서 어텐션 점수 기반으로 이미지 토큰을 제거.
- LLaVA-1.5-13B 모델에서 FLOPs 45% 감소를 달성하면서도 성능 저하 없이 다양한 이미지 및 동영상 이해 작업 수행.
- 13B 파라미터 모델의 FLOPs를 7B 파라미터 모델보다 낮은 수준으로 압축 가능.
핵심 아이디어
기존 LVLM에서 이미지 토큰은 깊은 레이어에서 텍스트 토큰에 비해 극히 낮은 어텐션 점수를 받는다는 점에서 통찰을 도출했다. 예를 들어, LLaVA-1.5 모델에서 깊은 레이어(2층 이후)에서 이미지 토큰의 평균 어텐션 점수는 시스템 프롬프트의 0.21%에 불과하다. 이는 시스템 프롬프트나 사용자 지시어에 집중된 어텐션이 이미지 토큰의 기여도를 약화시키는 현상으로, 어텐션 메커니즘의 레이어별 역할 차이를 반영한다. FastV는 이러한 현상을 기반으로, 특정 레이어 이후로 어텐션 점수 기준을 설정하여 이미지 토큰을 선택적으로 제거함으로써 추론 비용을 절감한다. 이는 기존의 희소 어텐션(sparse attention)과 달리 토큰 자체를 제거함으로써 Self-Attention과 FFN 모듈 모두의 계산을 생략하는 점에서 차별화된다.
기술적 접근법
- **FastV 알고리즘**: 어텐션 점수 기반의 이미지 토큰 제거. 특정 레이어 이후, 토큰의 평균 어텐션 점수가 임계값 이하인 경우 제거.
- **레이어 설정**: LLaVA-1.5-13B에서 2층 이후 레이어에서 토큰 제거.
- **모델**: LLaVA-1.5-7B, 13B, Qwen-VL, Video-LLaVA.
- **성능 지표**: FLOPs 감소, 추론 지연(latency), 다양한 비전-언어 작업에서의 정확도 유지.
- **하이퍼파라미터**: 토큰 제거 임계값, 레이어 선택, 어텐션 헤드 수.
- **실험 설정**: 1000개의 이미지-텍스트 쌍을 사용한 평균 어텐션 점수 계산.
주요 결과
- **LLaVA-1.5-13B**: FastV 적용 시 FLOPs 45% 감소.
- **A-OKVQA**: LLaVA-13B(FastV)는 LLaVA-7B보다 낮은 지연(latency)을 보이며, 성능은 오히려 우수.
- **Nocaps, Flickr30K, OCR-VQA, MMMU, PCA-Bench, Video-Understanding**: 다양한 작업에서 성능 유지.
- **이미지 해상도 실험**: 동일 토큰 수에서 FastV 적용 모델은 더 높은 해상도 이미지를 처리해 성능 향상.
의의 및 한계
FastV는 LVLM의 추론 효율성을 극대화하면서도 성능 저하 없이 다양한 작업에 적용 가능한 유연한 방법이다. 특히, 13B 파라미터 모델의 FLOPs를 7B 모델 수준으로 줄이는 것은 모델 크기와 추론 비용 간의 트레이드오프를 재정의할 수 있는 실용적 가치를 제공한다. 그러나 FastV는 특정 레이어에서 토큰을 제거하는 방식으로, 모든 작업에서 동일한 성능을 보장하지는 않는다. 또한, 어텐션 점수 기반의 제거 기준은 모델 종류나 작업 유형에 따라 최적화가 필요할 수 있다.
실용적 활용
FastV는 모바일 기기나 에지 디바이스에서 LVLM을 배포할 때 유용하며, 대규모 모델을 상용화하면서도 비용을 절감하고자 하는 상황에도 적합하다. 특히, 이미지 해상도를 높이면서도 추론 비용을 유지할 수 있어, 고해상도 시각 정보 처리가 필요한 산업 분야(예: 자율주행, 의료 영상 분석)에 적용 가능하다.