한 줄 요약
VideoTree는 장시간 동영상의 LLM 추론을 위한 트리 기반의 적응적 표현 방식으로, EgoSchema에서 61.1%의 정확도를 달성한다.
핵심 기여도
- **VideoTree**는 훈련 없이 장시간 동영상의 질의에 대응하는 적응적 트리 구조를 제안.
- **Adaptive Breadth Expansion**와 **Relevance-Guided Depth Expansion** 모듈을 통해 키프레임을 선택적으로 추출, 추론 효율성 향상.
- EgoSchema와 NExT-QA에서 기존 훈련 없는 접근법 대비 2.1%와 4.3%의 정확도 향상.
- 44분 평균 길이의 Video-MME에서 GPT-4V를 초과하는 성능.
핵심 아이디어
VideoTree는 장시간 동영상의 정보 과부하와 계층적 구조를 고려하지 못하는 기존 접근법의 한계를 해결하기 위해, 질의에 따라 키프레임을 적응적으로 선택하고 트리 구조로 표현하는 방식을 제안한다. 이는 **Adaptive Breadth Expansion** 모듈을 통해 초기 단계에서 키프레임을 클러스터링하고, **Relevance-Guided Depth Expansion**를 통해 세부 정보를 계층적으로 추가함으로써 실현된다. 이와 같은 트리 구조는 질의와 관련된 정보를 **coarse-to-fine** 방식으로 추출할 수 있도록 설계되어, LLM이 복잡한 질의에 효과적으로 대응할 수 있도록 지원한다.
기술적 접근법
- **Adaptive Breadth Expansion**: 키프레임을 클러스터링하고 관련성을 기반으로 반복적으로 선택.
- **Relevance-Guided Depth Expansion**: 트리 구조 내에서 질의와 관련된 세부 정보를 추가.
- **LLM-based Reasoning**: 트리 구조 내의 정보를 기반으로 LLM에 입력하여 질의에 대한 추론 수행.
- **비교 대상 모델**: LLoVi, VideoAgent, LangRepo.
- **캡션 수**: 7, 9, 11, 62.4개의 캡션 설정에서 평가.
- **LLM**: GPT-4, Mistral 7B, Mistral 12B.
주요 결과
- **EgoSchema**: 61.1% 정확도 (기존 훈련 없는 방법 대비 +2.1%).
- **NExT-QA**: 75.6% 정확도 (기존 훈련 없는 방법 대비 +4.3%).
- **Video-MME (long split)**: GPT-4V를 초과하는 성능.
- **Mistral 7B**: LangRepo 대비 2.2% 향상, 72.5% 적은 추론 시간.
- **Mistral 12B**: LangRepo 대비 4.8% 향상, 69.0% 적은 추론 시간.
- **캡션 수 62.4개**: 6% 성능 향상, 기존 방법 대비 지속적인 성능 개선.
의의 및 한계
VideoTree는 장시간 동영상의 질의에 대한 LLM 추론을 훈련 없이도 효율적으로 수행할 수 있는 구조를 제시하며, 기존 방법 대비 정확도와 추론 시간 모두에서 개선된 성능을 보인다. 특히, 트리 구조를 활용한 계층적 표현은 질의와 관련된 정보를 효과적으로 추출하는 데 기여하며, 다양한 LLM(예: Mistral)에서도 뛰어난 일반화 능력을 보인다. 그러나, 특정 질의 유형이나 복잡한 장면 구조에 대한 한계는 추가 연구가 필요하며, 트리 구조의 깊이와 너비 조절에 대한 최적화도 여전히 개선 가능하다.
실용적 활용
VideoTree는 영화 분석, 장시간 인간 행동 분석, 온라인 강의 요약 등 장시간 동영상이 필요한 산업 및 연구 분야에 적용 가능하다. 특히, 훈련 없이도 높은 정확도와 효율성을 유지하는 점에서, 데이터 수집 및 모델 훈련이 어려운 상황에서 유용하게 활용될 수 있다.