한 줄 요약
Video-of-Thought(VoT)는 MotionEpic이라는 새로운 비디오 MLLM과 CoT 기반 추론 프레임워크를 결합하여 복잡한 비디오 QA 성능을 획기적으로 향상시킨다.
핵심 기여도
- MotionEpic이라는 새로운 비디오 MLLM을 제안하여, STSG를 통한 fine-grained pixel-level spatial-temporal grounding을 달성.
- Video-of-Thought(VoT)라는 첫 번째 비디오 CoT 추론 프레임워크를 개발, 복잡한 비디오 QA 성능을 기존 최고 수준을 크게 상회.
- 8개의 복잡한 비디오 QA 벤치마크에서 fine-tuning 및 zero-shot 설정 모두에서 기존 최고 성능을 크게 개선.
- 비디오 추론 과정을 5단계로 구조화하여, 인지적 해석과 시공간 인식을 통합한 체계적 접근법 제시.
핵심 아이디어
기존 연구는 복잡한 비디오에 대한 깊은 이해와 추론에 어려움을 겪고 있다. 이에 본 연구는 인간의 인지 패턴을 모방하여, **low-level pixel perception**에서 **high-level cognitive interpretation**까지 단계적으로 문제를 분해하고 해결하는 **Video-of-Thought(VoT)** 프레임워크를 제안한다. VoT는 **Chain-of-Thought(CoT)** 기법을 비디오 추론에 최초로 적용한 것으로, 복잡한 비디오 QA 문제를 5단계로 분해하여 처리한다.
이를 위해, **MotionEpic**이라는 새로운 비디오 MLLM이 개발되며, 이는 **STSG**(Spatial-Temporal Scene Graph)를 통한 시공간 인식을 구현한다. MotionEpic은 ViT-L/14 인코더와 Q-Former 프로젝터를 사용하며, **Graph Transformer**를 재구성하여 STSG 정보를 인코딩한다. 이 모델은 비디오와 STSG 간의 **fine-grained pixel-level spatial-temporal grounding**을 가능하게 하며, 추론 과정에서 STSG 없이도 작동할 수 있도록 설계되었다.
기술적 접근법
- **MotionEpic**: 새로운 비디오 MLLM. Vicuna-7B(v1.5)를 백본으로 사용하며, ViT-L/14 인코더와 Q-Former 프로젝터를 결합.
- **STSG 통합**: 비디오의 시공간 정보를 STSG로 표현하고, 이를 Graph Transformer를 통해 인코딩.
- **VoT 프레임워크**: 5단계로 구성된 CoT 기반 추론 시스템.
- **STSG-free 추론**: STSG 어노테이션이 필요 없는 추론 과정 지원.
1. 질문에 포함된 대상 식별
2. 시간적 트랙릿 추적
3. 대상의 움직임과 환경 상호작용 해석
4. 선택지 평가 및 순위 매기기
5. 정답 검증 (pixel grounding + commonsense)
주요 결과
- 8개의 복잡한 비디오 QA 벤치마크에서 기존 최고 성능을 **매우 큰 폭으로 상회**.
- **zero-shot 설정**에서도 기존 모델 대비 **높은 정확도 향상**을 보임.
- **MotionEpic**은 STSG 기반 비디오 grounding에서 **fine-grained 인식 능력**을 보여, 기존 모델보다 정밀도가 높음.
- VoT는 **5단계 추론 과정**을 통해 인지적 해석 능력을 향상시키며, 정답 검증 단계에서 **사실 기반 정확도**를 높임.
의의 및 한계
본 연구는 **비디오 추론 분야에서 CoT 기법의 첫 적용**으로, 인간 수준의 비디오 이해를 가능하게 하는 중요한 발전을 이루었다. 특히, **STSG 기반의 시공간 인식**과 **인식적 추론**을 결합한 구조는 기존 모델들이 부족했던 복잡한 비디오 해석 능력을 보완한다.
하지만, **STSG 생성 과정의 자동화 수준**이나 **대규모 비디오 데이터셋에 대한 일반화 가능성**은 아직 명시되지 않았으며, 추후 연구에서 보완이 필요하다. 또한, **비디오 외 다른 멀티모달 입력**(예: 오디오, 텍스트)에 대한 확장 가능성도 언급되지 않았다.
실용적 활용
VoT는 **자율주행**, **보안 감시**, **교육 콘텐츠 분석** 등 복잡한 비디오 해석이 필요한 산업에 적용 가능하다. 특히, **사전 학습 없이도 정확도를 유지하는 zero-shot 성능**은 빠른 도입과 활용에 유리하며, **인간 수준의 추론 과정**은 의료, 법정 증거 분석 등 정확도가 중요한 분야에서도 활용 가능하다.