한 줄 요약
Video-DeepResearch는 비디오 기반 멀티모달 에이전트의 새로운 훈련-평가 프레임워크로, 64.0% 정확도를 달성하며 기존 모델을 상회한다.
핵심 기여도
- **Decoupled perception-exploration 파이프라인**을 도입하여 비디오 기반 탐색에서 시각적 탐색을 강제화.
- **Stage-wise tool unlocking**을 통해 모달리티 바이어스를 완화하고, 외부 도구 활용을 유도.
- **Video-DeepResearch-35B-A3B** 모델이 VideoDR-Bench에서 64.0% 정확도 달성, Claude-4.5-Sonnet(59.0%) 대비 5.0% 개선.
- **VideoDR-Bench**라는 200개의 복잡한 멀티홉 VQA 인스턴스를 포함한 새로운 벤치마크 제안.
핵심 아이디어
기존 멀티모달 에이전트는 정적 이미지에만 국한되어 있었으나, Video-DeepResearch는 **연속 비디오 스트림** 환경에서 **밀도 높은 시공간 탐색**과 **오픈 웹 탐색**을 결합한 새로운 패러다임을 제시한다. 이는 기존 모델에서 발생하는 **모달리티 바이어스** (시각 도구 대신 텍스트 검색에 의존)와 **파라메트릭 지식 유출** (내부 메모리에 의존) 문제를 해결하기 위한 핵심 접근이다. 이를 위해 **Stage-wise tool unlocking**을 도입하여, 웹 검색 전에 **cross-frame visual grounding**을 강제하고, **Decoupled perception-exploration 파이프라인**을 통해 시각적 인식과 탐색을 분리하여 시스템적으로 처리한다.
기술적 접근법
- **Data Engine**: 30K개의 비디오 기반 QA 쌍과 7K개의 정제된 탐색 경로를 생성.
- **Two-stage Training Recipe**:
- **Supervised Fine-Tuning (SFT)**: 7K개의 비디오 기반 QA 데이터로 초기 학습.
- **Group Relative Policy Optimization (GRPO)**: 2K개의 중간 난이도 데이터로 강화 학습을 수행.
- **Ablation Study**:
- Video-Centric SFT: 4K → 7K 데이터로 12.5% 성능 향상.
- Text-Augmented SFT: 3.8% 추가 성능 향상.
- RL Optimization (GRPO): 2.5% 최종 성능 향상.
주요 결과
- **Video-DeepResearch-35B-A3B**는 VideoDR-Bench에서 64.0% 정확도 달성 (Claude-4.5-Sonnet 59.0% 대비 +5.0%, GPT-5 52.5% 대비 +11.5%).
- **30B-A3B** 모델은 59.3%로 Claude-4.5-Sonnet와 경쟁.
- **Video-Centric SFT** 단계에서 40.5% → 53.0%로 12.5% 성능 향상.
- **Text-Augmented SFT** 단계에서 53.0% → 56.8%로 3.8% 추가 향상.
- **GRPO** 단계에서 56.8% → 59.3%로 2.5% 최종 향상.
의의 및 한계
Video-DeepResearch는 **비디오 기반 멀티모달 탐색** 분야에서 첫 통합 프레임워크로, **시각적 인식과 웹 탐색의 결합**을 효과적으로 구현한 사례이다. 특히, **Stage-wise tool unlocking**과 **Decoupled pipeline**은 기존 모델의 모달리티 바이어스와 파라메트릭 지식 유출 문제를 해결하는 데 기여하며, **VideoDR-Bench**는 복잡한 멀티홉 VQA 평가에 새로운 기준을 제시한다. 그러나 **비디오 데이터 생성의 복잡성**과 **강화 학습의 계산 비용**은 여전히 한계로 남아 있으며, 더 넓은 범위의 데이터와 알고리즘 최적화가 필요하다.
실용적 활용
Video-DeepResearch는 **교육, 미디어 분석, 자동화된 영상 분석 시스템** 등에서 활용 가능하다. 특히, **실시간 영상 분석과 외부 지식 통합이 필요한 산업**에서 효과적인 탐색 및 추론 능력을 제공할 수 있다.