한 줄 요약
TimeLens2는 다양한 영상 조건에서 신뢰할 수 있는 시간 구간 추정을 수행하는 다중 모달 대형 언어 모델이다.
핵심 기여도
- TimeLens2-93K는 caption-derived proposals, independent localization, cross-agent consensus, semantic verification, boundary refinement를 통한 신뢰성 있는 다중 구간 감독 파이프라인을 제시.
- temporal Wasserstein reward는 1차원 $W_1$ 거리 기반의 matching-free 피드백을 제공하여, 불균등한 카디널리티와 분할 상황에서도 효과적.
- 2B, 4B, 8B 버전이 Qwen3-VL 기반 모델 대비 각각 14.2, 13.0, 18.1 mIoU 포인트 개선.
- 4B 모델은 397B 파라미터를 가진 Qwen3.5-397B-A17B 모델을 모든 벤치마크에서 평균 7.5 mIoU 포인트 상회.
핵심 아이디어
기존의 영상-텍스트 모델은 "무엇이 일어났는지"는 설명하지만, "언제 일어났는지"는 정확히 추정하지 못한다. TimeLens2는 시간 구간을 집합으로 처리하여, 단일 또는 다중 구간의 신뢰성 있는 추정을 가능하게 한다. 이는 기존의 단일 패스 어노테이션과 강화 학습 기반의 reward가 불완전한 문제를 해결하기 위한 접근이다.
TimeLens2-93K는 단일 어노테이션을 여러 단계로 분할하여 점진적으로 구간을 좁히는 방식을 채택한다. 예를 들어, caption-derived proposals는 초기 구간 제안을, cross-agent consensus는 불일치된 인스턴스를 제거, boundary refinement는 경계를 정제한다. 이는 장시간 영상에서도 반복된 증거를 유지하면서 신뢰도 높은 라벨을 생성한다.
기술적 접근법
- **TimeLens2-93K 파이프라인**: caption-derived proposals → independent localization → cross-agent consensus → semantic verification → boundary refinement
- **temporal Wasserstein reward**: 1차원 $W_1$ 거리 계산을 통해, 합쳐진 예측 구간과 타겟 구간의 일치도를 평가.
- **tIoU (temporal IoU)**: 정밀한 겹침 정보를 보완.
- **GRPO (Gradient-based Reward Policy Optimization)**: 기하학적 위치를 직접 교정.
- **모델 크기**: 2B, 4B, 8B 버전 제공.
- **하이퍼파라미터**: 평가 지표는 mIoU와 Recall@1 (tIoU 0.3, 0.5, 0.7).
주요 결과
- TimeLens2-2B, 4B, 8B는 각각 평균 mIoU 44.5, 47.7, 48.0 달성.
- Qwen3-VL 기반 모델 대비 각각 14.2, 13.0, 18.1 mIoU 포인트 개선.
- 4B 모델은 Qwen3.5-397B-A17B 모델을 모든 벤치마크에서 평균 7.5 mIoU 포인트 상회.
- declarative-only 데이터에서 MomentSeeker의 question-form grounding 성능을 15.3 → 25.8 mIoU로 향상.
- temporal Wasserstein reward는 75.8%의 all-zero-tIoU GRPO 그룹에서 유의미한 정보를 복원.
의의 및 한계
TimeLens2는 영상 기반 질의에 대한 시간 구간 추정을 일반화된 방식으로 처리함으로써, 영상 아카이브의 검색 가능성을 높인다. 기존의 단일 구간 또는 단일 어노테이션 기반 접근법의 한계를 극복하고, 다중 구간, 다양한 영상 길이, 질문 형식, 1인칭/3인칭 관점에서 모두 적용 가능한 모델을 제시한 점에서 학술적·실용적 가치가 있다.
그러나, TimeLens2는 여전히 특정 도메인에서의 성능 차이나, 매우 긴 영상에서의 계산 효율성 문제는 명시되지 않았다. 또한, 실제 산업 환경에서의 대규모 배포 가능성에 대한 평가도 부재하다.
실용적 활용
TimeLens2는 영상 검색, 자막 생성, 영상 요약, 법적 증거 추출 등에서 활용 가능하다. 특히, 사용자가 특정 질문에 대한 정확한 시간 구간을 빠르게 확인할 수 있어, 콘텐츠 검증 및 분석 작업에 유용하다.