한 줄 요약
TempCloze는 영상 기반 대형 언어 모델의 시각적 시간 추론 능력을 평가하기 위한 새로운 비디오 클로즈 벤치마크이다.
핵심 기여도
- TempCloze 벤치마크를 제안: 1,521개의 영상, Semantic, Alignment, Progression 3차원의 다차원 디스트랙터 포함.
- 10개의 프로퍼리어리 및 21개의 오픈소스 Video-LLMs 평가 결과, Alignment 차원이 주요 병목임을 밝힘.
- Error Pattern Analysis와 Behavioral Sensitivity Analysis를 통해 모델의 선택에 영향을 미치는 요인을 분석.
- TempCloze-Mixed와 TempCloze-Hard라는 두 가지 보조 데이터셋을 제시.
핵심 아이디어
기존의 Video-LLMs 평가 방식은 자연어 기반 질문과 선택지를 통해 이루어지며, 이는 언어적 단서를 통한 우회적 해결 가능성을 열어준다. 이를 해결하기 위해, TempCloze는 영상의 시작과 끝 클립이 주어졌을 때, 중간 클립을 4가지 후보 중에서 선택하도록 요구하는 클로즈 형식을 도입한다. 이는 모델이 시각적 증거를 기반으로 시간적 구조를 추론하도록 유도한다. TempCloze는 Semantic(어떤 사건이 발생해야 하는지), Alignment(언제 발생해야 하는지), Progression(어떻게 전개되어야 하는지)의 세 차원에서 디스트랙터를 구성하며, 공유된 장면과 객체를 통해 외형적 단서를 최소화한다.
기술적 접근법
- **데이터셋**: 7개 출처에서 1,521개의 영상 사용. 주로 long-take 및 egocentric 영상.
- **디스트랙터 생성**: Semantic, Alignment, Progression 3차원. 예: Alignment는 ground-truth span을 이동하거나 확장한 클립.
- **평가 모델**: 10개의 프로퍼리어리 및 21개의 오픈소스 Video-LLMs.
- **분석 방법**: Error Pattern Analysis와 Behavioral Sensitivity Analysis를 통해 후보 순서, 컨텍스트 방향, 프레임 밀도, 테스트 타임 스케일링 등이 모델 선택에 미치는 영향을 평가.
주요 결과
- Alignment 차원에서 가장 큰 성능 저하 발생. 모델은 Semantic과 Progression은 잘 인식하지만, 정확한 시간적 위치를 파악하지 못함.
- TempCloze-Mixed와 TempCloze-Hard에서 Alignment 디스트랙터가 가장 혼동을 유발.
- 후보 순서 변경 시 선택이 불안정하지만, 전체 성능은 상대적으로 안정적.
- 모델은 시작 클립보다 끝 클립에 더 의존하며, 프레임 밀도 증가로 정보가 희석됨.
- 테스트 타임 스케일링은 성능 개선을 유도하지만, Alignment 차원의 상대적 순위는 유지됨.
의의 및 한계
- TempCloze는 언어적 단서를 최소화하고, 시각적 시간 추론을 직접 평가하는 새로운 평가 기준을 제시.
- 기존 Video-LLMs가 Alignment 차원에서의 시간적 정확도를 높이는 데 어려움을 겪는다는 점을 명확히 밝힘.
- 한계로는, TempCloze는 주로 중간 클립을 선택하는 단일 형식의 문제에 초점이 맞춰져 있으며, 더 긴 영상이나 복잡한 시간 구조를 다루는 평가가 필요하다는 점이 언급됨.
실용적 활용
- 영상 기반 대형 언어 모델의 시간적 추론 능력을 정확히 평가하고자 하는 연구자 및 엔지니어에게 유용.
- 특히, 영상 기반 추론 시스템의 시간적 정확도를 향상시키기 위한 모델 개선에 활용 가능.
- 영상 기반 콘텐츠 분석, 자동 요약, 감시 영상 해석 등 산업 분야에서도 활용 가능.