한 줄 요약
VideoScore는 37.6K개의 영상에 대한 인간 평가를 기반으로 학습하여, 기존 지표 대비 50점 이상 높은 상관계수(77.1)를 달성한 자동 영상 평가 모델이다.
핵심 기여도
- **VideoFeedback** 데이터셋: 11개의 생성 모델에서 생성된 37.6K개 영상에 대해 5개의 세부 평가 항목(Visual Quality, Temporal Consistency 등)으로 인간 평가를 수집한 최초의 대규모 데이터셋.
- **VideoScore 모델**: Mantis-Idefics2-8B를 기반으로 VideoFeedback 데이터셋에서 학습한 자동 평가 모델.
- **성능 개선**: VideoFeedback-test에서 77.1의 Spearman 상관계수를 달성하며, 기존 최고 성능 대비 약 50점 개선.
- **다양한 벤치마크에서 우수성**: EvalCrafter(59.5), GenAI-Bench(78.5), VBench(72.1)에서 기존 베이스라인 대비 4.4~11.4% 개선.
핵심 아이디어
기존 영상 생성 모델 평가 지표는 단일 측면(예: 시각 품질)에만 초점을 맞추거나, 인간 평가와의 상관성이 낮아 신뢰도가 부족했다. 이에, 본 연구는 **다중 측면 평가**와 **대규모 인간 평가 데이터셋**을 기반으로 한 새로운 자동 평가 모델 VideoScore를 제안한다.
VideoScore는 **Mantis-Idefics2-8B**라는 다중 이미지 및 영상 처리 능력이 뛰어난 모델을 기반으로, VideoFeedback 데이터셋에서 학습된다. 이 데이터셋은 5개의 평가 항목(Visual Quality, Temporal Consistency, Dynamic Degree, Text-to-Video Alignment, Factual Consistency)으로 구성되어 있으며, 각 항목은 1(불만족)에서 4(완벽)까지의 점수를 부여받는다.
기존 MLLM 기반 평가 방식(예: GPT-4o, Gemini)은 인간 평가와의 상관성이 낮았으나, VideoScore는 Mantis 기반 모델을 사용함으로써 **12.1%의 성능 향상**을 달성하는 것으로 나타났다. 이는 모델이 영상의 세부 측면을 정확히 이해하고 평가할 수 있음을 시사한다.
기술적 접근법
- **데이터셋 구성**: 11개의 영상 생성 모델(Pika, Lavie, SVD 등)을 사용하여 37.6K개의 영상을 생성하고, 20명의 전문 평가자에 의해 5개의 평가 항목에 대해 1~4점의 점수를 부여.
- **모델 구조**: Mantis-Idefics2-8B를 사용. 최대 128프레임 처리, 네이티브 해상도 지원.
- **학습 데이터**: VideoFeedback-train 데이터셋을 기반으로 fine-tuning.
- **평가 지표**: Spearman 상관계수, Pairwise 비교 정확도.
- **추가 실험**: 다양한 백본 모델을 사용한 ablation study를 통해 Mantis 기반 모델의 우수성을 검증.
주요 결과
- **VideoFeedback-test**: VideoScore의 Spearman 상관계수는 77.1로, 기존 최고 성능 대비 약 50점 개선.
- **EvalCrafter**: Text-to-Video Alignment 항목에서 59.5, 기존 최고 대비 4.4% 개선.
- **GenAI-Bench**: Pairwise 비교 정확도 78.5, 기존 최고 대비 11.4% 개선.
- **VBench**: 5개 항목 평균 72.1, 기존 최고 대비 9.6% 개선.
- **Ablation Study**: Mantis 기반 모델은 Idefics2 기반 모델 대비 12.1%의 성능 향상.
의의 및 한계
VideoScore는 기존 영상 평가 지표의 한계를 극복하고, 인간 평가와 높은 상관성을 보이는 자동 평가 모델로, **영상 생성 모델의 성능 추적 및 RLHF에서의 인간 피드백 시뮬레이션**에 유용하게 활용될 수 있다. 특히, 다중 측면 평가와 대규모 인간 평가 데이터셋을 기반으로 한 접근법은 영상 생성 분야의 평가 기준을 혁신적으로 발전시켰다.
그러나, VideoScore는 여전히 **인간 평가와의 완전한 일치**는 이루지 못하며, 평가 항목 간의 **일관성**(IAA: 60% 이상)도 개선 여지가 있다. 또한, 모델이 학습된 데이터셋의 범위를 벗어난 새로운 영상에 대한 일반화 능력도 추가 연구가 필요하다.
실용적 활용
VideoScore는 영상 생성 모델의 성능 비교, 모델 개선을 위한 RLHF 피드백 시뮬레이션, 생성 영상의 질적 평가 등에 활용될 수 있다. 특히, **영상 생성 기업**이나 **AI 연구소**에서 모델 개선 과정에서 자동 평가를 통해 인간 평가 대체 및 효율성 향상에 기여할 수 있다.