한 줄 요약
VGI-Bench는 영상 생성 모델의 시각적 추론 능력을 평가하기 위한 새로운 벤치마크로, Seedance 2.0 모델이 51.0% 성능을 기록하는 등 현재 모델들의 한계를 드러낸다.
핵심 기여도
- VGI-Bench: 27개 태스크, 810개 인스턴스로 구성된, 시각적 추론 능력을 평가하는 새로운 벤치마크.
- 두 가지 평가 지표(Completeness, Rubric Score)를 제안하여 과정 중심 평가를 실현.
- Seedance 2.0 모델이 51.0% 성능을 기록하며, 현재 영상 생성 모델의 시각적 추론 능력이 여전히 제한적임을 밝힘.
- 입력 조건 민감도, 합성 미세조정 전이 한계, 내부 디노이징 동향을 분석하여 실패 원인을 다각도로 진단.
핵심 아이디어
VGI-Bench는 기존 영상 생성 모델 평가의 주요 한계를 해결하기 위해 설계되었다. 기존 벤치마크는 추상적 입력이나 최종 상태만을 기준으로 하여, 실제 영상 생성 모델의 시각적 사전 지식과 추론 능력을 정확히 평가하지 못했다. VGI-Bench는 **광학적으로 사실적인 입력**(photorealistic-style inputs)을 사용하고, **중간 과정**(intermediate trajectory)을 기반으로 성공 여부를 판단함으로써, 모델이 단순히 최종 상태를 맞추는 것이 아닌, **시각적 추론을 통해 과정을 정확히 재현하는 능력**을 평가한다.
또한, VGI-Bench는 **2단계 분류 체계**(도메인 + 스킬 태그)를 도입하여, 모델의 특정 능력(예: 물리 법칙 준수, 객체 일관성 유지 등)을 세분화하여 평가할 수 있도록 설계되었다. 이는 기존 벤치마크가 단일 지표로 평가하는 한계를 극복한다.
기술적 접근법
- **VGI-Bench 구성**: 27개 태스크, 810개 인스턴스로 구성.
- **입력 조건**: 광학적으로 사실적인 이미지 사용으로, 추상적 입력에 비해 시각 도메인 불일치를 줄임.
- **평가 지표**:
- **Completeness (Comp.)**: 과제 목표에 대한 전반적 진행도를 3단계(Complete, Partial, Failed)로 평가.
- **Rubric Score (Rub.)**: 세부 규칙 위반 여부를 체크리스트 기반으로 평가.
- **프레임 샘플링 전략**: **4fps → 8fps**의 **adaptive frame sampling**과 **10-frame sliding window**를 사용하여, 과도한 샘플링 없이도 위반 사항을 포착.
- **점수 계산**: Comp. × Rub.의 **multiplicative aggregation**을 통해, 과정과 결과 모두를 고려한 최종 점수 산출.
- **VLM-judge**: 대규모 언어 모델 기반 평가자(Vision-Language Model)를 사용하여, 인간 판단과의 일관성을 높임.
주요 결과
- Seedance 2.0 모델이 VGI-Bench 평가 기준에서 **51.0%** 성능을 기록.
- **가장 성능이 높은 모델**이 51.0%에 불과하며, 현재 영상 생성 모델은 **일반적인 시각적 지능**(general-purpose visual intelligence)에 여전히 부족함.
- 실패 모드 분석에서 **물리적 붕괴**, **규칙 위반**, **객체/상태 불일치**가 주요 원인.
- 합성 미세조정(synthetic fine-tuning)은 추상 데이터에서 실제 태스크로 전이가 가능하지만, **훈련 분포가 스킬 요구사항을 얼마나 잘 커버하는지에 따라 한계가 있음**.
- 디노이징 과정에서 **초기 가설을 수정하지 않고 단순히 정제**(refinement)하는 경향이 강함.
의의 및 한계
VGI-Bench는 영상 생성 모델이 단순한 시각 시뮬레이터를 넘어, **시각적 추론 능력을 갖춘지**를 평가하는 첫 번째 시도로, **다양한 실패 원인을 분석**함으로써 모델 개선 방향을 제시한다. 특히, **입력 조건 민감도**, **미세조정 전이 한계**, **디노이징 동향**을 분석함으로써, 기존 평가 방법의 한계를 극복하고, **과정 중심 평가**(process-sensitive evaluation)를 가능하게 한다는 점에서 학술적 의의가 크다.
하지만, VGI-Bench는 **데이터가 공개되지 않았으며**, 일부 통계는 논문에서 유추한 것이므로, 외부 연구자들의 재현 및 확장이 제한될 수 있다. 또한, **모든 실패가 추론 오류 때문이 아니라 입력 조건에 따른 것일 수 있으므로**, 평가 시 조건 민감도를 보완하는 방향이 필요하다.
실용적 활용
VGI-Bench는 **영상 생성 모델의 시각적 추론 능력을 정량적으로 평가**할 수 있는 도구로, **다음 세대 영상 생성 모델 및 멀티모달 기초 모델**(foundation model)의 개발에 기여할 수 있다. 특히, **시뮬레이션 기반 학습**(embodied learning), **제어 가능한 편집**(controllable editing), **시나리오 기반 생성**(scenario-based generation) 등에서 활용 가능하다.