한 줄 요약
Sci-VBench는 과학 분야에서 지식과 추론이 필요한 동영상 생성 모델을 평가하는 벤치마크로, 1,253개의 전문가 주석이 담긴 예제를 포함한다.
핵심 기여도
- Sci-VBench는 4개 핵심 분야(자연과학, 의료, 인문사회, 공학)에 걸쳐 60개 주제, 1,253개의 전문가 주석 예제를 포함.
- Prompt Grounding, Scientific and Causal Correctness, Spatiotemporal Consistency 등 4개 평가 차원을 정의하고, 각 예제별로 1~5점 기준의 평가 루브릭을 제공.
- 16개 프로퍼리티 및 오픈소스 모델을 벤치마킹한 결과, Scientific and Causal Correctness에서 프로퍼리티-오픈소스 간 성능 차이가 두드러짐.
- MLLM-as-Judge 시스템과 비전문가 평가자도 전문가 평가와 높은 일관성 보임 (Cohen’s κ = 0.842).
핵심 아이디어
기존 동영상 생성 모델 평가가 시각적 사실성에 집중하는 반면, Sci-VBench는 과학적 메커니즘과 인과 관계를 정확히 반영하는 능력을 평가하는 데 초점을 맞춘다. 이는 단순히 시각적으로 설득력 있는 동영상이 아니라, 과학적 제약과 시간적 일관성을 유지하는 동영상 생성을 요구한다. Sci-VBench는 각 예제에 대해 전문가가 작성한 'Reference Guide'와 'Evaluation Rubric'을 제공하여, 비전문가나 MLLM도 동일한 기준으로 평가할 수 있도록 설계되었다. 특히, Scientific and Causal Correctness 차원은 기존의 일반적 품질 평가 기준이 포착하지 못하는 메커니즘 수준의 오류를 측정한다.
기술적 접근법
- **데이터셋**: 4개 핵심 분야(자연과학, 의료, 인문사회, 공학)에 걸쳐 60개 주제, 1,253개의 전문가 주석 예제.
- **평가 차원**: Low-level Perceptual Fidelity, Prompt Grounding, Scientific and Causal Correctness, Spatiotemporal Consistency.
- **평가 프로토콜**: 전문가 평가를 기준으로 하되, MLLM-as-Judge 시스템과 비전문가 평가자도 루브릭 기반으로 평가 가능하도록 설계.
- **평가 도구**: VBench 기반 Vision Tools(VT)과 rubric-conditioned MLLM-as-judge를 결합.
- **루브릭 작성**: 각 예제별 1~5점 기준으로, 관찰 가능한 증거를 기반으로 정의.
- **실험 대상 모델**: 16개 프로퍼리티 및 오픈소스 모델.
주요 결과
- **Prompt Grounding**: 프로퍼리티 모델이 오픈소스 모델 대비 평균적으로 10% 이상 높은 점수.
- **Scientific and Causal Correctness**: 프로퍼리티 모델이 오픈소스 모델 대비 평균적으로 15% 이상 높은 점수.
- **Spatiotemporal Consistency**: 프로퍼리티-오픈소스 간 차이는 상대적으로 작음.
- **Perceptual Quality**: 대부분의 모델 간 차이가 거의 없음.
- **비전문가 평가자와 MLLM-as-Judge**: 전문가 평가와 높은 일관성 보임 (Cohen’s κ = 0.842).
의의 및 한계
Sci-VBench는 과학 분야에서의 동영상 생성 모델 평가를 체계화하고, 전문가 평가 기준을 비전문가와 MLLM이 재현할 수 있도록 설계된 점에서 혁신적이다. 특히, Prompt Grounding과 Scientific and Causal Correctness 차원에서의 성능 차이는 시각적 사실성과 과학적 정확성 간의 괴리를 드러내며, 모델 개선 방향을 제시한다. 그러나 일부 과학 분야에서는 예제 수가 제한적이고, 모델이 시간적 일관성을 유지하는 데 어려움을 겪는다는 한계가 있다.
실용적 활용
Sci-VBench는 과학 교육, 연구 시뮬레이션, 의료 시각화 등에서 모델의 과학적 정확성과 시간적 일관성을 평가하는 데 활용될 수 있다. 특히, 모델 개발자들이 과학적 메커니즘을 정확히 반영하는 능력을 향상시키는 데 중요한 기준이 될 수 있다.