한 줄 요약
WorldExam은 1,474개의 테스트 케이스로 구성된 비디오 월드 모델 평가 벤치마크로, 시각적 품질을 넘어 내재적 반응성을 평가한다.
핵심 기여도
- 내재적 반응성(World Reactivity) 평가를 위한 4단계 다이어그노스틱 벤치마크 WorldExam 제안.
- 8개의 평가 태스크와 1,474개의 테스트 케이스로 구성.
- 카메라, 액션, 언어 기반 모델을 통합 평가.
- 20개 대표 모델 평가 결과, 시각 품질과 명시적 지시 준수는 내재적 반응성을 보장하지 않음.
핵심 아이디어
기존 벤치마크는 주로 시각 품질과 명시적 지시 준수를 평가하지만, 월드 모델이 진정한 의미에서 "세계"를 모델링하려면 입력에 명시되지 않은 상황에 대한 반응성을 갖춰야 한다. 예를 들어, 주체가 계단에 오를 때 움직임이 지형에 따라 적응하거나 장애물에 접근할 때 세계가 반응하는 능력이 필요하다. 이는 입력에 명시되지 않은 **scene-conditioned consequences**를 생성하는 능력을 의미하며, WorldExam은 이를 평가하기 위해 **World Reactivity**라는 새로운 평가 단계를 도입했다.
WorldExam은 각 모델의 인터페이스에 맞춰 **SE(3) 카메라 트래젝토리**, **이산 액션 시퀀스**, **자연어 프롬프트**를 사용하여 평가를 구성한다. 특히, World Reactivity 평가에서는 모델이 명시된 제어나 목표 외에 **scene-conditioned 반응**을 자동으로 유도하는지 평가한다. 예를 들어, "세 개의 볼트를 높이 순서대로 배열하라"는 목표가 주어졌을 때, 어떤 객체부터 움직일지, 움직임을 프레임 단위로 어떻게 구현할지가 명시되지 않으며, 이는 모델이 스스로 계획하고 반응해야 하는 상황이다.
기술적 접근법
- **4단계 평가 수준**: Visual Quality, Control Adherence, Spatial Consistency, World Reactivity.
- **8개 평가 태스크**: Camera Control, Subject Control, Scene Revisit, Terrain Interaction, Object Interaction, Social Interaction, Physical Reaction, Goal Completion.
- **1,474개 테스트 케이스**로 구성.
- **두 평가 트랙**:
- **Static-scene track**: 카메라 제어만 포함, 모든 모델(카메라, 액션, 언어 기반) 평가 가능.
- **Dynamic-interaction track**: 주체-환경 상호작용이 필요한 경우, 액션 및 언어 기반 모델만 평가.
- **평가 메트릭**:
- 3D 복원 모델을 사용한 Camera Control, Scene Revisit, Subject Control, Terrain Interaction 평가.
- 나머지 4개 태스크는 GPT-5.5 기반 VLM 판정자(VLM judge)를 사용한 체크리스트 점수.
- **인터페이스 적응**: 각 모델의 고유 인터페이스에 맞춘 평가 단위(예: 카메라 기반 모델은 SE(3) 카메라 트래젝토리).
주요 결과
- **20개 대표 모델 평가 결과**, **내재적 반응성**(World Reactivity)에서 명확한 능력 분화 발생.
- **카메라 기반 모델**: 카메라 제어 능력은 뛰어나지만, 동적 상호작용 지원 X.
- **액션 기반 모델**: 주체 제어 정밀도 높지만, 세계 반응성 부족.
- **언어 기반 모델**: 상호작용 및 목표 기반 작업에서 우수하지만, 복합 제어 따르기 부정확.
- **모든 모델이 넓은 태스크 커버리지와 일관된 성능을 결합하지 못함**.
- **고 시각 품질과 명시적 지시 준수는 내재적 반응성을 보장하지 않음**.
의의 및 한계
WorldExam은 월드 모델이 단순히 시각적 품질이나 명시적 지시를 따르는 것이 아니라, 입력에 명시되지 않은 상황에 대한 반응성을 갖는지 평가할 수 있는 체계적인 프레임워크를 제공한다. 이는 월드 모델이 진정한 의미에서 "세계"를 이해하고 반응하는 능력을 평가하는 데 기여한다. 또한, 다양한 인터페이스(카메라, 액션, 언어)를 통합 평가함으로써 모델 간 비교의 공정성을 높인다.
그러나 현재 벤치마크는 모델 인터페이스의 한계에 제약받는다. 예를 들어, 동적 상호작용 평가는 제3자 주체 제어가 가능한 모델에만 적용되며, **Goal Completion 태스크는 언어 기반 모델에만 제한**된다. 또한, 평가 메트릭은 **가시적 종단-종단 행동**만 평가하며, 내부 인과적 표현 학습 여부를 판단하지 못한다. 이는 향후 연구에서 개선이 필요한 부분이다.
실용적 활용
WorldExam은 월드 모델이 실제 세계와 유사한 반응성을 갖는지 평가할 수 있는 도구로, **로봇 제어**, **자율 주행**, **가상 환경 시뮬레이션**, **게임 AI** 등에서 활용 가능하다. 특히, **목표 기반 행동**(Goal Completion) 평가는 자율 시스템 설계에 중요한 인사이트를 제공할 수 있다.