한 줄 요약
Principia는 물리적 관계 일관성을 기준으로 동영상 생성 모델의 물리적 추론 능력을 평가하는 벤치마크로, 8가지 현상에 걸쳐 500개 이상의 실제 장면을 포함한다.
핵심 기여도
- Principia 벤치마크는 8가지 물리 현상(중력, 탄성, 마찰 등)을 다루며, 500개 이상의 실제 장면을 포함.
- Calibration-independent consistency score를 도입하여 이미지 공간에서 물리적 위반을 직접 측정.
- 6개의 최신 동영상 생성 모델이 Principia에서 최대 0.42 점을 기록, VBench에서는 0.8 점 수준.
- Isaac Sim을 활용한 합성 테스트베드를 구축하여 VLM과 동영상 생성 모델을 대규모로 평가.
핵심 아이디어
기존 방법은 절대적인 물리량(속도, 가속도 등)을 추정해야 하므로 불확실성이 높다. 본 연구는 물리 법칙이 두 객체 간의 상대 운동에 대해 불변 관계를 생성한다는 점에 주목한다. 예를 들어, 마찰이 있는 경사면에서 질량이 다른 두 블록이 동일한 조건에서 동시에 도착하는 현상은 질량에 무관한 물리적 불변량이다. 이 관계는 절대적인 물리량 추정 없이 이미지 공간에서 측정 가능하다. Principia는 이러한 관계를 8가지 물리 현상에 걸쳐 평가하여, 생성된 동영상의 물리적 일관성을 정량적으로 측정한다.
기술적 접근법
- **Principia 벤치마크**: 8가지 물리 현상(중력, 탄성, 마찰, 회전 관성, 포물선 운동, 운동량, 진자, 스프링-질량 진동)을 포함.
- **Invariance score**: 이미지 공간에서 상대 운동 관계를 기반으로 계산. 절대적인 물리량(질량, 속도, 가속도) 추정 없이 계산 가능.
- **Isaac Sim 합성 테스트베드**: 제어된 및 반물리적 시나리오 생성.
- **평가 대상**: 6개의 최신 동영상 생성 모델(Veo, Wan 등), 4개의 Vision-Language 모델.
주요 결과
- 6개의 최신 동영상 생성 모델 중 가장 높은 점수는 0.42 (Principia), VBench에서는 평균 0.8 점.
- VLM 중 가장 높은 정확도는 67%, 대부분의 모델은 우연 수준(50% 근처)에서 성능.
- 네트워크 크기 증가가 물리적 일관성 개선에 기여하지 않음.
- Open-weights 모델(Wan2.2-14B)이 closed-frontier 모델(Veo-3.1)보다 높은 성능.
의의 및 한계
Principia는 물리적 일관성을 정량적으로 평가하는 새로운 기준을 제시하며, 생성 모델이 단순히 시각적 사실성을 학습한 것임을 드러낸다. 그러나 실험 환경에서의 미세한 불균형(기하학적, 시간적, 표면적)이 실제 물리적 위반과 구별되지 않을 수 있다. 또한, 합성 데이터와 실제 데이터 간의 차이가 모델 평가에 영향을 줄 수 있다.
실용적 활용
Principia는 물리 기반 세계 모델로 활용되는 동영상 생성 모델의 신뢰도를 평가하는 데 유용하며, VLM의 물리적 추론 능력을 개선하는 데 사용될 수 있다. Isaac Sim을 기반으로 대규모 합성 데이터 생성이 가능하므로, 모델 개선을 위한 훈련 데이터로도 활용 가능하다.