한 줄 요약
PAWBench는 영상 생성 모델이 확률적으로 정렬된 세계 모델링에 얼마나 가까운지를 평가하는 벤치마크로, 50개 시나리오에서 기존 11개 시스템이 모두 일관된 분포를 재현하지 못함을 밝힘.
핵심 기여도
- **확률적 정렬(probabilistic alignment)**을 세계 모델링의 분포 기준으로 정식화하고, 이를 평가하는 **PAWBench** 벤치마크를 제안.
- **PAWEval** 프로토콜을 통해 반복 생성된 영상으로부터 경험적 분포를 추출, **PAW-Calibration**과 **PAW-Coverage** 평가를 수행.
- 50개 시나리오, 11개 시스템을 대상으로 실험한 결과, **모든 모델이 일관된 참조 확률과 유효 행동 범위를 동시에 재현하지 못함**.
- 언어 프롬프트, 초기 노이즈 샘플링, 미세 조정(fine-tuning)을 통한 분포 조정 실험을 수행.
핵심 아이디어
기존 영상 생성 모델은 단일 영상의 타당성만 평가받으며, 동일한 초기 관찰과 행동에 대해 가능한 미래의 분포를 정확히 모델링하는지 여부는 무시되어 왔다. 이는 **확률적 정렬**(probabilistic alignment)이라는 개념으로 정의되는데, 이는 동일한 조건에서 생성된 영상이 **물리적으로 가능한 미래의 전체 범위**(valid behaviors)와 **각각의 발생 확률**(probability mass)을 반영해야 한다는 것을 의미한다.
이를 위해 연구팀은 **PAWBench**를 제안하며, 50개 시나리오를 8개의 물리 메커니즘 그룹으로 분류하고, **PAW-Calibration**과 **PAW-Coverage**이라는 두 평가 스위트를 구성했다. PAW-Calibration은 분포가 수학적으로 명시된 시나리오(예: 동전 던지기, 바퀴 회전)를 대상으로 하며, PAW-Coverage는 가능한 결과는 열거 가능하지만 확률은 명시되지 않은 시나리오(예: 볼링공 굴리기, 병 뒤집기)를 대상으로 한다.
기술적 접근법
- **PAWBench**는 50개 시나리오로 구성되며, 각 시나리오에서 동일한 초기 이미지와 행동 프롬프트가 반복적으로 입력된다.
- **PAWEval**은 반복 생성된 영상에서 **가독성 있는 최종 결과**(in-schema outcomes)를 추출하고, 나머지를 **결과 해석 실패**(outcome-readout failure)로 분류한다.
- **PAW-Calibration**에서는 추출된 경험적 분포와 참조 확률을 비교하며, **PAW-Coverage**에서는 유효한 결과 범위의 회복 여부를 평가한다.
- 평가 시스템은 총 11개이며, **K = 50**개의 독립적 영상 생성이 수행되며, 최대 30개까지 결과 해석 실패를 허용한다.
- **Scene Pass Rate (SPR)**는 각 트랙(25개 시나리오)에서 20개 이상의 결과가 해석 가능한 경우를 기준으로 계산된다.
주요 결과
- 11개 시스템 모두 **PAW-Calibration**과 **PAW-Coverage**에서 참조 확률과 유효 행동 범위를 동시에 재현하지 못함.
- **PAWEval**은 인간 판단과 일치하며, 유한 샘플링이나 자동 결과 해석의 오류로 설명되지 않음.
- 언어 프롬프트, 초기 노이즈 샘플링, 미세 조정을 통해 분포를 조정하려는 시도는 일부 성공적이지만, **일관된 분포 회복은 실패**.
- **모든 시스템에서 Scene Pass Rate (SPR)**는 100%에 도달하지 못하며, 최소 20개 이상의 결과가 해석 가능한 경우에만 통과로 간주됨.
의의 및 한계
PAWBench는 영상 생성 모델이 단순히 타당한 영상만 생성하는 것을 넘어, **확률적 분포를 정확히 모델링하는 능력을 평가**할 수 있는 첫 번째 시도로, 세계 모델링의 학술적 기준을 정립하는 데 기여한다. 그러나 PAWBench는 **물리적 메커니즘의 범위가 제한적**이며, **모든 가능한 행동 분포를 포괄하지는 못**한다. 또한, **모델의 학습 분포 자체를 재구성하는 방법론은 여전히 미흡**하며, **언어나 노이즈 조절은 분포를 일관되게 변화시키지 못**한다는 한계가 드러났다.
실용적 활용
PAWBench는 **로봇 제어, 자율 주행, 시뮬레이션 기반 학습** 등에서 미래 행동의 확률적 분포를 정확히 예측해야 하는 분야에 적용 가능하다. 예를 들어, **자율 주행 시스템**이 동일한 상황에서 다양한 운전 방식을 고려할 수 있도록 도울 수 있으며, **강화 학습 환경**에서 보다 현실적인 세계 모델을 학습하는 데 활용될 수 있다.