한 줄 요약
DreamX-Phi 1.0은 언어 지시와 로봇 동작을 조건으로 미래 장면을 예측하는 조건부 영상 월드 모델로, WorldArena 2.0에서 Track 1 1위, Track 2 2위를 달성했다.
핵심 기여도
- **SE(3) 기하학적 인코딩**을 통해 로봇 팔의 3D 운동 구조를 유지하며, PRoPE-style attention을 사용하여 팔별 동작 경로를 정확히 반영.
- **경량화된 depth branch**와 **SAM3 masks**, **V-JEPA teacher**를 결합하여 장면 기하학과 조작 객체의 일관성을 유지.
- **Distribution-matching distillation**을 통해 다단계 생성기를 소수 단계 학습 모델로 압축, 효율적 배포 가능.
- WorldArena 2.0 Track 1에서 1위, Track 2에서 2위 달성. WorldArena 1.0 Track 1에서 76.88 EWMScore-P 기록.
핵심 아이디어
DreamX-Phi 1.0은 로봇 조작 동작과 장면 진화를 정확히 반영하는 영상 월드 모델을 구축하기 위해, 기하학적 구조와 객체 중심의 일관성을 동시에 고려하는 접근법을 제안한다. 기존 모델은 동작을 단순 토큰으로 압축하여 3D 운동 구조를 유지하지 못했으나, DreamX-Phi는 각 팔의 SE(3) 변환을 PRoPE-style attention에 주입함으로써 팔별 경로를 구조적으로 유지한다. 또한, 조작 중인 객체의 상태를 정확히 반영하기 위해 SAM3 마스크와 V-JEPA teacher를 활용하여 객체 일관성을 강화한다. 이는 단순한 시각적 사실성뿐 아니라, 동작 조건에 대한 충실도(faithfulness)를 높이는 핵심이다.
기술적 접근법
- **모델 기반**: Wan2.2-TI2V-5B 기반의 비디오 생성 모델.
- **동작 조건**: SE(3) 기반의 3D 팔 경로를 PRoPE-style attention으로 인코딩.
- **장면 기하학**: 경량 depth branch를 추가하여 장면의 3D 구조 유지.
- **객체 일관성**: SAM3 마스크와 V-JEPA teacher를 사용한 객체 중심의 마스킹.
- **효율적 배포**: 다단계 생성기를 few-step student 모델로 압축(Distribution-matching distillation).
- **학습 데이터**: 이고각 영상과 로봇 상호작용 데이터로 구성된 이질적 학습 코퍼스 사용.
주요 결과
- **WorldArena 2.0 Track 1**: 60.65 EWMScore-P 기록, 31개 팀 중 1위.
- **WorldArena 2.0 Track 2**: Adjust Bottle 태스크에서 67.19% 성공률, 2위.
- **WorldArena 1.0 Track 1**: 76.88 EWMScore-P 기록.
- **모델 효율성**: 다단계 생성기를 few-step 모델로 압축하여 추론 속도 향상.
의의 및 한계
DreamX-Phi 1.0은 로봇 조작 동작과 장면 진화를 동시에 정확히 반영하는 영상 월드 모델로서, 학술적·실용적으로 중요한 진전을 보여준다. 특히, SE(3) 기하학적 인코딩과 객체 일관성 유지 기법은 기존 모델의 한계를 극복하는 데 기여하며, 정책 학습 및 시뮬레이션 환경 구축에 활용 가능하다. 그러나, 모델 내 각 구성 요소의 기여도를 정량적으로 분석한 실험(ablation study)은 아직 수행되지 않았으며, 이는 향후 연구에서 보완되어야 할 점이다.
실용적 활용
DreamX-Phi 1.0은 로봇 시뮬레이션, 자율 조작 정책 학습, 로봇 이중체(RoboTwin) 구축 등에 활용 가능하다. 특히, 복잡한 조작 환경에서 시각-동작 일관성을 유지하는 모델로서, 실제 로봇 시스템의 사전 시뮬레이션 및 정책 최적화에 유용하게 사용될 수 있다.