한 줄 요약
EchoWM은 720p 영상, 환경음, 음악, 음성을 동시 생성하며, 1인칭 및 3인칭 시점의 연속 이동에 반응하는 옴니모달 월드 모델이다.
핵심 기여도
- **Enterable Omnimodal World Modeling**: 1인칭 및 3인칭 시점의 연속 이동과 영상, 환경음, 음성의 동시 생성을 지원하며, Multi-turn Continuation으로 단일 롤아웃을 넘어 확장 가능.
- **Unified Camera-Intent Interface**: 이산 명령어와 연속 카메라 포즈를 공유 6-DoF 상대 궤적으로 매핑하며, Dataset-level Calibration과 Relative UCPE를 통해 다양한 데이터 출처에서 일관된 기하 조건을 제공.
- **Capability-Aligned World Data Engine**: 내부 게임플레이, 인터넷 게임플레이, UE 시뮬레이션, 일반 인터넷 영상 4가지 출처를 결합하여 AV-rich, control-clean, balanced한 고질량 데이터를 구성.
- **Progressive Training Curriculum**: AV-CPT → Action-SFT → Joint-FT → Autoregressive Post-Training의 4단계 학습 과정을 통해 멀티모달 품질과 제어 반응성을 분리 학습.
핵심 아이디어
EchoWM은 사용자의 **카메라 인텐트**(Camera Intent)를 중심으로 상호작용을 구성한다. 이는 1인칭 시점에서는 관찰자의 이동을, 3인칭 시점에서는 카메라-캐릭터 동역학을 학습하여, 뷰에 종속되지 않은 통일된 인터페이스를 제공한다. 이 인텐트는 **공유 상대 6-DoF 궤적**(Shared Metric-Scale Relative 6-DoF Trajectory)으로 표현되며, **Dataset-level Calibration**을 통해 이질적인 데이터 출처 간 이동의 크기를 일관되게 유지한다.
EchoWM의 핵심 통찰은 **관찰자-주체 관계**(Observer-Subject Relationship)를 데이터에서 학습하여, 1인칭/3인칭 시점을 구분 없이 동일한 인터페이스로 처리할 수 있다는 점이다. 이는 기존 시스템에서 요구되는 뷰-특화된 컨트롤러나 카메라 릿(Camera Rig) 없이도 가능하다.
기술적 접근법
- **모델 아키텍처**: 이산 명령어와 연속 포즈를 공유 6-DoF 상대 궤적으로 매핑하며, **Relative UCPE**(Relative Unified Camera Positional Encoding)를 통해 카메라 기하학을 인코딩.
- **데이터 엔진**: 내부 게임플레이, 인터넷 게임플레이, UE 시뮬레이션, 일반 인터넷 영상 4가지 출처를 결합. **AV-rich, control-clean, balanced**한 데이터 구성.
- **학습 과정**:
1. **Audio-Visual Continued Pretraining (AV-CPT)**: AV-rich 데이터로 시각 동역학과 음향 사전 정보 학습.
2. **Action Fine-Tuning (Action-SFT)**: 백본 고정 후, 가벼운 궤적 경로만 학습하여 제어 민감도 분리.
3. **Joint Fine-Tuning (Joint-FT)**: AV-CPT와 Action-SFT의 능력을 결합하며, **저학습률**로 학습.
4. **Autoregressive Post-Training**: 모델이 자체 생성된 컨텍스트에 적응하도록 훈련.
주요 결과
- **WBench Navigation**: EchoWM은 **1위 성적**을 기록하며, 시각 품질, 설정 준수, 상호작용, 일관성, 물리적 타당성에서 우수한 성능.
- **SANA-WM-Bench**: 단기 및 장기 궤적 따라가기와 시각 지속성 평가에서 **상위 수준의 시각 품질**을 보임.
- **Multi-turn Continuation**: 단일 롤아웃을 넘어, **동기화된 환경음과 음성**을 유지하며 여러 턴의 생성을 지원.
의의 및 한계
EchoWM은 **생성 미디어**(Generative Media)와 **인터랙티브 월드 모델**(Interactive World Models)을 결합한 첫 번째 시도로, **1인칭/3인칭 시점의 통일된 인터페이스**, **멀티모달 생성**, **장기 생성 일관성**을 동시에 달성한 점에서 학술적·실용적 가치가 있다.
하지만, **사용자 행동**(예: 캐릭터의 임의 행동)은 카메라 이동으로 축소 표현되며, **별도의 음성-음향 컨트롤러**(Explicit Action-to-Sound Controller)는 제공되지 않아, **사운드 제어의 정확도**는 모델 내부의 **교차 모달 결합**(Cross-modal Coupling)에 의존한다는 한계가 있다.
실용적 활용
EchoWM은 **게임 개발**, **VR/AR 콘텐츠 생성**, **멀티모달 인터랙티브 미디어 플랫폼** 등에서 활용 가능하다. 특히, **사용자의 연속 이동에 반응하는 생성 환경**이 필요한 시나리오에서, **동시 생성되는 영상, 음향, 음성**을 통해 몰입감 있는 경험을 제공할 수 있다.