한 줄 요약
WorldPlay2는 실시간 대응과 장기 일관성을 갖춘 하이브리드 제어 인터페이스와 안정적 지도를 결합한 대규모 인터랙티브 월드 모델이다.
핵심 기여도
- **Factorized Hybrid Control Interface**: 프레임 정렬된 액션 제어와 구조화된 의미 제어를 결합하여 장면 외관, 캐릭터 ID, 동적 의미 이벤트를 명시적으로 분리.
- **Compressed Memory**: 과거 컨텍스트를 컴팩트한 메모리 토큰으로 압축하여 장기 모델링의 계산 비용을 70% 이상 감소.
- **Stable Forcing**: PDD 초기화와 Full-Rollout Replay를 결합하여 장기 생성의 일관성을 167초/반복으로 안정화.
핵심 아이디어
WorldPlay2는 기존 월드 모델이 직면한 두 가지 주요 문제, 즉 **이질적인 제어 신호 통합**과 **장기 일관성 유지**를 해결하기 위해 새로운 구조를 제안한다. 기존 모델은 카메라 이동과 캐릭터 이동 같은 저수준 제어와, 의미 이벤트 같은 고수준 제어를 통합하는 데 어려움이 있었으며, 이는 모델이 시각적 외관, 공간 이동, 이벤트를 혼동하게 만들었다. 이에 따라 WorldPlay2는 **Factorized Hybrid Control Interface**를 도입하여, 저수준 제어와 고수준 의미 제어를 명시적으로 분리하고, 각각을 독립적인 필드(장면, 캐릭터, 이벤트)로 처리한다.
또한, 기존의 장기 생성 모델은 전체 컨텍스트를 처리하는 데 비용이 많이 들었고, 이로 인해 지도 과정에서 불안정성이 발생했다. 이를 해결하기 위해 **Compressed Memory**와 **Stable Forcing**를 결합하여, 메모리 토큰을 사용한 클립별 점수 평가와 PDD 초기화, Full-Rollout Replay를 통해 장기 생성의 일관성을 유지하면서도 계산 비용을 줄였다.
기술적 접근법
- **Factorized Hybrid Control Interface**: 프레임 정렬된 액션 제어와 구조화된 의미 제어를 결합.
- **Compressed Memory**: 과거 컨텍스트를 메모리 토큰으로 압축, 전체 롤아웃 대신 클립별 점수 평가.
- **Stable Forcing**: PDD 초기화 + Full-Rollout Replay를 통해 장기 생성 일관성 유지.
- **데이터셋**: 700K 개의 30~60초 네비게이션 클립 + 10K 개의 10~30초 인터랙티브 이벤트 클립.
- **하드웨어 최적화**: 8개의 H20 GPU에서 16 FPS 실시간 생성.
주요 결과
- **WBench**: 2D 일관성 지표 (LPIPS, PSNR, SSIM)에서 기존 모델 대비 +12% 개선.
- **RevisitBench**: 200개의 재방문 경로에서 3D 공간 일관성 (MEt3R) 기존 대비 +15% 향상.
- **Full-Rollout Replay**: 320 레이턴트 롤아웃에서도 메모리 부족 없이 안정적 생성.
- **Distillation Time**: 261초 대비 167초로 35% 단축.
의의 및 한계
WorldPlay2는 인터랙티브 월드 모델의 실시간 대응과 장기 일관성을 동시에 달성한 첫 사례로, **Embodied Intelligence** 및 **스페이셜 컴퓨팅** 분야에서 중요한 발전을 의미한다. 특히, **Factorized Hybrid Control Interface**는 이질적인 제어 신호를 명확히 분리하여 모델의 제어 정확도를 높였으며, **Compressed Memory**와 **Stable Forcing**는 장기 생성의 일관성과 안정성을 동시에 보장한다.
그러나, **캐릭터의 시각적/의미적 드리프트**가 장기 롤아웃 시 발생하며, **무한 롤아웃 생성**에 대한 해결책은 아직 미비하다. 또한, 인터랙티브 이벤트 데이터셋이 10K 클립으로 상대적으로 작아, 더 많은 데이터가 필요할 수 있다.
실용적 활용
WorldPlay2는 게임 개발, VR/AR 환경 구축, 시뮬레이션 기반 정책 평가 등에서 활용 가능하다. 특히, **실시간 인터랙션**과 **장기 일관성**이 요구되는 대규모 생성 시스템에 적합하며, **Low-Bit Quantization**과 **KV Caching**을 통해 GPU 자원을 효율적으로 활용할 수 있다.