한 줄 요약
SolarWM은 다양한 데이터와 모델 기반으로 실시간 대화형 영상 생성을 가능하게 하는 오픈 소스 월드 모델 기반 구조를 제시한다.
핵심 기여도
- 1.43백만 개의 클립을 10개 데이터셋에서 통합한 **frame-aligned contract** 데이터 인프라 구축.
- **Wan2.2, LTX-2.5, MiniMax-H3** 기반 5B–33B 파라미터 모델 4개를 **backbone-native adaptation**으로 구현.
- **bidirectional adaptation**, **teacher-forced autoregressive initialization**, **distribution matching distillation**을 결합한 3단계 훈련 레시피 제시.
- 5초 훈련 시퀀스로 **minutes-to-hours** 실시간 롤아웃 가능.
핵심 아이디어
기존 시스템은 데이터셋 간 시간 스케일, 카메라 기하학, 시각 품질, 캡션 스타일의 차이로 인해 일관된 훈련이 어려웠다. SolarWM은 이 문제를 해결하기 위해 **reconfigurable multi-source data engine**을 도입하여 10개 데이터셋의 1.43백만 개 클립을 통일된 **frame-aligned contract**로 변환한다. 이는 시각 관측, 카메라 기하학, 캡션, 품질 메타데이터 등을 포함하며, 데이터 처리와 혼합 생성을 분리함으로써 재사용 및 확장성을 높인다. 또한, **backbone-native adaptation framework**를 통해 각 모델(Wan2.2, LTX-2.5, MiniMax-H3)의 고유한 표현 방식과 훈련 목표를 유지하면서도 통일된 인터페이스를 제공한다. 이는 카메라 조건, 훈련, 추론을 공유하는 인터페이스를 통해 가능하다.
기술적 접근법
- **Multi-source data engine**: 10개 데이터셋에서 1.43백만 개의 클립을 통일된 **frame-aligned contract**로 변환.
- **Backbone-native adaptation**: 각 모델(Wan2.2, LTX-2.5, MiniMax-H3)의 고유 표현 방식 유지.
- **Three-stage training recipe**:
- **Camera-conditioning interface**: 카메라 기하학을 기반으로 훈련 및 추론 통일.
- **5B–33B 파라미터 모델 4개**: SolarWM-wan2.2-5B, SolarWM-wan2.2-14B, SolarWM-ltx-2.5-22B, SolarWM-minimax-h3-33B.
1. **Bidirectional adaptation**
2. **Teacher-forced autoregressive initialization**
3. **Distribution matching distillation (DMD)**
주요 결과
- **5초 훈련 시퀀스**로 **minutes-to-hours** 실시간 롤아웃 가능.
- **10초, 분, 시간 단위**의 OOD 및 in-domain 환경에서 생성 성능 테스트.
- **ODE 또는 consistency-distillation (CD)** 없이도 **state-of-the-art 성능** 달성.
- **AR adaptation**은 빠르게 수렴, **DMD**는 최소한의 훈련 단계로도 효과적.
- **GPT Image 2 또는 Krea**로 생성된 이미지에서 10초 OOD 생성 성능 일관성 유지.
의의 및 한계
SolarWM은 데이터셋과 모델 기반의 이질성을 통합한 **재현 가능하고 확장 가능한 월드 모델 연구 기반**을 제공한다. 특히, **5초 훈련 시퀀스로 장기 롤아웃**을 가능하게 하며, 복잡한 훈련 파이프라인 없이도 **고품질 생성**을 달성하는 점에서 학술적·실용적 가치가 있다. 그러나 **10개 데이터셋**만을 기반으로 하므로 더 다양한 환경에서의 일반화 능력은 추가 연구가 필요하다. 또한, **모델 크기(5B–33B)**에 따라 성능 차이가 있을 수 있으며, 이는 추후 실험에서 검증되어야 한다.
실용적 활용
SolarWM은 게임 환경, 시뮬레이션, 대화형 콘텐츠 생성 등에서 **실시간 대화형 영상 생성**에 활용 가능하다. 특히, **카메라 제어 기반의 장기 롤아웃**이 필요한 VR/AR, 자율 주행 시뮬레이션, AI 에이전트 학습 등에 적용할 수 있다.