한 줄 요약
ST-WAM은 시각 분포 변화에 강한 조작을 위한 의미-시간적 세계 행동 모델로, DINOv3와 VAE를 결합한 이중 공간 예측과 현재-앵커 인텐트 검색을 제안한다.
핵심 기여도
- **Training-Distribution Hallucination** 현상을 식별하고, DINOv3가 Wan-VAE보다 시각 변화에 더 안정적임을 290개 프레임 트리플릿 실험으로 입증 (DINOv3: 0.904 유사도, Wan-VAE: 0.686).
- **ST-WAM** 제안: DINOv3를 기반으로 한 **Dual-Space Future Experts (DSFE)**와 **Current-Anchored Intent Retrieval (CAIR)** 모듈을 결합.
- **LIBERO-Plus**에서 Fast-WAM 대비 21.3% 성능 향상, 실제 환경에서 시각 변화 시 성공률 25.8% → 61.5%로 2배 이상 증가.
- 추가적인 체화 사전학습이나 태스크별 어노테이션 없이 end-to-end 학습 가능.
핵심 아이디어
기존 World Action Models(WAMs)는 VAE 기반의 픽셀 생성적 미래 예측을 사용하지만, 이는 시각 분포 변화 시 학습 도메인의 내용을 생성하는 Training-Distribution Hallucination 현상을 유발한다. 이는 학습 도메인과 현재 환경의 차이가 클 경우 미래 예측이 실제 상황과 벗어나는 문제를 초래한다. 본 연구는 이 문제를 해결하기 위해 DINOv3를 사용한 의미적 미래 예측과 현재-앵커 기반의 과거 인텐트 검색을 결합한 새로운 접근법을 제안한다. DINOv3는 시각 변화에 안정적이면서도 태스크 상태를 잘 구분할 수 있는 특징을 제공하며, 이를 DSFE와 CAIR 모듈에 활용함으로써 미래 예측과 과거 정보의 의미적 일관성을 유지한다.
기술적 접근법
- **Dual-Space Future Experts (DSFE)**: 미래 VAE 잠재 공간과 DINOv3 특징을 동시에 예측하는 3분기 Mixture-of-Transformers 구조.
- **Current-Anchored Intent Retrieval (CAIR)**: 현재 시각-언어 맥락을 기반으로 DINOv3 기반의 과거 정보에서 태스크 관련 인텐트를 검색.
- DINOv3는 학습 도메인과 다른 환경에서도 의미적 일관성을 유지하며, VAE는 세부 시각-운동 정보를 보존.
- 학습은 end-to-end 방식으로 진행되며, 추가 체화 사전학습이나 태스크별 어노테이션이 필요하지 않음.
- 미래 생성 없이 액션만 추론 가능.
주요 결과
- **LIBERO**: 98.7% 성공률
- **RoboTwin 2.0**: 92.8% 성공률
- **LIBERO-Plus (zero-shot)**: Fast-WAM 대비 21.3% 성능 향상
- **실제 환경 (시각 변화)**: Fast-WAM 25.8% → ST-WAM 61.5% (성능 2배 이상 향상)
- DINOv3 기반의 미래 예측과 과거 인텐트 검색이 성능 향상에 기여함.
의의 및 한계
ST-WAM은 픽셀 중심의 미래 예측에 의존하지 않고, 의미적-시간적 정보를 활용함으로써 시각 분포 변화에 대한 강건성을 향상시킨다. 특히, DINOv3는 학습 도메인과 다른 환경에서도 의미적 일관성을 유지하며, VAE는 세부 시각 정보를 보존하는 이점을 결합하여 기존 WAMs의 한계를 극복한다. 그러나 DINOv3는 학습된 특징이 특정 도메인에 의존할 수 있으며, 물리적 동역학 변화나 새로운 체화 형태에 대한 일반화는 추가 연구가 필요하다. 또한, 의미적 정보만으로는 모든 태스크를 포괄적으로 해결하기 어려울 수 있다.
실용적 활용
ST-WAM은 로봇이 실내 환경에서 물체 조작, 물리적 장애물 회피, 다양한 조명 및 배경 변화에 대응하는 상황에 적용 가능하다. 특히, 사전 학습 없이도 강건한 성능을 유지하므로, 빠른 도메인 적응이 필요한 산업 현장이나 서비스 로봇 분야에서 유용하게 활용될 수 있다.