한 줄 요약
Masked Visual Actions는 비디오 모델에 시각적 액션을 주입하여 로봇 월드 모델링을 통합하는 새로운 제어 인터페이스이다.
핵심 기여도
- Masked Visual Actions라는 새로운 픽셀 공간 제어 인터페이스를 제안, 15시간의 마스킹 예제로 학습한 단일 체크포인트가 다양한 환경에서 높은 시각 품질과 제어력을 달성.
- 동일한 비디오 모델을 정방향 및 역방향 월드 모델링 문제로 활용, 로봇 행동과 객체 움직임을 조건으로 다른 역할 수행.
- 정책 평가, 기반 모델 기반 계획, 역모델링 등 3가지 로봇 조작 응용에서 실험 검증.
- LoRA를 사용한 가벼운 학습으로 8개의 H200 GPU, 4일 동안 10,000스텝 학습.
핵심 아이디어
기존 로봇 월드 모델은 텍스트, 트랙, 포스, 키포인트 등 비시각적 신호로 조건을 주입하지만, 이는 모델의 사전 학습된 시각 경험과 미스얼라인되어 있다. Masked Visual Actions는 액션을 비디오 내 임의 엔티티의 부분적으로 드러난 궤적으로 표현함으로써, 모델의 픽셀 공간 내에서 직접적으로 액션을 표현한다. 이 방식은 로봇 움직임을 드러내면 정방향 역학 모델로, 객체 움직임을 드러내면 역모델로 동작하게 한다. 이는 동일한 모델을 사용하여 정방향 및 역방향 추론을 수행할 수 있음을 의미하며, 이는 기존의 별도 아키텍처에 의존하는 접근과 구별된다.
기술적 접근법
- 기반 모델: Wan-Fun-Control 2.2 14B
- 마스킹된 조건 비디오를 동일한 오토인코더로 인코딩, 조건 부합을 위해 콘캣 방식 사용
- 마스킹된 영역은 일정한 회색 배경으로 설정
- 전체 모델 대신 LoRA(랭크 256)를 사용한 가벼운 학습
- 8개의 NVIDIA H200 GPU, 배치 사이즈 4, 약 10,000스텝 학습 (4일)
- 학습 데이터: 15시간의 실제 및 시뮬레이션 데이터에서 추출된 마스킹 예제
주요 결과
- 단일 체크포인트가 다양한 환경과 여러 로봇 구현에서 높은 시각 품질과 제어력을 달성
- 정책 평가에서 모델의 상상된 롤아웃 결과가 실제 실행 결과와 일관된 상관관계를 보임
- 기반 모델 기반 계획에서 다양한 작업과 정책 아키텍처에서 일관된 성능 향상
- 역모델링에서 원하는 객체 움직임을 주면 로봇 움직임을 합성하여 목표 달성
의의 및 한계
Masked Visual Actions는 비디오 모델의 사전 학습된 경험을 효과적으로 활용하여, 로봇 월드 모델링의 두 방향(정방향 및 역방향)을 동일한 모델 내에서 처리할 수 있는 새로운 인터페이스를 제시한다. 이는 로봇 정책 평가, 계획, 역모델링 등 다양한 응용에서 실용성을 증가시키며, 학습 비용을 낮출 수 있다. 그러나 모델은 객체 상호작용의 상관관계를 학습할 뿐 인과관계는 아님을 명시하며, 기반 비디오 모델의 표현력과 추론 속도에 제한을 받는다.
실용적 활용
Masked Visual Actions는 로봇 정책 평가, 기반 모델 기반의 계획, 역모델링 등 다양한 로봇 조작 상황에서 활용 가능하다. 특히, 실제 환경에서의 학습 데이터가 제한적일 때, 시뮬레이션과 실제 데이터를 결합한 마스킹 예제로 학습 가능한 점에서 유용하며, 로봇 개발 비용을 절감하고 접근성을 높일 수 있다.