한 줄 요약
VPP는 VDM 내 예측적 시각 표현을 활용해 로봇 정책 성능을 18.6~28.8% 개선한 일반적 정책이다.
핵심 기여도
- VDM 내부의 예측적 시각 표현을 처음으로 로봇 정책 학습에 활용.
- TVP 모델을 조정한 VPP는 Calvin ABC-D 벤치마크에서 28.1% 상대 개선.
- 실제 Dexterous Hand 조작에서 28.8% 성공률 상승.
- SVD 사전 학습 모델과 인터넷 조작 데이터를 결합해 성능 향상.
핵심 아이디어
기존 로봇 정책은 두 이미지 대비 학습이나 단일 이미지 복원을 통해 사전 학습된 시각 인코더를 사용했으나, 이는 시퀀셜 정보를 충분히 포착하지 못한다. 반면, VDM은 동영상 생성을 통해 물리적 역학을 잘 이해하며, 예측적 시각 표현을 내재적으로 포함한다. 이 표현은 현재 단계와 예측된 미래 단계를 (T, H, W) 형태로 구조화하여, 로봇 정책 학습에 유용한 정보를 제공한다. 본 연구는 이러한 VDM 내 표현을 조정하고, 이를 기반으로 정책을 학습하는 VPP를 제안한다. 특히, TVP 모델을 조정하여 조작 도메인에서의 예측 능력을 향상시키고, Video Former와 Diffusion Policy를 결합해 정책을 학습한다.
기술적 접근법
- **VPP 학습 단계**: TVP 모델을 조정하여 조작 도메인에 맞게 훈련.
- **데이터**: 인터넷 조작 데이터, 오픈소스 로봇 데이터, 자체 수집 데이터를 사용.
- **VDM 구조**: (T, H, W) 형태로 현재와 미래 단계를 표현.
- **Policy 구성**: Video Former로 공간-시간 정보 추출 후, Diffusion Policy로 액션 생성.
- **사전 학습 모델**: SVD 모델을 기반으로 TVP를 조정.
주요 결과
- **Calvin ABC-D 벤치마크**: 기존 최고 기법 대비 28.1% 상대 개선.
- **실제 Dexterous Hand 조작**: 기존 최고 기법(Susie) 대비 28.8% 성공률 상승.
- **FVD 지표**: Bridge 데이터셋에서 TVP 모델이 기존 모델을 초과.
- **VPP 성능**: 인터넷 조작 데이터와 SVD 사전 학습 모델 없이 성능이 4.29 → 3.97로 감소.
의의 및 한계
VPP는 VDM 내 예측적 시각 표현을 활용한 첫 로봇 정책으로, 시뮬레이션 및 실제 환경에서 모두 뛰어난 성능을 보인다. 특히, 인터넷 조작 데이터와 사전 학습 모델을 결합함으로써 물리적 지식을 전이할 수 있다는 점에서 실용적 가치가 크다. 그러나, VPP는 사전 학습된 VDM에 의존적이며, 특정 도메인에 최적화된 데이터가 부족할 경우 성능이 저하될 수 있다. 또한, 예측적 표현의 구조가 복잡하여 해석성 측면에서 한계가 있을 수 있다.
실용적 활용
VPP는 다목적 로봇 정책 개발에 유용하며, 특히 Dexterous Hand 조작, 물체 이동, 환경 인식 등 다양한 조작 작업에 적용 가능하다. 인터넷 조작 데이터와 사전 학습 모델을 활용하면, 로봇 개발 비용을 줄이고, 다양한 환경에서의 일반화 능력을 높일 수 있다.