한 줄 요약
Zero-WAM은 인-컨텍스트 학습을 기반으로 인간 동영상에서 무작위 작업을 추론해 수행하는 로봇 정책을 제시한다.
핵심 기여도
- Zero-WAM은 인-컨텍스트 학습을 로봇 조작에 적용하여, 인간 동영상 기반의 작업 지시를 처리하는 새로운 정책을 제시한다.
- HumanGen 데이터셋을 생성하여 8.6K 작업에 걸쳐 74.2K 개의 인-컨텍스트 학습 쌍을 제공한다.
- IFP(인-컨텍스트 미래 청크 예측) 손실 함수를 도입하여 기존 작업에서 학습된 단축 경로를 억제한다.
- RoboTwin 2.0 시뮬레이션에서 47.0% 평균 성공률을 달성, LingBot-VA 대비 29.5% 점수 상승.
핵심 아이디어
Zero-WAM은 로봇이 학습되지 않은 작업을 수행할 수 있도록, 인-컨텍스트 학습(Implicit Context Learning, ICL)을 로봇 조작에 도입한다. 기존의 언어 기반 작업 지시는 시각적 정보를 제공하지 못하는 한계가 있었으나, Zero-WAM은 인간 동영상이 제공하는 시각적 변화와 시간적 구조를 활용한다. 이는 작업의 진화를 구체적으로 보여주어, 로봇이 동영상에서 작업의 의도를 추론하도록 돕는다.
Zero-WAM은 언어 지시와 인간 동영상 지시를 모두 처리할 수 있는 단일 정책을 구현한다. 이 정책은 미래 로봇 동영상과 실행 가능한 동작을 자동 회귀적으로 예측하며, 인간 동영상은 예측에 시각적 변화를 조건으로 제공한다. 또한, IFP 손실 함수는 미래 청크를 예측하도록 강제하여, 단순히 과거 로봇 동영상이나 언어 지시에 의존하는 것을 방지한다.
기술적 접근법
- **Zero-WAM**: 인-컨텍스트 인간 동영상 지시를 기반으로 작업을 수행하는 인과적 동영상-동작 모델.
- **HumanGen 데이터셋**: 8.6K 작업에 걸쳐 74.2K 개의 인-컨텍스트 학습 쌍을 포함. 인간 동영상과 로봇 궤적의 세미antically 매칭된 쌍 생성.
- **IFP 손실 함수**: 미래 청크 예측을 통해 단축 학습을 억제. 현재 로봇 동영상 표현에서 미래 청크를 예측하도록 강제.
- **MoT 설계**: 동영상 Transformer와 동작 Transformer가 공유 어텐션 레이어를 통해 상호작용.
- **Wan-2.2-TI2V-5B 기반**: 양방향 텍스트/이미지-동영상 생성 모델을 인과적 동영상-동작 정책으로 변환.
주요 결과
- RoboTwin 2.0 시뮬레이션에서 7개의 미학습 작업에서 47.0% 평균 성공률 달성.
- LingBot-VA 대비 29.5% 점수 상승.
- 실제 환경에서 다물체 장면, 장기 조작, 정밀 삽입 작업에 대한 인-컨텍스트 인간 동영상 기반 일반화 성공.
- IFP 도입 시 7개 작업 평균 성공률 28.55% → 46.95% 상승.
- "stack blocks three" 작업에서 0.00% → 9.00% 성공률 향상.
의의 및 한계
Zero-WAM은 로봇이 학습되지 않은 작업을 수행할 수 있도록, 인-컨텍스트 학습과 인간 동영상 기반 작업 지시를 결합한 새로운 접근법을 제시한다. HumanGen 데이터셋은 대규모 인-컨텍스트 학습 자료를 제공하며, IFP 손실 함수는 단축 학습을 억제해 모델이 인간 동영상에 의존하도록 유도한다. 이는 로봇이 다양한 작업에 대해 시각적 정보를 기반으로 일반화할 수 있도록 한다.
그러나, HumanGen 생성 파이프라인은 인간 동영상 생성에 자동화된 프로세스를 사용하므로, 실제 인간 시연과의 차이가 있을 수 있다. 또한, 일부 복잡한 작업에서는 인-컨텍스트 학습 데이터의 양이 부족해 성능이 제한될 수 있다. Zero-WAM은 시뮬레이션 환경에서의 성능이 뛰어나지만, 실제 세계의 복잡한 환경에서는 추가적인 최적화가 필요할 수 있다.
실용적 활용
Zero-WAM은 로봇이 사전 학습 없이 새로운 작업을 수행할 수 있도록 하기 때문에, 제조, 물류, 서비스 로봇 분야에서 유용하게 활용될 수 있다. 특히, 작업 지시가 언어로 명확히 표현되지 않거나, 시각적 변화가 중요한 작업에서 효과적이다. 또한, 대규모 인-컨텍스트 학습 데이터 생성 파이프라인은 로봇 학습 데이터 부족 문제를 완화할 수 있다.