한 줄 요약
Hydra-0는 로봇 동작을 픽셀 운동으로 표현하는 Action Flow를 기반으로, 다양한 로봇과 환경에서 일반적인 월드 모델링과 제어를 실현한 시스템이다.
핵심 기여도
- Action Flow라는 새로운 시각적 제어 인터페이스를 제안하여, 로봇 동작을 픽셀 운동으로 표현함으로써 90.4%의 로봇 운동 오차 감소와 60.2%의 객체 운동 오차 감소를 달성.
- RoboLab 벤치마크에서 재현 성공률과 참조 성공률 간의 피어슨 상관계수 r=0.96을 달성.
- Zero-shot 합성 및 데이터 효율적 적응을 지원하며, 인간 시연에서 전달된 객체 플로우를 기반으로 로봇 동작을 예측하는 inverse 모드를 발견.
- Action Flow는 다양한 비디오 생성 백본에서 이식 가능하며, 기존의 Cosmos 2.5 기반 베이스라인 대비 성능 향상.
핵심 아이디어
Hydra-0는 로봇의 동작을 픽셀 수준의 운동으로 표현하는 Action Flow라는 공유된 시각적 인터페이스를 도입한다. 이는 로봇의 구조에 의존하지 않고, 다양한 로봇 구현체와 환경에서 동작의 결과를 예측할 수 있는 일반적인 월드 모델링을 가능하게 한다. Action Flow는 로봇 또는 객체의 시각적 점들의 희소한 운동 궤적을 표현하며, 이는 동일한 형식으로 로봇 운동과 작업 의도를 설명할 수 있다. 이 인터페이스는 forward dynamics prediction과 inverse motion prediction을 모두 지원하며, 로봇 제어와 시뮬레이션, 데이터 전이를 연결하는 공통 인터페이스로 활용된다.
기술적 접근법
- **Action Flow**: 로봇 동작을 픽셀 운동으로 표현하는 공유된 시각적 인터페이스.
- **Encoder-Decoder 구조**: 초기 관측을 공간 잠재 상태 $ \mathbf{s}_0 = e_\phi(\mathbf{o}_0) $로 매핑하고, 동작 시퀀스 $ \mathcal{F} $를 기반으로 미래 잠재 상태 $ \hat{\mathbf{s}}_{1:H} = g_\theta(\mathbf{s}_0, \mathcal{F}) $를 예측.
- **Dynamics Model**: $ g_\theta $ 함수를 사용하여 미래 상태를 예측.
- **Cosmos 2.5와 비교**: Action Flow를 기반으로 Cosmos 2.5와 Wan2.2를 동일한 데이터셋과 로봇 운동 궤적에서 학습.
- **Inverse Mode**: 객체 플로우를 입력으로 받아 로봇 운동을 예측하는 world action model. 잠재 특징을 실행 가능한 동작으로 매핑하는 action head를 사용.
주요 결과
- **Cosmos 2.5 기반 베이스라인 대비**: 로봇 운동 오차 90.4%, 객체 운동 오차 60.2% 감소.
- **RoboLab 벤치마크**: 재현 성공률과 참조 성공률 간의 피어슨 상관계수 r=0.96.
- **Inverse Mode 성능**: 인간 시연에서 전달된 객체 플로우를 기반으로 로봇 동작을 예측하며, 작업별 전문가 시연 없이 실행 가능한 동작을 생성.
의의 및 한계
Hydra-0는 다양한 로봇 구현체와 환경에서 일반적인 월드 모델링과 제어를 가능하게 하며, 데이터 효율적 적응과 zero-shot 합성을 지원함으로써 로봇 학습과 제어 분야에 중요한 기여를 한다. Action Flow는 시각적 예측, open-loop 정책 평가, 로봇 제어를 연결하는 공통 인터페이스로 활용될 수 있다. 그러나 본 연구는 특정한 로봇-객체 상호작용 환경에 초점을 맞추고 있으며, 더 넓은 범위의 로봇 타입과 작업에 대한 일반화 가능성은 추가 연구가 필요하다.
실용적 활용
Hydra-0는 로봇이 다양한 작업 환경에서 데이터 효율적으로 적응하고, 인간 시연을 기반으로 제어를 학습할 수 있는 시스템으로, 산업 로봇, 서비스 로봇, 물류 자동화 등에서 활용 가능하다. 특히, 복잡한 물체와 상호작용하는 로봇의 제어 및 정책 평가에 유용할 것으로 기대된다.