한 줄 요약
MM-ABC는 이동 및 조작의 협업을 학습하는 모바일 조작 기반 모델로, 다양한 데이터에서 61.2% 성공률을 달성.
핵심 기여도
- **MM-ABC** 모델을 제안, 이동 및 조작 스트림을 분리하면서도 협업을 가능하게 함.
- **Clean-action x-prediction**을 사용해 정확도를 높임. RoboCasa365에서 속도 예측 대비 3.6% 성능 향상.
- **Future branch**를 통해 훈련 시 기하학적 의도를 학습, 추론 시에는 제거하여 비용 절감.
- 5,000+ 시간, 12개 데이터셋, 17개 형태의 이종 로봇 데이터로 사전 훈련.
핵심 아이디어
기존 모바일 조작 연구는 3D 재구성이나 예측 모델을 사용해 공간 인식을 강화했으나, 이는 계산 비용이 높고, 이동과 조작 스트림 간 협업이 부족했다. MM-ABC는 이동과 조작을 별도 스트림으로 유지하면서도 **masked joint attention**을 통해 정보를 공유하는 **MM-APT**를 도입했다. 또한, **clean-action x-prediction**을 사용해 정확한 엔드포인트 예측을 가능하게 하며, **future branch**를 통해 기하학적 의도를 학습함으로써 훈련 신호를 강화했다. 이는 **velocity prediction** 대비 더 정확한 작업 분배와 노이즈 제거를 가능하게 한다는 점에서 차별화된다.
기술적 접근법
- **MM-ABC**는 **Seeing**, **Coordinating**, **Imagining**의 3가지 원칙을 기반으로 구성됨.
- **Seeing**: **DeepStack** 인터페이스를 통해 다수준 VLM 특성을 액션 전문가에 주입.
- **Imagining**: 학습 가능한 미래 쿼리가 고정된 기하학적 교사 모델을 사용해 풍부한 기하학적 표현을 학습.
- **Coordinating**: **MM-APT**를 통해 이동 및 조작 스트림을 분리하면서 **masked joint attention**으로 정보 공유.
- **Clean-action x-prediction**을 사용해 엔드포인트를 직접 예측.
- **Future branch**는 훈련 시에만 사용되며, 추론 시에는 제거되어 비용 절감.
주요 결과
- **RoboCasa365**에서 clean-action 예측을 velocity 예측으로 대체하면 성공률이 32.8%에서 29.2%로 감소.
- **MM-ABC**는 **EBench**에서 44.71%, **RoboCasa365**에서 61.2%, **LIBERO**에서 99.1%, **LIBERO-Plus**에서 82.8% 성공률 달성.
- 실제 세계 5개 작업에서 평균 83% 성공률, **π₀.₅** 대비 12% 높음.
- future supervision 제거 시 성능이 7.9% 감소, multilevel conditioning 제거 시 7.2~10.8% 감소.
의의 및 한계
MM-ABC는 이동과 조작을 별도 스트림으로 유지하면서도 협업을 가능하게 하며, 이종 로봇 데이터를 기반으로 사전 훈련하여 다양한 환경에서 성능을 발휘한다. 특히, **clean-action x-prediction**과 **future branch**를 통해 훈련 신호를 강화하고, 추론 비용을 절감하는 점에서 실용적 가치가 있다. 그러나 **MM-ABC**는 특정 작업에 대한 미세 조정 없이도 성능을 유지하지만, 복잡한 환경 변화에 대한 일반화 능력은 추가 연구가 필요하다. 또한, **velocity prediction** 대비 **clean-action x-prediction**의 장점을 명확히 입증했으나, 이는 특정 데이터셋에서만 검증된 점이 한계다.
실용적 활용
MM-ABC는 로봇이 다양한 환경에서 이동과 조작을 동시에 수행해야 하는 상황, 예를 들어 가정용 서비스 로봇, 물류 시스템, 산업 자동화 등에 적용 가능하다. 특히, **MM-APT**와 **clean-action x-prediction**은 복잡한 작업 분배와 정확한 엔드포인트 예측이 필요한 실제 작업에서 유용하다.