한 줄 요약
VLAct는 제한된 로봇 데이터로 전이 가능한 시각-행동 표현을 학습하는 VLA 모델의 지속적 사전 학습 방법이다.
핵심 기여도
- VLAct는 VLM-prior preservation, multi-head continuous action co-supervision, partially unified cross-embodiment action layout을 통해 표현 중심의 지속적 사전 학습을 제안.
- RoboCasa-GR1에서 20% 데이터로 GR00T-N1.6 베이스라인을 초과 (49.5% vs. 47.6%).
- 16-GPU 환경에서 개방된 데이터로 LIBERO-Plus(82.6%), RoboTwin 2.0(92.5%) 등 주요 벤치마크에서 경쟁력 있는 성능 달성.
- 모든 실험에서 action head와 fine-tuning 조건을 동일하게 유지하며, 7.6–21.4 포인트 개선을 기록.
핵심 아이디어
VLAct는 로봇 데이터 확장이 어렵기 때문에, 제한된 데이터로 전이 가능한 시각-행동 표현을 학습하는 것이 중요하다는 통찰에 기반한다. 기존 VLM의 표현력을 유지하면서, 다양한 로봇 체제(embodiment)에서 공유 가능한 행동 의미를 학습하는 것이 핵심이다. 이는 단일 행동 헤드에 과적합되는 것을 방지하고, 여러 헤드를 통해 행동 표현을 다양화하는 multi-head continuous action co-supervision을 통해 달성된다. 또한, 로봇 고유의 행동(예: 그리퍼 열기/닫기)이 다른 체제에서도 공유될 수 있도록 partially unified action layout과 wrap-aware loss를 도입한다. 이러한 접근은 VLM을 단순히 고정된 구성요소가 아닌, VLA 모델의 첫 번째 설계 변수로 재정의한다.
기술적 접근법
- **VLAct**: VLM-prior preservation, multi-head continuous action co-supervision, partially unified cross-embodiment action layout로 구성된 VLA 지향 VLM 백본.
- **VLM-prior preservation**: shallow-layer protection과 caption-data mixing을 통해 기존 VLM 표현력을 유지.
- **Multi-head continuous action co-supervision**: 여러 행동 헤드를 동시에 학습하여 단일 헤드에 과적합되지 않도록 유도.
- **Partially unified action layout**: 로봇 체제 간 공유 가능한 행동 표현을 위한 구조.
- **Wrap-aware loss**: 주기적 관절(예: 회전)에 대한 손실 함수로, 표현 일관성을 유지.
- **데이터**: DROID, InternA1, RoboCoin, MolmoAct 등 open-source 로봇 데이터와 captioning 데이터 사용.
- **하드웨어**: 16-GPU 환경에서 학습.
주요 결과
- **LIBERO-Plus**: 82.6% 성공률 (ABot-M0, LingBot-VLA 등 산업 모델 초과).
- **RoboTwin 2.0**: 92.5% 성공률.
- **RoboDojo**: 10.66 평균 점수, 7.60% 성공률로 35개 정책 중 6위.
- **RoboCasa-GR1**: 20% 데이터로 GR00T-N1.6(47.6%) 대비 49.5% 성공률 달성.
- **VLA-Arena**: 54.8% 성공률.
- **모든 실험**: 동일한 action head, optimizer, fine-tuning budget 조건에서 7.6–21.4 포인트 개선.
의의 및 한계
VLAct는 로봇 데이터 확장에 의존하지 않고, 표현 중심의 지속적 사전 학습을 통해 VLA 모델의 성능을 향상시킬 수 있음을 보여준다. 특히, open-source 데이터와 16-GPU 환경에서도 산업 모델을 경쟁적으로 따라잡는 성능을 보여주며, VLA 연구에서 데이터 확장 외의 새로운 축으로서의 중요성을 입증한다. 그러나, 로봇 데이터의 품질과 다양성은 여전히 한계이며, 실제 세계에서의 장기적 성능과 안정성은 추가 연구가 필요하다. 또한, VLAct는 특정 task-specific head에 의존하지 않지만, 최적의 head 선택은 여전히 사용자에게 달려 있다.
실용적 활용
VLAct는 제한된 로봇 데이터와 컴퓨팅 자원으로도 높은 성능을 내는 VLA 모델 개발에 활용될 수 있다. 특히, 다양한 로봇 체제를 지원하는 시스템, 예를 들어 서비스 로봇, 인간 모방 로봇 등에서 즉각적인 전이 학습이 필요한 상황에 적합하다. 또한, open-source 데이터와 소규모 GPU 환경에서도 사용 가능하므로, 연구소나 중소 기업에서도 실용적으로 활용할 수 있다.