한 줄 요약
Anchor-Align는 VLA 미세조정 시 사전 학습된 표현을 보존하고 언어-작동 정렬을 강화하여 실제 로봇 성능을 28%에서 54%까지 향상시킨다.
핵심 기여도
- Vision-Language Anchoring: 사전 학습된 VLM의 표현을 유지하기 위해 동결된 VLM으로부터 레이어별 표현을 증류.
- Language-Action Alignment: 동일한 로봇 관측에 대해 언어와 작동 예측을 공동 학습.
- xArm7 로봇 실험에서 28% → 54%, 37% → 60% 성능 향상.
- LIBERO-PRO, LIBERO-Plus, CALVIN 시뮬레이션에서 OOD 일반화, 지각 안정성, 장기 제어 개선.
핵심 아이디어
기존 행동 복제(Behavior Cloning, BC) 기반 VLA 미세조정은 사전 학습된 시각-언어 표현을 점진적으로 덮어써 일반화 능력을 저하시킨다. 또한, 언어와 작동 헤드가 서로 다른 관측에 학습되어 언어-작동 불일치가 발생한다. 이를 해결하기 위해, Anchor-Align은 두 가지 핵심 아이디어를 제시한다. 첫째, Vision-Language Anchoring은 동결된 VLM의 표현을 사용해 미세조정 중 표현 드리프트를 방지한다. 둘째, Language-Action Alignment는 각 작동 타겟을 이산 운동 방향 레이블로 변환하고, 동일한 관측에서 언어와 작동 예측을 공동 학습하여 정렬을 강화한다. 이는 기존 BC 손실과 결합되어, 추가 데이터나 아키텍처 변경 없이도 일반화와 정확도를 동시에 향상시킨다.
기술적 접근법
- **Vision-Language Anchoring**: 동결된 VLM의 표현을 사용하여 레이어별 표현 증류(distillation loss)를 적용.
- **Language-Action Alignment**: 연속 작동 타겟을 이산 운동 방향 레이블로 변환 후, 동일 관측에서 언어와 작동 예측을 공동 학습.
- **데이터셋**: xArm7 로봇 실험, LIBERO-PRO, LIBERO-Plus, CALVIN 시뮬레이션.
- **성능 지표**: 실제 로봇 성공률, OOD 일반화, 지각 안정성, 장기 제어.
- **미세조정 방식**: BC 기반, 회귀 및 flow-matching 작동 헤드 모두 적용 가능.
주요 결과
- **xArm7 로봇 실험**: 두 VLA 아키텍처에서 각각 28% → 54%, 37% → 60% 성능 향상.
- **LIBERO-PRO**: OOD 일반화 개선.
- **LIBERO-Plus**: 지각 안정성 향상.
- **CALVIN**: 장기 제어 성능 향상.
- **GQA 정확도**: Anchor-Align은 70% 사전 학습 정확도 유지, BC는 94% 감소.
의의 및 한계
Anchor-Align은 사전 학습된 VLM 표현을 보존하면서도 효과적인 작동 학습을 가능하게 하여, 기존 BC와 co-training의 한계를 극복한다. 특히, 실제 로봇 실험과 시뮬레이션 모두에서 일관된 성능 향상을 보이며, VLA 미세조정의 새로운 패러다임을 제시한다. 그러나, 이 방법은 기존 데이터와 학습 프로세스를 재사용하므로, 새로운 도메인이나 복잡한 다중 작업 환경에서는 추가 연구가 필요할 수 있다. 또한, 언어-작동 정렬의 효과는 특정 작업 유형에 따라 변동이 있을 수 있다.
실용적 활용
Anchor-Align은 로봇 조작, 자율 시스템, 서비스 로봇 등에서 시각-언어-작동 모델의 일반화와 정확도를 동시에 향상시킬 수 있다. 특히, 실제 환경에서의 OOD 일반화와 장기 제어가 필요한 산업 현장에서 유용하게 활용될 수 있다.