한 줄 요약
ForceVLA는 외부 힘을 1등급 모달로 통합한 VLA 모델로, 접촉이 많은 조작 작업 성능을 23.2% 개선한다.
핵심 기여도
- FVLMoE라는 힘 인식 Mixture-of-Experts 모듈을 도입하여 VLA 모델에 실시간 6축 힘 피드백을 통합.
- ForceVLA-Data라는 새로운 데이터셋을 제안, 5개의 접촉 집약적 조작 작업에서 동기화된 시각, 고유감각, 힘-토크 신호를 수집.
- π₀ 기반 베이스라인 대비 평균 작업 성공률을 23.2% 향상시키며, 플러그 삽입 작업에서는 최대 80% 성공률 달성.
- 힘 피드백의 적절한 퓨전 전략을 통해 힘 정보를 VLM 핵심 인코딩 이후에 도입, 성능 저하를 방지.
핵심 아이디어
기존 VLA 모델은 시각과 언어 정보를 기반으로 조작을 수행하지만, 힘 정보를 충분히 활용하지 못해 접촉이 많은 작업에서 한계가 있었다. ForceVLA는 외부 힘을 1등급 모달로 취급하고, 이를 VLA 시스템에 통합하는 새로운 프레임워크를 제안한다. 핵심 기술은 FVLMoE라는 Mixture-of-Experts 모듈로, 이는 VLM 기반 시각-언어 임베딩과 실시간 6축 힘 피드백을 동적으로 통합한다. FVLMoE는 게이팅 메커니즘을 통해 작업 단계에 따라 전문가 서브네트워크를 적응적으로 활성화하여, 정교한 힘 제어를 가능하게 한다. 이는 작업 상황에 따라 다른 힘 조절이 필요한 상황에서 특히 효과적이다.
기술적 접근법
- **FVLMoE 모듈**: VLM 핵심 인코딩 이후에 힘 피드백을 도입, 모달별 전문가 서브네트워크를 동적으로 라우팅.
- **ForceVLA-Data 데이터셋**: 5개의 접촉 집약적 작업에서 동기화된 시각, 고유감각, 힘-토크 신호를 수집.
- **Late Fusion 전략**: 힘 정보는 VLM 인코딩 이후에 결합, 힘-시각-언어의 깊은 통합을 가능하게 함.
- **Gating Mechanism**: 작업 단계와 상황에 따라 적절한 전문가 서브네트워크를 선택적으로 활성화.
주요 결과
- **π₀ 기반 베이스라인 대비 평균 작업 성공률 23.2% 향상**.
- **플러그 삽입 작업에서 최대 80% 성공률 달성**.
- **Object Gen. 1에서 80.00% 성공률, Height Gen.에서 토크 제한 내 성공 유지**.
- **Visual Occlusion 환경에서 90.00% 성공률 달성**, 시각 정보만 사용하는 모델 대비 훨씬 높은 성능.
의의 및 한계
ForceVLA는 VLA 모델에 힘 정보를 체계적으로 통합함으로써, 접촉이 많은 작업에서의 정밀성과 안정성을 크게 향상시켰다. FVLMoE 모듈은 힘 정보를 기반으로 한 상황 인식 및 조작 전략의 적응성을 강화하며, ForceVLA-Data는 이 분야의 연구를 위한 새로운 기준을 제시한다. 그러나 현재는 추정된 외부 와트치 값을 사용하고 있어, 고정밀 힘 측정이 필요한 작업에서는 한계가 있다. 또한, 고가의 힘-토크 센서가 내장된 로봇 플랫폼에서만 검증되었기 때문에, 저비용 플랫폼에서의 확장 가능성도 한계로 제기된다.
실용적 활용
ForceVLA는 산업 로봇에서의 정밀 조립, 의료 로봇의 부드러운 조작, 서비스 로봇의 물체 처리 등 다양한 분야에서 적용 가능하다. 특히, 시야가 제한되거나 동적 불확실성이 높은 환경에서 힘 정보를 기반으로 한 정밀한 제어가 필요한 작업에 유용하다.