한 줄 요약
BridgeVLA++는 3D 로봇 조작에서 데이터 효율성과 기억 기반 추론을 동시에 달성한 통합 Vision-Language-Action(VLA) 프레임워크이다.
핵심 기여도
- BridgeVLA++는 BridgeVLA에 **통합된 시공간 기억 아키텍처**(spatio-temporal memory architecture)를 추가하여 과거 관측을 모델링함.
- **Battery Try** 태스크에서 BridgeVLA++는 96% 성공률을 달성해 가장 강력한 기존 기반선(MemoryWAM)의 41% 대비 55% 개선.
- **BridgeVLA++는 3개의 시연만으로 95.4% 성공률**을 달성해 뛰어난 샘플 효율성을 보임.
- **BridgeVLA++는 실제 로봇 플랫폼에서도 93.3% 성공률**을 기록하며, 기존 메모리 기반 SAM2Act+ 대비 3배 향상.
핵심 아이디어
BridgeVLA는 3D 포인트 클라우드를 멀티뷰 이미지로 투영하고, **중간 히트맵**(intermediate heatmap)을 예측한 후 로봇 액션을 생성함으로써, 사전 학습된 VLM의 입력-출력 정렬을 유지해 데이터 효율성을 높였다. 그러나 이는 과거 관측을 고려하지 못하는 한계가 있었다. BridgeVLA++는 이를 해결하기 위해 **시공간 기억**(spatio-temporal memory)을 도입하여, 공간적 맥락과 시간적 상호작용 기록을 동시에 모델링함. 이는 특히 장기적 태스크(예: Battery Try)에서 기존 메모리 기반 모델 대비 55% 성공률 개선을 가능하게 함. 또한, **BridgeVLA는 3D 위치 정보를 2D 이미지 특징과 결합하는 3D 컨볼루션 모듈**(3D convolutional module)을 사용해 3D 공간 정보를 효과적으로 활용함.
기술적 접근법
- **BridgeVLA**: 3D 포인트 클라우드를 멀티뷰 이미지로 투영 → 중간 히트맵 예측 → 로봇 액션 생성.
- **BridgeVLA++**: BridgeVLA에 **통합 시공간 기억**(spatio-temporal memory architecture) 추가.
- **6D 회전 파라미터화**(6D rotation parameterization) 사용 → Euler 각도 대비 수치적 안정성 향상.
- **3D 위치 인코딩 모듈**(3D convolutional module)을 통해 2D 이미지 특징과 3D 위치 정보를 결합.
- **Convex-upsampling 모듈**(309M 파라미터) 대신 Transformer 디코더(303M 파라미터)를 사용하는 실험적 변형도 수행됨.
주요 결과
- **BridgeVLA++는 9개 태스크 중 8개에서 최고 성능**을 달성.
- **Battery Try** 태스크에서 96% 성공률 (MemoryWAM 대비 +55%).
- **BridgeVLA++는 3개의 시연만으로 95.4% 성공률**을 달성 (BridgeVLA 대비 +5.4%).
- **BridgeVLA++는 실제 로봇 플랫폼에서 93.3% 성공률** (SAM2Act+ 대비 +63.3%).
- **BridgeVLA는 10개 시연만으로 90.5% 성공률**을 달성해 기존 SAM2Act(86.8%) 대비 +3.7% 개선.
의의 및 한계
BridgeVLA++는 3D VLA 모델에서 **데이터 효율성**, **강건한 일반화**, **기억 기반 추론**을 동시에 달성한 첫 번째 통합 프레임워크로, 특히 **장기적 태스크**(Battery Try)와 **복잡한 환경**(Sort Shape, Place Cups)에서 뛰어난 성능을 보임. 또한, **실제 로봇 플랫폼에서의 성능**을 통해 실용성을 입증함. 그러나 실패 사례 중 일부는 **표적 가리기**(occlusion) 상황에서 발생하며, 이는 향후 시야 확장이나 다중 카메라 입력을 고려할 필요성을 시사함. 또한, **BridgeVLA++는 3D 정보를 효과적으로 활용하는 아키텍처 설계**가 핵심이며, 단순히 3D 정보를 포함하는 것만으로는 데이터 효율성을 달성할 수 없다는 점이 강조됨.
실용적 활용
BridgeVLA++는 **데이터가 제한적인 환경**(예: 제조, 의료)에서의 로봇 조작, **장기적 기억이 필요한 작업**(예: 정렬, 분류), **복잡한 3D 환경**(예: 물체 배치, 이중 팔 조작)에 적용 가능하다. 특히, **실제 로봇 플랫폼에서의 성능**을 통해 산업 현장에서 즉각적인 도입이 가능하며, **시공간 기억 기반의 로봇 제어 시스템 설계**에 기초가 될 수 있다.