한 줄 요약
W2-VLA는 글로벌 작업 맥락을 고려한 미래 손목 움직임 예측을 통해 정밀 로봇 조작 성능을 향상시키는 VLA 모델이다.
핵심 기여도
- W2-VLA는 글로벌 작업 맥락과 손목 로컬 예측을 연결하는 **task-conditioned latent interface**를 도입.
- **W2-CoT**라는 구조화된 합성 어노테이션 파이프라인을 통해 정밀 조작의 학습을 보조.
- **LIBERO**에서 평균 성공률 98.5%, **RoboTwin 2.0 Easy**에서 60.71%, **Hard**에서 18.21% 달성.
- **80 Hz 이상**의 실시간 액션 생성 속도 유지.
핵심 아이디어
기존 VLA 모델은 메인 뷰와 손목 뷰를 병렬 입력으로 처리해, 손목 관찰의 로컬 상호작용 역할을 간과했다. 그러나 정밀 조작에서는 글로벌 맥락 하에서 손목 로컬 상호작용의 미래 예측이 필수적이다. W2-VLA는 **latent modeling tokens**을 통해 VLM(비전-언어 모델)과 손목 예측기 사이의 인터페이스를 형성하고, 이 인터페이스를 기반으로 **future wrist latents**를 예측한다. 이는 현재 손목 히스토리와 결합되어 액션 생성에 미래 정보를 제공한다. 또한, **W2-CoT**는 조작 진행, 물리적 전이 신호, 손목 로컬 증거를 포함한 구조화된 어노테이션을 생성해, 인터페이스 학습을 보조한다. 이는 **task-conditioned supervision**을 통해 정밀한 미래 예측을 가능하게 한다.
기술적 접근법
- **W2-VLA**는 현재 멀티뷰 관찰과 작업 지시를 입력으로 받아, VLM이 **latent modeling tokens**을 컨텍스트화.
- 이 토큰의 숨겨진 상태는 VLM과 손목 예측기 사이의 **task-conditioned interface**를 형성.
- **W2-CoT**는 합성 파이프라인을 통해 **manipulation progress**, **physical transition cues**, **wrist-local evidence** 어노테이션 생성.
- 예측기는 **V-JEPA 2.1 encoder**로 인코딩된 손목 히스토리와 인터페이스를 기반으로 미래 손목 latent를 예측.
- **flow-matching action head**에 미래 정보를 결합해 액션을 생성.
- 추론 시에는 CoT 생성이 필요 없으며, 액션 생성 속도는 **80 Hz 이상**.
주요 결과
- **LIBERO** 데이터셋에서 평균 성공률 **98.5%** 달성.
- **RoboTwin 2.0 Easy**에서 **60.71%**, **Hard**에서 **18.21%** 성공률.
- **Wrist Predictor** 제거 시 LIBERO 평균 성공률이 **98.5% → 97.5%** 감소.
- **W2-CoT** 어노테이션 제거 시 성공률 **98.5% → 98.0%** 감소.
- **16개 토큰** 인터페이스가 **98.5% 성공률**과 **110.58 ms**의 지연 시간을 기록.
의의 및 한계
W2-VLA는 정밀 조작에서 **글로벌-로컬 상호작용**을 효과적으로 모델링하며, **실시간 액션 생성**과 **OOD 환경 내성**을 동시에 달성한 점에서 학술적·실용적 의의가 있다. 특히, **W2-CoT**는 구조화된 어노테이션을 통해 학습 효율성을 높인다. 그러나, **복잡한 다중 작업**이나 **장기적 계획**에서는 추가적인 연구가 필요할 수 있다. 또한, **손목 뷰만 예측**하는 선택은 일부 상황에서 정보 손실을 초래할 수 있다.
실용적 활용
W2-VLA는 **로봇 조립**, **정밀 산업 자동화**, **의료 로봇** 등에서 **접촉 민감한 조작**이 필요한 상황에 적용 가능하다. 특히, **실시간 성능**과 **복잡한 작업 환경 내성**을 요구하는 산업 현장에서 유용할 것으로 기대된다.