한 줄 요약
로봇 실행 오류에 대응하는 VLA 정책의 실시간 적응 방법과 시뮬레이션 벤치마크를 제안한다.
핵심 기여도
- **Self-Compensating VLA**: 실행 오류를 보상하는 실시간 정책 적응 알고리즘.
- **RoboStress**: 7가지 실행 조건 시나리오를 포함한 시뮬레이션 벤치마크.
- **실제 로봇 실험**: 두 Piper 팔에서 평균 성공률 30% 포인트 이상 향상.
- **새로운 객체까지 일반화**: 학습 시 보지 못한 객체에서도 성능 개선.
핵심 아이디어
기존 VLA 정책은 로봇의 실행 오류(예: 마찰, 백래시, 페이로드 변화)에 취약하다. 이 연구는 로봇의 실행 동작과 VLA가 명령한 동작 간의 잔차(residual)를 활용하여 정책을 실시간으로 보상하는 Self-Compensating VLA를 제안한다. 이 잔차는 로봇의 프로피오셉션(profioception)을 통해 측정되며, 정책 업데이트에 사용된다. 이는 작업 보상(reward)이나 라벨 없이도 가능하다는 점에서 혁신적이다. 또한, 실제 로봇 실험을 대체할 수 있는 RoboStress 시뮬레이션 벤치마크를 제시하여, 다양한 실행 조건에서 VLA의 내구성을 체계적으로 평가할 수 있도록 한다. RoboStress는 마찰, 백래시, 컴플라이언스, 중력 보상 오류 등의 조인트 수준 모델을 결합한 7가지 시나리오를 포함한다.
기술적 접근법
- **Self-Compensating VLA**:
- 잔차(residual) = VLA 명령 - 실제 실행 동작
- 정책 업데이트: 잔차를 기반으로 온라인 학습 (Adam 옵티마이저 사용)
- 정책은 로봇의 저수준 컨트롤러를 변경하지 않으며, 명령을 사전 보상(precorrection)
- **RoboStress**:
- 4가지 조인트 수준 오류 모델: 마찰, 백래시, 컴플라이언스, 중력 보상 오류
- 7가지 실행 조건 시나리오: 로봇의 상태와 이전 동작 기록에 따라 실행 오류가 달라짐
- **실험 설정**:
- 두 Piper 팔, 각각 다른 사용 이력
- 평가 에피소드: 25개, LoRA 초기화 없이 연속 실행
- 온라인 업데이트 시작 시점: feedback buffer가 채워진 후
주요 결과
- **RoboStress 실험**:
- π₀ 기반 정책 성공률 41.7% → 44.2% (3.5% 향상)
- π₀.₅ 기반 정책 성공률 49.1% → 56.6% (7.5% 향상)
- **실제 로봇 실험**:
- 두 Piper 팔에서 각각 30% 포인트 이상 성공률 향상
- 학습 시 보지 못한 객체에서도 성능 개선
- **잔차 기반 보상 분석**:
- 정책 고정 + 잔차 보정만 적용 시 성공률 23.6% (기본 정책 50.0% 대비 저하)
- 온라인 정책 업데이트가 성능 향상에 결정적 역할
의의 및 한계
- **의의**:
- 로봇 실행 오류에 대한 VLA 내구성 연구의 공백을 메움
- 실시간 정책 보상과 시뮬레이션 벤치마크를 결합한 체계적 접근
- 실제 로봇에서 30% 포인트 이상 성능 향상으로 실용적 가치
- **한계**:
- 프로피오셉션에 의존하며 외부 센서 정보는 활용하지 않음
- RoboStress는 시뮬레이션 기반으로 실제 로봇과의 차이 가능성 있음
- 정책 업데이트는 특정 작업 경계에서 초기화되며, 장기적 적응은 제한적
실용적 활용
- **로봇 제조 및 서비스 산업**: 로봇 팔의 마모나 페이로드 변화에 대응하는 정책 보상 시스템 구축 가능
- **로봇 학습 연구**: 실행 오류 내구성 향상을 위한 정책 학습 및 평가 기준 제공
- **로봇 운영 환경**: 다양한 사용 환경에서 동일한 VLA 정책을 재사용할 수 있는 기반 마련