한 줄 요약
실시간 실행을 위한 RTC 알고리즘으로, 디퓨전/플로우 기반 VLA의 액션 청크 처리를 비동기적으로 수행하여 지연에 강한 성능을 보인다.
핵심 기여도
- RTC(RT Chunking) 알고리즘 제안: 기존 디퓨전/플로우 기반 VLA에 추가 학습 없이 적용 가능.
- Kinetix 시뮬레이터에서 12개의 동적 작업을 포함한 새로운 벤치마크 제시.
- π₀.₅ VLA 기반으로 6개의 이중 조작 작업에서 RTC 적용 후 성능 향상.
- 46ms의 KV 캐시 프리필 시간, 13ms 네트워크 지연 등 실제 지연 상황에서의 성능 검증.
핵심 아이디어
기존 액션 청크 처리는 시간 일관성을 제공하지만, 청크 경계에서 지연이 발생하면 갑작스러운 중단이나 비정상적인 동작이 발생한다. RTC는 이 문제를 해결하기 위해 "인페인팅" 기법을 도입하여, 현재 청크 실행 중 다음 청크를 생성한다. 이때, 실행이 보장된 액션은 "프리징"하고, 나머지는 "인페인팅"하여 부드러운 전이를 보장한다. 이는 기존 디퓨전/플로우 기반 VLA에 즉시 적용 가능하며, 추론 단계에서만 작동하므로 추가 학습이 필요 없다. 특히, 인페인팅은 조건부 플로우 매칭 기반의 액션 생성 과정에서 활용되며, 이는 기존 청크 경계에서의 모드 점프를 방지한다.
기술적 접근법
- **RTC 알고리즘**: 실행 중인 청크와 다음 청크 생성을 비동기적으로 수행.
- **인페인팅**: 다음 청크 생성 시, 실행이 보장된 액션은 고정하고 나머지를 보완.
- **플로우 매칭 기반 액션 생성**: 액션 청크는 랜덤 노이즈에서 시작하여 플로우 필드 통합을 통해 생성.
- **인퍼런스 딜레이 계산**: `d = ⌊δ / Δt⌋`로 정의, 여기서 δ는 청크 생성 시간, Δt는 컨트롤러 타임스텝.
- **기존 VLA 활용**: π₀.₅ VLA를 기반으로 6개의 이중 조작 작업 평가.
- **하드웨어 조건**: RTX 4090 GPU에서 KV 캐시 프리필 시간 46ms, 네트워크 지연 13ms.
주요 결과
- **Kinetix 시뮬레이터**: 12개의 동적 작업에서 RTC 적용 시, 기존 방법 대비 높은 성능 유지.
- **실제 작업 성능**: π₀.₅ VLA 기반 6개의 이중 조작 작업에서 RTC 적용 시, 정확도와 성공률 향상.
- **지연 내성**: 46ms의 KV 캐시 프리필 시간, 13ms의 네트워크 지연 상황에서도 높은 성공률 유지.
- **정밀 작업 성과**: 예를 들어, "화재 점화" 작업에서 RTC 적용 시, 지연이 있는 조건에서도 높은 성공률 달성.
의의 및 한계
RTC는 기존 디퓨전/플로우 기반 VLA의 실시간 실행 문제를 해결하며, 실제 조건에서 높은 성능을 보인다. 특히, 인페인팅 기법을 통해 청크 경계에서의 불연속성을 줄이고, 비동기적 실행을 가능하게 함으로써, 다양한 동적 작업에서의 활용 가능성이 높다. 그러나, 기존 방법 대비 약간의 계산 오버헤드가 발생하며, 더 동적인 작업(예: 다리 로봇의 이동)에서는 추가 연구가 필요하다. 또한, RTC는 기존 VLA에 즉시 적용 가능하지만, 특정 하드웨어 조건에서 최적화가 필요할 수 있다.
실용적 활용
RTC는 이중 조작 로봇, 모바일 조작, 자율 주행 등 실시간 제어가 필요한 다양한 산업 분야에 적용 가능하다. 특히, 네트워크 지연이 발생하는 원격 제어 환경에서 유용하며, 정밀 작업(예: 화재 점화, 미세 조작)에서의 성능 향상이 기대된다.