한 줄 요약
StreamPI는 기존 단일 프레임 VLA 모델에 시간 정보를 추가하면서 추가 파라미터 없이 실시간 추론을 가능하게 하는 스트리밍 멀티모달 시간 모델링 프레임워크이다.
핵심 기여도
- **Instruction-anchored temporal modeling**을 도입하여 언어 지시가 지속적으로 유지되도록 설계.
- **Random-interval streaming training** 전략을 통해 비동기적 로봇 배포 환경에 대한 견고함 향상.
- 기존 **π0.5** 모델의 사전 학습 가중치를 그대로 활용하며, 추가 파라미터 없이 **single-frame 및 multi-frame 추론**을 지원.
- **LIBERO 벤치마크**에서 π0.5 대비 **성능 개선**을 실험적으로 검증.
핵심 아이디어
StreamPI는 단일 프레임 VLA 모델이 시간 정보를 활용할 수 있도록 설계된 스트리밍 멀티모달 시간 모델링 프레임워크이다. 핵심 아이디어는 각 (시각 관측, 언어 지시) 쌍을 **원자적 시간 단위**로 취급하는 **instruction-anchored temporal modeling**이다. 이는 각 쌍 내에서 **bidirectional attention**을 통해 cross-modal 퓨전을 수행하고, 쌍 간에는 **causal attention**을 통해 자동 회귀적 스트리밍 추론을 유지한다. 이로 인해 언어 지시가 작업 실행 중 지속적으로 유지되어 **instruction forgetting** 문제를 해결한다. 또한, **random-interval streaming training** 전략은 학습 시 다양한 프레임 간격을 노출시켜 실제 로봇 배포 시 비동기적 환경에 대한 견고함을 높인다.
기술적 접근법
- **Instruction-anchored temporal modeling**: (image, text) 쌍을 원자적 단위로 취급.
- **Intra-pair**: bidirectional attention을 사용한 cross-modal 퓨전.
- **Inter-pair**: causal attention을 사용한 자동 회귀적 스트리밍.
- **Random-interval streaming training**: 학습 시 **random interval** (예: 3 프레임 간격)을 도입.
- **LLM length extrapolation**: 기존 **π0.5**의 사전 학습 가중치를 그대로 활용.
- **No additional parameters**: 새로운 파라미터 도입 없이 기존 모델의 표현력을 유지.
- **Key&Value caching**: 스트리밍 추론 시 과거 텐서를 캐시하여 추론 비용을 고정.
주요 결과
- **LIBERO-Long** 데이터셋에서 **T=5**일 때, fixed-interval training 대비 **+3.0%** 성능 향상.
- **T=3**일 때, fixed-interval 대비 **+1.1%** 성능 향상.
- **T=5**에서 random-interval training 시 **98.3%** 성공률 달성.
- **T=1** (단일 프레임)에서도 π0.5 대비 성능 개선.
- **Real-robot tasks**에서 π0.5 대비 **memory-dependent 및 spatial-precision tasks**에서 일관된 성능 향상.
의의 및 한계
StreamPI는 기존 단일 프레임 VLA 모델의 시간 정보 처리 한계를 극복하고, 비동기적 환경에서의 실시간 추론을 가능하게 하여 로봇 조작 분야에서 실용성을 높인다. 특히, **instruction-anchored modeling**은 지시가 지속적으로 유지되어 복잡한 작업 수행에 유리하다. 또한, **random-interval training**은 실제 로봇 배포 시 다양한 프레임 간격에 대한 견고함을 제공한다. 그러나, **π0.5**와 같은 강력한 단일 프레임 모델을 기반으로 하기 때문에, 시간 정보를 완전히 새로운 방식으로 학습하는 모델과 비교하면 **flexibility** 측면에서 한계가 있을 수 있다.
실용적 활용
StreamPI는 **로봇 조작** 분야에서 특히 유용하다. 특히, **memory-dependent task** (예: 다이내믹한 대상 잡기) 및 **spatial-precision task** (예: 정밀한 물체 배치)에서 효과적으로 활용될 수 있다. 또한, **비동기적 환경**에서의 실시간 추론이 필요한 **실제 로봇 배포** 시나리오에도 적합하다.