한 줄 요약
Seer는 시각-작업 루프를 통합한 예측적 역 역학 모델(PIDM)로, 대규모 데이터 학습을 통해 시뮬레이션 및 실제 환경에서 기존 방법 대비 13~43% 성능 향상.
핵심 기여도
- **PIDM**(Predictive Inverse Dynamics Model)을 제안하여, 시각 예측과 역 역학 예측을 통합한 end-to-end 학습 프레임워크 구축.
- **Seer** 모델은 **Transformer 기반**으로, **DROID** 대규모 로봇 데이터셋에서 pre-training 후 실제 환경에서 **최소한의 fine-tuning**으로도 뛰어난 성능.
- **CALVIN ABC-D** 벤치마크에서 기존 최고 성능(평균 길이 4.28) 달성, **LIBERO-LONG**에서 13%, **CALVIN ABC-D**에서 21%, 실제 작업에서 43% 개선.
- **[FRS]** 및 **[INV]** 토큰을 활용한 **multi-modal encoder** 설계로, 시각과 작업 정보의 유기적 통합 가능.
핵심 아이디어
기존 로봇 정책 학습은 "작업" 또는 "시각" 중심으로 분리되어 있었으나, Seer는 이 둘을 **end-to-end 방식으로 통합**하여 학습 효율성을 높인다. PIDM은 미래 시각 상태를 예측한 뒤, 이를 기반으로 작업을 예측하는 역 역학 모델을 사용한다. 이는 인간이 시각과 작업을 동시에 조정하는 방식을 모방한 것.
구체적으로, **[FRS] 토큰**은 미래 시각 정보를 예측하고, **[INV] 토큰**은 이 시각 정보를 조건으로 작업을 예측한다. 이 두 토큰은 **unidirectional attention mask**를 통해 시각과 작업 정보가 유기적으로 결합되도록 설계되어, **end-to-end 학습**이 가능하다. 이는 기존의 분리된 시각-작업 학습 방식과는 차별화된다.
기술적 접근법
- **Seer 모델**은 **Transformer 기반**으로, **ViT**(Vision Transformer)와 **MLP**(Multi-Layer Perceptron)를 활용한 **multi-modal encoder**를 사용.
- **[FRS] 토큰**은 미래 이미지를 예측, **[INV] 토큰**은 예측된 시각 정보를 조건으로 작업을 예측.
- **Perceiver resampler**를 통해 이미지 토큰 수를 줄이고, **CLIP text encoder**로 언어 정보를 임베딩.
- **DROID** 대규모 로봇 데이터셋에서 pre-training 후, 실제 환경에서는 **최소한의 fine-tuning**으로도 성능 유지.
- **ℒ_fore**와 **ℒ_inv** 손실 함수를 통해 시각 예측과 역 역학 예측을 동시에 최적화.
주요 결과
- **LIBERO-LONG** 벤치마크에서 기존 최고 성능 대비 **13% 성능 향상**.
- **CALVIN ABC-D**에서 기존 최고 성능을 **21% 개선**, 평균 작업 길이 **4.28** 달성.
- 실제 환경에서 **43% 성능 향상**.
- **고강도 방해 환경**에서도 **새로운 객체, 조명 조건, 환경**에 대한 일반화 능력 우수.
- **900회 이상의 실제 실험**에서 **robustness**를 입증.
의의 및 한계
Seer는 시각과 작업을 통합한 end-to-end 학습을 통해 기존의 분리된 접근 방식을 극복하고, 대규모 데이터에서 학습한 정책을 실제 환경으로 이전하는 데 성공했다. 특히, **Transformer 기반의 multi-modal 학습**은 시각-작업 통합의 새로운 가능성을 제시한다.
그러나 한계도 존재한다. 첫째, **6개의 downstream task**만 평가되어, **고정밀도, 접촉이 많은 작업**에 대한 평가가 부족하다. 둘째, **다양한 로봇 플랫폼 간의 cross-embodiment 성능**도 검증되지 않았다. 이는 Seer의 보편성과 확장성을 평가하기 위한 추가 연구가 필요함을 시사한다.
실용적 활용
Seer는 **로봇 조작** 분야에서 **대규모 데이터 학습 후 실제 환경으로의 이전**이 필요한 상황에 적합하다. 특히, **미래 시각 예측을 기반으로 작업을 결정**하는 방식은 **실시간 조작**, **복잡한 환경에서의 일반화**, **최소한의 fine-tuning 데이터**로도 성능을 유지하는 데 유리하다. **공장 자동화**, **서비스 로봇**, **의료 로봇** 등 다양한 산업 분야에서 활용 가능.