한 줄 요약
Dynin-Robotics는 언어-비주얼-액션을 통합한 공유된 마스킹 확산 모델로, 78.4%의 성공률을 달성하고 29.2× 가속화된 액션 디코딩을 지원한다.
핵심 기여도
- **Dynin-Omni**라는 다중 모달 마스킹 확산 백본을 도입하여 언어, 비주얼, 목표, 액션을 이산 토큰으로 통합 표현.
- **공유된 트레jectory 모델**을 통해 액션 예측, 목표 상태 예측, 미래 관측 예측, 트레jectory-인스트럭션 재구성 등 다양한 조건적 인터페이스를 학습.
- **29.2× 가속화된 블록-병렬 디코딩** 구현으로 모델 측 액션 디코딩 속도 향상.
- **78.4% 평균 성공률**을 기록하며 Franka Research 3 로봇에서 4가지 조작 조건에서 뛰어난 성능 보여.
핵심 아이디어
Dynin-Robotics는 언어, 비주얼, 액션, 목표를 하나의 이산 토큰 시퀀스로 표현하는 **공유된 마스킹 확산 모델**(Dynin-Omni)을 기반으로 한다. 이 모델은 조건과 타겟 스팬을 변화시켜 다양한 학습 목표를 학습할 수 있다. 예를 들어, 액션 예측, 액션-조건 미래 관측 예측, 종단 목표 상태 예측, 트레jectory-인스트럭션 재구성 등이 가능하다. 이는 **동일한 모델이 다양한 조건적 인터페이스를 지원**하며, 추론 시 액션 후보 평가, 목표 예측, 액션-미래 상태 공동 정제를 통해 계산 자원을 유연하게 할당할 수 있음을 의미한다. 핵심 아이디어는 **단일 모델이 여러 로봇 학습 목표를 학습하고, 추론 시 예측을 조합하여 제어를 개선**할 수 있다는 점이다.
기술적 접근법
- **Dynin-Omni**는 언어, 비주얼, 목표, 액션을 이산 토큰으로 표현하는 **마스킹 확산 백본**.
- **Policy**는 관측과 인스트럭션으로부터 액션 청크를 예측.
- **World Modeling**은 현재 컨텍스트와 액션으로부터 다음 비주얼 관측을 예측.
- **Task Understanding**은 트레jectory 프레임으로부터 인스트럭션을 재구성.
- **Goal-State Prediction**은 지시된 목표에 해당하는 종단 비주얼 상태를 예측.
- **블록-병렬 마스킹 디코딩**과 **dInfer** 최적화 스택을 통해 액션 디코딩 속도 29.2× 향상.
- **48개 Open X-Embodiment 데이터셋**에서 약 1.33백만 트레jectory로 **지속적 사전 학습** 수행.
주요 결과
- **VLABench**에서 로봇 사전 학습이 고정된 Stage-2 스텝 예산 내에서 적응 성능 향상.
- **Policy-only 후처리 대비 전체 목적 혼합**이 동일한 결합 디코더에서 지시 변경 성공률 1.6% 개선.
- **목표 가이드와 액션-미래 상태 공동 디노이징 결합**이 액션만 디코딩 대비 지시 변경 성공률 2.3% 개선.
- **LIBERO**에서 98.1% 평균 성공률, **zero-shot LIBERO-Plus**에서 73.0%, **Franka Research 3**에서 78.4% 평균 성공률 달성.
- **모델 측 액션 디코딩 속도**는 최적화된 블록-병렬 구현으로 기초 구현 대비 29.2× 향상.
의의 및 한계
Dynin-Robotics는 **단일 모델이 여러 로봇 학습 목표를 학습하고, 추론 시 예측을 조합하여 제어를 개선**할 수 있음을 보여준다. 이는 로봇 정책, 시각 예측, 작업 이해를 통합하는 **유연한 인터페이스**를 제공하며, **동일한 모델이 다양한 도메인에 적응**할 수 있음을 입증한다. 또한, **블록-병렬 디코딩**을 통해 추론 속도를 크게 향상시켜 실시간 제어에 유리하다. 그러나, 평가가 **단일 로봇 플랫폼**(Franka Research 3)에 한정되었으며, **장기 미래 예측**이나 **트레jectory-언어 정확도**에 대한 정량적 평가가 부족하다는 한계가 있다.
실용적 활용
Dynin-Robotics는 **자연어 지시에 기반한 로봇 조작**이 필요한 산업 현장, 예를 들어, 물류, 제조, 서비스 로봇 분야에서 활용 가능하다. 또한, **다중 도메인에서의 적응 학습**이 필요한 연구 환경에서도 유용하며, **실시간 액션 제어**가 요구되는 시스템에 적용할 수 있다.