한 줄 요약
RynnValue는 7,000시간 이상의 데이터로 학습된 로봇 가치 기초 모델로, 시간 거리 기반의 보상 인터페이스를 통해 정량적 성능을 향상시킨다.
핵심 기여도
- **시간 거리**(temporal distance)를 기반으로 한 **가치 기초 모델**(value foundation model)을 제안, 7,000시간 이상의 이질적 데이터 학습 가능.
- **랜덤 시간 샘플링**, **시간 순서 섞기**, **가치 분리 어텐션**(value-isolation attention)을 결합하여 학습 단축 경로를 억제.
- **RBM-EVAL-OOD**에서 Kendall’s τ_a 0.675 달성, 기존 최고 성능(0.655)을 초과.
- **실제 정책 성공률**을 온라인 52.5% → 72.5%, 오프라인 63.8% → 82.5%로 향상.
핵심 아이디어
기존 로봇 보상 모델은 **진행도**(progress)나 **선호도**(preference)와 같은 내부적 앵커(anchor)에 의존해 이질적 데이터에 일반화가 어려웠다. RynnValue는 이를 **시간 거리**(temporal distance)로 대체하여, 언어로 지정된 목표까지의 **방향성 있는 비용**(cost-to-go)을 예측하는 모델을 제안한다. 이는 시간 스탬프만으로 라벨을 생성할 수 있어, **선호도 라벨 없이도 3M개 이상의 지시 조건 클립**(instruction-conditioned clips)을 학습 가능하게 한다.
핵심 통찰은 **가치**(value)를 단순한 진행도가 아닌, **목표 조건**(goal-conditioned)으로 정의함으로써, 이질적 데이터와 다양한 로봇 구조, 시점, 작업에 걸쳐 일반화할 수 있다는 점이다. 이를 위해 **가치 분리 어텐션**과 **시간 순서 섞기**를 도입해, 모델이 시각적 증거에만 의존하도록 유도한다.
기술적 접근법
- **입력**: 언어 조건(ℓ), 로봇 관측 시퀀스(ℐ), 로봇 메타데이터(m)
- **출력**: 각 관측의 **절대 시간 거리**와 **연속 관측 간 상대 시간 변화**
- **샘플링**: 각 비디오에서 8개 관측(K=8)을 무작위 시간으로 추출
- **모델 아키텍처**: RynnBrain 기반, BroNet 잔잔 MLP(4096 너비, 8 깊이, ReLU 활성화)
- **라벨링**: 시간 스탬프 기반, **서브태스크 분할**(subtask segmentation)과 **컷오프 재라벨링**(cutoff relabeling)을 통해 의미 있는 완료 지점을 정의
- **학습 기법**:
- **랜덤 시간 샘플링**
- **시간 순서 섞기**(temporal-order shuffling)
- **가치 분리 어텐션**(value-isolation attention)
- **보조 학습 목표**: 자연어 비디오 설명, 지시 일치, 성공 예측
주요 결과
- **RBM-EVAL-OOD**에서 Kendall’s τ_a 0.675 달성 (기존 최고 0.655, 진행도 기반 0.292 대비 2배 이상 향상)
- **실제 정책 성공률**:
- 온라인: 52.5% → 72.5% (+19.9%)
- 오프라인: 63.8% → 82.5% (+18.7%)
- **시간 순서 섞기 제거 시** 성능 0.189로 급격히 하락
- **가치 분리 어텐션 제거 시** 성능 0.482로 감소
- **자연어 감독 제거 시** 성능 0.537로 하락
- **상대 시간 거리 감독 제거 시** USC Trossen에서 1.000 → 0.639로 감소
의의 및 한계
RynnValue는 **이질적 데이터**(real-world, simulated, egocentric)를 통합하고, **선호도 라벨 없이도 학습 가능**하다는 점에서 학술적·실용적 가치가 있다. 특히, **가치 기초 모델**(value foundation model)로서 **단일 인터페이스**(single interface)를 제공하며, **온라인/오프라인 정책 학습 모두에서 성능 향상**을 보인다.
그러나 현재는 **짧은 시간 창**(short window)의 샘플만을 기반으로 학습하며, **장기적 시간 범위**(longer horizons)나 **스트리밍 추론**(streaming inference)에 대한 확장은 아직 이루어지지 않았다. 또한, **최소 시간**(minimum-time) 기반의 목표를 가정하므로, **에너지, 안전, 정밀도** 등의 작업 특화 비용을 고려한 가치 의미론은 아직 포함되지 않았다.
실용적 활용
RynnValue는 **이질적 로봇 데이터**(다양한 로봇 구조, 시점, 작업)를 통합하는 **보상 인터페이스**(reward interface)로 활용 가능하다. 특히, **실제 환경**(real-world)에서의 **온라인/오프라인 정책 학습**에 적용할 수 있으며, **자연어 기반 지시**(instruction-conditioned) 작업 수행에 적합하다. 또한, **다양한 로봇 종**(end-effectors)과 **이동형 조작**(mobile manipulation) 환경으로 확장될 수 있다.