한 줄 요약
DreamTraj는 단일 RGB 이미지와 작업 지시문으로 6-DoF 물체 궤적을 생성하는 새로운 접근법으로, 비디오 생성 없이 확산 모델 내부 표현에서 직접 추출한다.
핵심 기여도
- **MOVE 데이터셋**: 5,038개의 인간 검수 6-DoF 물체 궤적과 세부 자연어 지시문을 포함한 데이터셋 제공.
- **DreamTraj 모델**: 단일 RGB 이미지와 지시문만으로 6-DoF 궤적을 생성하며, 비디오, 깊이, CAD 모델 없이 작동.
- **4.6× 가속**: 기존의 "생성-추출" 파이프라인 대비 4.6배 빠른 추론 속도.
- **최초의 접근**: 확산 모델의 중간 표현에서 직접 6-DoF 궤적을 디코딩한 첫 사례.
핵심 아이디어
기존 접근은 비디오 생성 후 픽셀 수준에서 궤적을 추출하거나, CAD 모델과 깊이 정보 같은 특권 입력을 필요로 했다. DreamTraj는 이러한 제약을 극복하기 위해, 이미지-비디오 확산 모델의 중간 표현에서 직접 6-DoF 궤적을 추출하는 새로운 패러다임을 제안한다. 구체적으로, 확산 모델의 **query-key attention 맵**과 **pooled hidden states**를 활용하여, 물체의 위치와 회전 정보를 추출한다. 이는 비디오를 완전히 생성하지 않아 추론 속도를 크게 향상시키는 핵심 아이디어이다.
기술적 접근법
- **입력**: 단일 RGB 이미지 $I_0$와 자연어 지시문 $\ell$.
- **모델 구조**:
- **Frozen image-to-video diffusion backbone**: 외부 비디오 생성 없이 내부 표현에서 궤적 정보를 추출.
- **Reader 모듈**: query-key attention 맵과 pooled hidden states를 입력으로 받아, 9-D pose token (3D translation + 6D rotation)을 생성.
- **Depth 추정**: 단일 입력 이미지의 단안 깊이 추정으로 궤적을 메트릭 스케일로 변환.
- **추론 단계**:
1. 확산 모델의 early denoising 단계에서 latent motion signal 추출.
2. Reader가 이 신호를 기반으로 future object trajectory를 디코딩.
3. 모든 추론 과정에서 비디오 생성 없이 진행.
주요 결과
- **MOVE 데이터셋**: 5,038개의 6-DoF 궤적과 세부 자연어 지시문을 포함.
- **성능**: 기존의 multi-frame 또는 특권 입력을 사용하는 예측기 대비, **번역 및 회전 모두에서 최신 기술 수준** 달성.
- **속도**: "생성-추출" 파이프라인 대비 **4.6× 빠른 추론 속도**.
- **추가 실험**: q·k 트랙, pooled hidden states, 지시문 제거 실험에서 각각 ADE +0.71cm, 끝점 오차 증가, 회전 오차 증가 등 정량적 영향 확인.
의의 및 한계
DreamTraj는 물체 조작 시스템에서 필수적인 6-DoF 궤적 예측을, 비디오 생성 없이 실시간으로 수행할 수 있는 기반을 제공한다. 특히, **MOVE 데이터셋**은 자연어-운동 간 정밀한 연결을 위한 고질량 학습 데이터를 공급하며, **query-key attention 기반의 Reader 모듈**은 비디오 생성 없이도 물체의 위치와 회전 정보를 추출할 수 있음을 입증한다. 그러나, **단일 입력 이미지의 깊이 추정에 의존**하며, 이는 메트릭 스케일 복원에 한계를 초래할 수 있다. 또한, **확산 모델의 내부 표현 해석**은 모델 종속적일 수 있어, 다른 모델로의 이식 가능성에 대한 추가 연구가 필요하다.
실용적 활용
DreamTraj는 로봇 조작 시스템, 특히 **실내 환경에서의 물체 이동 예측 및 조작**에 적용 가능하다. 예를 들어, **자율 로봇이 단일 이미지와 지시문만으로 물체의 3D 궤적을 예측**하여, 정확한 그립 및 배치를 계획할 수 있다. 또한, **실시간 성능과 특권 입력 없이 작동**하므로, 실제 현장 적용에 유리한 조건을 제공한다.