한 줄 요약
ReferTrack은 단일 전면 카메라 기반의 언어 지시 추적 문제를 해결하기 위해 언급 후 추적 방식을 도입한 VLA 모델로, EVT-Bench에서 최고 성능을 달성한다.
핵심 기여도
- **Refer-then-Tracking 패러다임** 도입: 이미지 기반 바운딩 박스 선택 후 추적 경로 생성.
- **TVBI (Temporal-Viewpoint-Bbox Indicator)** 토큰을 통해 시간적 바운딩 박스 기하학 정보를 추적 정책에 주입.
- **Refer-QA 데이터셋**과 함께 코-트레이닝하여 이미지 기반 추론 능력 강화.
- **EVT-Bench**에서 단일 카메라 기반으로 89.4%, 73.3%, 74.1%의 성공률 달성.
핵심 아이디어
기존 VLA 모델은 추적 대상 식별과 경로 계획을 추상적인 공간 잠재 공간에서 처리하여 시각적 정합성이 약한 문제가 있었다. ReferTrack은 이를 해결하기 위해 **이미지 공간의 바운딩 박스 기반 선택**을 핵심 아이디어로 삼았다. 모델은 먼저 **Refer-CoT 토큰**을 통해 바운딩 박스 목록 중 하나를 선택하고, 이 선택을 기반으로 추적 경로를 생성한다.
추가적으로, **TVBI 토큰**을 도입하여 이전 선택된 바운딩 박스의 기하학 정보를 추적 정책에 주입함으로써 시간에 따른 대상의 움직임을 보존한다. 이는 추적 정확도를 높이고, 복잡한 환경에서의 추적 안정성을 향상시킨다.
기술적 접근법
- **Refer-CoT 토큰**: 바운딩 박스 목록 중 하나를 선택 (예: ⟨NO_EXIST⟩ 포함).
- **TVBI 토큰**: 시간적-시점-바운딩 박스 정보를 시각 히스토리에 주입.
- **Refer-QA 데이터셋**: 인덱스 기반 바운딩 박스 선택 인터페이스를 사용한 커스텀 QA 데이터셋으로 코-트레이닝.
- **모델 파라미터**: 4B 파라미터의 백본 사용, 강화 학습 없이 순수 SFT 기반 학습.
주요 결과
- **EVT-Bench**에서 단일 카메라 기반으로 다음과 같은 성공률 달성:
- Single-target: 89.4%
- Distracted: 73.3%
- Ambiguity: 74.1%
- **TVBI w/ GT bbox** 버전은 81.5% SR, 84.7% TR 달성.
- **Refer-CoT + TVBI 제거 시** 성능 급격히 하락 (55.7% SR, 71.4% TR).
의의 및 한계
ReferTrack은 추적 대상 식별과 경로 계획을 명확히 분리하면서도, 이미지 기반 추론을 통해 추적 정확도를 높이는 새로운 패러다임을 제시한다. 특히, **TVBI 토큰**을 통해 시간적 정보를 효과적으로 활용함으로써, 복잡한 환경에서도 추적 안정성을 유지할 수 있다.
그러나, **단일 카메라**로 인한 시야 제한이 여전히 한계로 작용할 수 있으며, **복잡한 다중 대상 추적** 상황에서는 추가적인 개선이 필요하다. 또한, **강화 학습 없이 순수 SFT 기반**으로 학습된 모델이므로, 정교한 정책 최적화가 필요한 상황에서는 한계가 있을 수 있다.
실용적 활용
ReferTrack은 **다양한 이동 로봇**(족보형, 인형형 로봇)에 적용 가능하며, **실내/실외 환경에서의 언어 지시 추적**에 유용하다. 특히, **시각-언어 정합성이 중요한 서비스 로봇**이나 **보행자 추적 시스템** 등에 활용 가능하다.