한 줄 요약
TAMP-Nav는 2D VLM 사전 학습과 3D 실행 간의 불일치를 해결하며, 효율적인 탐색을 위한 통합 프레임워크로 R2R-CE에서 66.2%의 SR 성능을 달성한다.
핵심 기여도
- **Pixel-to-3D Action Formulation (Point)**: VLM이 2D 픽셀을 선택해 3D 좌표로 변환하여 SLAM 컨트롤러에 전달함으로써 2D-3D 불일치를 해소.
- **Selective Reasoning and Anchor-Trajectory Memory (Think and Memorize)**: CoT를 중요한 노드에서만 실행하고, 중간 경로는 Space-Time Indicators로 압축하여 메모리 효율성을 높임.
- **Two-Level GRPO (Align)**: 전역 성과 보상과 세부 과정 보상을 결합하여 정밀한 정책 최적화를 수행. 90k 학습 트레젝토리로 SOTA 성능 달성.
핵심 아이디어
기존 VLN 모델은 VLM의 2D 사전 학습과 3D 실행 사이의 불일치, CoT의 빈도 조절 문제, 메모리 관리의 비효율성이라는 세 가지 주요 한계를 겪는다. TAMP-Nav는 이를 해결하기 위해 **Pixel-to-3D Action Formulation**을 도입하여 VLM이 2D 이미지에서 픽셀을 선택하고, 이를 3D 좌표로 변환하여 SLAM 컨트롤러에 전달함으로써 자연스러운 실행을 가능하게 한다. 또한, **Selective Reasoning**을 통해 CoT를 필요 시에만 실행하고, **Anchor-Trajectory Memory**를 통해 핵심 노드의 정보만 저장하며, 중간 경로는 **Space-Time Indicators**로 압축하여 메모리 사용을 최적화한다. 마지막으로, **Two-Level GRPO**는 전역 성과와 세부 과정 보상을 결합하여 정밀한 정책 학습을 가능하게 하며, 이는 **SPL, 타겟 접근 지표, 충돌 회피** 등 다양한 보상을 통합한 **dense supervision**을 통해 이루어진다.
기술적 접근법
- **Pixel-to-3D Action Formulation (Point)**: VLM이 2D 픽셀을 선택하고, 이는 3D 좌표로 변환되어 SLAM 컨트롤러에 전달됨.
- **Selective Reasoning and Anchor-Trajectory Memory (Think and Memorize)**: CoT는 중요한 노드에서만 실행되며, 중간 경로는 STI로 압축됨.
- **Two-Level GRPO (Align)**: 전역 성과 보상(SPL, 타겟 접근)과 세부 과정 보상(충돌 회피, 정지 동작 정확도)을 결합.
- **학습 데이터**: 90k 트레젝토리로 학습.
- **SLAM 컨트롤러**: 고정된, 학습되지 않은 SLAM 컨트롤러 사용.
주요 결과
- **R2R-CE 데이터셋**에서 **66.2%의 SR** 성능 달성.
- **90k 학습 트레젝토리**로 높은 샘플 효율성 보임.
- **Dense CoT 대비 CoT 호출 감소 73.7%**.
- **Full History 대비 AT-Mem 성능 개선 4.3% (R2R-CE)**.
- **STI 제거 시 SR 감소 2.6% (R2R-CE)**.
의의 및 한계
TAMP-Nav는 VLM의 2D 사전 학습과 3D 실행 간의 불일치를 해소하고, CoT의 빈도 조절과 메모리 관리를 효율적으로 처리함으로써, 기존 VLN 모델의 주요 한계를 극복한다. 특히, **Pixel-to-3D Action Formulation**은 VLM의 2D 시각 능력을 자연스럽게 활용하며, **Two-Level GRPO**는 정밀한 정책 최적화를 통해 높은 성능을 달성한다. 그러나, **CoT 지도의 공간 일관성**에 따라 성능이 민감하게 변하며, **강력한 오픈-소스 모델과 프로퍼티 모델 간의 성능 격차는 작지만 존재**한다. 또한, **SLAM 컨트롤러는 고정되어 있어**, 실제 환경에서의 유연성은 추가 연구가 필요하다.
실용적 활용
TAMP-Nav는 **로봇 네비게이션**, **가상 현실(VR) 내 가이드 투어**, **자율 주행 시스템** 등에서 자연어 기반의 3D 환경 탐색을 필요로 하는 산업에 적용 가능하다. 특히, **저비용 SLAM 컨트롤러와 결합**하여 실시간 성능을 유지하면서도 **높은 정확도의 경로 탐색**이 필요한 상황에서 유용하다.