한 줄 요약
SpatialCLI는 VLM이 공간 도구를 활용한 후 이를 내재화하여 공간 추론 성능을 향상시키는 3단계 프레임워크이다.
핵심 기여도
- SpatialCLI는 VLM에 공간 도구를 연결하고, Cold-Start SFT와 agentic RL을 통해 도구 사용을 학습한 후, Trajectory-Guided Capability Internalization을 통해 내재화한다.
- SpatialCLI-Bench라는 516개 예제로 구성된 새로운 벤치마크를 제시하여, 공간 인식의 조합적 추론을 평가한다.
- MindCube에서 Qwen3-VL-8B-Instruct의 성능을 도구 사용 시 29.3%에서 84.6%로 향상시키며, GPT-5.6 Sol(72.1%)을 초과한다. 도구 없이도 73.8% 성능을 유지한다.
- SpatialCLI-8B는 SpatialCLI-Bench에서 도구 사용 시 91.3%, 사용하지 않아도 72.7% 성능을 달성한다.
핵심 아이디어
기존 VLM은 공간 세부 정보를 정확히 인식하지 못하며, 전문 시각 모델은 세부 정보는 인식하지만 작업 수준 결정을 할 수 없다. 이 문제를 해결하기 위해 SpatialCLI는 VLM이 공간 도구를 활용한 후, 그 사용 경험을 내재화하여 독립적인 추론 능력을 갖도록 한다.
Call 단계에서는 SAM 3, DA3, VGGT 등 전문 시각 모델을 공간 도구로 연결하여 VLM의 인식을 향상시킨다. Learn 단계에서는 Cold-Start SFT와 agentic RL을 사용하여 도구 사용 정책을 학습한다. Internalize 단계에서는 성공적인 도구 사용 경로를 Dual-View Capability Internalization을 통해 VLM에 내재화한다.
이 접근은 VLM이 외부 도구 없이도 전문 시각 능력을 직접 추론할 수 있도록 하며, 이는 물리적 세계에 본질적으로 적합한 Foundation Model로의 진화를 가능하게 한다.
기술적 접근법
- **Call**: Inference-Time Tool Augmentation. SAM 3, DA3, VGGT 등 전문 모델을 공간 도구로 연결.
- **Learn**: Cold-Start SFT와 agentic RL을 사용하여 도구 사용 정책을 학습.
- **Internalize**: Trajectory-Guided Capability Internalization. 성공적인 도구 사용 경로를 Dual-View Capability Internalization을 통해 내재화.
- **SpatialCLI-Bench**: 516개 예제, 6가지 선택지, localization, segmentation, depth, pose를 포함한 조합적 추론 평가.
- **평가 설정**: 최대 10개의 도구 호출, temperature 1.0, top-p 0.95, top-k 20, 최대 생성 길이 40,960 토큰.
주요 결과
- **MindCube**: Qwen3-VL-8B-Instruct의 도구 사용 시 성능 29.3% → 84.6%. GPT-5.6 Sol(72.1%)을 초과. 도구 없이도 73.8% 유지.
- **SpatialCLI-Bench**: SpatialCLI-8B는 도구 사용 시 91.3%, 사용하지 않아도 72.7% 성능.
- **기타 벤치마크**: MMSI, DA-2K, BOPASK에서도 일관된 성능 향상.
- **GPT-5.6 Sol**: SpatialCLI-Bench에서 48.8%로, SpatialCLI-8B(91.3%) 대비 42.5% 낮음.
의의 및 한계
SpatialCLI는 VLM이 외부 전문 모델을 활용하고, 이를 내재화하여 독립적인 공간 추론을 가능하게 하는 새로운 프레임워크이다. 이는 물리적 세계에 적합한 Foundation Model로의 진화를 제시하며, 기존 VLM의 한계를 극복할 수 있는 가능성을 보여준다.
하지만, 현재는 구조화된 공간 인식 출력과 인식 중심 작업에만 제한된다. 전문 도구의 커버리지와 신뢰성에 의존하며, 다중 모달 출력 내재화나 VLA 도구 통합은 아직 미비하다.
실용적 활용
SpatialCLI는 로봇, 자율 주행, AR/VR 등 실제 물리적 환경에서 작동하는 시스템에 적용 가능하다. 특히, 복합 공간 작업에서 여러 전문 인식 능력을 조합적으로 활용해야 하는 상황에서 유용하다.