Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces

Jihan Yang, Shusheng Yang, Anjali Gupta, Rilyn Han, Fei-Fei Li, Saining Xie

arXiv:2412.14171 · 2026-07-27 공개 · arXiv · PDF

chain-of-thought spatial-reasoning multimodal-llm vsi-bench cognitive-maps video-based visual-spatial local-world-models

Abstract

Humans possess the visual-spatial intelligence to remember spaces from sequential visual observations. However, can Multimodal Large Language Models (MLLMs) trained on million-scale video datasets also "think in space" from videos? We present a novel video-based visual-spatial intelligence benchmark (VSI-Bench) of over 5,000 question-answer pairs, and find that MLLMs exhibit competitive—though subhuman—visual-spatial intelligence. We probe models to express how they think in space both linguistically and visually and find that while spatial reasoning capabilities remain the primary bottleneck for MLLMs to reach higher benchmark performance, local world models and spatial awareness do emerge within these models. Notably, prevailing linguistic reasoning techniques (e.g., chain-of-thought, self-consistency, tree-of-thoughts) fail to improve performance, whereas explicitly generating cognitive maps during question-answering enhances MLLMs’ spatial distance ability.

한국어 요약

한 줄 요약

MLLMs가 비디오 기반 공간 인지 능력을 갖는지 탐구한 연구로, VSI-Bench라는 새로운 벤치마크를 제시하고 공간 추론 능력 향상을 위한 인지 지도 생성 방법을 제시.

핵심 기여도

핵심 아이디어

인간은 시퀀셜 시각 관찰을 통해 공간을 기억하고 추론할 수 있는 시각-공간 지능을 갖지만, MLLMs가 비디오를 통해 비슷한 능력을 갖는지는 명확하지 않았다. 이를 확인하기 위해 연구자들은 VSI-Bench라는 새로운 비디오 기반 시각-공간 지능 벤치마크를 개발했다. 이 벤치마크는 290개 이상의 실제 실내 장면 비디오를 기반으로 구성되어 있으며, 시간에 따른 연속적인 입력을 통해 인간의 공간 인지 방식과 유사한 조건을 제공한다. 연구는 MLLMs가 비록 공간 추론 능력이 약한 상태이지만, 지역적 세계 모델과 공간 인식 능력이 나타남을 밝혔다. 특히, 인지 지도를 생성하는 것이 공간 거리 추론 능력을 향상시키는 데 효과적임을 발견했다.

기술적 접근법

주요 결과

의의 및 한계

이 연구는 MLLMs가 비디오를 통해 공간 인지 능력을 갖는지 탐구하며, VSI-Bench라는 새로운 벤치마크를 제시함으로써 시각-공간 지능 연구의 기초를 마련했다. 특히, 인지 지도 생성이라는 새로운 접근법이 공간 추론 능력 향상에 효과적임을 밝혀내는 것은 중요한 기여이다. 그러나 MLLMs는 여전히 인간 수준의 공간 추론 능력에 도달하지 못하며, **egocentric-allocentric 변환**과 **관계 추론(relational reasoning)** 능력이 주요한 한계점으로 드러났다. 또한, 현재 연구는 제로샷 설정에서만 평가되었기 때문에, 미세조정(fine-tuning)이나 새로운 학습 목표 개발이 필요하다는 한계가 있다.

실용적 활용

이 연구는 로봇공학, 자율주행, AR/VR 등 시각-공간 지능이 필요한 분야에서 MLLMs의 활용 가능성을 제시한다. 특히, 인지 지도 생성 기법은 실제 환경에서의 공간 추론 능력을 향상시키는 데 활용될 수 있으며, MLLMs의 시각-공간 지능을 구체화하고 강화하는 데 중요한 단서를 제공한다.