한 줄 요약
RoboSpatial은 2D 및 3D 시각-언어 모델의 공간 이해 능력을 향상시키기 위해 설계된 대규모 로봇용 데이터셋이다.
핵심 기여도
- RoboSpatial 데이터셋을 제안하여 기존 VLM의 공간 이해 능력 한계를 해결함.
- 1M 이미지, 5k 3D 스캔, 3M 개의 공간 관계 어노테이션 포함.
- 2D- 및 3D-모델 모두 사용 가능하도록 2D 이미지와 3D 스캔을 짝지음.
- 공간 관계 예측, 공간 배치 예측, 로봇 조작 등 다운스트림 작업에서 기존 베이스라인을 초과함.
핵심 아이디어
기존 시각-언어 모델(VLM)은 일반 이미지 데이터셋에서 학습되어 공간 참조 프레임(ego-, world-, object-centric)을 이해하는 데 어려움을 겪는다. 이는 로봇이 실제 환경에서 의미 있는 상호작용을 하기 위해 필수적인 능력이다. RoboSpatial은 이러한 문제를 해결하기 위해 설계된 데이터셋으로, 공간 관계를 3가지 유형(공간 맥락, 공간 호환성, 공간 구성)으로 구분하고, 각 질문-답변 쌍을 3가지 참조 프레임에서 제시한다. 이는 모델이 다양한 관점에서 공간 정보를 해석하도록 유도하며, 실제 로봇 작업에 필요한 유연한 공간 추론 능력을 향상시킨다.
기술적 접근법
- **공간 관계 유형**: 공간 맥락(공간 내 빈 공간 식별), 공간 호환성(공간에 객체 배치 가능성), 공간 구성(두 객체 간 상대적 관계)으로 분류.
- **참조 프레임**: Ego-centric, World-centric, Object-centric의 3가지 관점에서 질문 생성.
- **데이터셋 구성**: 1M 이미지, 5k 3D 스캔, 3M 어노테이션 포함.
- **데이터 생성 파이프라인**: 기존 RGBD 데이터셋을 변환하여 공간 질문-답변 쌍 생성.
- **평가 방법**: RoboSpatial-Val(검증 집합), RoboSpatial-Home(수작업 데이터)에서 성능 평가.
주요 결과
- RoboSpatial로 학습한 모델은 BLINK 데이터셋에서 "under", "next to" 등의 새로운 공간 관계에 대해 70% 이상의 정확도를 보임.
- RoboSpatial-Home에서 참조 프레임 추론 정확도는 85% 이상 달성.
- 3D VLM은 2D VLM 대비 10~15% 높은 성능을 보임.
- 3D VLM은 깊이 정보를 활용하여 공간 관계 예측에서 더 우수한 성능을 나타냄.
의의 및 한계
RoboSpatial은 로봇이 실제 환경에서 공간 정보를 해석하고 조작할 수 있도록 기반을 제공하며, 기존 VLM의 공간 이해 능력 한계를 보완한다. 특히, 2D 및 3D 모델 모두 사용 가능한 데이터셋 구조는 다양한 연구와 응용에 유리하다. 그러나 일부 3D VLM이 사용된 훈련 데이터와 유사한 환경에 노출되어 있어 성능 편향이 발생할 수 있다는 한계가 있다. 또한, 데이터셋의 자동 생성 파이프라인은 새로운 공간 관계나 환경에 확장 가능하지만, 수작업 검증이 필요한 부분도 존재한다.
실용적 활용
RoboSpatial은 로봇이 물체 배치, 경로 계획, 조작 등 실제 작업에 필요한 공간 이해 능력을 향상시키는 데 활용될 수 있다. 또한, 증강현실(AR) 및 자율주행 분야에서도 공간 관계 해석에 필요한 VLM 훈련에 사용될 수 있다.