한 줄 요약
PROBE는 물리적 상호작용이 필요한 질문에 대답하는 VLM 에이전트를 평가하고 미세조정하는 프레임워크로, PROBE-Sim 시뮬레이터와 PROBE-Bench 벤치마크, PROBE-Agent 미세조정 레시피를 제시한다.
핵심 기여도
- **PROBE-Sim**: 1,796개의 실제 스캔된 객체와 UR5 로봇이 포함된 고정밀 테이블탑 시뮬레이터로, VLM 에이전트의 물리적 상호작용 평가를 위한 첫 번째 시뮬레이터.
- **PROBE-Bench**: 6개 질문 유형(Count, Find, Compare 등)에 걸쳐 150개의 잡동사니 테이블탑 장면을 포함한 평가 스위트.
- **PROBE-Agent**: Gemini 3.1 Pro에서 Qwen3-VL로의 지도 학습을 통해 성공적 도구 사용 경로를 이식하는 미세조정 레시피.
- **성능 향상**: 미세조정 후 Qwen3-VL-8B-SFT와 NVILA-15B-SFT가 각각 7.6%와 15.4% 개선됨.
핵심 아이디어
기존 VLM은 정적 환경에서의 2D 객체 지정과 공간 추론에 강하지만, 물리적 상호작용이 필요한 동적 환경에서는 한계가 있다. 예를 들어, "내 약이 캐비닛에 여전히 있나요?"라는 질문은 물리적으로 장애물을 제거해야 답을 찾을 수 있다. 이에 PROBE는 **Manipulation-Grounded Visual Question Answering (MG-VQA)** 문제를 정식화하고, VLM 에이전트가 물리적 도구를 사용해 장애물을 제거하고 질문에 대답하도록 평가 및 학습하는 프레임워크를 제시한다. 핵심 아이디어는 **도구 기반 에이전트가 단순 인식 기반 모델보다 평균 8.0% 높은 성능을 보인다는 점**이며, PROBE-Agent는 이 성능을 더 높이기 위해 **강력한 선생 모델(Gemini 3.1 Pro)의 성공 경로를 학습**하는 방식을 채택한다.
기술적 접근법
- **PROBE-Sim**: UR5 로봇이 6-DOF 조작과 닫힌 그립퍼 푸시를 수행하는 고정밀 테이블탑 시뮬레이터. 481개 카테고리의 1,796개 실제 스캔 객체 포함.
- **PROBE-Bench**: 6개 질문 유형(Count, Find, Compare, Size, Reduce, Beneath)에 걸쳐 150개의 잡동사니 테이블탑 장면.
- **PROBE-Agent**: Gemini 3.1 Pro에서 Qwen3-VL로의 지도 학습을 통해 도구 사용 경로를 이식. 학습 데이터는 성공적 경로를 포함한 mixed-data 레시피 사용.
- **성능 평가**: Qwen3-VL-8B-SFT와 NVILA-15B-SFT 모델이 미세조정 후 각각 48.1% → 67.8%, 51.7% → 69.1% 성능 향상.
주요 결과
- **PROBE-Bench 성능**: Qwen3-VL-8B-SFT는 48.1%에서 67.8%로, NVILA-15B는 51.7%에서 69.1%로 성능 향상.
- **새로운 작업 일반화**: Beneath 작업에서 Qwen3-VL-8B-SFT는 7.6%, NVILA-15B는 15.4% 개선.
- **시뮬레이션-현실 이전**: PROBE-Agent 정책이 실제 테이블탑 환경에서 성공적으로 이전됨.
- **Gemini 3.1 Pro 성능**: 전체 평균 69.2%, 다단계 조작 작업에서는 30.4%로 성능 저하.
의의 및 한계
PROBE는 VLM 에이전트가 물리적 상호작용을 통해 질문에 대답하는 새로운 평가 환경을 제시하며, 도구 사용이 성능을 평균 8.0% 향상시킨다는 점에서 학술적·실용적 가치가 있다. 특히, PROBE-Agent는 오픈-웨이트 모델에 강력한 선생 모델의 지식을 이식하여, **성능 향상과 작업 일반화를 동시에 달성**한다. 그러나, 다단계 조작 작업에서 성능 저하(30.4%)는 **조직적인 일반화 학습이 여전히 미흡하다는 한계**를 드러낸다. 또한, 벤치마크는 여전히 포화되지 않았으며, **도구 사용 시기와 방법을 정확히 결정하는 능력 향상이 필요**하다.
실용적 활용
PROBE는 홈 로봇, 물류 시스템, 서비스 로봇 등 물리적 상호작용이 필요한 환경에서 VLM 에이전트의 성능을 평가하고 학습할 수 있는 플랫폼으로 활용 가능하다. 특히, **도구 사용을 통한 물리적 조작이 필요한 질문에 대한 답변 능력 향상**이 필요한 산업 분야에 적합하며, 오픈-웨이트 모델의 성능 향상을 위한 미세조정 레시피도 실용적 가치가 있다.