SceneActBench: Can Agents Act on the 3D Scenes They See?

Yifei Zhao, Xiangxin Zhou, Wenhao Yang, Jiaqi Tang, Pu Jian, Huanjin Yao, Jiarui Yao, Haowei Lin, Chunchao Guo, Zhuo Chen, Wenkai Lyu, Jianzhu Ma, Xueqian Wang, Wenxi Zhu

arXiv:2607.22393 · 2026-07-27 공개 · arXiv · PDF

vision-language vlm-agents task-specific-metrics scene-act-bench geometric-evaluation multi-object agent-environment-loop agent-action

Abstract

Vision-language model (VLM) agents increasingly use tools to act on 3D scenes rather than only describe them. Existing 3D benchmarks score textual responses or single-object operations, leaving agent action on complete multi-object 3D scenes under evaluated. We present SceneActBench, a benchmark for visually conditioned action across five 3D tasks under a unified agent-environment loop. Given PNG images or sampled video frames and, where applicable, supplied 3D assets, an agent acts on a 3D environment. We evaluate each final output against hidden ground truth with task-specific geometric metrics. SceneActBench comprises five tasks built from 210 source instances, yielding 520 task cases including paired input conditions. Every task runs through one fixed agent loop to keep the comparison fair. Across eleven proprietary VLM configurations, Overall scores span 38.6-50.2, and none performs consistently well across tasks. We further analyse where and how failures manifest.

한국어 요약

한 줄 요약

SceneActBench는 3D 환경에서 시각 정보를 바탕으로 대리자가 행동하는 능력을 평가하는 새로운 벤치마크이다.

핵심 기여도

핵심 아이디어

기존 3D 벤치마크는 텍스트 응답이나 단일 객체 조작에만 초점을 맞추고, 대리자가 전체 다중 객체 3D 환경에 작용하는 능력을 충분히 평가하지 못한다. SceneActBench는 이 문제를 해결하기 위해, 대리자가 PNG 이미지나 샘플된 비디오 프레임을 바탕으로 3D 환경에 작용하도록 설계된 실행 가능한 평가 프레임워크를 제시한다. 이는 기존의 3D VQA나 단일 작업 기반 평가와 달리, 대리자가 실제 3D 공간 내 여러 객체에 대한 조정된 행동을 수행해야 하는 실질적인 시험을 제공한다. 특히, 대리자는 레이아웃 재구성, 카메라 시점 조정, 가동 가능한 객체 조작, 3D 재구성, 동적 시퀀스 재현 등 다각도의 작업을 수행해야 하며, 이는 기하학적 지표를 통해 평가된다.

기술적 접근법

SceneActBench는 210개의 소스 인스턴스(100개의 가구가 있는 방, 100개의 가동 가능한 객체, 10개의 다중 객체 동적 시퀀스)를 기반으로 5개의 작업을 구성한다. 각 작업은 고정된 대리자-환경 루프(fixed agent loop)를 통해 평가되며, 최종 출력은 숨겨진 지오메트리 기준에 따라 작업별 기하학적 지표로 평가된다. 평가 대상은 11개의 프로퍼리어리 VLM 설정이며, 각 설정은 동일한 환경 루프를 거쳐 비교가 공정하게 이루어진다.

주요 결과

의의 및 한계

SceneActBench는 3D 환경에서 대리자가 행동하는 능력을 실행 가능한 방식으로 평가함으로써, 기존 텍스트 기반 평가의 한계를 극복한다. 특히, 다중 객체 환경에서의 조정된 행동을 평가함으로써 실용적 3D 애플리케이션에 필요한 능력을 측정할 수 있다. 그러나 현재 벤치마크는 210개의 소스 인스턴스만 포함하며, 더 넓은 3D 환경이나 개방형 모델에 대한 평가는 아직 이루어지지 않았다. 또한, 실패 분석은 개별 작업 수준에서 이루어지며, 전체 시스템 수준의 일반화는 제한적이다.

실용적 활용

SceneActBench는 3D 환경에서 대리자가 물리적 객체를 조작하거나 시점/구조를 재구성해야 하는 산업(예: 로봇, 게임, AR/VR)에서 모델 성능을 평가하는 데 활용될 수 있다. 또한, 연구자들이 3D 공간 이해와 행동 능력을 개선하기 위한 알고리즘 개발에 기준을 제공한다.