HarnessEval-W: Agentifying the Evaluation of Visual Worlds
Weiliang Chen, Haowen Sun, Jun Gao, Jiawei Chi, Hanyang Wang, Qiyu Dai, Yihao Li, Hao Li, Jingnan Gao, Yi-Hsin Hung, Xingzhuo Guo, Shangchen Miao, Zhiyuan Shi, Xiang Li, Fengrui Tian, Weihua Du, Ziqi Huang, Shenyuan Gao, Siqiao Huang, Mingyu Liu, Yifei Li, Shizun Wang, Xi Wang, Tianqi Zhang, Xue Luo, Xiyin Ren, Jinshan Ren, Xiaoyang Shen, Xiaobo Hu, Zhiyang Dou, Mingyu Ding, Yichao Yan, Xinchao Wang, Yizhou Wang, Shilong Liu, Wenzhao Zheng, Yueqi Duan, Yuan Gong, Ziwei Liu, Ming-Yu Liu, Jialong Wu, Jiangran Lyu, Fangfu Liu
arXiv:2608.16859 · 2026-08-18 공개 · arXiv · PDF
llm-evaluation world-models physics-simulation evaluation-benchmarks rollout-evaluation transparent-evaluation causality-checking agent-based-evaluation
Abstract
A benchmark should deliver more than a scalar score: what makes an evaluation trustworthy is the reasoning that justifies the score. This is especially critical for world models, where judging a rollout requires understanding whether physics, causality, and world state evolve correctly. Humans spot such violations naturally, yet no existing benchmark automates this capability: metrics are computed brute-force, leaving no reasoning chain that can be examined or verified. We introduce HarnessEval-W, an agentified evaluation pipeline that brings the harness paradigm from the LLM ecosystem to world model benchmarking. Rather than applying a fixed rubric, HarnessEval-W interprets the context of each evaluation case, decomposes the evaluation question into measurable subproblems, and spawns specialized sub-agents, each equipped with tailored context and diagnostic tools to reason over its own subproblem. The parent agent then validates the gathered evidence and summarizes it into the final verdict. This hierarchical workflow turns every evaluation into a transparent evidence tree whose complete reasoning chain justifies the result. We apply HarnessEval-W to 18 representative world models over 330 evaluation cases. Its judgments closely align with human preferences while providing verifiable, fine-grained diagnoses of every generated rollout. We open-source the full pipeline as a live benchmark and invite the broad community to contribute to grow new skills and evaluation cases as world models evolve.
한국어 요약
한 줄 요약
HarnessEval-W는 세계 모델 평가를 위한 에이전트 기반 파이프라인으로, 330개 평가 사례에서 인간 선호와 높은 일치도를 보인다.
핵심 기여도
- **HarnessEval-W**라는 에이전트 기반 평가 파이프라인을 제안하여, 기존 벤치마크의 블랙박스 문제를 해결.
- 330개 평가 사례와 18개 대표 세계 모델을 대상으로 평가, 인간 선호와 **높은 일치도**를 보임.
- 평가 결과를 **투명한 증거 트리(evidence tree)** 형태로 제공하여, 각 점수의 논리적 근거를 검증 가능하게 함.
- **Observation Quality**, **Transition Correctness**, **World Persistence** 3가지 핵심 기능을 기반으로 평가 사례를 구성.
핵심 아이디어
기존 세계 모델 평가 시스템은 단순히 수치 점수만 제공하며, 그 근거를 설명하거나 검증할 수 없었다. HarnessEval-W는 이 문제를 해결하기 위해 **LLM 생태계의 harness 개념을 도입**, 평가를 에이전트 기반 워크플로우로 구현했다. 평가 에이전트는 각 사례의 맥락을 해석하고, 평가 질문을 측정 가능한 하위 문제로 분해한 후, 각 하위 문제에 맞는 **специализированны한 서브에이전트(sub-agent)**를 생성한다. 이 서브에이전트는 각각 **맞춤형 진단 도구**를 사용해 증거를 수집하고, 상위 에이전트가 이를 검증한 후 최종 판단을 내린다. 이는 단순 Q&A 평가를 넘어, **투명한 추론 체인**을 생성하는 구조를 갖는다.
기술적 접근법
- **HarnessEval-W**는 **계층적 워크플로우**를 기반으로 구성됨.
- 평가 사례 마다 **Observation Quality**, **Transition Correctness**, **World Persistence** 3가지 핵심 기능에 따라 평가가 이루어짐.
- 평가 사례는 **구조화된 장면 분류(taxonomy)**를 기반으로 생성되며, **구체적인 행동**이 생성된 장면에 접목됨.
- 평가 과정에서 **bounding box 추적**, **시간적 교차 검증**, **속도 추정** 등의 도구가 사용됨.
- 평가 결과는 **증거 트리(evidence tree)** 형태로 저장되며, **각 도구의 시각적 근거**와 **논리적 연결**이 기록됨.
주요 결과
- 18개 대표 세계 모델을 330개 평가 사례에 대해 평가한 결과, **인간 선호와 높은 일치도**를 보임.
- **비디오 생성기(video generator)**를 세계 모델로 변환하는 과정은 **능력 분포를 재분배**하는 경향이 있음.
- 평가 점수는 단순한 스칼라가 아니라, **검증 가능한 세부 진단**과 **논리적 추론 체인**을 포함함.
- 평가 결과는 **투명한 증거 트리** 형태로 제공되어, **모델 실패 원인을 세부적으로 파악** 가능.
의의 및 한계
HarnessEval-W는 세계 모델 평가의 **신뢰성과 투명성**을 획기적으로 향상시킨다. 기존 평가 시스템이 블랙박스로 작동하는 반면, HarnessEval-W는 **각 평가 단계의 논리적 근거를 기록**하여, 결과를 검증할 수 있도록 한다. 또한, **서브에이전트 기반의 분산 평가**는 다양한 평가 사례에 유연하게 대응할 수 있는 장점을 가진다. 그러나, 현재는 **330개의 평가 사례**만 포함되어 있어, 세계 모델의 전체 범위를 포괄하지 못할 수 있다. 또한, 평가 도구와 서브에이전트의 **확장성**에 따라 평가의 정확도가 달라질 수 있다.
실용적 활용
HarnessEval-W는 **세계 모델 개발자**가 모델의 **물리적 일관성**, **시간적 지속성**, **관측 품질**을 정확히 평가할 수 있도록 지원한다. 또한, **비디오 생성기나 시뮬레이터 개발자**가 모델의 **실제 세계 모델링 능력**을 측정하는 데 활용 가능하다. 이 시스템은 **개방형 벤치마크**로 제공되며, 연구자와 개발자들이 **새로운 평가 사례와 기술을 추가**하여 지속적으로 발전시킬 수 있다.