한 줄 요약
AutoWorldModel-Bench는 8개 게임 환경에서 AI 코드 에이전트가 세계 모델을 자율적으로 개선하는 데 사용되는 폐쇄 루프 벤치마크이다.
핵심 기여도
- AutoWorldModel-Bench를 소개: 8개 게임, 4개의 초기 모델, 고정된 컴퓨트 예산(6시간) 하에서 폐쇄 루프 평가.
- Codex-5.4와 Claude Opus 4.6가 64개 세션 중 63개에서 성능 개선.
- 91%의 세션에서 개선은 하이퍼파라미터 조정이 아닌 연구 스타일의 수정(목표, 표현, 롤아웃 절차, 아키텍처 변경)으로 이루어짐.
- 롤아웃 헤ORIZON(h=20)에서 성능 향상이 집중됨.
핵심 아이디어
AutoWorldModel-Bench는 세계 모델 연구에서 AI 코드 에이전트의 자율 연구 능력을 평가하는 새로운 벤치마크이다. 기존 평가 시스템은 명확한 목표와 지표가 주어진 엔지니어링 작업에 집중되지만, AutoWorldModel-Bench는 개방형 연구 문제를 반영한다. 이는 세계 모델의 아키텍처, 학습 목적, 상태 표현이 복잡하게 상호작용하는 상황에서 에이전트가 독자적으로 개선 방향을 제시해야 하기 때문이다.
구체적으로, 8개 게임 환경에서 추출된 구조화된 상태(tensorized structured-state)를 사용하여 감지 작업을 우회하고, 모델의 역학 예측 능력을 독립적으로 평가한다. 이는 각 게임의 엔티티 상태를 추출하여 공통 텐서 형식으로 제공함으로써 가능하다. 에이전트는 6시간의 컴퓨트 예산 내에서 초기 모델을 개선해야 하며, 이 과정에서 새로운 목표, 표현, 롤아웃 절차, 아키텍처 변경 등 연구 스타일의 수정이 이루어진다.
기술적 접근법
- **게임 환경**: 8개 게임, 각각의 구조화된 상태(tensorized structured-state)를 사용.
- **초기 모델**: RSSM/Dreamer, AR-Transformer, D3PM, MaskGIT.
- **롤아웃 평가**: Position L1 (정규화된 L1 오차), Alive F1 (F1 점수)를 기반으로 하며, 헤ORIZON별 가중 평가를 통해 롤아웃 정확도를 측정.
- **최종 점수**: 헤ORIZON 가중 평가 (test score: h1, h10, h20; scenario score: h1, h10, h_end).
- **에이전트 제약**: 6시간, 단일 H100 GPU, 10분당 최대 실행 시간.
- **데이터 분할**: training, validation, test, scenario. 에이전트는 training과 validation에만 접근 가능.
주요 결과
- Codex-5.4와 Claude Opus 4.6가 64개 세션 중 63개에서 성능 개선.
- 91%의 세션에서 개선은 하이퍼파라미터 조정이 아닌 연구 스타일의 수정(목표, 표현, 롤아웃 절차, 아키텍처 변경)으로 이루어짐.
- 성능 향상은 주로 롤아웃 헤ORIZON h=20에서 집중됨.
- Position L1 오차 감소와 Alive F1 점수 향상이 주요 지표.
의의 및 한계
AutoWorldModel-Bench는 AI 코드 에이전트가 연구 스타일의 문제를 해결하는 능력을 평가하는 첫 번째 폐쇄 루프 벤치마크이다. 이는 기존 평가 시스템이 명확한 목표와 지표가 주어진 엔지니어링 작업에 집중된 반면, AutoWorldModel-Bench는 개방형 연구 문제를 반영하여 AI 연구 에이전트의 진정한 연구 능력을 평가할 수 있다.
그러나, 벤치마크는 8개 게임 환경에만 제한되며, 더 넓은 범위의 세계 모델 연구를 반영하기 위해서는 추가 환경이 필요하다. 또한, 에이전트의 성능 개선이 롤아웃 헤ORIZON h=20에 집중되므로, 단기 예측 능력보다는 장기 예측 능력을 평가하는 데 초점이 맞춰져 있다.
실용적 활용
AutoWorldModel-Bench는 AI 연구 에이전트의 자율 연구 능력을 평가하는 데 활용될 수 있으며, 특히 세계 모델 연구, 장기 예측 모델 개발, 자율 학습 시스템 설계 등에 적용 가능하다. 게임 개발, 시뮬레이션, 자율 시스템 설계 분야에서 AI 에이전트의 연구 능력을 평가하고 개선 방향을 제시하는 데 유용하게 사용될 수 있다.