한 줄 요약
게임 개발을 기반으로 한 RLHEV 학습 패러다임이 세계 모델 확장에 효과적인 검증 가능한 데이터 엔진으로 제시된다.
핵심 기여도
- RLHEV (Reinforcement Learning with Human-Engine Verification)라는 새로운 게임 개발 기반의 후학습 패러다임 제안.
- AWoMo (Agentic World Model) 모듈을 통해 개발자-엔진 검증 신호를 학습 데이터로 변환.
- UnitySceneBench에서 0.681의 최고 점수 달성.
- D4RL Gym-MuJoCo에서 +48.43%의 성능 향상 기록.
핵심 아이디어
기존 세계 모델 확장 전략은 더 많은 동영상 데이터와 컴퓨팅 자원을 기반으로 하지만, 이는 효율적이지 않다. 코드 에이전트의 성공은 실행 가능한 코드가 컴파일러와 런타임을 통해 명확한 보상 신호를 제공하기 때문이며, 이는 RL 후학습에 중요한 역할을 한다. 반면, 공간 생성은 CLIP 점수와 같은 흐릿한 대체 지표에 의존하고 있어 RL 후학습을 지원하기 어렵다. 게임 개발은 이러한 문제를 해결할 수 있는 새로운 보상 환경을 제공한다. 게임 엔진은 충돌, 물리, 탐색 가능성 등을 자동으로 검증하며, 개발자는 최종 승인 신호를 제공한다. 이는 엔진과 개발자의 이중 검증 시스템을 형성하며, AWoMo는 이러한 신호를 학습 데이터로 활용한다.
기술적 접근법
- **RLHEV**: 게임 개발 과정에서 생성된 엔진 신호와 개발자 승인을 결합한 후학습 패러다임.
- **AWoMo**: 세계 생성 에이전트로, 씬 편집 제안, 엔진-인간 검증 관찰, 수정된 멀티모달 트레이스를 학습 데이터로 변환.
- **UnitySceneBench**: 200개의 Unity 자산 편집 평가 데이터셋.
- **Gymnasium MuJoCo, D4RL Gym-MuJoCo**: 정책 평가를 위한 강화 학습 환경.
- **R2R (Room-to-Room)**: 자연어 지시에 따른 탐색 성능 평가.
주요 결과
- **UnitySceneBench**에서 RLHEV는 0.681의 최고 점수를 달성 (정확도 0.665).
- **Unreal**에서 OOD 성능이 0.25 → 0.35 (+0.10), **Godot**에서 0.15 → 0.35 (+0.20) 향상.
- **R2R**에서 +0.79%, **Gymnasium MuJoCo**에서 +9.96%, **D4RL Gym-MuJoCo**에서 +48.43%의 성능 향상 기록.
- 720개의 Unity 씬 생성에서 640개가 완전히 렌더링 및 라벨링 성공 (Unity exit code 0).
의의 및 한계
RLHEV는 세계 모델의 후학습에 필요한 명확한 보상 신호를 제공하며, 게임 개발을 기반으로 한 데이터 생성 루프를 구축함으로써 공간 지능의 확장 가능성을 높인다. 특히, 엔진과 개발자의 이중 검증은 흐릿한 대체 지표에 의존하는 기존 방법과 차별화된다. 그러나 현재 실험은 진단 수준이며, 더 큰 규모의 연구가 필요하다. 또한, 재귀적 자기 개선 루프를 완전히 구현하기 위해서는 플레이 가능한 자산, 외부 엔진 검증, 인간 승인, 게임 에이전트 테스트 등을 통합해야 한다.
실용적 활용
게임 개발 기반의 RLHEV는 게임 콘텐츠 자동 생성, VR/AR 환경 구축, 시뮬레이션 기반 학습 등에 활용 가능하다. 특히, AWoMo는 개발자 워크플로우에 통합되어 세계 모델의 생성-검증-학습 루프를 자동화할 수 있어, 산업용 AI 개발 및 연구 분야에서 실용적 가치가 높다.