Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence

Xin Ding, Liang Mi, Mingzhe Huang, Zixuan Wang, Chao Zhang, Zixu Hao, Fu Chen, Xiangyu Li, Yikai Zheng, Yaoyu Guo, Weijun Wang, Kun Li, Hao Wu, Yunxin Liu, Ting Cao

arXiv:2608.16590 · 2026-08-20 공개 · arXiv · PDF

embodied-agents self-evolving libero-pro robocasa physical-intelligence action-frequency-governance closed-loop-learning runtime-critics

Abstract

Embodied agents are increasingly used to close the gap left by end-to-end policy models. Yet the agentic path has not realized closed-loop learning in physical execution: existing harnesses remain largely open-loop, following fixed skills during rollout and reflecting only after an episode completes. Such post-hoc reflection cannot govern execution as it unfolds, because physical interaction requires decisions to track rapidly changing robot-environment states at a frequency beyond today's large agentic models. We present Zetta, a closed-loop embodied harness that evolves code-based runtime critics and recovery skills online while keeping the base policy frozen. Through three timescale-separated loops, Zetta provides action-frequency governance, rollout-level critic-recovery proposal, and validation-gated skill updates. Together with Z-Infra, a rollout infrastructure decoupling agent logic from heterogeneous execution resources, Zetta achieves state-of-the-art success on LIBERO-Pro and RoboCasa under our current rollout budget, reaching 90.8% and 93.6%, with an 11.1x inference speedup; success continues to scale with self-exploration experience; learned skills transfer zero-shot, and clear robotic "Aha Moments" emerge. These results show that closed-loop harness self-evolution opens a scaling path for reliable physical intelligence.

한국어 요약

한 줄 요약

Zetta는 실시간 실행 중 코드 기반 크리틱과 복구 기술을 진화시키며, 90.8% 성공률을 달성한 클로즈드-루프 에마바디드 허네스이다.

핵심 기여도

핵심 아이디어

기존 에마바디드 에이전트는 실행 중에 고정된 기술을 따르며, 에피소드 종료 후에만 반성하는 오픈-루프 구조를 유지한다. 이는 빠르게 변화하는 로봇-환경 상태를 반영하지 못해 신뢰성 있는 실행을 어렵게 만든다. Zetta는 이러한 문제를 해결하기 위해 실행 중에 코드 기반의 실시간 크리틱과 복구 기술을 온라인으로 진화시키는 클로즈드-루프 허네스를 제안한다.

Zetta는 세 가지 타임스케일 루프를 통해 실행을 지속적으로 개선한다:
1. **Critic-Governed Action Loop**는 액션 주파수로 실행되며, 필요 시 복구 기술을 호출한다.
2. **Rollout-Batch Candidate Optimization Loop**는 실패 사례를 클러스터링하고, 후보 크리틱과 복구 기술을 제안한다.
3. **Validation-Gated Skill Update Loop**는 성공률 향상과 타스크 간 일반화를 보장하는 후보만을 스킬 메모리에 추가한다.

이러한 구조는 실행 중에도 학습을 가능하게 하며, Zetta는 기존 정책 모델을 동결한 상태에서 허네스만 진화시켜 신뢰성 있는 물리적 지능을 확장한다.

기술적 접근법

주요 결과

의의 및 한계

Zetta는 실행 중에도 학습이 가능한 클로즈드-루프 허네스를 통해, 기존 오픈-루프 시스템의 한계를 극복하고, 물리적 환경에서 신뢰성 있는 지능을 확장하는 새로운 경로를 제시한다. 특히, Zetta는 기존 정책 모델을 동결한 상태에서 허네스만 진화시켜, 정책 재학습 없이도 성능을 향상시킬 수 있다.

그러나 Zetta는 여전히 시뮬레이션 환경에서 평가되었으며, 실제 로봇에 적용하기 위해서는 시뮬레이션-실제 간의 격차를 해소하는 추가 연구가 필요하다. 또한, 코드 기반 크리틱의 생성과 업데이트는 복잡한 알고리즘적 처리를 요구하므로, 실시간 실행에 대한 최적화가 지속적으로 필요하다.

실용적 활용

Zetta는 물리적 환경에서 지속적으로 진화하는 로봇 시스템 개발에 활용될 수 있다. 특히, 제조, 물류, 서비스 로봇 분야에서 복잡한 작업 환경에 적응하는 능력을 요구하는 상황에 적합하다. 또한, Z-Infra는 다양한 환경과 하드웨어에서 동일한 에이전트를 확장 실행할 수 있어, 대규모 로봇 플랫폼 구축에도 유용하다.