Aspire: Can Models Self-Evolve from Vague Goals?

Yuhao Wu, Jingyuan Zhang, Jiajun Shi, Yuxuan Zhang, Xinping Lei, Junting Zhou, Zexuan Wang, Yuchen Wu, Huan Zhou, Duo Wang, Yinzhu Piao, Yongchang Peng, Yunfeng Shi, Jin Chen, Zuo Wang, Jinkai Liu, Jiaheng Liu, Wenxuan Zhang, Shen Yan, Wenhao Huang, Ge Zhang

arXiv:2608.31111 · 2026-09-03 공개 · arXiv · PDF

agent-harness self-evolution llm-benchmarks evaluation-metrics training-data hidden-evaluation vague-goals model-weight

Abstract

Many important forms of human learning begin with a vague goal, such as "become a better physicist" or "improve at research." Learners must interpret the goal, identify capability gaps, decide how to learn, and determine whether they have actually improved. In contrast, existing work on LLM self-evolution typically begins with tasks and evaluation metrics specified by humans, reducing self-evolution to optimizing an explicit objective rather than deciding what and how to learn. We introduce ASPIRE, a benchmark for vague-goal-driven self-evolution. ASPIRE provides only a natural-language capability goal while downstream evaluation tasks remain hidden. The agent must operationalize the goal by choosing data and update methods, constructing training and validation signals, and deciding when to evaluate. ASPIRE supports both model-weight and agent-harness evolution in a unified interactive environment and evaluates the resulting systems on a hidden, expert-authored set of 520 items spanning six goals. Our experiments show that vague goals redirect search effort toward goal interpretation. Current agents routinely complete training and harness-editing loops, but weight-level gains remain sparse and unstable, and the strongest evolved harness remains below the engineered Qwen-Agent reference. Agents often train on mismatched data and trust narrow self-evaluations, so local gains fail to transfer to hidden evaluation and continued search and training can erase earlier improvements.

한국어 요약

한 줄 요약

ASPIRE는 모델이 명확한 목표 없이 모호한 능력 목표로부터 스스로 진화할 수 있는 벤치마크를 제시한다.

핵심 기여도

핵심 아이디어

ASPIRE는 인간 학습과 유사하게, 명확한 목표 없이 모호한 능력 목표로부터 모델이 스스로 진화하도록 유도하는 문제를 정식화한다. 기존 연구는 주로 주어진 목표에 따라 어떻게 개선할지를 탐색하는 데 집중했지만, ASPIRE는 ‘무엇을 개선할 것인가’와 ‘어떻게 개선할 것인가’를 동시에 결정하도록 요구한다. 이는 에이전트가 능력 격차를 진단하고, 중간 목표를 설정하며, 학습 및 검증 신호를 직접 구성해야 함을 의미한다. ASPIRE는 이러한 결정 공간을 확장함으로써, 에이전트가 생성한 대리 목표가 실제 능력 향상으로 이어지지 않을 수 있다는 새로운 실패 모드를 드러낸다.

기술적 접근법

ASPIRE는 자연어로 표현된 능력 목표만을 제공하며, 평가 항목은 숨겨져 있다. 에이전트는 데이터 선택, 업데이트 방법, 학습 및 검증 신호 구성, 평가 타이밍 결정을 포함한 모든 결정을 스스로 해야 한다. ASPIRE는 모델 가중치와 에이전트 하이버스의 진화를 지원하며, 통합된 에이전트 툴을 통해 데이터 다운로드, 학습 실행, 자기 평가, 후보 브랜치 관리 등을 수행할 수 있다. 평가 시스템은 데이터 관리, 작업 스케줄링, 리소스 분리, 체크포인트 검증을 담당하며, 에이전트는 평가 항목, 참조 답변, 항목별 피드백에 접근할 수 없다.

주요 결과

의의 및 한계

ASPIRE는 모델이 자율적으로 목표를 해석하고, 학습 전략을 구성하며, 진정한 능력 향상을 판단할 수 있는 능력을 평가하는 데 기여한다. 이는 학술적으로는 자율 학습의 다음 단계를 제시하며, 실용적으로는 인간 엔지니어 없이 모델을 배포 환경에 적응시키는 방향으로 이어질 수 있다. 그러나 ASPIRE는 6개의 목표와 전문가가 작성한 평가 항목에 의존하며, 반복 실험과 재귀적 진화 연구는 아직 제한적이다. 또한, 평가 항목의 범위와 점수 정확도가 결과 해석에 영향을 줄 수 있다.

실용적 활용

ASPIRE는 모델이 명확한 지침 없이 배포 환경에 적응하도록 훈련시키는 데 활용될 수 있다. 특히, 데이터 플랫폼 및 프런티어 모델 기업에서 인간 엔지니어 없이 시스템을 유지 및 개선하는 데 유용할 수 있다. 또한, 연구자들이 모델이 스스로 학습 목표를 정의하고 실행하는 능력을 평가하는 데 기초 자료로 활용될 수 있다.