AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

Yaxin Luo, Haobin Jiang, Jialv Zou, Xu Huang, Wenhao Yan, Haodong Li, Zhengrong Yue, Jing Li, Xiaofu Chen, Xiaohan Zhao, Jiacheng Liu, Jiacheng Cui, Zhiqiang Shen, Xiaotong Li

arXiv:2608.13560 · 2026-08-15 공개 · arXiv · PDF

long-horizon human-preference meta-harness agentic-design poster-generation posterbench code-agent model-optimizer

Abstract

Transforming multimodal sources into condensed and structured media outputs can be fundamentally conceptualized as a long-horizon agentic process centered on a model-harness system. While an ideal harness system should align with human design priors and accumulate reusable experience through empirical exploration to drive recursive self-improvement, existing paradigms remain static and fall short of this capability. In this paper, we present AutoDesign, a framework that aligns with human design priors, where a meta-harness optimizer guides a code agent to recursively improve harness based on rollout feedback. To instantiate and evaluate this framework, we focus on the academic paper-to-poster generation task and introduce PosterBench, comprising a 100-paper Main Track spanning five disciplines and PosterBench-mini, a shared 10-paper subset for controlled evaluation. On the PosterBench Main Track, AutoDesign achieves the highest score of 78.32, surpassing the closed-source commercial system Claude Design by 7.45 points. Across seven controlled code-agent-model configurations, integrating the learned DesignHarness consistently improves performance, increasing the average PosterBench Score from 54.99 to 67.39 (+12.4%). In a fully autonomous long-horizon loop, it executes 253 tool calls and 11 editing turns within 40 minutes for under $3, reaching average conference-poster quality in human evaluation. A system-blind human study further demonstrates that AutoDesign achieves the highest human preference among evaluated systems.

한국어 요약

한 줄 요약

AutoDesign은 학술 논문을 포스터로 자동 생성하는 과정에서 인간 선호에 맞춘 재귀적 개선을 통해 78.32 점을 달성한 메타-해버 시스템 최적화 프레임워크이다.

핵심 기여도

핵심 아이디어

AutoDesign은 기존의 정적 해버 시스템을 벗어나, 인간 선호에 기반한 **메타-해버 최적화**(meta-harness optimization)를 통해 시스템 자체를 재귀적으로 개선하는 프레임워크이다. 이는 **DesignHarness**라는 실행 가능한 시스템을 생성하며, 이 시스템은 **논문 → 포스터** 생성 과정에서 **인간 피드백**과 **롤아웃 트레이스**(rollout traces)를 기반으로 **재귀적 학습**을 수행한다.

기존 시스템은 단일 피드백을 일회성 신호로 처리하지만, AutoDesign은 이를 **지속 가능한 디자인 지식**(persistent design knowledge)으로 전환한다. 이는 **MetaHarnessOptimizer**가 **롤아웃**(rollouts)과 **평가 점수**를 집계하여 반복 실패를 분석하고, **코드 에이전트**(code agent)를 통해 **DesignHarness**를 제한된 범위 내에서 업데이트하는 방식으로 이루어진다. 업데이트는 **수락 게이트**(acceptance gate)를 통과해야 하며, 훈련 세트 성능 향상과 개발 세트 성능 저하가 동시에 발생하지 않는 경우에만 허용된다.

기술적 접근법

주요 결과

의의 및 한계

AutoDesign은 **인간 선호에 기반한 디자인 생성**을 **재귀적 시스템 학습**으로 전환함으로써, 기존의 정적 디자인 시스템을 극복하는 학술적 기여를 제공한다. 특히, **DesignHarness**는 실행 가능한 시스템으로, **논문 → 포스터** 생성 과정에서 **인간 피드백**과 **롤아웃 데이터**를 기반으로 지속적으로 개선되며, **PosterBench**를 통해 정량적으로 평가받는다.

그러나, AutoDesign은 **특정 도메인**(학술 포스터 생성)에 초점을 맞춘 시스템이므로, 다른 다중 모달 디자인 작업으로 확장 가능성은 명시되지 않음. 또한, **인간 피드백의 질**이 시스템 성능에 큰 영향을 미칠 수 있으므로, **피드백 데이터의 다양성과 질**에 대한 추가 연구가 필요하다.

실용적 활용

AutoDesign은 학술 포스터 제작, 웹페이지 또는 슬라이드 자동 생성 등 **다중 모달 입력을 구조화된 출력으로 변환**해야 하는 산업 및 연구 분야에 적용 가능하다. 특히, **인간 피드백 없이도 자동화된 편집과 개선**이 필요한 상황에서 유용하며, **저비용**(포스터당 $0.27)으로 고품질 결과를 생성할 수 있어 연구자 및 디자인 팀에 실용적 가치를 제공한다.