Source-linked AI summary
AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design
Yaxin Luo, Haobin Jiang, Jialv Zou, Xu Huang, Wenhao Yan, Haodong Li, Zhengrong Yue, Jing Li, Xiaofu Chen, Xiaohan Zhao, Jiacheng Liu, Jiacheng Cui, Zhiqiang Shen, Xiaotong Li
TL;DR
Multimodal design system은 개별 시도의 피드백을 재사용 가능한 design knowledge로 전환하는 방법이 부족하다. AutoDesign은 rollout evaluation을 사용해 design harness를 재귀적으로 최적화하며, 78.32의 최고 PosterBench score와 가장 높은 human preference를 달성한다.
문제
기존 multimodal design system은 human-aligned feedback을 재사용 가능한 design knowledge가 아니라 일시적인 것으로 취급한다.
방법
AutoDesign은 중첩된 design-harness 및 meta-harness loop를 사용해 human-aligned evaluation과 rollout feedback으로 실행 가능한 paper-to-poster system을 재귀적으로 개선한다.
결과
AutoDesign은 78.32의 최고 PosterBench score를 달성하고, Claude Design을 7.45 points 앞서며, 가장 높은 human preference estimate를 받는다.
시사점 및 한계
AutoDesign은 model weights를 고정한 채 반복되는 design failure를 향후 paper-to-poster generation을 위한 지속적인 개선으로 전환한다.
시사점 및 한계
AutoDesign은 현재 academic paper-to-poster generation에 대해 검증되었으며, 다른 media로 신뢰성 있게 확장하려면 medium-specific data, evaluator, rendering gate, objective가 필요하다.
Abstract
from arXiv · showhide
Transforming multimodal sources into condensed and structured media outputs can be fundamentally conceptualized as a long-horizon agentic process centered on a model-harness system. While an ideal harness system should align with human design priors and accumulate reusable experience through empirical exploration to drive recursive self-improvement, existing paradigms remain static and fall short of this capability. In this paper, we present AutoDesign, a framework that aligns with human design priors, where a meta-harness optimizer guides a code agent to recursively improve harness based on rollout feedback. To instantiate and evaluate this framework, we focus on the academic paper-to-poster generation task and introduce PosterBench, comprising a 100-paper Main Track spanning five disciplines and PosterBench-mini, a shared 10-paper subset for controlled evaluation. On the PosterBench Main Track, AutoDesign achieves the highest score of 78.32, surpassing the closed-source commercial system Claude Design by 7.45 points. Across seven controlled code-agent-model configurations, integrating the learned DesignHarness consistently improves performance, increasing the average PosterBench Score from 54.99 to 67.39 (+12.4%). In a fully autonomous long-horizon loop, it executes 253 tool calls and 11 editing turns within 40 minutes for under $3, reaching average conference-poster quality in human evaluation. A system-blind human study further demonstrates that AutoDesign achieves the highest human preference among evaluated systems.
1 서론
서론은 AutoDesign을 인간의 설계 선호에 부합하는 멀티모달 설계를 위해 재귀적으로 개선되는 meta-harness로 제시하고, 이를 논문-포스터 생성에 적용해 PosterBench로 평가한다. 벤치마크 품질 향상, 경쟁력 있는 Main Track 성능, 저비용 배포, 가장 높은 인간 선호도를 보고한다.
- 방법: AutoDesign은 개별 산출물만 최적화하는 대신 인간 선호에 기반한 평가를 사용해 design harness 자체를 재귀적으로 최적화한다.외부 루프는 harness 구성요소 업데이트를 제안하고 평가한 뒤 수용하거나 거부하며, 수용된 업데이트는 DesignHarness에 누적된다.
- 응용: DesignHarness는 학술 논문을 입력받아 critic 피드백에 따라 포스터를 생성하고 수정하며, 추적 가능한 근거를 보존하면서 가독성과 시각적 일관성을 갖춘 결과물을 완성한다.논문-포스터 생성은 길고 멀티모달인 과학 자료를 읽기 쉬운 단일 포스터로 압축해야 한다.
- 벤치마크: PosterBench는 자료 충실도, 고밀도 과학 커뮤니케이션, 렌더링된 사용성을 함께 측정하도록 도입되어 기존 논문-포스터 벤치마크의 공백을 보완한다.기존 벤치마크는 레이아웃, 추출, 충실도 또는 시각적 품질과 같은 일부 요소만 다뤘다.
- 결과: DesignHarness를 일곱 개의 Code Agent에 연결하면 평균 PosterBench Score가 54.99에서 67.39로 상승하며, 12.40 points의 향상을 보인다.이 향상은 PosterBench-mini에서 보고되었다.
- 결과: 78.32 PosterBench Main Track score를 달성한 AutoDesign은 동일한 Claude Code 및 Claude 4.8 configuration에서 closed-source Claude Design을 7.45 points 앞서며, 유효한 pairwise judgment 933건에서 64.0% Bradley–Terry preference도 기록한다.64.0% 추정치의 95% interval은 55.2–77.8%다.
2 Meta-Harness 정식화
이 절에서는 design harness를 multimodal source를 사람이 사용하는 artifact로 변환하는 고정 모델 시스템으로, meta-harness를 해당 harness를 개선하는 시스템으로 정식화한다. 최적화는 underlying model parameter를 고정한 채 artifact의 기대 품질을 목표로 한다.
- 2.1 Design Harness 정의: design harness H는 고정된 LLM 또는 MLLM πθ를 둘러싸고 multimodal input x와 context c를 사람이 사용하는 artifact y로 변환한다.이 정식화는 harness를 model weight와 구별되는 최적화 대상으로 다루는 연구를 따른다 (Lee et al., 2026b; Ren et al., 2026).
- 2.1 Design Harness 정의: harness는 trajectory τ를 통해 y를 생성하며, artifact 생성 과정에서 중간 action, state, revision을 기록한다.
- 2.1 Design Harness 정의: 다섯 가지 구성 요소는 Context and Memory, Tools and Specifications, Execution Runtime, Orchestration, Evaluation and Feedback이다.각각 source와 state 관리, artifact authoring, rendering과 validation, workflow 제어, critique 기반 revision을 지원한다.
- 2.1 Design Harness 정의: 이 분해는 high-level abstraction이며, 구체적인 구성 요소는 meta-harness가 인스턴스화하고 반복적으로 개선한다.
- 2.2 Meta-Harness 정의: meta-harness는 design harness에 작동하여 harness requirement와 implementation을 optional initial harness H0로부터 optimized harness HT로 변환한다.이 정의는 Lee et al. (2026b), Zhang et al. (2026a), Lin et al. (2026)과 관련된다.
- 2.2 Meta-Harness 정의: 최적화 목적은 task distribution ptask에 대해 H가 생성하는 artifact의 expected quality이며, Rmeta(y, x, c)로 평가한다.
- 2.2 Meta-Harness 정의: 최적화 중에는 θ remains fixed이므로, 개선은 underlying model πθ가 아니라 이를 둘러싼 scaffold에 작용한다.이는 Ren et al. (2026)이 설명한 model과 scaffold의 구별을 유지한다.
3 Meta-Harness 학습 루프
AutoDesign은 design-harness 실행과 meta-harness 최적화를 중첩된 피드백 루프로 구성한다. 내부 루프는 designer–critic 상호작용을 통해 산출물을 수정하고, 외부 루프는 rollout evidence를 사용해 harness 업데이트를 제안·평가하고 선택적으로 수용한다.
- 중첩된 피드백 루프: 이 framework는 고정된 design harness 아래에 산출물 생성을 배치하고, task 간 harness 최적화를 수행해 내부 및 외부 피드백 루프를 형성한다.내부 루프는 실행 trajectory를 기록하고, 외부 루프는 이를 분석해 task 전반의 harness를 개선한다.
- 내부 루프 design harness: 초기 design harness는 산출물을 생성하고 수정하는 designer와 산출물을 평가해 후속 수정에 필요한 feedback을 제공하는 critic으로 구성된다.첫 단계에서는 빈 초기 산출물과 feedback만으로 designer가 multimodal source와 design requirements에서 draft를 생성할 수 있다.
- 외부 루프 최적화: 각 외부 루프 iteration은 rollout, evaluation, update proposal, acceptance를 수행하며, evaluator는 7개 quality dimension에 걸쳐 rule-based check와 VLM judgment를 결합한다.최적화 시점의 evaluator는 최종 system 비교에 사용되는 고정된 PosterBench protocol과 구별된다.
- 업데이트 제안: coding-agent optimizer는 trajectory, score, persistent history를 분석한 뒤 credit assignment의 해석 가능성을 유지하기 위해 iteration마다 정확히 하나의 harness component만 수정한다.변경을 구현하기 전에 planner와 code-editor role, parallel subagent, structured failure analysis, update plan을 사용한다.
- 수용 및 persistent optimization: 제안된 harness는 training performance가 향상되고 development performance가 하락하지 않을 때만 수용되어 overfitting을 방지하며, persistent record는 비교, 재현성, rollback을 지원한다.optimization record에는 checkpoint, trajectory, score, 선택된 component, plan, code change, decision이 저장되며, 선택적 human guidance는 정체된 search의 방향을 전환할 수 있다.
4 최적화된 DesignHarness
DesignHarness는 provenance를 인식한 source ingestion, 반복적인 artifact 생성 및 수정, validation과 visual critique, finalization을 결합한 최적화 아키텍처를 갖춘 multimodal harness다. academic poster, presentation slide, video, web page 등의 output을 지원한다.
- Source ingestion: Ingestion 단계는 metadata, outline, 핵심 passage, figure, table을 source location과 함께 추출해 구조화되고 provenance를 인식한 context를 구축한다.이 자료들은 생성과 수정에 사용할 content brief와 medium별 artifact plan으로 구성된다.
- Artifact generation: Designer coding agent는 현재 artifact, feedback, 유지된 ingestion context를 조건으로 삼아 수정 가능한 HTML artifact를 반복적으로 생성한다.Source에 근거한 context는 inner-loop refinement 단계 전반에 걸쳐 유지된다.
- Validation and critique: 각 candidate는 unsafe하거나 누락된 asset, 손상된 provenance, 심각한 layout failure, typography 또는 layout violation을 대상으로 deterministic blocking check를 거친다.실패한 candidate는 추가 inspection을 위해 rendering된다.
- Validation and critique: Rule-based validation과 design compliance, layout, readability, aesthetics에 대한 critic-VLM assessment는 다음 revision을 위한 repair signal로 통합된다.이 feedback-to-revision loop는 structured check와 visual critique를 연결한다.
- Finalization: 최대 K = 12회의 refinement attempt가 허용되며, 이후 passing candidate는 rendering adjustment, mathematical typesetting, asset inlining을 거쳐 finalized된다.모든 blocking check를 통과하면 loop가 즉시 종료되며, 그렇지 않으면 attempt budget을 소진한 뒤 harness가 fallback한다.
5 평가 프로토콜
PosterBench는 공통 입력, 렌더링, 고정 evaluator를 사용해 100편·5개 분야의 Main Track과 공유 10편 subset에서 paper-to-poster 시스템을 평가한다. AutoDesign은 benchmark와 human preference 비교에서 선두를 차지하며, harness를 연결하면 다양한 configuration에서 score가 향상된다.
- PosterBench Main Track: 78.32: AutoDesign은 PosterBench Main Track에서 가장 높은 score를 달성하며, 동일한 Claude Code와 Claude 4.8 조건에서 Claude Design을 7.45 points, OpenDesign을 8.87 points 앞선다.Table 1은 100편 평가 세트를 다루며 design agent, coding agent, handcrafted workflow를 비교한다.
- PosterBench-mini Main Track: 81.46: Codex를 사용한 AutoDesign은 native Codex baseline을 5.59 points 앞서며, Claude Code configuration에서는 standalone baseline의 69.55에 비해 74.56에 도달한다.이 결과는 controlled ablation에 사용한 공유 10편 subset인 PosterBench-mini에서 보고되었다.
- Harness Contribution: 5.01–19.56 points: design harness를 연결하면 완료된 7개 model–code-agent configuration 모두에서 PosterBench Score가 향상된다.가장 큰 향상은 Claude Code를 사용하는 DeepSeek V4 Pro의 19.56 points이며, native Codex–GPT-5.5 configuration은 75.87에서 81.46으로 향상된다.
- Human Evaluation: 64.0%: AutoDesign은 가장 높은 Bradley–Terry human-preference 추정치를 보이며, tie-adjusted preference는 Claude Code 대비 61.3%, OpenDesign 대비 63.1%, Claude Design 대비 67.6%다.이 연구에는 933개의 ranking judgment와 3회의 skip이 포함되며, AutoDesign 추정치의 95% interval은 55.2–77.8%다.
- Benchmark–Human Alignment: 74.4%: PosterBench Score 격차가 최소 20점일 때 benchmark가 선호한 포스터가 인간의 판단과 일치하는 비율로, 0–3점 격차의 경우 51.9%다.PosterBench는 규칙 기반 공간, OCR, 수치 grounding, render-integrity 검사와 rubric 기반 VLM judge를 결합하며, 그 점수는 인간의 선호와 양의 상관관계를 보인다(r = 0.34).
6 향후 연구 방향
AutoDesign의 design pattern은 paper-to-poster generation을 넘어 다양한 multimodal output과 multimodal-in, multimodal-out agentic design system으로 확장된다. 향후 연구는 harness adaptation을 model post-training 및 model–harness co-evolution과도 연결한다.
- 일반화된 multimodal design: Figure 12는 papers, visual evidence, code, data, human guidance를 통합해 medium-specific output을 반복적으로 생성하는 multimodal-in, multimodal-out system을 구상한다.
- 매체 간 일반화: 최적화된 DesignHarness는 이미 paper-to-poster generation을 slide decks, webpages, conference videos로 확장한다.이러한 pilot output은 agentic design pattern이 단일 input이나 output medium에 한정되지 않음을 시사한다.
- Model–harness co-evolution: 최근 연구는 continual harness adaptation, self-improving harnesses, model–harness co-evolution을 연결하며, harness optimization이 model post-training을 보완한다는 점을 제시한다.Long-horizon trajectory와 repair outcome은 실행 시점의 supervision을 제공하고, model은 reasoning 및 coding capability를 제공한다 (Karten et al., 2026; Zhang et al., 2026a; Lee et al., 2026a).
7 관련 연구
기존 연구는 포스터 및 문서에서 파생된 기타 미디어를 위한 멀티모달 생성, 응답 수준의 refinement, 지속적인 경험을 축적하는 에이전트를 아우른다. AutoDesign은 이 중 후자의 방향을 확장해 source-grounded하고 편집 가능한 학술 산출물을 위한 DesignHarness를 진화시킨다.
- 멀티모달 디자인 생성: 학술 포스터 시스템은 레이아웃, source coverage, 텍스트–이미지 정렬, 멀티모달 생성, 특화 에이전트, 시각적 refinement를 연구한다.이러한 시스템에는 SciPostLayout, deep submodular extraction, Paper2Poster, P2P, PosterGen, PosterForest, Any2Poster가 포함된다 (Pang et al., 2025; Sun et al., 2026; Zhang et al., 2025b; Choi et al., 2026; Vinaykumar et al., 2026).
- 멀티모달 디자인 생성: 관련 시스템은 논문이나 기타 문서로부터 슬라이드, 웹페이지, 내레이션 비디오도 생성한다.인용된 시스템에는 Fu et al. (2022), Zheng et al. (2025), Ge et al. (2025), Yang et al. (2025), Chen et al. (2025), Zhu et al. (2025)가 포함된다.
- Refinement와 persistent adaptation: Critic, render diagnostics, regeneration policy는 현재의 멀티모달 산출물을 개선하며, persistent agent는 reflection, 실행 가능한 skill, 기타 경험을 보존한다.Self-Refine은 feedback을 사용해 현재 답변을 수정한다 (Madaan et al., 2023). AutoDesign은 source-grounded하고 편집 가능한 산출물을 위한 DesignHarness를 개발해 persistent evolution을 적용한다.
- Refinement와 persistent adaptation: Persistent system update는 task-local history, development split, 관련 adaptation 설정 전반에서 learning signal과 최종 evaluation을 분리하는 방식이 서로 다르다.RHI (Lee et al., 2026a)는 evaluator 측에 evaluation prompt를 유지하면서 pairwise history를 task-local signal로 보존한다. Recursive Self-Evolving Agents는 Continual Harness, Adaptive Auto-Harness, Live-SWE-agent와 함께 독립적인 development split을 사용한다 (Nguyen et al., 2026; Karten et al., …).
8 결론
AutoDesign은 지속적 학습을 통해 반복되는 디자인 실패를 향후 멀티모달 출력의 개선으로 전환한다. MetaHarnessOptimizer는 model weights를 고정한 채 DesignHarness component를 업데이트하고, design priors를 축적하며 편집 가능한 paper-to-poster 출력을 생성한다.
- AutoDesign은 반복되는 디자인 실패를 향후 멀티모달 출력을 생성하는 시스템의 개선으로 전환한다.
- MetaHarnessOptimizer는 trajectory, source 및 rendering diagnostics, evaluator feedback, reference posters를 종합해 한 번에 하나의 DesignHarness component를 업데이트한다.
- model weights를 고정하면 paper-to-poster generation은 design priors를 축적하고 직접 사용하거나 로컬에서 수정할 수 있는 편집 가능한 출력을 생성하는 지속적 학습 과정이 된다.
A 보충 실험 자료
부록은 통제 비교, 공유 생성 지시문, 고정된 평가 프로토콜, 공개된 기록, 대응되는 시각적 증거를 문서화해 실험 인터페이스를 검토할 수 있게 한다.
- 부록은 실험에 사용된 통제 비교와 공유 생성 지시문을 문서화한다.
- 고정된 평가 프로토콜을 명시하고 실험 기록을 공개한다.
- 대응되는 시각적 증거는 문서화된 실험 자료를 보완한다.
부록 안내
부록 A.1은 보고된 트랙 전반에서 고정하거나 변경한 요인을 비롯해 benchmark 입력과 비교 행렬을 정리한다. 또한 비교에 사용한 공통 system-instruction 발췌문과 task prompt를 제공한다.
- A.1 Benchmark Inputs and Comparison Matrix: 부록 A.1은 보고된 트랙의 benchmark 입력과 비교 행렬을 명시한다.benchmark에 사용한 source package를 식별한다.
- A.1 Benchmark Inputs and Comparison Matrix: 비교 행렬은 각 보고된 트랙에서 어떤 요인을 고정하고 어떤 요인을 변경했는지 기록한다.이 구조는 모든 비교의 조건을 명확히 한다.
- A.1 Benchmark Inputs and Comparison Matrix: 부록에는 비교 대상 시스템 전반에서 사용한 system-instruction 발췌문과 공통 task prompt가 포함된다.이 자료는 비교를 위한 공통 prompting 맥락을 정의한다.
A.2 AutoDesign 생성 인터페이스
이 절에서는 최적화된 design harness에 단계적으로 축적된 기능과 이를 5개 구성요소 추상화에 대응시키는 방식을 설명한다.
- A.2 AutoDesign 생성 인터페이스: 최적화된 design harness는 기능을 단계적으로 축적하고 이를 5개 구성요소 추상화에 대응시킨다.
A.3 DesignHarness Evolution … A.6 Additional AutoDesign Poster Demonstrations
부록은 AutoDesign의 통제된 생성 인터페이스, 진화하는 DesignHarness 아키텍처, PosterBench의 채점 및 공개 기록, 시스템 블라인드 인간 평가, 추가 정성적 포스터 시연을 명시한다. 이 자료들은 재현 가능한 입력, 소스에 근거한 산출물 요구사항, 감사 가능한 평가, 대표 산출물을 함께 정의한다.
- A.1 Benchmark Inputs and Comparison Matrix: AutoDesign의 비교 프로토콜은 모든 시스템에 동일한 소스 패키지를 제공하고 편집 가능한 포스터 산출물 하나를 요구하며, 주장·수치·시각적 증거의 근거로 논문을 우선한다.Table 5는 완성된 시스템을 비교하는 main track과 명시된 요인 하나만 변화시키는 controlled track을 구분한다.
- A.3 DesignHarness Evolution: DesignHarness는 planning과 critique에서 source grounding, specialist support, 편집 가능한 HTML, repair 및 validation gate, image-native evaluation을 결합하는 coding-agent system으로 진화한다.Figure 14는 이를 개별 meta-harness 반복의 연대기가 아니라 구현 수준의 아키텍처 요약으로 제시한다.
- A.4 PosterBench Evaluation Interface: PosterBench는 수동으로 지정되고 고정된 일곱 개 차원으로 렌더링된 산출물을 평가하며, 완성된 시스템의 채점과 harness 최적화 중 사용되는 Rmeta 피드백을 분리한다.Benchmark는 차원별 가중 점수를 집계하고, record 수준의 상한을 적용하며, 사례별 capped poster score를 평균한다.
- A.4 PosterBench Evaluation Interface: PosterBench는 render integrity, occupancy, OCR readability, source grounding을 검사하는 programmatic check와 렌더링된 포스터 및 압축된 소스 맥락을 조건으로 하는 blinded VLM judgment를 결합한다.충분히 큰 batch에서는 style-homogeneity check가 professional aesthetics만 낮출 수 있으며, 포스터가 10개인 PosterBench-mini에는 적용되지 않는다.
- A.5 Released Records and Human Evaluation: 공개된 benchmark record는 configuration, source case와 discipline, evaluation status, aggregate score, 일곱 개 차원 점수를 식별하여 보고된 행을 감사하고 재집계할 수 있게 한다.Archive는 fresh evaluation과 reaggregated record를 구분한다.
- A.5 Released Records and Human Evaluation: 인간 연구는 논문별 여섯 개의 모든 비순서 시스템 쌍을 포함하는 system-blind pairwise comparison을 사용하며, 균형 잡힌 제시와 보존된 non-skip decision에 대한 Bradley–Terry 분석을 수행한다.완전한 roster는 동일한 논문 커버리지와 연결된 비교 그래프를 제공하며, tie는 절반의 승리로 계산하고 불확실성은 2,000개의 교차 paper–reviewer bootstrap resample을 사용한다.
- A.6 Additional AutoDesign Poster Demonstrations: 추가 자료는 세 시스템 간 matched poster comparison과 LongCat-Next, NeRF, Attention Is All You Need, DDPM 논문에서 렌더링한 네 가지 AutoDesign demonstration을 제공한다.Matched comparison은 동일한 소스 논문과 공통 generation prompt를 사용한다.