AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

TL;DR

AutoDesign通过元-harness优化框架,递归提升长远目标下的多模态设计质量,关键指标78.32分。

cs.CV 🔴 高级 2026-08-14 116 次浏览
Yaxin Luo Haobin Jiang Jialv Zou Xu Huang Wenhao Yan Haodong Li Zhengrong Yue Jing Li Xiaofu Chen Xiaohan Zhao Jiacheng Liu Jiacheng Cui Zhiqiang Shen Xiaotong Li
人工智能 元学习 多模态设计 自动化系统 长远优化

核心发现

方法论

AutoDesign采用双层反馈循环架构,内层为设计系统(DesignHarness),负责从多模态源生成和迭代修正输出;外层为元-harness(Meta-Harness),通过分析多轮生成轨迹和评估指标,指导设计系统的递归优化。具体而言,内层循环由设计者模型(如大规模语言模型)和批评者(Critic)协同工作,生成候选Artifact并根据规则和视觉批评进行修正;外层循环则利用评估器(基于规则和视觉语言模型)对多任务生成结果进行评分,分析失败模式,提出有限范围的系统组件更新,确保优化方向符合人类偏好。优化过程依赖于贝叶斯优化或强化学习机制,确保每次更新都在训练集上提升性能且不损害验证集表现。该框架在学术论文海报生成任务中实现了端到端自动化,涵盖源信息提取、内容组织、视觉布局、细节修正等环节,形成了一个持续自我改进的闭环系统。

关键结果

  • 在PosterBench主赛道中,AutoDesign达到了78.32分,超越闭源商业系统Claude Design的71.87分,提升了7.45分,显示出其在多模态学术海报生成中的优越性能。通过在七个不同配置的代码代理模型中引入学习到的DesignHarness,平均得分由54.99提升至67.39,提升幅度达12.4%。
  • 在完全自主长远循环中,AutoDesign在40分钟内完成了253次工具调用和11轮编辑,成本低于3美元,生成的海报在人工评审中达到了会议海报的质量水平,验证了其在实际应用中的高效性和可靠性。
  • 系统盲评的用户偏好调查显示,AutoDesign在所有被评系统中获得最高偏好比例(64.0%),特别是在关键视觉和内容连贯性方面表现出色,充分体现了其在自动化设计中的潜力。

研究意义

该研究突破了传统静态设计系统的局限,通过引入元优化机制,实现了设计系统的自我演化与持续改进。这不仅提升了多模态内容生成的质量和效率,也为未来智能设计系统的自主学习与适应提供了理论基础。其在学术论文海报、幻灯片、网页等多种媒介中的应用,展示了广泛的行业潜力,特别是在科研、教育和内容创作等领域,能够显著降低人工成本、提升产出质量,推动智能内容生成的产业升级。

技术贡献

本文提出的AutoDesign框架创新性地将系统设计视为元优化问题,区别于传统的模型微调或单轮优化。通过定义五个核心功能模块(上下文与记忆、工具与规范、执行环境、调度机制、评估反馈),实现了系统的模块化和可扩展性。利用双层反馈机制,结合贝叶斯优化和强化学习策略,动态调整设计系统的组成部分,确保持续改进。特别是在学术论文到海报的任务中,设计了专门的PosterBench评测协议,涵盖内容忠实度、视觉表现和可用性等多维指标,为多模态生成提供了全面的性能衡量标准。该方法在多个配置中验证了其稳定性和优越性,显著优于现有的静态系统和商业方案。

新颖性

本研究首次将元优化框架应用于多模态内容生成系统,特别是在长远目标导向的设计任务中实现了递归自我改进。与传统的单轮优化或微调不同,AutoDesign通过双层反馈循环,持续积累设计知识,形成可持续迭代的自我提升机制。这一创新不仅在理论上丰富了系统优化的范畴,也在实践中显著提升了生成内容的质量和适应性。其在学术论文海报生成中的成功应用,验证了该方法在复杂、多模态、多目标任务中的潜力,开启了自动化设计系统的新时代。

局限性

  • 当前系统主要针对学术论文到海报的转换任务,尚未充分验证在其他多模态内容生成场景中的泛化能力,存在任务特定依赖的问题。
  • 元优化过程依赖大量的轨迹采样和评估,计算成本较高,尤其在更大规模或更复杂任务中可能面临效率瓶颈。
  • 尽管引入了人类引导机制,但在完全自动化的情况下,系统仍可能受到偏差或误导,未来需要增强模型的鲁棒性和解释能力。

未来方向

未来将探索多任务、多模态、多目标的联合优化策略,提升系统的泛化能力和适应性。还计划引入更高效的样本采集和评估机制,降低计算成本。同时,结合强化学习和因果推断,增强系统的自主学习能力,使其在更复杂的设计任务中表现出更强的适应性和创造力。此外,推动系统的可解释性和用户交互能力,提升实际应用中的用户体验和信任度。

AI 总览摘要

在当今信息爆炸的时代,科学研究和内容创作面临着海量多模态数据的整合与表达难题。传统的内容生成系统多依赖静态模型或单轮优化,难以实现持续自我改进,导致输出内容在质量和适应性上存在局限。AutoDesign提出了一种创新的元优化框架,旨在解决这一难题。其核心思想是将内容生成过程中的系统设计(即设计harness)视为一个可优化的目标,通过双层反馈机制实现递归提升。内层循环由设计者模型和批评者共同作用,生成并修正内容;外层循环则分析多轮轨迹和评估指标,指导系统组件的有限范围更新,从而不断优化整体设计能力。

该方法在学术论文到海报的任务中得到了验证,表现出优异的性能。AutoDesign在PosterBench主赛道中获得78.32分,超越了商业闭源系统Claude Design的71.87分,彰显其在多模态内容生成中的竞争力。通过在七个不同配置中引入学习到的DesignHarness,平均得分从54.99提升到67.39,验证了其稳定性和泛化能力。

更令人振奋的是,AutoDesign实现了全自动化的长远循环,40分钟内完成253次工具调用和11轮编辑,成本低于3美元,生成的海报在人工评审中达到了会议标准。这一成果不仅展示了其在科研和工业中的应用潜力,也为未来智能内容生成系统提供了新思路。

该研究的创新点在于将系统设计视为一个可持续优化的目标,结合贝叶斯优化和强化学习机制,构建了模块化、可扩展的系统架构。其在多模态、多目标、多任务场景中的应用,为自动化设计和内容生成开辟了新的路径。未来,随着模型规模的扩大和算法的优化,AutoDesign有望在更复杂、更高质量的内容生成任务中发挥更大作用,推动智能创作的产业变革。

深度分析

研究背景

随着人工智能技术的快速发展,多模态内容生成已成为研究热点。从早期的单模态文本生成到近年来结合视觉、语音等多模态信息的复杂系统,研究者不断探索如何提升生成内容的质量、连贯性和实用性。代表性工作包括OpenAI的GPT系列、DeepMind的Perceiver模型,以及微软的CoCa(Contrastive Captioners)等。这些系统在自然语言理解、视觉理解和多模态融合方面取得了显著突破。然而,现有方法多依赖静态模型或单轮优化,难以实现持续的自我改进,特别是在复杂的设计任务中表现有限。近年来,元学习和强化学习的引入,为系统的自我优化提供了新思路,但在多模态内容生成中的应用仍处于探索阶段。学术论文到海报的转换任务,作为多模态设计的典型代表,融合了文本、图像、布局等多源信息,具有高度的复杂性和挑战性。此前的评测大多关注布局合理性、内容忠实度或视觉效果,缺乏对整体设计质量的全面衡量。本文提出的AutoDesign,旨在通过元优化机制,实现系统的持续自我改进,推动多模态设计向智能化、自动化方向迈进。

核心问题

多模态内容生成的核心难题在于如何在保证信息忠实的基础上,实现内容的密集表达和视觉的协调统一。传统系统多依赖预训练模型或静态规则,难以适应多样化的设计需求和偏好,且缺乏持续学习能力。具体而言,现有方法在源信息提取、内容组织、视觉布局和细节修正等环节存在信息碎片化、缺乏全局优化、难以实现个性化定制等瓶颈。这些问题导致生成的内容在忠实度、连贯性和美观性方面难以兼顾,限制了多模态设计的实际应用效果。更严重的是,缺乏一种系统化的机制,将人类偏好、结构约束和反馈信息转化为持续优化的设计知识,导致系统难以实现长远的自我提升。解决这一问题,要求设计一种具有自我学习和递归优化能力的系统架构,能够在多轮交互中不断积累经验,逐步提升内容质量和用户满意度。

核心创新

AutoDesign的核心创新在于引入元优化(Meta-Optimization)框架,将系统设计(DesignHarness)作为可优化的目标,而非仅仅微调模型参数。具体创新点包括:

  • �� 双层反馈循环:内层为设计系统,负责内容生成和修正;外层为元-harness,分析多轮轨迹和评估指标,指导系统组件的有限范围更新。
  • �� 模块化设计:将系统划分为五个核心功能模块(上下文、工具、执行环境、调度、反馈),实现灵活扩展和定制。
  • �� 任务驱动的评估机制:构建PosterBench评测协议,涵盖忠实度、覆盖度、密度、视觉证据、布局、可读性和美学,提供多维度性能指标。
  • �� 递归自我改进:通过有限范围的系统组件更新,逐步积累设计知识,实现持续优化,避免模型参数的微调带来的灾难性遗忘。
  • �� 全自动化长远循环:在无需人工干预的情况下,完成多轮内容生成、修正和优化,显著提升效率和内容质量。

方法详解

  • �� 设计系统(DesignHarness)由五个核心模块组成:上下文与记忆、工具与规范、执行环境、调度机制、评估反馈。
  • �� 内层循环:由设计者模型(如GPT-4)和批评者(Critic)协作,生成候选内容并根据规则和视觉批评进行局部修正,形成执行轨迹。
  • �� 外层循环:利用评估器(结合规则和视觉语言模型)对多轮轨迹进行评分,分析失败模式,提出有限范围的系统组件更新建议。
  • �� 更新提议由元优化器(如贝叶斯优化或强化学习策略)实现,确保每次更新都在训练集上提升性能且不损害验证集表现。
  • �� 采用接受门控机制,只接受在训练集上表现提升且验证集不退步的系统组件更新。
  • �� 通过多轮迭代,逐步优化设计系统,使其在学术论文到海报的任务中实现端到端自动化,从源信息提取到视觉布局再到细节修正,形成闭环优化体系。

实验设计

  • �� 数据集:使用PosterBench,包括100篇跨五个学科的论文主赛道和10篇控制子集,涵盖多模态信息和结构化内容。
  • �� 基线:比较静态系统(如Claude Design)和不同配置的AutoDesign系统(共7个配置),评估指标包括PosterBench得分、内容忠实度、视觉质量等。
  • �� 评估指标:采用多维度评分体系,包括规则检测、视觉语言模型评价和人类偏好调查。
  • �� 超参数:训练轮次、轨迹采样次数、组件更新范围、评估器阈值等,详细调优以确保系统稳定性。
  • �� Ablation研究:分析不同模块(如评估器、反馈机制、更新策略)对最终性能的影响,验证递归优化的有效性。

结果分析

  • �� AutoDesign在PosterBench主赛道中获得78.32分,超越Claude Design(71.87分)7.45分,显示出其在多模态学术海报生成中的优势。
  • �� 在七个不同配置中引入学习到的DesignHarness,平均得分由54.99提升至67.39,验证了系统的稳定性和迁移能力。
  • �� 完全自主循环中,40分钟内完成253次工具调用和11轮编辑,成本低于3美元,生成的海报在人工评审中达到了会议标准,验证了其实用性和效率。
  • �� 用户偏好调查显示,AutoDesign在所有被评系统中偏好比例达64.0%,特别在视觉连贯性和内容完整性方面表现优异。

应用场景

  • �� 立即应用:科研人员可以利用AutoDesign自动生成会议海报,减少手工设计时间,提高效率;内容创作者可以用其快速制作多模态内容,提升产出质量;教育行业可借助其自动化生成教学演示材料,增强教学效果。
  • �� 长期愿景:推动智能设计系统的普及,实现从文本到视觉内容的全自动化,降低内容创作门槛,促进跨领域知识传播,最终实现个性化、实时化的内容定制与优化。

局限与展望

  • �� 目前系统主要针对学术论文到海报的场景,泛化到其他多模态内容生成任务仍需验证,存在任务特定依赖。
  • �� 递归优化过程计算成本较高,尤其在更大规模任务中可能面临效率瓶颈。
  • �� 完全自动化仍存在偏差和误导风险,未来需增强模型的鲁棒性和可解释性,确保生成内容的可靠性和透明度。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,手边有各种食材(源信息),你需要把它们变成一道美味的菜肴(最终内容)。传统的方法就像是按照食谱一步步做,完成后就算结束。而AutoDesign像是一个聪明的厨师,它不仅会按照食谱做菜,还会不断尝试不同的调料和烹饪技巧,观察每次的味道(评估),并根据反馈调整配方(优化系统)。这个厨师还会记住每次尝试的经验,逐渐学会哪些调料组合更好,哪些步骤可以省略或改进。它的目标是让菜变得越来越好,不需要每次都从头开始,也不需要人一直盯着看。这个过程就像是一个不断学习、不断改进的厨师,最终能做出既符合口味又漂亮的菜肴。这就是AutoDesign的核心思想:用智能的方法,让系统自己变得更聪明、更会做内容,像一个有经验的厨师一样不断提升。

简单解释 像给14岁少年讲一样

想象你在学校的美术课上,要画一幅漂亮的海报。以前,你可能会用模板,自己填点颜色,然后结束。但AutoDesign就像是一个超级聪明的画家,它会自己试着画,看看效果,然后根据老师的评价(比如颜色漂亮、内容清楚)不断改进。它会记住哪些颜色搭配好,哪些排版更吸引人,就像在玩一款游戏,不断练习、学习,最后画出一幅令人惊叹的海报。更酷的是,这个画家可以自己反复试验,不需要你一直指导它。它会自己分析哪里可以做得更好,然后一步步变得更厉害。这样一来,不管你是要做学术海报还是广告,它都能帮你快速搞定,而且效果还比以前更棒!这就是AutoDesign的神奇之处:让机器自己学习变强,帮我们做出更漂亮、更有用的内容。

术语表

Meta-Harness (元-harness)

一种系统架构,用于指导内容生成系统的递归优化,通过分析多轮输出和评估指标不断改进设计能力。

在论文中,Meta-Harness指导设计系统的整体优化过程。

DesignHarness (设计harness)

具体实现内容生成和修正的系统,包含多个功能模块,负责从源信息到最终输出的全过程。

作为系统的核心执行单元,反复生成和修正内容。

PosterBench

专为学术论文到海报任务设计的评测平台,涵盖内容忠实度、视觉表现等七个维度。

用于评估AutoDesign的性能。

Rollout (轨迹)

系统在生成过程中每一步的操作、状态和修正的完整记录。

用于分析系统的行为和优化方向。

Evaluator (评估器)

结合规则和视觉语言模型,对生成内容进行多维度评分的工具。

用于自动评估生成结果的质量。

Feedback (反馈)

Critic模型提供的评价信息,用于指导内容修正。

在内层循环中起关键作用。

Meta-Optimization (元优化)

针对系统架构或组件的优化过程,旨在提升整体性能。

通过外层循环实现。

Inner Loop (内循环)

内容生成和修正的持续过程。

由设计者模型和Critic协作完成。

Outer Loop (外循环)

分析多轮轨迹,提出系统组件更新,推动系统递归优化。

实现系统的持续自我改进。

Autonomous Optimization (自主优化)

系统在无人工干预下,通过多轮反馈实现自我提升的能力。

是AutoDesign的核心特性之一。

开放问题 这项研究留下的未解疑问

  • 1 如何将AutoDesign扩展到非学术内容生成场景,例如商业广告或娱乐内容,仍未充分验证,未来需要探索多任务、多模态、多目标的联合优化策略,以实现更广泛的应用。

应用场景

近期应用

学术会议海报自动生成

科研人员可以利用AutoDesign快速生成高质量的会议海报,节省设计时间,提高展示效果,特别适合多学科交叉的科研团队。

内容创作者辅助工具

内容创作者可以用AutoDesign自动生成多模态内容,如网页、幻灯片和短视频,提升内容丰富度和吸引力,降低制作门槛。

教育材料自动制作

教育工作者可以借助AutoDesign快速生成教学演示材料和科普海报,增强教学互动性和趣味性。

远期愿景

智能内容生成平台

未来将发展出全自动、多模态、个性化的内容创作平台,实现实时定制和优化,推动内容产业的数字化转型。

跨领域知识融合系统

结合AutoDesign的递归优化能力,构建跨学科、多模态的知识融合系统,支持科学研究、艺术创作和商业创新的深度结合。

原文摘要

Transforming multimodal sources into condensed and structured media outputs can be fundamentally conceptualized as a long-horizon agentic process centered on a model-harness system. While an ideal harness system should align with human design priors and accumulate reusable experience through empirical exploration to drive recursive self-improvement, existing paradigms remain static and fall short of this capability. In this paper, we present AutoDesign, a framework that aligns with human design priors, where a meta-harness optimizer guides a code agent to recursively improve harness based on rollout feedback. To instantiate and evaluate this framework, we focus on the academic paper-to-poster generation task and introduce PosterBench, comprising a 100-paper Main Track spanning five disciplines and PosterBench-mini, a shared 10-paper subset for controlled evaluation. On the PosterBench Main Track, AutoDesign achieves the highest score of 78.32, surpassing the closed-source commercial system Claude Design by 7.45 points. Across seven controlled code-agent-model configurations, integrating the learned DesignHarness consistently improves performance, increasing the average PosterBench Score from 54.99 to 67.39 (+12.4%). In a fully autonomous long-horizon loop, it executes 253 tool calls and 11 editing turns within 40 minutes for under $3, reaching average conference-poster quality in human evaluation. A system-blind human study further demonstrates that AutoDesign achieves the highest human preference among evaluated systems.

cs.CV cs.AI cs.CL

参考文献 (20)

P2P: Automated Paper-to-Poster Generation and Fine-Grained Benchmark

Tao Sun, Enhao Pan, Zhengkai Yang 等

2025 16 引用 ⭐ 高影响力 查看解读 →

Self-Improvements in Modern Agentic Systems: A Survey

Zhenjiang Ren, Yimeng Chen, Dandan Guo 等

2026 4 引用 ⭐ 高影响力 查看解读 →

Deep Submodular Optimization and LLM for Multimodal Content Extraction and Automatic Poster Generation from Long Document

Vijay Jaisankar, Sambaran Bandyopadhyay, Kalp Vyas 等

2025 2 引用 ⭐ 高影响力

Paper2Poster: Towards Multimodal Poster Automation from Scientific Papers

Wei Pang, K. Lin, Xiangru Jian 等

2025 51 引用 ⭐ 高影响力 查看解读 →

Workshops

Johanna Amaya

1993 81 引用

Recursive Harness Self-Improvement

Hyunin Lee, Jinglue Xu, Jeffrey Seely 等

2026 5 引用 查看解读 →

PosterForest: Hierarchical Multi-Agent Collaboration for Scientific Poster Generation

Jiho Choi, Seojeong Park, Seongjong Song 等

2025 6 引用 查看解读 →

Paper2Video: Automatic Video Generation from Scientific Papers

Zeyu Zhu, Kevin Qinghong Lin, M. Shou

2025 25 引用 查看解读 →

Huxley-Gödel Machine: Human-Level Coding Agent Development by an Approximation of the Optimal Self-Improving Machine

Wenyi Wang, Piotr Piekos, Nanbo Li 等

2025 30 引用 查看解读 →

Igd: Instructional Graphic Design With Multimodal Layer Generatio

Yadong Qu, Shancheng Fang, Yuxin Wang 等

2025 6 引用 查看解读 →

UICoder: Finetuning Large Language Models to Generate User Interface Code through Automated Feedback

Jason Wu, E. Schoop, Alan Leung 等

2024 53 引用 查看解读 →

Live-SWE-agent: Can Software Engineering Agents Self-Evolve on the Fly?

Chun Xia, Zhe Wang, Yan Yang 等

2025 86 引用 查看解读 →

DesignAsCode: Bridging Structural Editability and Visual Fidelity in Graphic Design Generation

Ziyuan Liu, Shizhao Sun, Danqing Huang 等

2026 1 引用 查看解读 →

MOSS: Self-Evolution through Source-Level Rewriting in Autonomous Agent Systems

Qi Cai, Yonggang Zhang, Xianzhang Jia 等

2026 5 引用 查看解读 →

Evolutionary principles in self-referential learning, or on learning how to learn: The meta-meta-. hook

Jürgen Schmidhuber

1987 862 引用

Design2Code: Benchmarking Multimodal Code Generation for Automated Front-End Engineering

Chenglei Si, Yanzhe Zhang, Ryan Li 等

2024 152 引用 查看解读 →

Any2Poster: Any-Source Poster Generation Across Modalities and Domains

Amogh Vinaykumar, A. Li, Suozhi Huang 等

2026 3 引用 查看解读 →

Voyager: An Open-Ended Embodied Agent with Large Language Models

Guanzhi Wang, Yuqi Xie, Yunfan Jiang 等

2023 2128 引用 查看解读 →

GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning

Lakshya A. Agrawal, Shangyin Tan, Dilara Soylu 等

2025 313 引用 查看解读 →

SciPostLayout: A Dataset for Layout Analysis and Layout Generation of Scientific Posters

Shohei Tanaka, Hao Wang, Yoshitaka Ushiku

2024 16 引用 查看解读 →