AutoDesign:让 Agent 自己改自己的 harness,40 分钟把论文变成会议海报

简介: AutoDesign提出“元挽具优化”,将Agent的prompt、工具、流程等系统组件作为自动进化对象:外层循环优化系统,内层循环生成作品,模型权重不变。在论文转海报任务中,超越Claude Design 7.45分,验证了“弱模型+强系统”的高性价比路径。(239字)

氛围图

💡 一句话总结:AutoDesign 把「围绕模型的那套系统」(prompt、工具、流程)变成可被 Agent 自动优化的对象——外层循环改系统、内层循环出作品,模型权重一动不动。落在论文转海报任务上,它超了商业系统 Claude Design 7.45 分。做 Agent 开发的人,这篇的「怎么让系统自己进化」可以直接抄作业。

导语:你也是「harness 手工人」吗?

先问一个可能戳到你的问题:过去一年里,你有多少个晚上是在改 system prompt、调工具描述、往 agent 流程里塞一个「先反思再执行」的步骤?

对,就是那种活。模型是现成的(Claude、GPT、开源模型随便挑),真正吃掉你时间的是围绕模型搭的那套东西——上下文怎么组织、给哪些工具、循环跑几轮、失败怎么兜底。这套东西有个正式名字:harness(直译"挽具",就是套在马身上控制方向的那套装备——在 Agent 语境里指围绕模型的完整脚手架系统)。Claude Code、Codex CLI 这些 coding agent,本质都是"强模型 + 精心打磨的 harness"。

痛点在于:harness 的迭代至今仍是纯手工业。你跑一遍任务、看看哪里翻车、回去改一版 prompt 或流程,再来一遍。你从失败里学到的经验,全在你脑子里——换个任务、换个同事,归零。而人类设计师恰恰相反:他们把每次改稿的教训沉淀成方法论,越做越快。

这篇论文(美团联合 MBZUAI、清华、北大等多家机构的 arXiv 2608.13560)干的事就一句话:把 harness 手工迭代这个环节,也交给 Agent 自动化

想自己动手试?

🎯 这篇论文到底想解决什么问题?

论文选的试验场是「论文转学术海报」:把一篇几十页的 PDF 压成一张信息密度极高、还要好看能讲的会议海报。这个任务做 AI 的人都不陌生——deadline 前一周,每个组里总有倒霉蛋在 PowerPoint 里对齐文本框。

为什么选它?因为这是个典型的长程 agentic 任务:要抽取论文里的关键证据、决定放哪几张图、排版、检查溢出、反复修——每一步都可能翻车,翻车了还得知道改哪。现有系统(Paper2Poster、PosterGen 这类)已经能走「生成 → 批评 → 修改」的循环,但它们的反馈只用来修当前这张海报。

论文的核心观察是:这中间缺一层。修好一张海报,系统本身没有任何长进;下次换篇论文,它从同样的起点重新犯错。反馈应该被用来改进"生成海报的那套系统",而不只是那张海报——这就是标题里的 Meta-Harness Optimization(元挽具优化:用一个更高层的系统去优化 harness 本身)。

为了验证这事靠谱,团队还顺手造了个评测基准 PosterBench:100 篇横跨 AI、生物医学、气候、经济、物理五个学科的论文,从忠实度、覆盖度、信息密度、视觉证据、布局、可读性、美学七个维度打分(每维 0–10,越高越好),规则算法和 VLM 评委混合判卷。自己造裁判这事后面理性看待一节再聊。

🛠️ 它的思路是什么?

整套系统是两个套着的循环:内层出作品,外层改系统

先说内层。初始状态极简,只有两个角色:designer 负责生成和修改作品,critic 负责挑毛病给反馈,两者交替,直到作品过关。这个循环你可能在各种 self-refine 工作流里见过,不新鲜。新鲜的是外层——它每轮干四件事:

  1. 🎬 Rollout(完整跑一遍):让当前 harness 在一批训练论文上各生成一张海报,记下全过程轨迹和得分。
  2. 📊 评估:一个用人类标注的参考海报构造出来的评估器打分,规则检查 + VLM 判断混合。
  3. ✏️ 提出更新:一个 coding agent 先当"架构师"——派子 agent 分析轨迹,找出反复出现的失败模式(比如"图表总是溢出边界"),形成修改计划;再当"程序员"——动手改 harness 的代码。
  4. 🚦 验收门控:改完的 harness 必须在训练集上变好、且在独立的开发集上不退步,才被接受;否则回滚。

AutoDesign 总览
图说:内层循环负责"作品改到好",外层循环负责"系统改到强"——两层各管各的优化对象

几个设计细节我觉得相当老练,值得单独说:

  • 每次只许改一个组件。论文把 harness 拆成五个组件(上下文与记忆 / 工具与规范 / 执行运行时 / 编排 / 评估与反馈),外层每轮只能动其中一个。为什么?如果一轮同时改了 prompt、工具和流程,效果变好了你也不知道该谢谁——单组件更新让每次收益都能归因。
  • 开发集对优化器保密。开发集(dev set,用来验证有没有过拟合的独立数据)的分数只进验收门控,从不给提修改建议的 agent 看。这是个很干净的"盲评"设计——优化器想讨好开发集都没门路。
  • 全程记账。每一轮改了什么、为什么、接受还是拒绝,全部写进优化记录,还带代码快照。被拒绝的尝试也是资产:下一轮看到"这招试过没用",就不会重复踩坑。

外层循环
图说:外层每轮四步——跑任务、评估、提单组件更新、门控验收,可全程无人干预

那外层优化跑出来的最终产物长什么样?论文叫它 DesignHarness,一条四阶段流水线:先做论文摄取(抽大纲、关键段落、图表,每个元素都带源位置可回溯),然后由一个 coding agent 型 designer 生成和修订——作品全程是可编辑的 HTML 而不是图片,修一处溢出只需改局部代码,不用整张重画;再过双 critic(确定性规则校验管"资产缺失、溢出重叠"这类硬伤,VLM 管"好不好看"这类感知判断),最多修 12 轮;最后定稿导出。

DesignHarness 架构
图说:演化出的最终系统——规则校验器加 VLM 视觉 critic 双保险,产出的海报保持可编辑、可溯源

值得一提的是,这套演化真不是摆设:跑了 7 天,224 个子 agent 参与,累计 54 次 harness 更新被接受。下图是一条真实的优化轨迹——自主优化先爬升后进入平台期,卡住了;这时人类给一句方向性指导,搜索被重定向,分数又上一个台阶。所以它支持人在环,但不是必须。

优化轨迹
图说:单篇论文的得分随外层迭代的变化——自主优化到平台期后,一句人类指导让曲线再度抬头

📈 效果到底怎么样?

数字挑三个最有说服力的。

第一,主榜第一,超商业系统。 PosterBench 100 篇主榜上,AutoDesign 拿 78.32 分,超过 Anthropic 的商业设计系统 Claude Design 7.45 分,也超过 OpenDesign 8.87 分。更狠的对照是裸 Claude Code 只有 70.01——同一个模型、同一个 coding agent,套上演化出来的 harness,直接多拿 8 分多。

第二,也是最打动我的:七个配置,全部提升。 固定模型和 coding agent、只加 DesignHarness,7 组配置无一例外变好:

配置(模型 × coding agent) 裸 agent +DesignHarness 增益
GPT-5.5 × Codex 75.87 81.46 +5.59
Claude 4.8 × Claude Code 69.55 74.56 +5.01
Kimi K2.7 × Claude Code 57.20 70.12 +12.92
DeepSeek V4 Pro × Claude Code 34.73 54.29 +19.56

增益对比
图说:七组配置的增益对比——越弱的模型,被 harness 拉得越多

看出规律了吗?基线越弱,增益越大。DeepSeek V4 Pro 裸奔只有 34.73,套上 harness 直接 +19.56;而本来就强的 GPT-5.5 只多 5.59。我倾向于这么读:harness 装载的是"别溢出、别贴正文截图、信息密度要够"这类纪律性知识,弱模型缺的恰恰是这个。当然硬币另一面是——harness 补短板可以,补不出模型没有的天花板。

第三,便宜到离谱的端到端成本。 一次完整生成:253 次工具调用、11 轮编辑、40 分钟、不到 3 美元,几乎无人工干预。用国产 LongCat 2.0 的话,一张海报约 0.27 美元。团队还让 AutoDesign 给自己的论文做了张海报当 demo——自己吃自己的狗粮,这个我服。

自产海报
图说:AutoDesign 给自己论文生成的海报——40 分钟、253 次工具调用的产物

修订轨迹
图说:一次生成的修订过程——critic 圈出失败区域,修改只动那一块,得分从 0.36 修到 0.78

盲测人评也给力:11 个人在不知道系统身份的情况下两两对比海报,933 个有效判断里,AutoDesign 的 Bradley–Terry 偏好估计(一种把两两胜负换算成"击败随机对手概率"的模型,越高越好)64.0%,四个参评系统里最高。

💡 为什么你要关心?

就算你不做海报生成,这篇的可迁移资产也不少:

  • 🔁 「harness 当优化目标」可以直接搬到你的 Agent 项目。你手头的 skill 配置、MCP 工具编排、multi-agent 流程,本质都是 harness。AutoDesign 给出的配方:单组件有界更新 + 训练/开发双集盲评门控 + 全程优化记录——三件套拿来就能套在你自己的 agent 迭代上,把"人肉 A/B 测 prompt"升级成"自动演化 + 门控验收"。
  • 💰 弱模型 + 强 harness 是条性价比路线。表格里 Seed 2.1 Pro 以 27% 的成本拿到 GPT-5.5 约 88% 的分数。预算敏感的团队,与其追最贵的模型,不如先投资一层好 harness——这份数据就是证据。
  • 🧪 评测协议值得抄。"规则算法管硬指标 + rubric VLM 管感知指标 + record-level ceiling(严重翻车直接封顶压分)"这套混合判卷,以及"分差多大才可信"的校准分析(分差 0–3 分时人机一致率只有 51.9%,基本等于瞎猜;20 分以上才到 74.4%),做任何 AIGC 评测的人都该看看。

PosterBench 评估协议
图说:PosterBench 的判卷流水线——左边规则算法查空间/OCR/数值接地/渲染完整性,右边 VLM 评委看视觉证据、布局、可读性、美学

🤔 理性看待

几个该打问号的地方,朋友式提醒:

  • 自己训、自己考。优化期的评估器和最终评测 PosterBench 虽然流程上分离,但共享同一套七维质量词汇表,且同团队构建。harness 演化优化的恰恰是"在这套质量观下得分高"。盲测人评是目前最强的外部校验(AutoDesign 确实第一),但人机相关性只有 r=0.34——"超 7.45 分"的人类感知差距,大概率比数字小。
  • 赢的维度耐人寻味。AutoDesign 的增益集中在信息密度、可读性这些可规则化判定的维度;在最"人类"的美学(5.59)和视觉证据(5.97)上,反而输给 Claude Design(7.36 / 7.62)。学到的可能更多是纪律,而非论文宣称的"设计先验"——这是我的解读,不是论文结论。
  • 小样本方差。三条受控消融 track 都基于只有 10 篇论文的 mini 子集,绝对排名的外推要留个心眼;外层优化 7 天的算力成本论文也没报。

尾声

抛开数字,这篇论文真正立住的判断是:模型能力之外,"围绕模型的系统"是一等公民的优化对象——而且这个优化过程本身可以自动化、可以记账、可以门控。你今晚还在手搓的那份 prompt,可能就是下一个被自动演化的对象。

作者:lusca
版本:lusca-paper-blog v1.6.0
出处:https://github.com/yjmm10/lusca-skill/tree/main/skills/lusca-paper-blog

相关文章
|
6天前
|
人工智能 安全 API
阿里云Token Plan 个人版Quick Start:最低39 元/月,主流AI工具直接接入,Credits 统一计量
阿里云百炼 Token Plan 个人版是面向个人开发者的 AI 大模型订阅服务,采用 Credits 统一计量,支持在 Claude Code、Cursor、Qwen Code 等主流 AI 编程和智能体工具中使用。目前提供 Lite、Standard、Pro 三档套餐及用量包,限时价格分别为 39 元/月、139 元/月、499 元/月。
阿里云Token Plan 个人版Quick Start:最低39 元/月,主流AI工具直接接入,Credits 统一计量
|
22天前
|
Kubernetes 应用服务中间件 nginx
Kubernetes (K8s) 从入门到实战:命名空间、Pod、Controller、Service,图文并茂
本文是K8s初学者的实战笔记,系统讲解命名空间(隔离资源、环境划分、权限控制)、Pod(最小调度单元、多容器、标签、生命周期、探针、资源限制)、控制器(Deployment灰度发布/回滚、StatefulSet/Job/DaemonSet)及Service(ClusterIP/NodePort、负载均衡、多端口)等核心概念与操作,附带丰富命令示例和原理剖析。
Kubernetes (K8s) 从入门到实战:命名空间、Pod、Controller、Service,图文并茂
|
3月前
|
人工智能 自然语言处理 测试技术
告别手动画图:用自然语言生成可直接发布的 SVG+PNG 技术图
`fireworks-tech-graph`它把技术图这件事,从一次性手工劳动,变成了一种可以沉淀、复用、批量生成的 Skill 能力。在 AI/Agent 相关内容越来越多的背景下,这是一个很值得试一下的项目。
436 10
告别手动画图:用自然语言生成可直接发布的 SVG+PNG 技术图
|
3月前
|
人工智能 Kubernetes 安全
【重磅】 Blade AI 自主韧性测试智能体正式开源
本次阿里云峰会上发布韧性测试智能体 Blade AI:用自然语言一句话自动完成系统韧性测试全流程。
672 20
|
3月前
|
人工智能 监控 前端开发
学习AI Agent编程-第二天-LangGraph ReAct模式实现
本文介绍了LangChain中ReAct(推理-行动)模式的实践应用:通过“会议室申请”流程,演示LLM如何循环执行“决策→调用工具→评估结果→调整策略”,实现多步任务自动化。代码涵盖流程定义、工具函数与多轮会话测试,验证了其在空闲检查、报备审批、异常处理等场景的可靠性。(239字)
448 7
学习AI Agent编程-第二天-LangGraph ReAct模式实现
|
3月前
|
数据采集 人工智能 分布式计算
多Agent集群中的"情报官"设计:为什么系统需要一个RDD
在多Agent系统中,信息采集环节的失误往往是级联错误的根源。本文从行业实践和学术研究两个维度,论证了专职情报采集Agent的必要性,并详细解析了枢衡RDD(资源探测)的五大架构设计原则,包括与CAD的对抗性协作机制等。最后提供了一套可落地的自检清单,帮助开发者判断自己的Agent集群是否需要引入专职情报官角色。
|
3月前
|
人工智能 自然语言处理 安全
多AI聚合的五个常见误区:你以为的“交叉验证”可能只是“重复犯错”
本文剖析多AI聚合系统五大常见误区:盲目追求数量、迷信“少数服从多数”、误信数据天然独立、将分歧视为缺陷、幻想彻底消除幻觉。强调模型独立性、分歧价值与用户主动判别才是发挥聚合效能的关键。
335 5
|
3月前
|
机器学习/深度学习 自然语言处理 C++
大模型应用:大模型实测对比:1.8B vs 6B,本地部署的极限拉扯与真实体感.119
本文对比Qwen1.5-1.8B与ChatGLM2-6B两大中文大模型:前者轻量易部署,CPU即可运行,代码简洁,但易幻觉、指令遵循弱;后者参数量大,中文理解与逻辑更强,但需GPU、加载复杂。二者代表“小而美”与“大而全”的典型路径。
573 2
大模型应用:大模型实测对比:1.8B vs 6B,本地部署的极限拉扯与真实体感.119
|
4月前
|
人工智能 自然语言处理 供应链
为什么 MCP 在协议层会有 prompt injection的问题:工具描述如何劫持 agent 上下文
MCP(Model Context Protocol)虽成AI Agent主流集成标准,但其将工具描述全量注入上下文的设计,导致“Context Poisoning”——恶意指令可借工具元数据污染LLM推理。OWASP将其列为LLM应用头号漏洞,2025年已致超10万站点遭袭。根本风险在于协议层信任模型缺失,非清洗不可用。
338 12
为什么 MCP 在协议层会有 prompt injection的问题:工具描述如何劫持 agent 上下文

热门文章

最新文章