AutoDesign:让 Agent 自己改自己的 harness,40 分钟把论文变成会议海报

简介: AutoDesign提出“元挽具优化”,将Agent的prompt、工具、流程等系统组件作为自动进化对象:外层循环优化系统,内层循环生成作品,模型权重不变。在论文转海报任务中,超越Claude Design 7.45分,验证了“弱模型+强系统”的高性价比路径。(239字)

氛围图

💡 一句话总结:AutoDesign 把「围绕模型的那套系统」(prompt、工具、流程)变成可被 Agent 自动优化的对象——外层循环改系统、内层循环出作品,模型权重一动不动。落在论文转海报任务上,它超了商业系统 Claude Design 7.45 分。做 Agent 开发的人,这篇的「怎么让系统自己进化」可以直接抄作业。

导语:你也是「harness 手工人」吗?

先问一个可能戳到你的问题:过去一年里,你有多少个晚上是在改 system prompt、调工具描述、往 agent 流程里塞一个「先反思再执行」的步骤?

对,就是那种活。模型是现成的(Claude、GPT、开源模型随便挑),真正吃掉你时间的是围绕模型搭的那套东西——上下文怎么组织、给哪些工具、循环跑几轮、失败怎么兜底。这套东西有个正式名字:harness(直译"挽具",就是套在马身上控制方向的那套装备——在 Agent 语境里指围绕模型的完整脚手架系统)。Claude Code、Codex CLI 这些 coding agent,本质都是"强模型 + 精心打磨的 harness"。

痛点在于:harness 的迭代至今仍是纯手工业。你跑一遍任务、看看哪里翻车、回去改一版 prompt 或流程,再来一遍。你从失败里学到的经验,全在你脑子里——换个任务、换个同事,归零。而人类设计师恰恰相反:他们把每次改稿的教训沉淀成方法论,越做越快。

这篇论文(美团联合 MBZUAI、清华、北大等多家机构的 arXiv 2608.13560)干的事就一句话:把 harness 手工迭代这个环节,也交给 Agent 自动化

想自己动手试?

🎯 这篇论文到底想解决什么问题?

论文选的试验场是「论文转学术海报」:把一篇几十页的 PDF 压成一张信息密度极高、还要好看能讲的会议海报。这个任务做 AI 的人都不陌生——deadline 前一周,每个组里总有倒霉蛋在 PowerPoint 里对齐文本框。

为什么选它?因为这是个典型的长程 agentic 任务:要抽取论文里的关键证据、决定放哪几张图、排版、检查溢出、反复修——每一步都可能翻车,翻车了还得知道改哪。现有系统(Paper2Poster、PosterGen 这类)已经能走「生成 → 批评 → 修改」的循环,但它们的反馈只用来修当前这张海报。

论文的核心观察是:这中间缺一层。修好一张海报,系统本身没有任何长进;下次换篇论文,它从同样的起点重新犯错。反馈应该被用来改进"生成海报的那套系统",而不只是那张海报——这就是标题里的 Meta-Harness Optimization(元挽具优化:用一个更高层的系统去优化 harness 本身)。

为了验证这事靠谱,团队还顺手造了个评测基准 PosterBench:100 篇横跨 AI、生物医学、气候、经济、物理五个学科的论文,从忠实度、覆盖度、信息密度、视觉证据、布局、可读性、美学七个维度打分(每维 0–10,越高越好),规则算法和 VLM 评委混合判卷。自己造裁判这事后面理性看待一节再聊。

🛠️ 它的思路是什么?

整套系统是两个套着的循环:内层出作品,外层改系统

先说内层。初始状态极简,只有两个角色:designer 负责生成和修改作品,critic 负责挑毛病给反馈,两者交替,直到作品过关。这个循环你可能在各种 self-refine 工作流里见过,不新鲜。新鲜的是外层——它每轮干四件事:

  1. 🎬 Rollout(完整跑一遍):让当前 harness 在一批训练论文上各生成一张海报,记下全过程轨迹和得分。
  2. 📊 评估:一个用人类标注的参考海报构造出来的评估器打分,规则检查 + VLM 判断混合。
  3. ✏️ 提出更新:一个 coding agent 先当"架构师"——派子 agent 分析轨迹,找出反复出现的失败模式(比如"图表总是溢出边界"),形成修改计划;再当"程序员"——动手改 harness 的代码。
  4. 🚦 验收门控:改完的 harness 必须在训练集上变好、且在独立的开发集上不退步,才被接受;否则回滚。

AutoDesign 总览
图说:内层循环负责"作品改到好",外层循环负责"系统改到强"——两层各管各的优化对象

几个设计细节我觉得相当老练,值得单独说:

  • 每次只许改一个组件。论文把 harness 拆成五个组件(上下文与记忆 / 工具与规范 / 执行运行时 / 编排 / 评估与反馈),外层每轮只能动其中一个。为什么?如果一轮同时改了 prompt、工具和流程,效果变好了你也不知道该谢谁——单组件更新让每次收益都能归因。
  • 开发集对优化器保密。开发集(dev set,用来验证有没有过拟合的独立数据)的分数只进验收门控,从不给提修改建议的 agent 看。这是个很干净的"盲评"设计——优化器想讨好开发集都没门路。
  • 全程记账。每一轮改了什么、为什么、接受还是拒绝,全部写进优化记录,还带代码快照。被拒绝的尝试也是资产:下一轮看到"这招试过没用",就不会重复踩坑。

外层循环
图说:外层每轮四步——跑任务、评估、提单组件更新、门控验收,可全程无人干预

那外层优化跑出来的最终产物长什么样?论文叫它 DesignHarness,一条四阶段流水线:先做论文摄取(抽大纲、关键段落、图表,每个元素都带源位置可回溯),然后由一个 coding agent 型 designer 生成和修订——作品全程是可编辑的 HTML 而不是图片,修一处溢出只需改局部代码,不用整张重画;再过双 critic(确定性规则校验管"资产缺失、溢出重叠"这类硬伤,VLM 管"好不好看"这类感知判断),最多修 12 轮;最后定稿导出。

DesignHarness 架构
图说:演化出的最终系统——规则校验器加 VLM 视觉 critic 双保险,产出的海报保持可编辑、可溯源

值得一提的是,这套演化真不是摆设:跑了 7 天,224 个子 agent 参与,累计 54 次 harness 更新被接受。下图是一条真实的优化轨迹——自主优化先爬升后进入平台期,卡住了;这时人类给一句方向性指导,搜索被重定向,分数又上一个台阶。所以它支持人在环,但不是必须。

优化轨迹
图说:单篇论文的得分随外层迭代的变化——自主优化到平台期后,一句人类指导让曲线再度抬头

📈 效果到底怎么样?

数字挑三个最有说服力的。

第一,主榜第一,超商业系统。 PosterBench 100 篇主榜上,AutoDesign 拿 78.32 分,超过 Anthropic 的商业设计系统 Claude Design 7.45 分,也超过 OpenDesign 8.87 分。更狠的对照是裸 Claude Code 只有 70.01——同一个模型、同一个 coding agent,套上演化出来的 harness,直接多拿 8 分多。

第二,也是最打动我的:七个配置,全部提升。 固定模型和 coding agent、只加 DesignHarness,7 组配置无一例外变好:

配置(模型 × coding agent) 裸 agent +DesignHarness 增益
GPT-5.5 × Codex 75.87 81.46 +5.59
Claude 4.8 × Claude Code 69.55 74.56 +5.01
Kimi K2.7 × Claude Code 57.20 70.12 +12.92
DeepSeek V4 Pro × Claude Code 34.73 54.29 +19.56

增益对比
图说:七组配置的增益对比——越弱的模型,被 harness 拉得越多

看出规律了吗?基线越弱,增益越大。DeepSeek V4 Pro 裸奔只有 34.73,套上 harness 直接 +19.56;而本来就强的 GPT-5.5 只多 5.59。我倾向于这么读:harness 装载的是"别溢出、别贴正文截图、信息密度要够"这类纪律性知识,弱模型缺的恰恰是这个。当然硬币另一面是——harness 补短板可以,补不出模型没有的天花板。

第三,便宜到离谱的端到端成本。 一次完整生成:253 次工具调用、11 轮编辑、40 分钟、不到 3 美元,几乎无人工干预。用国产 LongCat 2.0 的话,一张海报约 0.27 美元。团队还让 AutoDesign 给自己的论文做了张海报当 demo——自己吃自己的狗粮,这个我服。

自产海报
图说:AutoDesign 给自己论文生成的海报——40 分钟、253 次工具调用的产物

修订轨迹
图说:一次生成的修订过程——critic 圈出失败区域,修改只动那一块,得分从 0.36 修到 0.78

盲测人评也给力:11 个人在不知道系统身份的情况下两两对比海报,933 个有效判断里,AutoDesign 的 Bradley–Terry 偏好估计(一种把两两胜负换算成"击败随机对手概率"的模型,越高越好)64.0%,四个参评系统里最高。

💡 为什么你要关心?

就算你不做海报生成,这篇的可迁移资产也不少:

  • 🔁 「harness 当优化目标」可以直接搬到你的 Agent 项目。你手头的 skill 配置、MCP 工具编排、multi-agent 流程,本质都是 harness。AutoDesign 给出的配方:单组件有界更新 + 训练/开发双集盲评门控 + 全程优化记录——三件套拿来就能套在你自己的 agent 迭代上,把"人肉 A/B 测 prompt"升级成"自动演化 + 门控验收"。
  • 💰 弱模型 + 强 harness 是条性价比路线。表格里 Seed 2.1 Pro 以 27% 的成本拿到 GPT-5.5 约 88% 的分数。预算敏感的团队,与其追最贵的模型,不如先投资一层好 harness——这份数据就是证据。
  • 🧪 评测协议值得抄。"规则算法管硬指标 + rubric VLM 管感知指标 + record-level ceiling(严重翻车直接封顶压分)"这套混合判卷,以及"分差多大才可信"的校准分析(分差 0–3 分时人机一致率只有 51.9%,基本等于瞎猜;20 分以上才到 74.4%),做任何 AIGC 评测的人都该看看。

PosterBench 评估协议
图说:PosterBench 的判卷流水线——左边规则算法查空间/OCR/数值接地/渲染完整性,右边 VLM 评委看视觉证据、布局、可读性、美学

🤔 理性看待

几个该打问号的地方,朋友式提醒:

  • 自己训、自己考。优化期的评估器和最终评测 PosterBench 虽然流程上分离,但共享同一套七维质量词汇表,且同团队构建。harness 演化优化的恰恰是"在这套质量观下得分高"。盲测人评是目前最强的外部校验(AutoDesign 确实第一),但人机相关性只有 r=0.34——"超 7.45 分"的人类感知差距,大概率比数字小。
  • 赢的维度耐人寻味。AutoDesign 的增益集中在信息密度、可读性这些可规则化判定的维度;在最"人类"的美学(5.59)和视觉证据(5.97)上,反而输给 Claude Design(7.36 / 7.62)。学到的可能更多是纪律,而非论文宣称的"设计先验"——这是我的解读,不是论文结论。
  • 小样本方差。三条受控消融 track 都基于只有 10 篇论文的 mini 子集,绝对排名的外推要留个心眼;外层优化 7 天的算力成本论文也没报。

尾声

抛开数字,这篇论文真正立住的判断是:模型能力之外,"围绕模型的系统"是一等公民的优化对象——而且这个优化过程本身可以自动化、可以记账、可以门控。你今晚还在手搓的那份 prompt,可能就是下一个被自动演化的对象。

作者:lusca
版本:lusca-paper-blog v1.6.0
出处:https://github.com/yjmm10/lusca-skill/tree/main/skills/lusca-paper-blog

相关文章
|
9天前
|
存储 弹性计算 缓存
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
本文更新了2026年阿里云全系列云服务器租赁活动报价,所有特惠资源均可前往阿里云活动中心选购,整体覆盖从个人入门到企业级高性能场景的全梯度需求。其中轻量应用服务器主打极致性价比,2核2G峰值200M带宽配置每日10点、15点限时抢购价仅38元/年,2核4G配置379元/年起;高性价比的经济型e实例、通用算力型u2i实例覆盖2核4G至4核32G全档位,适配开发测试与中小型企业业务;搭载英特尔至强6处理器的第九代c9i企业级实例算力较上代提升20%,支撑高并发生产环境,不同实例规格价差清晰,用户可根据自身业务负载与预算灵活选型。
1910 119
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
|
10天前
|
人工智能 程序员 API
Codex 接入 DeepSeek-V4-Flash:还能补上识图,提供两套方案
Codex 接入 DeepSeek-V4-Flash 怎么配?本文覆盖 CLI 与桌面端,再用 qwen3-vl-flash 补识图,两套方案可直接照做
1463 13
|
16天前
|
云安全 人工智能 运维
阿里云联动百位企业安全专家,共识Agent防御最佳实践
当Agent成为新员工,你的安全边界在哪里?
1966 10
阿里云联动百位企业安全专家,共识Agent防御最佳实践
|
7天前
|
编解码 弹性计算 云计算
MiniMax-H3 视频生成模型 — 一键部署与使用指南
MiniMax-H3是MiniMax开源的33B全模态视频生成模型,支持文生视频、图生视频、参考生视频三种模式,原生输出2K/15秒带立体声音频视频,已原生适配ComfyUI,并可通过阿里云计算巢一键部署。(239字)
|
10天前
|
人工智能 JSON Shell
2026AI漫剧本地全开源方案(附各个软件模型链接),8G显卡也能流畅运行
这是一套完全本地化部署的AI漫剧生成技术链路:涵盖LLM剧本分镜生成、FLUX文生图(IP-Adapter人脸锁定)、StoryDiffusion时序连贯控制、LTX-2.3唇形同步视频生成,及ComfyUI全流程调度。零云端费用,仅耗硬件算力,单集2–4小时可产出竖屏短视频,适配抖音/B站分发。
|
8天前
|
人工智能 API 开发工具
2026 零基础本地 AI 漫剧完整实操教程(8G 笔记本显卡可用|附可直接复制命令与代码)
本方案提供完全离线、本地运行的漫剧全自动制作流程:RTX3060/4050 8G显卡即可驱动,涵盖Qwen写分镜→ComfyUI统一角色绘图→LTX2.3图生微动画→Qwen3-TTS本地配音→FFmpeg自动合成,全程无水印、免API、不限次。专为低显存优化,解决变脸、闪烁、爆内存三大痛点。(239字)
|
22天前
|
人工智能 前端开发 Linux
Codex 桌面版安装 + CC Switch 接入第三方 API 完整教程(2026 最新)
2026最新教程:手把手教你安装Codex桌面版,通过CC Switch v3.17.0一键接入Fenno等国产API(兼容OpenAI Responses格式),跳过账号登录,完整启用代码审查、多步任务与上下文感知功能。零基础友好,全程图文实操。(239字)
3443 5
|
10天前
|
编解码 人工智能 安全
2核4G/4核8G/8核16G阿里云服务器如何选择实例?经济型e、通用算力型u2i与计算型c9i选哪个?
本文介绍了阿里云2核4G、4核8G、8核16G三档主流配置下经济型e、通用算力型u2i和计算型c9i三种实例的最新活动价格与适用场景。同配置下三者价差显著,以2核4G为例,经济型e低至599.93元/年,计算型c9i则高达1742.08元/年。文章详细解析了各实例的性能定位:经济型e适合轻负载入门场景,u2i兼顾稳定算力与性价比,c9i凭借第9代至强处理器与芯片级安全能力支撑高性能业务。同时提示用户可叠加满减优惠券享受折上折,建议根据业务负载与预算综合决策。
555 113