
💡 一句话总结:AutoDesign 把「围绕模型的那套系统」(prompt、工具、流程)变成可被 Agent 自动优化的对象——外层循环改系统、内层循环出作品,模型权重一动不动。落在论文转海报任务上,它超了商业系统 Claude Design 7.45 分。做 Agent 开发的人,这篇的「怎么让系统自己进化」可以直接抄作业。
导语:你也是「harness 手工人」吗?
先问一个可能戳到你的问题:过去一年里,你有多少个晚上是在改 system prompt、调工具描述、往 agent 流程里塞一个「先反思再执行」的步骤?
对,就是那种活。模型是现成的(Claude、GPT、开源模型随便挑),真正吃掉你时间的是围绕模型搭的那套东西——上下文怎么组织、给哪些工具、循环跑几轮、失败怎么兜底。这套东西有个正式名字:harness(直译"挽具",就是套在马身上控制方向的那套装备——在 Agent 语境里指围绕模型的完整脚手架系统)。Claude Code、Codex CLI 这些 coding agent,本质都是"强模型 + 精心打磨的 harness"。
痛点在于:harness 的迭代至今仍是纯手工业。你跑一遍任务、看看哪里翻车、回去改一版 prompt 或流程,再来一遍。你从失败里学到的经验,全在你脑子里——换个任务、换个同事,归零。而人类设计师恰恰相反:他们把每次改稿的教训沉淀成方法论,越做越快。
这篇论文(美团联合 MBZUAI、清华、北大等多家机构的 arXiv 2608.13560)干的事就一句话:把 harness 手工迭代这个环节,也交给 Agent 自动化。
想自己动手试?
- 📄 论文:arXiv 2608.13560
- 💻 代码:GitHub · Yaxin9Luo/AutoDesign
- 🏠 项目主页:autodesign.designanything.ai
- 🎮 Demo:designanything.ai
🎯 这篇论文到底想解决什么问题?
论文选的试验场是「论文转学术海报」:把一篇几十页的 PDF 压成一张信息密度极高、还要好看能讲的会议海报。这个任务做 AI 的人都不陌生——deadline 前一周,每个组里总有倒霉蛋在 PowerPoint 里对齐文本框。
为什么选它?因为这是个典型的长程 agentic 任务:要抽取论文里的关键证据、决定放哪几张图、排版、检查溢出、反复修——每一步都可能翻车,翻车了还得知道改哪。现有系统(Paper2Poster、PosterGen 这类)已经能走「生成 → 批评 → 修改」的循环,但它们的反馈只用来修当前这张海报。
论文的核心观察是:这中间缺一层。修好一张海报,系统本身没有任何长进;下次换篇论文,它从同样的起点重新犯错。反馈应该被用来改进"生成海报的那套系统",而不只是那张海报——这就是标题里的 Meta-Harness Optimization(元挽具优化:用一个更高层的系统去优化 harness 本身)。
为了验证这事靠谱,团队还顺手造了个评测基准 PosterBench:100 篇横跨 AI、生物医学、气候、经济、物理五个学科的论文,从忠实度、覆盖度、信息密度、视觉证据、布局、可读性、美学七个维度打分(每维 0–10,越高越好),规则算法和 VLM 评委混合判卷。自己造裁判这事后面理性看待一节再聊。
🛠️ 它的思路是什么?
整套系统是两个套着的循环:内层出作品,外层改系统。
先说内层。初始状态极简,只有两个角色:designer 负责生成和修改作品,critic 负责挑毛病给反馈,两者交替,直到作品过关。这个循环你可能在各种 self-refine 工作流里见过,不新鲜。新鲜的是外层——它每轮干四件事:
- 🎬 Rollout(完整跑一遍):让当前 harness 在一批训练论文上各生成一张海报,记下全过程轨迹和得分。
- 📊 评估:一个用人类标注的参考海报构造出来的评估器打分,规则检查 + VLM 判断混合。
- ✏️ 提出更新:一个 coding agent 先当"架构师"——派子 agent 分析轨迹,找出反复出现的失败模式(比如"图表总是溢出边界"),形成修改计划;再当"程序员"——动手改 harness 的代码。
- 🚦 验收门控:改完的 harness 必须在训练集上变好、且在独立的开发集上不退步,才被接受;否则回滚。

图说:内层循环负责"作品改到好",外层循环负责"系统改到强"——两层各管各的优化对象
几个设计细节我觉得相当老练,值得单独说:
- 每次只许改一个组件。论文把 harness 拆成五个组件(上下文与记忆 / 工具与规范 / 执行运行时 / 编排 / 评估与反馈),外层每轮只能动其中一个。为什么?如果一轮同时改了 prompt、工具和流程,效果变好了你也不知道该谢谁——单组件更新让每次收益都能归因。
- 开发集对优化器保密。开发集(dev set,用来验证有没有过拟合的独立数据)的分数只进验收门控,从不给提修改建议的 agent 看。这是个很干净的"盲评"设计——优化器想讨好开发集都没门路。
- 全程记账。每一轮改了什么、为什么、接受还是拒绝,全部写进优化记录,还带代码快照。被拒绝的尝试也是资产:下一轮看到"这招试过没用",就不会重复踩坑。

图说:外层每轮四步——跑任务、评估、提单组件更新、门控验收,可全程无人干预
那外层优化跑出来的最终产物长什么样?论文叫它 DesignHarness,一条四阶段流水线:先做论文摄取(抽大纲、关键段落、图表,每个元素都带源位置可回溯),然后由一个 coding agent 型 designer 生成和修订——作品全程是可编辑的 HTML 而不是图片,修一处溢出只需改局部代码,不用整张重画;再过双 critic(确定性规则校验管"资产缺失、溢出重叠"这类硬伤,VLM 管"好不好看"这类感知判断),最多修 12 轮;最后定稿导出。

图说:演化出的最终系统——规则校验器加 VLM 视觉 critic 双保险,产出的海报保持可编辑、可溯源
值得一提的是,这套演化真不是摆设:跑了 7 天,224 个子 agent 参与,累计 54 次 harness 更新被接受。下图是一条真实的优化轨迹——自主优化先爬升后进入平台期,卡住了;这时人类给一句方向性指导,搜索被重定向,分数又上一个台阶。所以它支持人在环,但不是必须。

图说:单篇论文的得分随外层迭代的变化——自主优化到平台期后,一句人类指导让曲线再度抬头
📈 效果到底怎么样?
数字挑三个最有说服力的。
第一,主榜第一,超商业系统。 PosterBench 100 篇主榜上,AutoDesign 拿 78.32 分,超过 Anthropic 的商业设计系统 Claude Design 7.45 分,也超过 OpenDesign 8.87 分。更狠的对照是裸 Claude Code 只有 70.01——同一个模型、同一个 coding agent,套上演化出来的 harness,直接多拿 8 分多。
第二,也是最打动我的:七个配置,全部提升。 固定模型和 coding agent、只加 DesignHarness,7 组配置无一例外变好:
| 配置(模型 × coding agent) | 裸 agent | +DesignHarness | 增益 |
|---|---|---|---|
| GPT-5.5 × Codex | 75.87 | 81.46 | +5.59 |
| Claude 4.8 × Claude Code | 69.55 | 74.56 | +5.01 |
| Kimi K2.7 × Claude Code | 57.20 | 70.12 | +12.92 |
| DeepSeek V4 Pro × Claude Code | 34.73 | 54.29 | +19.56 |

图说:七组配置的增益对比——越弱的模型,被 harness 拉得越多
看出规律了吗?基线越弱,增益越大。DeepSeek V4 Pro 裸奔只有 34.73,套上 harness 直接 +19.56;而本来就强的 GPT-5.5 只多 5.59。我倾向于这么读:harness 装载的是"别溢出、别贴正文截图、信息密度要够"这类纪律性知识,弱模型缺的恰恰是这个。当然硬币另一面是——harness 补短板可以,补不出模型没有的天花板。
第三,便宜到离谱的端到端成本。 一次完整生成:253 次工具调用、11 轮编辑、40 分钟、不到 3 美元,几乎无人工干预。用国产 LongCat 2.0 的话,一张海报约 0.27 美元。团队还让 AutoDesign 给自己的论文做了张海报当 demo——自己吃自己的狗粮,这个我服。

图说:AutoDesign 给自己论文生成的海报——40 分钟、253 次工具调用的产物

图说:一次生成的修订过程——critic 圈出失败区域,修改只动那一块,得分从 0.36 修到 0.78
盲测人评也给力:11 个人在不知道系统身份的情况下两两对比海报,933 个有效判断里,AutoDesign 的 Bradley–Terry 偏好估计(一种把两两胜负换算成"击败随机对手概率"的模型,越高越好)64.0%,四个参评系统里最高。
💡 为什么你要关心?
就算你不做海报生成,这篇的可迁移资产也不少:
- 🔁 「harness 当优化目标」可以直接搬到你的 Agent 项目。你手头的 skill 配置、MCP 工具编排、multi-agent 流程,本质都是 harness。AutoDesign 给出的配方:单组件有界更新 + 训练/开发双集盲评门控 + 全程优化记录——三件套拿来就能套在你自己的 agent 迭代上,把"人肉 A/B 测 prompt"升级成"自动演化 + 门控验收"。
- 💰 弱模型 + 强 harness 是条性价比路线。表格里 Seed 2.1 Pro 以 27% 的成本拿到 GPT-5.5 约 88% 的分数。预算敏感的团队,与其追最贵的模型,不如先投资一层好 harness——这份数据就是证据。
- 🧪 评测协议值得抄。"规则算法管硬指标 + rubric VLM 管感知指标 + record-level ceiling(严重翻车直接封顶压分)"这套混合判卷,以及"分差多大才可信"的校准分析(分差 0–3 分时人机一致率只有 51.9%,基本等于瞎猜;20 分以上才到 74.4%),做任何 AIGC 评测的人都该看看。

图说:PosterBench 的判卷流水线——左边规则算法查空间/OCR/数值接地/渲染完整性,右边 VLM 评委看视觉证据、布局、可读性、美学
🤔 理性看待
几个该打问号的地方,朋友式提醒:
- 自己训、自己考。优化期的评估器和最终评测 PosterBench 虽然流程上分离,但共享同一套七维质量词汇表,且同团队构建。harness 演化优化的恰恰是"在这套质量观下得分高"。盲测人评是目前最强的外部校验(AutoDesign 确实第一),但人机相关性只有 r=0.34——"超 7.45 分"的人类感知差距,大概率比数字小。
- 赢的维度耐人寻味。AutoDesign 的增益集中在信息密度、可读性这些可规则化判定的维度;在最"人类"的美学(5.59)和视觉证据(5.97)上,反而输给 Claude Design(7.36 / 7.62)。学到的可能更多是纪律,而非论文宣称的"设计先验"——这是我的解读,不是论文结论。
- 小样本方差。三条受控消融 track 都基于只有 10 篇论文的 mini 子集,绝对排名的外推要留个心眼;外层优化 7 天的算力成本论文也没报。
尾声
抛开数字,这篇论文真正立住的判断是:模型能力之外,"围绕模型的系统"是一等公民的优化对象——而且这个优化过程本身可以自动化、可以记账、可以门控。你今晚还在手搓的那份 prompt,可能就是下一个被自动演化的对象。
作者:lusca
版本:lusca-paper-blog v1.6.0
出处:https://github.com/yjmm10/lusca-skill/tree/main/skills/lusca-paper-blog