智能体的分数一半是噪声:给什么信息比用多强的模型更重要

简介: 该研究通过18,240条智能体轨迹实验发现:智能体表现54%方差源于运行噪声,非配置差异;“给什么信息”对性能影响最大,超越模型强度与预算;配置间存在强交互,行为需系统级设计(如验证工具),而非依赖提示词。重新定义智能体为可配置系统。(239字)

一项覆盖 18,000+ 条智能体轨迹的系统实验发现——智能体得分的方差里约 54% 是跑次噪声而非配置差异;在五条配置轴(信息/推理保留/自我验证/预算/模型强度)里,「给智能体什么信息」的效应超过模型强度和运行预算,排第一。
arXiv 2610.01618 · Agents Are Systems, Not Models · 2026-10-01
111.png

arXiv 2610.01618 · Agents Are Systems, Not Models: Rethinking Agentic Evaluation · 2026-10-01
这篇论文做了什么
智能体评测已经从「只看成功率」进化到关注成本、一致性、鲁棒性。但有个盲区:评测普遍把智能体当固定对象看待。实际上智能体是可配置系统——用户决定告诉它什么、让它跑多久、用什么模型,每个选择都影响结果。
研究团队设计了一个受控实验:四个科学任务(天体物理与基因组学)+ 一个基准:智能体必须调用领域专家模型解决任务(通用模型无法凭知识解决),产出与专家模型的参考分数对比。然后沿五条配置轴系统变化:

  1. 给智能体的信息(任务说明的详略) 2. 是否保留跨步骤的推理 3. 被要求自我验证的强度 4. 运行时预算 5. 骨干模型的强度
    每个配置跑多次(共 18,240 条轨迹全部开源),分离信号与噪声。
    四个发现
    发现一:智能体的结果天然是噪的。 真实尝试的得分方差里约 54% 是跑次噪声——同一配置跑两次,分数可能差一截。这意味着:不报方差的单次智能体评测基本没有意义;「我们的智能体比你们高 3 分」这类宣称,需要多次运行的置信区间支撑。

发现二:信息轴效应最大,超过模型与预算。 给智能体的信息量对得分的贡献排第一——超过骨干模型强度、超过运行预算。而且信息更足还同时降低成本和运行时间、改善校准(智能体对自己答案的信心更准)。
112.png

发现三:配置轴之间有交互,不能孤立调。 加预算主要在「信息足够」时提升分数——信息不足时加预算甚至降分(智能体拿时间空转)。轴与轴不独立,单独调一轴可能被另一轴卡住。
发现四:有些行为提示词管不动,得靠系统设计。 「自我验证」这类行为,用户在提示词里怎么催效果都有限——但给它一个专门的验证工具,行为立刻显著改变。结论:这类行为应该在系统层设计(提供工具/机制),而不是指望提示词。
为什么这篇值得读

  1. 「智能体是系统不是模型」有了数据支撑——这个论文标题里的论断被 18k 轨迹的实验落地成可操作的结论 2. 给评测者提了醒:跑次噪声占一半方差,单次跑的智能体榜单要重新审视 3. 给构建者提了顺序:与其先纠结换更强的模型,先把「给智能体的信息」这件事做对——这是最便宜的增益来源 4. 行为设计归位:验证类行为交给系统工具而非提示词,这是智能体工程的设计原则
    与 BuddyMe 的经验印证
    这篇的四个发现在我们的工作流实践里都有对应:每步落盘与可回溯(信息轴——任务链中每步给智能体的上下文是设计重点);多轮任务跑多次取稳定结论而非单次判优(噪声发现);验证环节做成显式工序而非提示词叮嘱(发现四——BuddyMe 工作流的验证步骤独立成节点)。每天免费 4500 万 Token 的额度,够把「同一任务多配置对照」这种实验成本打下来——智能体调优先跑对照实验,是这篇给所有构建者最实用的建议。
    BuddyMe 每日免费 4500 万 Token。
目录
相关文章
|
14天前
|
人工智能 JSON API
全网刷屏的 Jev 模型正式开放!一手实战测评 + 保姆级教程
全网爆火的 Jev 模型是什么?有什么用?怎么使用?怎么接入 AI 编程工具?效果真的好么?傻子可懂的 Jev 保姆级实战教程 + 项目实战测评来啦
8067 15
|
13天前
|
人工智能 并行计算 PyTorch
秋叶 ComfyUI 2026 整合包 v3.2 完整部署教程:Python 3.13 + Torch 2.13 全栈升级
秋叶aaaki ComfyUI 2026年8月整合包v3.2正式发布!全面升级Python 3.13.11、PyTorch 2.13.0+cu130及ComfyUI v0.30.2,原生支持MiniMax H3、Wan 2.2、Qwen-Image-2.1等2026主流音视频/图像模型,解压即用,无需环境配置。
2076 12
|
12天前
|
人工智能 测试技术 API
最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透!
Jev是TypeSafe AI推出的“系统一模型”,不生成文本,专做毫秒级结构化决策:Choice(多选)、Score(打分)、Noul(是非概率)。响应快193倍、成本低444倍,适合工单路由、内容审核、测试定级等高频判断场景。
1798 4
最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透!
|
11天前
|
人工智能 编解码 并行计算
MiniMax-H3 一键整合包技术文档:8G 显存运行 AI 漫剧制作 —— 角色替换 / 动作迁移 / 文图生视频部署与调参指南
MiniMax H3 是 MiniMax 开源的全模态视频生成模型,支持文/图/音/视多条件输入,输出最高2K、15秒带双声道音频视频。本文档详述其Int8量化版在8GB显存下的本地一键部署、三段式工作流(EDIT/REPLACE/CONTINUE)、参数调优及常见问题排查。(239字)
|
7天前
|
人工智能 Linux 开发者
【2026国内使用】Codex安装过程一篇讲透(Win/Mac/Linux全支持)
Codex是OpenAI推出的AI编程智能体,可读取本地项目、理解需求并自动修改代码。支持桌面GUI、命令行(CLI)及VS Code/Cursor插件三种形态,覆盖可视化操作、终端高效开发与编辑器无缝集成场景,助开发者用自然语言驱动编码全流程。(239字)
【2026国内使用】Codex安装过程一篇讲透(Win/Mac/Linux全支持)
|
26天前
|
人工智能 自然语言处理 安全
阿里云千问办公 QwenWork详细介绍:产品核心能力、典型场景、价格及常见问题解答
千问办公是阿里云推出的一站式AI办公平台,主打"不止于对话,更注重交付",依托通义千问旗舰大模型,用户一句话即可完成数据分析、PPT生成、视频剪辑等复杂任务,直接输出可用成果。产品深度打通钉钉生态与企业OA,覆盖桌面端、网页端,提供企业标准版198元/人/月等多档订阅方案,新用户注册即赠2000积分,适配工程师、HR、财务等多职业办公场景,成为能动手干活的"全能AI同事"。
3843 10
|
20天前
|
缓存 IDE Java
【保姆级】Android Studio下载、安装和汉化教程(2026最新)
Android Studio 是 Google 官方推出的免费 Android 应用开发集成环境,基于 IntelliJ IDEA,内置模拟器、调试器、性能分析及 Compose 界面工具,功能全面,文档丰富,是安卓开发首选工具。(239字)
2187 1

热门文章

最新文章