智能体的分数一半是噪声:给什么信息比用多强的模型更重要

简介: 该研究通过18,240条智能体轨迹实验发现:智能体表现54%方差源于运行噪声,非配置差异;“给什么信息”对性能影响最大,超越模型强度与预算;配置间存在强交互,行为需系统级设计(如验证工具),而非依赖提示词。重新定义智能体为可配置系统。(239字)

一项覆盖 18,000+ 条智能体轨迹的系统实验发现——智能体得分的方差里约 54% 是跑次噪声而非配置差异;在五条配置轴(信息/推理保留/自我验证/预算/模型强度)里,「给智能体什么信息」的效应超过模型强度和运行预算,排第一。
arXiv 2610.01618 · Agents Are Systems, Not Models · 2026-10-01
111.png

arXiv 2610.01618 · Agents Are Systems, Not Models: Rethinking Agentic Evaluation · 2026-10-01
这篇论文做了什么
智能体评测已经从「只看成功率」进化到关注成本、一致性、鲁棒性。但有个盲区:评测普遍把智能体当固定对象看待。实际上智能体是可配置系统——用户决定告诉它什么、让它跑多久、用什么模型,每个选择都影响结果。
研究团队设计了一个受控实验:四个科学任务(天体物理与基因组学)+ 一个基准:智能体必须调用领域专家模型解决任务(通用模型无法凭知识解决),产出与专家模型的参考分数对比。然后沿五条配置轴系统变化:

  1. 给智能体的信息(任务说明的详略) 2. 是否保留跨步骤的推理 3. 被要求自我验证的强度 4. 运行时预算 5. 骨干模型的强度
    每个配置跑多次(共 18,240 条轨迹全部开源),分离信号与噪声。
    四个发现
    发现一:智能体的结果天然是噪的。 真实尝试的得分方差里约 54% 是跑次噪声——同一配置跑两次,分数可能差一截。这意味着:不报方差的单次智能体评测基本没有意义;「我们的智能体比你们高 3 分」这类宣称,需要多次运行的置信区间支撑。

发现二:信息轴效应最大,超过模型与预算。 给智能体的信息量对得分的贡献排第一——超过骨干模型强度、超过运行预算。而且信息更足还同时降低成本和运行时间、改善校准(智能体对自己答案的信心更准)。
112.png

发现三:配置轴之间有交互,不能孤立调。 加预算主要在「信息足够」时提升分数——信息不足时加预算甚至降分(智能体拿时间空转)。轴与轴不独立,单独调一轴可能被另一轴卡住。
发现四:有些行为提示词管不动,得靠系统设计。 「自我验证」这类行为,用户在提示词里怎么催效果都有限——但给它一个专门的验证工具,行为立刻显著改变。结论:这类行为应该在系统层设计(提供工具/机制),而不是指望提示词。
为什么这篇值得读

  1. 「智能体是系统不是模型」有了数据支撑——这个论文标题里的论断被 18k 轨迹的实验落地成可操作的结论 2. 给评测者提了醒:跑次噪声占一半方差,单次跑的智能体榜单要重新审视 3. 给构建者提了顺序:与其先纠结换更强的模型,先把「给智能体的信息」这件事做对——这是最便宜的增益来源 4. 行为设计归位:验证类行为交给系统工具而非提示词,这是智能体工程的设计原则
    与 BuddyMe 的经验印证
    这篇的四个发现在我们的工作流实践里都有对应:每步落盘与可回溯(信息轴——任务链中每步给智能体的上下文是设计重点);多轮任务跑多次取稳定结论而非单次判优(噪声发现);验证环节做成显式工序而非提示词叮嘱(发现四——BuddyMe 工作流的验证步骤独立成节点)。每天免费 4500 万 Token 的额度,够把「同一任务多配置对照」这种实验成本打下来——智能体调优先跑对照实验,是这篇给所有构建者最实用的建议。
    BuddyMe 每日免费 4500 万 Token。
目录
相关文章
|
13天前
|
人工智能 IDE API
AI 编程智能体 Qoder CN 详解,产品线划分、Credits 定价规则、CLI 命令实战指南
整体来看,Qoder CN完成升级之后,已经从单纯的IDE代码补全插件进化为覆盖编码开发、办公自动化、数字员工的全栈AI智能体平台。多终端产品矩阵、丰富大模型基座选择、BYOK自带密钥、MCP工具扩展、Quest子智能体协同,满足从个人开发者到大型企业的不同诉求。订阅档位划分清晰,Credits跨产品共享降低多工具同时使用的成本。CLI命令行工具打通终端自动化链路,可以和现有开发流水线结合。开发者只要理清各版本功能差异、Credits互通规则,做好资源用量监控,合理配置MCP外部工具,就可以充分发挥这套产品的能力,大幅提升编码、办公任务的执行效率。
227 0
|
27天前
|
人工智能 自然语言处理 安全
阿里云千问办公 QwenWork详细介绍:产品核心能力、典型场景、价格及常见问题解答
千问办公是阿里云推出的一站式AI办公平台,主打"不止于对话,更注重交付",依托通义千问旗舰大模型,用户一句话即可完成数据分析、PPT生成、视频剪辑等复杂任务,直接输出可用成果。产品深度打通钉钉生态与企业OA,覆盖桌面端、网页端,提供企业标准版198元/人/月等多档订阅方案,新用户注册即赠2000积分,适配工程师、HR、财务等多职业办公场景,成为能动手干活的"全能AI同事"。
3881 10
|
1天前
|
人工智能 自然语言处理 监控
怎样在 Claude Code 里按时间和来源查 AI 资讯
编程时刷资讯低效?与其在X、HN、Reddit间反复切换,不如用Claude Code或Codex“精准查询”:一句话限定来源(如HN/Reddit/X)、时间(48小时/本周)、类目(Agent/模型发布)与人物(Karpathy等),直达关键信息。
29 1
|
1天前
|
运维 监控 Java
微服务架构和单体架构的区别:拆之前你得先想清楚这件事
微服务架构常被当成单体架构的升级版,其实两者是取舍关系。本文讲清微服务架构和单体架构的区别、微服务到底能解决什么问题,帮你判断该不该拆。
23 0
微服务架构和单体架构的区别:拆之前你得先想清楚这件事
|
1天前
|
缓存 人工智能 安全
深度拆解OpenAI Agents API:任务跑得越久,测试为什么越不能只看最终答案?
本文提出面向长时Agent任务的五层验收法,聚焦执行轨迹可追溯、环境状态可审计、行为边界可约束。强调不只验结果,更验过程证据链——从输入快照、执行轨迹到干净环境重放,确保AI行为透明、安全、可复现。(239字)
深度拆解OpenAI Agents API:任务跑得越久,测试为什么越不能只看最终答案?
|
1天前
|
人工智能 安全 机器人
Agent到底该怎么测?这4个评测方法可以直接用
本文详解Agent评测四大核心维度:回答质量、工具调用准确性、执行轨迹合规性、环境状态真实性。突破传统LLM“说对不对”的局限,转向验证“做没做对”,为测试工程师提供可落地的四层评测体系与工程化实践路径。
Agent到底该怎么测?这4个评测方法可以直接用
|
1天前
|
人工智能 自然语言处理 数据可视化
阿里云百炼是什么?如何快速上手百炼AI模型平台?新手0门槛使用指南
阿里云百炼(Model Studio)是一站式AI大模型服务平台,支持通义千问及主流第三方模型,提供OpenAI兼容API、可视化应用构建与工作流编排能力,助力企业快速开发智能体与知识库问答等AI应用。(239字)
|
1天前
|
Web App开发 弹性计算 运维
让 ego-browser 在云主机上长期稳定运行的四个开关
本文详解 `ego-browser` 四大运维开关(禁用画面回传、空闲自动回收、worker 租约兜底、登录态持久化),并提供云主机(ECS/CVM)部署最佳实践,助你在带宽与内存受限环境下实现长期稳定托管。
22 0
|
1天前
|
消息中间件 JSON 缓存
抖店订单详情接口集成实践:调用封装与数据解析
本文介绍抖店订单详情接口的调用与工程化实践,涵盖请求封装、异常重试、状态码解析、脱敏处理、空地址兜底及幂等设计,助开发者高效集成,规避签名、限流、状态误判等常见坑点。(239字)
|
1天前
|
并行计算 PyTorch Linux
显存计算与模型选择:你的显卡能跑多大的模型
本篇直击本地部署核心痛点:显存不够?模型选错?用公式(权重+KV Cache+开销)教你精准估算,附8/12/16/24/48GB显存档位经验表,明确给出“24G甜点是32B Q4_K_M”,告别OOM玄学。

热门文章

最新文章