这两天行业里在传一个说法:推理成本两年降了95%以上,"每个业务流程配一个Agent"终于在经济上算得过账了,智能体要从单点助手变成可计费、可编排的"数字化劳动力"。
听着挺振奋,但我更想泼盆冷水:成本曲线从来不是Agent商业化的瓶颈,可靠性才是。
推理便宜了不代表任务能稳定跑完。一个流程里只要有一步判断错、一次工具调用失败、一次上下文丢失,前面省下的token成本转头就变成人工介入、返工、甚至客户流失的隐性成本——这笔账没人愿意算,因为算完就会发现,所谓"按结果付费"目前更像是厂商的定价话术,而不是客户敢签的合同条款。
具体拆开看,Agent在生产环境里翻车通常不是模型不够聪明,而是几个很工程化的问题:多步任务里错误会累积,第一步的幻觉到第五步可能已经面目全非;工具调用的成功率和参数准确度,在实际业务系统里远比benchmark上难看;还有上下文管理——长任务一旦跑到中段,模型对早期约束的"记忆"会开始漂移,这类问题目前业界还没有统一的解法,大多靠各家自己攒的兜底机制硬扛。
所以真正决定一个Agent能不能商用的,从来不是它便宜,而是两件事:错误率能不能被约束在一个可以兜底的范围内,以及出错之后能不能被追溯、被纠正。前者靠的是场景收窄和流程拆解——把一个模糊的大任务拆成边界清晰的小步骤,每一步都可校验;后者靠的是可观测性,决策链路能不能完整记录下来,异常能不能在发生的当下被拦截,而不是等结果已经交付出去才发现问题。这两件事都不性感,也不是靠降价能解决的,但恰恰是把Agent从demo做成生产系统的真正门槛。
我倒觉得,现在谈"数字化劳动力"有点早。上一代"生成式AI"换了个名字变成"智能体",很大一部分也是营销先跑在了工程前面——概念迭代的速度,一直比工程成熟度的迭代快。接下来半年真正值得较劲的,不是谁的模型又降价了,而是谁在"错误发生之后怎么办"这件事上,拿出了工程上站得住的答案。这才是能不能真正把Agent卖给企业客户、而不是卖给VC的分水岭。