过去两年,企业级智能体自动化的落地路径有一个共同特征:先挑规则清晰的场景,把重复的鼠标键盘动作交给程序,再逐步往复杂流程里走。这套打法在边界明确、样本充足的任务上效率很高,但一旦遇到表单字段缺失、附件格式混乱、业务口径随部门变化的情况,维护成本就会迅速超过收益。这不是执行工具不够快,而是"规则从哪来"这个问题没有答案。真正耗掉时间的,是在同一类材料上反复重建理解。这属于企业级智能体自动化在文档密集型场景里绕不过去的一环。把这些步骤拆开,正是企业级智能体自动化从"辅助"走向"执行"的前提。
一、先给结论
结论是:大模型把"理解"和"生成"这两件事的成本压了下来,但没有自动解决"可控"这件事。执行层真正要补的是 3 块能力——听得懂意图、拿得到事实、收得住动作。少了任何一块,自动化都只能停在演示环节。
二、能力沿四个台阶往上走
从公开的行业实践看,大模型的能力大致沿 4 个台阶演进:描述、生成、推理、行动。
- 描述:把非结构化文本归纳成结构化摘要,替代一部分人工阅读。
- 生成:按模板产出文本、查询语句、脚本片段。
- 推理:在给定约束下做多步判断,比如判断一笔费用该走哪条审批链。
- 行动:把判断结果落到真实系统里,触发后续流程。
前三个台阶更多发生在"与人对话"的界面上,第四个台阶才真正进入执行层。不少项目做到第三台阶就当作完成了,其实只完成了准备动作。三、执行层的三块底线能力
当执行主体从写好的脚本变成模型给出操作建议,系统必须重新回答一个老问题:凭什么相信这一步。行业里通常把这类能力拆成三块。
- 界面引擎:不依赖接口文档,直接按界面元素定位控件并操作,用于老系统改造这类没有开放接口的场景。
- 系统适配层:把界面差异收在适配层里,业务逻辑不跟着界面变。界面改版时只动适配层,不动规则。
- 治理框架:每个动作都要留痕、可回放、可撤销,出问题能还原当时的界面状态与操作参数。
这三条不是加分项,是模型进入执行层之后的及格线。四、三道闸门
我们在落地时给自己定过三道闸门。
- 意图闸门:这一步要做什么,目标由人确认,不由模型自行推导目的。
- 事实闸门:引用到的数据要有出处,检索不到就转人工,不许推测填充。
- 动作闸门:涉及资金、对外发送、数据删除的动作,必须有二次确认。
3 道闸门串起来,模型可以往前走,但每一步都有停下来的理由。闸门不是把模型拦住,而是把不确定的部分挡在人这一侧。五、我们踩过的三个具体坑
- 把"理解得准"当成完成度。早期用标准样本上的准确率评估,模型表现很好;切到真实业务数据就掉下来。后来改成按场景统计"需要人工介入的比例",指标才稳定。
- 把模型输出直接写进表单。出现过字段被写成自然语言描述、下游系统解析失败的情况。改为模型只输出结构化候选值,由规则层校验通过后再落库。
- 忽略操作的可回放性。出问题后无法还原当时的界面,只能靠人凭印象复现。后来把每一步的界面快照与操作参数一起留存,复盘时间从 3 天压缩到 0.5 天。
六、怎么验证这套机制真的生效
我们看四个指标,它们各自对应上面的一个环节:
- 意图理解覆盖率:输入给到系统后,不需要人补充背景就能开工的比例,我们按场景逐个数。
- 事实可溯源率:模型引用到的数据里,能给出出处的比例。
- 动作自动通过率:不需要人工确认即可执行的动作占比,配合人工复核量一起看。
- 回放成功率:事后按留痕重放一次,结果与当时一致的比例。
上面这四项指标看的是同一件事在不同环节的落点,建议一个季度复算一轮,不要每周都动,否则难以判断是机制变了还是数据本身在变。这组指标不追求某一项特别高,只要四项平衡,说明不确定性被挡在了该挡的地方。七、行业里已经跑到什么规模
放到行业里看,这一转向已经有可查的推进节奏:某保险集团内部上线的自动化场景数量在 2 年内从 80 个增长到 150 个;某股份制银行公开的业务场景数量达到 220 多个,其中规则可完全枚举的比例不足半数。场景数量往上走,规则覆盖率就必然往下走,执行层要补的能力也就从"可选"变成了"必备"。检查清单
- 目标是否由人确认,而不是由模型推导。
- 引用数据能否给出出处,检索不到是否转人工。
- 资金、发送、删除类动作是否都有二次确认。
- 每一步操作是否留存界面快照与操作参数。
- 是否按场景统计人工介入比例,而不是只看整体准确率。