很多团队把"自动化上线"当成终点,结果机器人半夜报错没人知道,第二天才发现业务漏跑。我的体会是:智能体自动化能不能规模化,一半看编排,一半看可观测。看不见,就管不了;管不了,规模越大越危险。
一、三层指标要分开看
我习惯把指标拆成三层:运行层(成功率、耗时、并发)、业务层(处理笔数、准确率、节省工时)、治理层(权限变更、资产复用率)。某保险集团建了统一监控看板加虚拟运行环境,支撑六百多个场景、累计数万小时运行,靠的就是三层指标分级视图。业务层指标让老板看懂价值,运行层指标让运维看清健康。
二、追踪比日志更关键
单看"成功 / 失败"不够。一次对账失败,要能追到是哪个系统返回了异常、哪条数据触发了分支。我的做法是给每个任务发追踪标识,串起跨系统调用链,出问题时直接定位,不用翻几十个日志文件。没有追踪,排障就是猜谜。
三、根因分析要能沉淀
同样的问题第二次出现,就该有自动归因。某大型银行的监控体系把常见故障模式建成知识,新告警先匹配历史根因,能自动给处置建议。可观测的目标不是"看到",而是"少犯第二遍"。知识沉淀得越厚,半夜被叫醒的次数越少。
四、用 SLO 给运维定底线
给关键流程设服务等级目标:比如日终对账必须在几点前完成、准确率不低于某阈值。越界就告警升级。没有 SLO,监控只是热闹的图表;有了 SLO,图表才变成可执行的契约。
五、把可观测做成平台能力
别让每个团队各自搭监控。我建议把指标采集、追踪埋点、告警路由做成平台内置能力,新流程上线即自动接入看板。某保险集团的虚拟运行环境正是这种思路,才能用一套看板管住数百个场景。可观测一旦下沉为平台能力,规模化的门槛就降下来了。
告警一多就容易"狼来了"。我建议给告警分级:影响业务的红色、影响效率的黄色、纯提示的蓝色,只有红色才夜里叫人。某大型银行把故障模式建成知识库后,重复告警自动归并,值班人员的有效处理率明显提升,告警从噪音变信号。我还习惯给每个红色告警配"标准处置手册",新人照着做也能处理大半,减少对个别老手的依赖,运维韧性因此更强。告警分级之后,我会定期回看红色根因分布,若某类问题反复出现,就推动上游流程改造,而不是永远靠告警兜底。
再补一条经验:可观测数据也要讲"保鲜"。指标看板如果一直红着没人管,团队会逐渐无视它,告警失去意义。我定了规矩:红色告警必须当天闭环或升级,黄色周内清,蓝色按月归档。看板常清常新,告警才有人信。某大型银行靠这套节奏,把有效告警占比稳步拉高,运维从救火走向预防。
检查清单
运行 / 业务 / 治理三层指标是否分开?
是否具备跨系统调用链追踪?
根因是否可沉淀为知识复用?
关键流程是否设了 SLO?
告警是否能升级到责任人?
企业级智能体自动化要"跑得久",可观测性工程是绕不开的必修课。看不见的自动化,终会变成不敢信的自动化。