一个常见误解是:上了智能体,脏数据也能自动变干净。现实恰恰相反——智能体对数据质量的敏感度,比人还高。喂给它错的主数据,它就把错扩散到十个系统。我现在的立场很明确:数据治理做不到位,企业级智能体自动化宁可晚做。宁可少上几个场景,也不拿脏数据去赌系统的稳定。
一、先过"数据门"三问
每个准备自动化的流程,我都要求先回答:数据从哪来、可信不可信、能不能结构化。某能源化工集团的报销场景,先把分散在各部门、各格式的票据汇集、清洗、结构化,再交给机器人处理,报销周期直接减半、年省上千人力小时,凭证类文本审核每天上万条且准确率保持高位。多花的清洗功夫,在后面每一步都赚了回来。
二、主数据校验要前置
很多故障出在"源头字段就不对"。某白酒企业把 18 个场景端到端打通时,把主数据校验放在流程开头,物料、客户、科目先核对再往下走,集成 ERP、预算、资金、税务、网银后实现全流程自动化。某轴承零部件企业的 BOM 校验也从两天压到二十分钟、效率翻数倍。校验前置一次,后面千次运行都受益。
三、结构化是智能化的前提
大模型擅长"读",但不擅长"猜"。一份版式杂乱的报关单,先 OCR 再抽取字段,随后才进判定逻辑,准确率才稳。某药企报关从五十分钟压到五分钟、效率提升九成;某轴承企业进出口单据从三小时压到半小时、准确率八成多且零错误、保持 100% 合规——共同前提都是先把非结构化数据变成可信结构。
四、数据治理与自动化的关系
自动化不是数据治理的替代品,而是它的"放大器"。治理好了,一个机器人能服务全公司;治理差,十个机器人也在补洞。我常跟团队说:先修路再通车,别指望车能把坑碾平。
五、给数据门设责任岗
流程跑起来后,谁对数据质量负责?我建议设专人对接数据源、定义校验规则、处理异常回流。某轴承企业的 BOM 场景正是因为有明确的责任门,才把校验时间从两天稳定压到二十分钟,而不是靠临时救火。责任到人,数据才可信。
数据质量也不能只靠一次清洗。我倾向建立"数据质量月度度量":源字段缺失率、结构化失败率、复核驳回率,三项指标盯着看。某轴承企业的 BOM 场景能长期稳定,靠的就是把质量度量变成月度例会的固定议程,而不是出事才查。更进一步,我会把数据质量指标反向绑定到流程负责人,谁的环节出错率高,谁就去优化,形成闭环。数据门守不住,再漂亮的编排也会在下游崩盘,前面所有自动化努力都白费。
补一句:数据治理和自动化常常是互相成就的关系。自动化把数据流动的每一步都记录下来,反而让原先看不见的数据质量问题暴露出来;反过来,治理补强后又让自动化更稳。两者应安排在同一项目组里协同推进,而不是各管一摊。某能源化工集团就是把报销自动化与数据清洗放在一个团队,才实现周期减半且长期稳定。
检查清单
流程数据来源是否清晰可溯?
主数据校验是否前置到流程起始环节?
非结构化单据是否先结构化再判定?
是否建立了数据质量的责任门?
自动化是否反过来推动了数据治理?
企业级智能体自动化能不能跑稳,先看数据底座牢不牢。数据门这道关,省不得,也绕不过。