过去做BI报表,数据对不上顶多改改口径重跑一遍;现在AI直接参与排产、风控和供应商评估,同样的数据问题就成了决策偏差。AI应用加速落地,让数据治理从后台的外围工作,进入了AI应用的核心链路。
企业AI竞争正在从"模型能力竞争",转向"模型能力与数据供给能力的协同竞争"。以下从六个角度展开这一判断。
一、大模型很强,但企业的数据问题不会自动消失
模型可以理解和计算,但它至少有以下五件事解决不了。
第一,不能替企业确定指标的权威口径。"销售额"是含税还是不含税?"回款率"的分母是对账金额还是签约金额?模型不知道答案——这些定义需要业务和技术团队共同确认。
第二,不能自动判断哪套系统是可信数据源。同一个物料编码在ERP、MES、WMS中各不相同,模型无法判断以哪个为准。
第三,不能凭空补全缺失的业务术语和元数据。数据库字段叫"F_STAT_CD",模型不知道它代表"订单状态"还是"客户等级"——除非有人告诉它。
第四,不能保证源数据的准确、及时和完整。录入错误、同步延迟、字段缺失——这些是数据生产环节的问题,不在模型的能力范围内。
第五,不能代替企业制定数据权限和安全规则。谁能看什么数据、哪些字段不能展示给AI——这些是治理规则,不是模型推理。
一句话概括:模型可以生成答案,但数据治理决定这个答案是否建立在正确的数据、口径和权限之上。
二、三个趋势,让数据治理从外围工作进入AI核心链路
趋势一:AI进入核心业务,错误代价被放大。 当AI从"帮写周报"走向"帮做排产计划"和"帮评估供应商风险",数据错误的后果就从"报表数字对不上"变成了"生产、采购和风控决策出现偏差"。同样的数据问题,在BI报表时代是恼人,在AI决策时代是危险。
趋势二:高质量数据集从政策概念进入建设阶段。 2026年,江苏省共有147个项目入选高质量数据集建设先行先试名单,覆盖制造、医疗、交通等多个领域。数据供给正在从企业内部的一项IT工作,升级为有政策牵引和标准规范的基础设施工程。
趋势三:AI应用与数据治理形成双向循环。 这不是"先治理完再上AI"或"先上AI再补治理"的二选一。实践中的有效路径是:AI应用上线后,业务人员问出的"错误答案"往往恰好暴露了指标口径不一致、元数据标注缺失、数据时效不匹配等问题——这些信号反过来为治理工作提供了精准优先级。治理改善AI效果,AI暴露治理短板,两件事互相推动。
三、AI时代,治理发生了什么变化
AI没有让传统数据治理过时,但它深刻改变了治理的对象、要求和方式。
治理对象变了。 过去的数据治理主要面向结构化数据库中的表和字段。今天,企业的AI应用同时消费数据库、文档库、知识库、向量数据和训练推理数据集。治理的范围不再局限于"那张表",而是覆盖了AI消费数据的所有入口。
治理要求变了。 过去的数据质量目标是"字段正确、报表一致"。今天的标准升级为"机器可理解、语义可映射、结果可解释"。数据不仅要准确,还需要被AI正确地找到、正确地理解、正确地引用——这对元数据、业务术语和指标口径提出了远高于传统BI时代的精细度要求。
治理方式变了。 过去的数据治理通常以项目制推进——立项、实施、验收、结项。但在AI持续迭代的场景中,数据、模型和业务需求都在不断地变化。治理需要从阶段性项目升级为随数据、模型和业务场景持续迭代的闭环运营。
四、企业需要升级哪些治理能力
面向AI场景,企业可以从六个维度审视自身的数据治理准备度。
数据准确。 源数据真实、完整、符合业务规则。如果源表数据本身有误,AI给出的答案从一开始就是错的。
口径统一。 核心指标拥有唯一或明确适用范围的定义。"销售额"到底含不含税、"准时交付率"按哪个时间节点计算——这些定义需要跨部门达成共识并落地到系统中。
语义完整。 字段、表、指标和业务术语之间能够正确映射。业务人员说"帮我看下回款情况",AI需要知道去哪张表的哪个字段查什么算——这中间的所有映射关系都是治理需要沉淀的资产。
时效可控。 明确每个数据集的更新频率和可用时间范围。财务以月结为准,生产需要实时——AI需要知道"最新的数据"对不同场景意味着什么。
全程可追溯。 AI给出的每一个数据结论,应能追溯到数据源、加工过程和数据版本。当业务人员质疑"这个数为什么和财务对不上",追溯能力就是排查的起点。
安全可控。 AI只能访问和展示当前用户获得授权的数据,既不能因权限范围不足导致答案失真,也不能越权展示敏感字段。

五、沿着"理采存管用"建设AI数据供给能力
以上六个维度不是彼此孤立的检查项。"理、采、存、管、用"五阶段方法论,是行业实践沉淀出的一条可操作实施路径,覆盖了从数据准备到数据消费的完整链路。
在"理"阶段,明确AI应用场景,盘点和梳理涉及的数据资产、业务术语和核心指标口径——先搞清楚"AI需要什么数据、这些数据在哪、怎么定义的"。
在"采"阶段,将ERP、MES、CRM、文档库等多源异构数据接入统一的数据底座,解决"数据散落在哪"的问题。
在"存"阶段,对归集的数据进行清洗转换和编码统一,形成标准化的数据基础——这一步决定了后续AI消费的数据是否有统一的"语言"。
在"管"阶段,系统性地开展数据标准、元数据管理、质量检测、安全脱敏、血缘追踪和权限控制——六个维度中的大多数能力在这一阶段集中落地。
在"用"阶段,将治理成果以数据集、API、知识库和智能问数服务的形式发布和交付,让AI真正消费到经过治理的可信数据。
数据中台类产品按照这一链路,将数据盘点、归集、标准、元数据、质量、安全和数据服务连接起来,为AI应用持续提供可信、可理解、可追溯的数据供给。
六、企业从哪里开始
不必追求一步到位地完成全公司范围的数据治理,更务实的方式是"选场景、盘数据、跑闭环"。
先选择一个价值明确、数据边界清晰的AI应用场景——例如智能问数中的"经营分析"场景或"客户回款"场景。然后盘点该场景涉及的数据源、核心指标、业务术语和已知的质量问题。最后打通一条从"治理→应用→反馈→再治理"的小闭环,验证效果后再逐步扩展到更多场景。
这个闭环的核心价值在于:它让治理的优先级由真实的AI应用需求驱动,而不是由治理团队凭经验排期。当业务人员在AI问数中发现"这个指标口径不对"时,治理团队就有了明确的下一个工作目标。