企业里大量业务凭证——合同、发票、报关单、订单、物流单——都是非结构化的。它们格式千变万化、版式年年更新,纯靠人工录入慢且错,纯靠通用 OCR 又常常"识别准但业务跑不通"。本文拆解一套文档智能的端到端实践,重点聊容易被忽视的"兜底"环节。
一、为什么单据是自动化的硬骨头
与固定界面的系统操作不同,单据的难点在于"没有固定结构":同一类发票来自不同供应商、排版各异;同一份合同每次条款顺序不同;扫描件还有倾斜、印章遮挡、表格跨页等问题。这些因素叠加,让单点识别模型在真实业务里频频失手。
二、五步法:采集 → 分类 → 提取 → 审核 → 录入

一套稳妥的文档智能流水线通常拆成五步:
- 采集:从邮件、网盘、业务系统或扫描设备统一汇聚单据,统一格式与命名。
- 分类:自动判断单据类型(发票 / 合同 / 订单 / 报关单),分流派发到对应处理流。
- 提取:用多模态识别从单据中抽取关键字段(金额、税号、日期、明细行等),而非仅做整页 OCR。
- 审核:按业务规则校验字段一致性(如价税合计是否等于金额加税额),低置信度自动转人工。
- 录入:把结构化结果回写到 ERP 或财务中台,驱动后续自动化执行。
三、不能只靠 OCR:版式差异是真实挑战
很多团队低估了版式差异。通用 OCR 对规整文档表现好,但遇到以下情况会明显退化:表格线缺失或错位、字段跨页、竖排或混合排版、印章压字。此时"识别字符"和"抽取正确业务字段"之间还有距离。
因此第 4 步的"审核"不能省。实践中的做法是建立"抽取—规则校验—转人工"的兜底闭环:模型给每个字段打置信度,低于阈值的连同上下文一并推给业务人员确认;确认结果再反哺模型。这样既保住了准确率,又让人工只处理真正疑难的单据。
这里要强调"多模态"的价值。纯 OCR 本质是图像转文字,对版面结构不敏感;而多模态识别能同时理解文字、表格线、印章位置和排版逻辑,更贴近"人看单据"的方式。对带印章压字、表格跨页、混合排版的复杂单据,多模态的字段抽取稳定性明显优于单模态 OCR。但即便如此,它仍不是银弹——所以兜底闭环必须保留,把模型不确定处交给人,才是生产环境跑得稳的组合。
四、场景落地
- 应付与订单:从供应商发票、采购订单中抽取字段,自动与合同三单对齐,差异自动预警。
- 物流与清关:从运单、报关单抽取关键信息,驱动报关与库存更新。
- 招采数据整理:某医药集团运营人员需登录 30 多个省份的医药局采购系统筛选招采数据,用"AI 识别 + 平台执行层"组合实现全天候自动查询整理,近千条数据达到 100% 正确率,完全释放人力。
- 客服与合同:从客户邮件附件、销售合同中抽取关键条款与要素,自动生成工单或归档索引,让客服与法务从翻文档中解放出来。
这些场景的共同点是:先让文档智能把"非结构化"变成"结构化",再交给自动化执行层去"跑流程",二者串起来业务才真正闭环。
五、与自动化平台的集成
文档智能单独存在价值有限,真正的收益在"识别结果驱动执行"。例如发票字段抽取完成后,平台自动发起付款申请、更新应付账款、触发审批流;识别到异常则转人工并挂起后续流程。文档智能是"眼睛",自动化执行层是"手脚",缺一个都跑不通。
结语
文档智能的终点不是"识别准",而是"业务跑得通"。五步法保证流程完整,版式兜底保证极端情况不崩,人机协同保证准确率可持续——这三件事做到位,非结构化单据才真正从成本