单证、发票、合同、报关单、验收单,这类材料有一个共同点:信息量很大,但格式完全不受控。同一张报销发票,可能来自三个不同的开票系统;同一份采购合同,附件可能是扫描件、图片或者从老系统导出的文本片段。人工处理的瓶颈从来不是看得慢,而是每一次都要重新理解一遍材料。要把这类工作交给企业级智能体自动化,得先把流程拆成可以单独衡量的几步。
一、先给结论
结论是:把单据处理拆成采集、分类、提取、审核、录入五步,每一步只解决一类问题,可以让准确率在每个环节单独衡量、单独优化。五步全都用同一套规则硬扛,是这类项目失败的常见原因。
二、采集:先解决"材料到不齐"
采集这一步的目标不是快,而是全。常见做法是分三条路同时收:系统间直连取数、邮件与门户收件箱归集、本地上传补录。三条路共用一个归集目录与统一命名规则,避免文件散落在各自的文件夹里。缺件是常态,所以采集阶段要能标记缺口并在后续环节提示补件,而不是静默跳过。
三、分类:把混杂材料收拢成可处理的集合
分类的作用不是归档好看,而是给后面的提取步骤限定可选项。我们把分类粒度定在"单据类型 + 业务场景"两维,比如"增值税发票 / 费用报销"。粒度太粗,提取时要试错;太细,新增类型就要改规则。实践中一个中型财务共享中心稳定在 20 到 50 个类型,是可以长期维护的量级。
四、提取:识别与理解的边界要划清
传统的ocr方式擅长还原文字位置,但对"这笔金额含不含税""这个日期是开票日还是付款日"这类问题无能为力。多模态方式的优势在于把版面与内容一起看,能直接给出字段值与上下文。我们的做法是两者叠加:识别层给出文字与坐标,理解层给出字段与置信度,理解层的结果必须落到识别层能验证的位置上。版式变化时,理解层要能退化到版面兜底,重新定位而不是直接报错。
五、审核与录入:置信度决定人的工作量
审核环节很容易被做成"人人都看一遍",成本反而比手工更高。我们的规则是按置信度分层:高置信直接过、中置信由业务抽查、低置信强制人工。这样人的精力只集中在真正看不准的那部分。录入环节则尽量把校验前移到写库前,字段类型、必填项、业务口径一次校验完,避免下游系统再抛一堆错误。
六、我们踩过的三个具体坑
- 把分类做成了纯规则匹配。新增一种附件格式就要改一套规则,维护跟不上。后来用模型先看类型再看字段,规则只兜底。
- 审核环节不分置信度,全部人工核对。十万条量级的单据需要数十人天,成本甚至高于手工处理。改为分层审核后人工量下降明显。
- 忽略补件闭环。缺少的附件在审核阶段被打回,但没人负责催,单据长期停在半截状态。后来把补件任务并入采集环节统一跟进才解决。
七、怎么验证这套机制真的生效
- 分类准确率:抽 100 张单据人工复核,类型判错的数量。
- 字段级准确率:按字段统计,不按整单统计。整单口径会掩盖局部错误。
- 人工介入比例:需要人处理的单据占比,这是成本的直接来源。
- 补件闭环时长:从判缺到补齐的平均天数。
行业里同等规模的大批推进也并不少见。某能源化工集团每天需要处理的凭证文本在 1 万条量级;某集团财务共享的文本审核,上万条材料在几分钟内过完,只留 1 人做复核,准确率保持在高位。这些数字背后有个共同前提:流程已经被拆成可以单独衡量的几步。某药企的报关单处理,单票耗时从 50 分钟降到 5 分钟,效率提升 90%,每周省下约 1 人天。某印刷包装企业的入离职办理,从 15 到 20 分钟压到 3 分钟,效率提升 5 到 8 倍。这些案例里没有一个是靠堆算力拿到的,都是靠步骤拆分与置信度分层。
这四项每季复算一次,趋势比绝对值更有意义。检查清单
- 三条采集路径是否有统一归集与命名规则。
- 分类粒度是否控制在可维护的数量级。
- 提取结果能否回溯到识别层的位置。
- 审核是否按置信度分层,而不是全部人工。
- 缺件是否有明确的补件责任人与时限。