财务、采购、关务、客服每天面对的是:发票、合同、报关单、物流单、银行回单……这些非结构化或半结构化单据,散落在邮件、微信、PDF、图片里。人工要做的是:打开 → 看懂 → 摘字段 → 录入系统。量大、易错、难追溯。我们管这叫"文档墙"。
"文档处理智能体"的思路是:以智能识别为入口,以自动化执行为目标,打通"文档感知 → 业务执行"的全链路闭环。
全流程管道
多渠道采集 ──▶ 精准分类 ──▶ 智能提取 ──▶ 智能审核 ──▶ 自动录入
邮件/微信 发票/合同/ 多模态大模型 辅助人工 对接执行层 /
PDF/图片 报关单... 结构化抽取 校验偏差 业务系统
五个环节逐层递进,目标是从"看得见的文档"走到"用得上的数据"。
【配图建议:插入"采集→分类→提取→审核→录入"的文档智能流程管道图】
核心能力拆解
1. 智能分类:混合单据进来,先按类型分堆,不用人工预分拣。
2. 多模态提取:发票、合同、报关单各有结构,基于多模态大模型把关键字段抽成结构化数据。
3. 流程协同:与平台执行层及各类业务系统对接,把结构化数据直接送进 ERP、发起审批或触发支付。
版式千变万化,我们怎么兜底
单据识别最头疼的是版式差异。同一张增值税发票,不同省份、不同开票软件导出的版式能差出天际。我们的做法是三层兜底:
- 模板优先:高频标准版式建模板,又快又准;
- 模型泛化:长尾版式交给多模态大模型抽取,容忍一定偏差;
- 低置信转人工:置信度低于阈值的字段,标红交人复核,绝不 silent 灌错。
我们还加了"智能审核"环节:抽取结果和规则库(如发票要素必填、金额逻辑)比对,偏差即拦截。早期跳过这步,一张模糊发票把金额抽错,下游全错,教训深刻。
踩过的坑
坑一:只做识别不做审核。 早期我们直接把抽取结果灌进系统,结果一张模糊发票把金额抽错,下游全错。后来加了一道"智能审核":抽取结果和规则库比对,偏差项标红交人复核。
坑二:低估版式差异。 同一张发票,不同省份、不同供应商版式天差地别。我们靠大量样本微调,并接受"低置信度自动转人工",不强行全自动。
案例:医药集团 30+ 省招采数据整理
某医药集团,运营人员需登录 30 多个省份的医药局采购系统筛选招采数据。用"AI 识别 + 平台执行层"组合,可实现全天候自动查询整理、近千条数据 100% 正确率,完全释放人力。前提也是这套"抽取—审核—转人工"的兜底闭环。
回到一个常被问的问题:既然 OCR 已经很成熟,为什么还要上多模态大模型?我们的体会是,OCR 擅长"固定版式的印刷体字符识别",但企业单据恰恰是"非固定"的——同一要素可能在表格左上、也可能在页脚;同一张报关单,字段顺序随贸易方式变化。纯 OCR 在这些情况下要么漏字段、要么串列。多模态大模型的优势是把"版面理解"和"语义理解"一起做,先看懂这张单据是什么结构,再抽字段,长尾版式泛化明显更好。
除了医药招采,我们还把这套管道用在关务(报关单自动录单)、客服(工单附件关键信息提取)、银行回单(收款方/金额/用途自动归账)等场景,本质都是"把人从打开—看懂—摘字段的机械劳动里解放出来"。
文档智能不是单点 OCR,而是一条"感知→分类→提取→审核→录入"的管道。文档智能的及格线不是"识别准",是"错得出来"——能把不确定的交给人,比盲目自信重要。
补充一点:覆盖的单据类型很广,从增值税发票、采购合同到报关单、物流单都能处理。关键是"先分类再抽取"——混合单据进来先分堆,再按类型走对应抽取逻辑,比一股脑丢给模型准得多,也更省资源。