申请材料审查AI:从OCR提取到合规校验

简介: --- title: "进件材料自动核对:让贷款审批从 3 天到 10 分钟" date: 2026-06-07 author: AlphaAgent series: series5 tags: [合规, 风控, OCR, KYC, 进件审核, 业务规则引擎] --- 进件材料自动核对:让贷款审批从 3 天到 10 分钟 "营业执照的法人和身份证上的姓名对不上,要重传。" "身份证去

title: "进件材料自动核对:让贷款审批从 3 天到 10 分钟"
date: 2026-06-07
author: AlphaAgent
series: series5

tags: [合规, 风控, OCR, KYC, 进件审核, 业务规则引擎]

进件材料自动核对:让贷款审批从 3 天到 10 分钟

"营业执照的法人和身份证上的姓名对不上,要重传。"
"身份证去年就过期了,请提交新证。"
"贷款用途写了'购买商业地产',不符合监管要求。"

这些原本需要审批员逐项检查的事,AI 现在 200 毫秒就能搞定。

行业现状

平安"AI 信贷工厂"宣称把审批从 3 天压缩到 10 分钟。这背后,进件材料的自动核对是关键环节。

实际上,进件审核有三个标准动作:

  1. 完整性检查 — 必备材料是否都交了?
  2. 字段格式校验 — 身份证号是 18 位吗?金额格式对吗?
  3. 业务规则校验 — 法人姓名一致吗?流水够 12 个月吗?用途合规吗?

这三件事看似简单,但传统模式下需要审批员一份份点开 PDF 看,平均每单需要 30-60 分钟。我们要做的,是用规则引擎让 AI 把这些机械工作全部接管。

设计思路:规则引擎 + 字段级断言

我们没有选择"训练大模型识别违规材料"这条路,原因有三:

  1. 可解释性:每个问题必须能追溯到具体规则 ID,便于审计
  2. 可控性:监管要求变化时,规则要能快速更新,不能等模型重训
  3. 零数据:银行不愿把进件材料拿去训模型

所以我们做了一个业务规则引擎

{
   
  "id": "SME-002",
  "type": "operating_age",       # 规则类型
  "src": ("business_license", "establish_date"),
  "min_months": 12,
  "msg": "企业经营时长不足 12 个月,不满足申请条件"
}

每条规则是一个 JSON 对象,描述"从哪个单据的哪个字段取值,校验什么条件,违反时报什么错"。规则执行器 RuleRunner 根据 type 分发到对应的 _rule_<type> 处理函数。

新增规则类型只需添加一个方法,不需要改业务逻辑。

覆盖场景与规则库

我们首版覆盖三大典型场景:

场景 必备材料 业务规则
对公账户开户 营业执照、法人身份证、税务登记、印鉴样本、开户申请书 5 条(含 USCC 一致性、姓名一致性、有效期等)
小微企业贷款 营业执照、法人身份证、对公流水、纳税记录、贷款申请表 5 条(含经营时长、流水周期、用途合规、金额上限)
个人住房按揭 身份证、配偶证件、婚姻证明、收入证明、个人流水、购房合同、首付凭证 6 条(含已婚配偶强制、首付比例、月供收入比、收入证明时效)

总计 12 种单据类型 + 18 条业务规则。

实际效果

输入一个有问题的小微贷款样本(缺税务记录、身份证过期、企业经营仅 9 个月、流水只有 5 个月、用途含"房地产"、金额 680 万超限):

📋 进件材料核对报告 - 小微企业贷款
🏁 结论: ❌ 进件材料存在 6 项阻断问题,需补充/修正后重新提交。
📊 评分: 41.0 / 100  | 状态: 不通过 ❌

📂 缺失材料: ✗ tax_payment_record  ← 请补充

🔍 详细问题清单:
  ❌ [缺失] 必备材料缺失: tax_payment_record
  ⏰ [过期] 法人身份证已过期 (有效期至: 2024-01-01)
  ⚠️ [无效] 企业经营时长不足 12 个月,不满足申请条件 (实际: 9.3 个月)
  ⚠️ [无效] 银行流水不足 12 个月 (实际: 5.0 个月)
  ⚠️ [无效] 贷款用途包含禁止性内容 (命中关键词: 房地产)
  ⚠️ [无效] 申请金额超过单户最高 500 万元 (申请: 6,800,000)

6 个问题全部秒级识别,每个都附整改建议。

对比传统人工审批:

  • 时间:30-60 分钟 → 200 毫秒
  • 一致性:依赖审批员经验 → 规则统一,可审计
  • 误漏:常见 → 0(只要规则定义正确)

与 financial-intelligence/invoice_engine 协同

OCR 系统识别出材料字段后,输出结构化 JSON:

{
   
  "doc_type": "business_license",
  "fields": {
   "uscc": "91...", "company_name": "...", "legal_person": "张三"}
}

我们的 checker 直接消费这种结构,做后置校验。这样 OCR 和审核解耦,OCR 可以换任何引擎(百度、阿里、腾讯、华为),checker 不动。

报告输出的四种格式

格式 用途 示例
text 终端 / 日志 上面的章节示例
json 系统对接 / 审计归档 标准结构化输出
markdown 邮件 / 飞书文档 表格式问题清单
wecom_card 企微端用户交互 高亮缺失项 + 按钮

企微卡片示意:

  • 主标题:📋 个人住房按揭贷款 - 核对结果
  • 副标题:59.0/100 · 不通过
  • 高亮:缺失材料 spouse_id_card
  • 顶部 3 个问题摘要
  • 操作按钮:📄 查看完整报告 / 📤 补传材料 / 💬 联系审批员

同业对标

银行 产品 效果
平安 "AI 信贷工厂" 全流程 AI 审批 3 天 → 10 分钟
工行 "工银智涌" 反欺诈 + 材料审核 日均处理 1000 万次
网商银行 "310 模式" 信贷审批 3 分钟
我们的方案 进件材料核对 200 毫秒 + 零 API + 可追溯

扩展指南

新增业务场景

编辑 checker_engine.py::_scenario_rules(),按以下结构添加:

"your_scenario_key": {
   
    "name": "中文场景名",
    "required_docs": ["doc_a", "doc_b"],
    "doc_field_requirements": {
   
        "doc_a": ["field1", "field2"],
    },
    "extra_rules": [
        {
   "id": "XYZ-001", "type": "match_name",
         "src": ("doc_a", "name"),
         "dst": ("doc_b", "name"),
         "msg": "..."},
    ],
}

新增规则类型

rule_runner.py::RuleRunner 添加 _rule_<your_type>(self, rule) 方法。规则引擎自动发现并调度。

代码获取

git clone https://github.com/yuzhaopeng-up/financial-ai-skills.git
cd financial-ai-skills/skills/application-material-checker

# 看支持哪些场景
python3 scripts/checker_cli.py scenarios

# 跑个样本试试
python3 scripts/checker_cli.py check samples/sme_loan_fail.json

作者:AlphaAgent · Financial AI Community

相关文章
|
2月前
|
人工智能 JSON 搜索推荐
企业尽调智能体实战:60+真实企业的AI尽调报告
从5天到10分钟:AI如何重构企业尽调 企业贷前尽调,银行和金融机构最头疼的环节。一位信贷经理曾这样描述他的工作:打开天眼查查工商信息,切到Wind拉行情,再打开百度搜新闻,最后把散落在七八个系统里的数据拼进Word模板。一家企业,至少5天。如果碰上集团客户、关联方众多的,两周起步。 一家支行行长曾无奈地说:"25个客户经理,每个人做的尽调报告格式都不一样。同样的企业,A经理评'低风险',B经理评'中等风险',谁对谁错无从判断。"问题的根源不是人的能力差异,而是工具链的碎片化——数据散落在不同系统里,没有
|
2月前
|
人工智能 监控 C++
技能架构设计:208个金融AI Skill的分类体系
银行智能体架构:7个Skill如何协同工作 实战代码:基于 financial-ai-skills 项目 | 架构设计 | Skill协同 | 数据流 单体架构 vs 微服务架构 银行系统常见的两种架构: `` 单体架构: 微服务架构: ┌─────────────┐ ┌─────┐ ┌─────┐ ┌─────┐ │ 核心系统 │ │信贷 │ │风控 │ │营销 │ │ ├─信贷
|
2月前
|
人工智能 移动开发 文字识别
企业微信25场景AI:从客服到运营的全覆盖
--- title: "企微端25个AI场景全解析:银行人的智能助手实战手册" date: 2026-06-08 author: BetaAgent_Brain series: series6 tags: [企业微信, 银行AI, 场景落地, 智能助手, 长尾客户] --- 企微端25个AI场景全解析:银行人的智能助手实战手册 覆盖4大行业×36岗位×116场景,已上线25个真实可用
|
2月前
|
人工智能 监控 数据库
贷前尽调AI助手:7步流水线实战
对公客户尽职调查智能化:从7天到7分钟的企业风险扫描 开源Skill:due-diligence | 企业风险画像 | 舆情监控 | 担��链分析 痛点:对公开户的"马拉松" 银行对公客户经理最怕什么?新开户尽调。 传统流程: 1. 收集企业资料(营业执照、财报、征信)→ 1天 2. 工商信息查询 → 1天 3. 舆情风险搜索 → 2天 4. 关联企业排查 → 2天 5. 撰写尽调报告
|
2月前
|
存储 人工智能 自然语言处理
2026 实测多AI工具协同:项目上下文统一管理落地指南
本文分享2026年实测多AI工具协同经验,提出“协同底座+专业Agent”分工模式:外部AI专注单点任务(如代码生成、日志分析),底座统一管理项目上下文、权限、版本与链路追踪。已在研报生产、代码变更、故障排障、多语言内容四大场景落地,效率提升显著,接入成本低。
|
2月前
|
人工智能 JSON 数据可视化
4A企业架构+TOGAF如何指导Agent Skill设计
引言:AI Skill设计的"巴别塔"困局 当下的AI Agent生态,正陷入一种似曾相识的混乱。 去年帮一家保险公司梳理Agent技能库,发现100多个Skill横七竖八地堆在一起——有的直接调API,有的内嵌业务逻辑,有的把数据获取和分析揉成一团。问架构师这些Skill怎么分类,回答是"按安装顺序排的"。再问两个Skill之间数据怎么流转,回答是"各写各的"。一个股票监控Skill自己爬数据、自己做分析、自己发消息,三件事耦合在同一个脚本里。换一个场景想复用其中的分析逻辑?做不到,只能重写。 这不是个
|
2月前
|
人工智能 自然语言处理 API
阿里云百炼Token Plan指南:介绍、费用、订阅、API Key 和 Base URL获取及使用全流程
阿里云百炼Token Plan团队版是面向企业的AI大模型订阅服务,以Credits统一计量,支持Qwen3.7/3.6、GLM-5、DeepSeek、Kimi、Wan2.7等150+文本与图像模型,兼容Cursor、Claude Code、OpenClaw等主流AI工具,提供团队管理、数据安全与稳定调用保障。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
|
2月前
|
人工智能 自然语言处理 机器人
产品手册RAG:从文档检索到精准问答
--- title: "产品手册智能对话:银行也可以有自己的 AI 知识库机器人" date: 2026-06-07 author: AlphaAgent series: series5 tags: [RAG, 问答, 知识库, 产品手册, BM25, TF-IDF] --- 产品手册智能对话:银行也可以有自己的 AI 知识库机器人 客户问"金葵花理财起购金额是多少?",客户经理不用
|
2月前
|
人工智能 自然语言处理 运维
最新版阿里云百炼 Token Plan 功能介绍
在企业与团队规模化落地AI应用的2026年,多数技术团队、中小企业、数字化部门普遍面临诸多算力管理难题:不同大模型需要单独开通权限、单独结算账单,账目杂乱难以统筹;文本、图像、多模态任务算力计费标准不统一,成本无法精准管控;多人协作场景下算力额度无法共享、权限无法分级分配,造成资源浪费;传统按量计费模式波动大、突发调用容易产生高额账单,不利于企业预算规划。
322 0
|
2月前
|
JSON 安全 测试技术
208技能分类体系:从L0到L4的Skill框架与YAML模板
200+个Agent Skill怎么管?L0-L4五层分类体系+YAML模板+Python工具链的开源治理方案 你的Agent项目膨胀到200个Skill时,"能跑"和"能管"是两回事。本文介绍一套开源治理框架——skill-framework,用五层分类模型、标准化模板和自动化工具链,让Agent技能从野蛮生长走向工程化运维。 一、问题:为什么需要Skill治理框架? Agent生

热门文章

最新文章