ConfBench:大模型的「我很有把握」,到底能不能信?

简介: ConfBench 用受控退化造出一份「低精度区」基准,首次系统测出 VLM 在文档提取时自报的置信度能不能信,还给了 ECARB 这个能直接算「省多少人工审核」的指标——做文档智能 / IDP 的人值得读。

氛围图

💡 一句话总结:ConfBench 用受控退化造出一份「低精度区」基准,首次系统测出 VLM 在文档提取时自报的置信度能不能信,还给了 ECARB 这个能直接算「省多少人工审核」的指标——做文档智能 / IDP 的人值得读。

💬 导语:那个 0.95 的置信度,你真敢拿它分流吗?

先问一个可能戳到你的问题:你那个跑得好好的文档抽取 pipeline,每条结果都附一个置信度分数,你是不是就按这个分数把高自信的自动入库、低自信的丢给人工复核?

如果是,再追问一句:你验过那个分数本身可不可信吗?

很多做智能文档处理(IDP,Intelligent Document Processing)的人都默认「模型自报的置信度 = 真实把握」,可现实常常打脸——大模型在提取错的时候照样拍胸脯说「我 95% 确定」。校准(calibration,就是「模型说的自信程度跟它实际答对的概率对不对得上」)一旦失准,按置信度路由的整套人机协作就会出两种毛病:

  • 过度自信的错:本该送审的错被自动通过,漏到客户或合规那里
  • 过度不自信的对:把一堆其实没问题的结果也丢去人工,审查队列被淹

而你要去验证校准好不好,会发现一个尴尬的现状:现有的文档基准(DocVQA、FUNSD 这类)都是干净高质量样本,正确率高得离谱,错误样本和低自信样本实在太少。可校准恰恰要在「模型答得不太好」的那段区间里才有意义——干净基准把这段盲区留给你了。

这正是 Amazon AWS 团队的 ConfBench 想填的坑。

想自己动手试?

🤔 这篇论文到底想解决什么问题?

研究问题一句话:视觉语言模型(VLM,就是能同时看图、读文字的大模型)在文档关键信息提取(KIE)里自报的置信度,能不能信?能不能拿它可靠地把结果分流到「直接自动化」或「送人工审查」?

这件事为什么重要?因为 IDP 生产系统几乎都靠「置信度阈值」做人机协作路由——分数过线就自动处理、不过线就丢人工。这套逻辑成立的前提,是模型的置信度真的反映了它答对的可能性。一旦模型过度自信(这是大模型的通病),阈值路由就会失灵,要么错误漏审带来风险,要么人工队列爆炸带来成本。

那为什么以前没人好好测这个?因为缺合适的基准。测校准需要一种叫 ECE(期望校准误差) 的指标——简单说,它要看「模型说 80% 自信的那些预测里,实际是不是大约 80% 答对了」,而且要在从低到高各个自信区间都有足够样本才能算准。可现有文档基准都是干净样本,正确率集中在高位,错误和低自信样本稀疏,低精度区根本没几个点,ECE 在这段就算不准。

打个不太严谨但好记的比方:这就像你去做体检,可体检样本库里全是健康人——你想知道「各项指标在人不舒服时还准不准」,可样本里压根没几个不舒服的。ConfBench 干的第一件事,就是把这段盲区手动填满。下面这张图就是它的「战绩」——用 Claude Sonnet 4.5 跑同一批文档,原始 75 份发票的精度都挤在 0.6 以上(左峰),经过论文的退化处理后,0.0–0.6 的低精度区被实实在在填满了(右峰)。

图1:增强前后每文档平均实体提取精度分布——左峰是原始 75 份干净文档(精度>0.6),右峰是退化变体填满的 0.0–0.6 低精度区

图说:左峰是「原本就干净」的文档,右峰是论文用退化「制造」出的难题——低精度区从无到有被填满,校准评估终于有了足够样本

🛠️ 它的思路是什么?

ConfBench 的思路分三步走:先把样本造难、再让模型各显神通、最后用一个接地气的指标算经济账

第一步,把样本造难。 作者拿 75 份人工核验过的真实 FCC 发票(来自 RealKIE-FCC-Verified)当底子,套上一个叫 Augraphy 的开源文档退化引擎,模拟一份真实文档从打印、流转到扫描一路上会遭的罪。退化分三个阶段,对应文档的「一生」:

  • 🖨️ 墨水阶段(Ink phase):模拟字迹洇开、淡墨、印痕
  • 📄 纸张阶段(Paper phase):模拟老化、折痕、污渍、水印、打孔
  • 📠 后期阶段(Post phase):模拟 JPEG 压缩、旋转、扫描摩尔纹、传真/复印噪声、点阵打印

关键是有个 OCR-Safe 约束——退化力度卡在「精度有意义地下降、但不至于全军覆没」的区间。这点很要紧:如果退化太狠、模型全部识别失败,那也没法测校准(全错就没梯度了)。最后 75 份干净发票变成 1,346 个退化变体,按精度下降幅度分 Mild(轻)、Moderate(中)、High(重)三档。直观感受一下「同一份发票在轻度和重度退化下长什么样」——难度梯度一目了然:

图6a:原始干净扫描

图说:原始的干净扫描件——模型在这种图上正确率高,但恰恰因此测不出校准盲区

图6d:重度退化——dithered 点阵打印

图说:重度点阵打印退化——人看着都费劲,正好把模型推到「低精度区」,校准评估要的正是这种样本

第二步,让模型各显神通。 作者拉了 7 个 VLM 来跑——4 个专有(Claude Opus 4.6、Sonnet 4.5、Haiku 4.5、Kimi K2.5)加 3 个开源(Qwen 3 VL-235B、Qwen 3.6-27B、Gemma 3-12B)。每个样本用 3 种输入模态喂给模型:

  • 📝 OCR-only:只给 OCR 抽出来的文字
  • 📝🖼️ OCR+Image:文字和原图都给
  • 🖼️ Image-only:只给原图,让模型自己看

那置信度怎么拿?这是这篇论文最有意思的部分,它比了两大流派。

一是 verbalized(语言化置信度)——直接让模型「自己说」。做法是让模型对每个字段列出 top-4 个候选值并各打一个 0–1 的概率,取最高概率那个当结果、概率当置信度。妙处是单次调用同时完成提取和打分,省 token,而且明确不用 chain-of-thought(作者引前人发现 CoT 不改善校准)。

二是 logprob(token 对数概率)——扒模型内部。让模型贪婪解码吐出答案,然后取答案那串 token 各自的对数概率(模型生成时给每个 token 的内部打分),再按三种方式聚合成一个置信度:

  • 🔹 first-token:只看答案第一个 token 的概率(「模型对这个值的开头有多笃定」)
  • 🔹 mean-token:所有 token 的几何平均概率
  • 🔹 margin:top-2 候选的标准化差距(差距越大越确定)

两条路径、加上模态和模型,最终汇成一张完整的对比矩阵。下图是整个实验设计的鸟瞰:

图2:实验设计总览——上半 verbalized 路径(提取+置信度单次调用搞定),下半 logprob 路径(贪婪解码取 token 概率再聚合)

图说:两条置信度获取路径从同一批退化文档出发,最终都汇入同一组校准指标做对比

第三步,用一个接地气的指标算经济账。 这是这篇论文我最喜欢的地方。学术指标 ECE、Brier、AUROC 对运营者来说太抽象——你跟老板说「我们模型 AUROC 0.84」,老板关心的是「那我雇的人工能少看几条」。于是作者提出 ECARB(审查预算下的错误捕获倍率),把校准直接换算成钱。它的工作方式是这样的:

  1. 把所有预测按置信度从低到高排(最低自信的排最前,也就是「模型最该送审的」)
  2. 取前 30% 送人工审查(30% 是你能负担的审查预算)
  3. 数这 30% 里实际抓到了多少条错误
  4. 拿这个数除以「随机抽 30% 期望抓到的错误数」

比值大于 1 就说明模型的置信度有路由价值——越大,说明同等人工能抓越多错。比起一个抽象的 AUROC,运营者更需要「我审 30% 能比瞎蒙多抓几倍错」这种话。

📈 效果到底怎么样?

7 个模型 × 3 种模态 × 4 种策略,跑出 7 万多条实体级评估。结果里我挑几条最值得在意的说。

先看模态:OCR 文本和原图一起喂,是双赢。 在「提取精度(WOA)」对「置信度判别力(AUROC)」的散点图上,OCR+Image 模态稳定占据右上角——既准又可信。这有点反直觉:你可能以为多给一份 OCR 文本只是帮模型提准,但它连带把置信度质量也抬上去了。换句话说,喂得全,模型不仅答得更对、对「自己答得对不对」也判断得更准。

图3:模态对比——横轴提取精度 WOA,纵轴置信度判别力 AUROC;OCR+Image 一致占据右上(既准又可信),Image-only 偏弱

图说:右上角是「又准又可信」的理想区,OCR+Image 点云稳定挤在那里——给模型同时看文字和原图,是最划算的输入方式

再看模型:同一家校准随规模变好,跨家参数量却不灵。 Claude 家族内,校准随模型规模干净地单调提升:

模型 AUROC↑(越高越会分辨对错) ECE↓(越低越校准)
Claude Opus 4.6 0.84 0.05
Claude Sonnet 4.5 0.77 0.13
Claude Haiku 4.5 0.74 0.17

(AUROC:模型「把错和对分开」的能力,0.5 是瞎蒙、1.0 是完美;ECE:置信度数值跟实际正确率的偏差,越接近 0 越校准。)

这条「能力→校准」的单调关系在 Claude 家族里很漂亮。但跨家族就翻车了:Qwen 3.6-27B(AUROC 0.72)反而压过自家更大的 Qwen 3 VL-235B(0.62)。所以「参数量越大校准越好」这个直觉不成立——作者据此把结论模糊成「模型能力主导校准」,但「能力」到底指参数、数据还是对齐方式,论文没拆开讲(这点后面 caveat 再说)。最有说服力的是 reliability diagram(可靠性图),它直接把「模型说的自信」和「实际正确率」叠在一起比:

图5b:Claude 家族可靠性图——Opus 4.6 柱状紧贴 y=x 对角线(近完美校准),Haiku 偏离明显

图说:对角线是「说多少自信就答对多少」的完美校准;Opus 几乎贴着线,Haiku 则系统性跑偏——校准好坏一目了然

最后看经济账:ECARB 告诉你选错模型会浪费多少人工。 在 30% 审查预算下,最佳配置(Claude Opus 4.6 + verbalized)达到 2.43×——也就是同等人工能抓到 2.43 倍于随机抽查的错误。最弱的配置(Gemma verbalized)也有 1.39×。关键不是「都比 1 大」,而是 2.43 和 1.39 之间差了快一倍——选错模型,你的审查团队效率就白白折半。

主表里还有一个我特别想点的细节:「提取最准」和「置信度最可信」不是一回事。看 Verbalized 这组,Sonnet 4.5 的提取精度(Acc 0.77)和 F1(0.51)其实反高于 Opus 4.6,但 Opus 的校准(ECE 0.05)远好于 Sonnet(0.13)。换句话说,Opus 提取略不那么准,但它「对自己答得对不对」判断得更诚实——而做人机协作路由,你恰恰更需要后者。下面这张主表摘录(OCR+Image 模态)值得存下来当参考:

模型(策略) AUROC↑ ECE↓ ECARB@30%↑
Claude Opus 4.6(verbalized) 0.84 0.05 2.43
Claude Sonnet 4.5(verbalized) 0.77 0.13 2.24
Claude Haiku 4.5(verbalized) 0.74 0.17 1.96
Qwen 3.6-27B(verbalized) 0.72 0.22 1.93
Gemma 3-12B(logprob first-token) 0.64 0.36 1.45

最后一条值得记的:置信度策略没有银弹。Qwen 3.6-27B 上 verbalized(0.72)赢 logprob(0.62),可 Gemma 3-12B 上反过来,logprob(0.64)赢 verbalized(0.58)。所以「verbalized 一定比 logprob 好」这种结论不能下——换个模型可能就翻转,得实测。

🚀 为什么你要关心?

你可能不做发票提取,但只要工作里有大模型「自报置信度 + 按阈值路由」这套模式,这篇都跟你有关。几条我看到的实际落点:

  • 🎯 重新验你的置信度阈值:如果你现在按某个固定阈值分流提取结果,拿这篇的方法在自家真实文档上复测一次 ECARB。很可能你会发现,信了很久的置信度,路由效率其实只有 1.3×——大量该送审的没送、不该送的浪费了人工。
  • 🎯 选模型别只看 F1:这篇最大的贡献之一,是把「校准质量」单独立成一条跟「提取精度」并列的评估维度。以后选文档抽取模型,F1 高不代表置信度可信,得另看 AUROC / ECE——ConfBench 给了首个可比的基线。
  • 🎯 ECARB 这个指标直接拿走:任何「靠置信度路由」的场景——欺诈审核、内容审核、医疗初审、RAG 答案要不要信——都能套 ECARB 算「我审这么多人能多抓几倍错」。它把抽象的校准统计量翻译成了运营听得懂的话。
  • 🎯 verbalized 1S-TopK 是个省钱的通用招:单次调用同时拿到提取结果和置信度、不用多次采样、对所有 VLM 通用——如果你的 pipeline 还在用多次采样估置信度(贵),这套单阶段方法值得借鉴。

再往远看一层:多模态大模型做文档解析是这两年明确在火的方向,各家都在卷「提取准不准」。但「能不能信它的自信」是这条赛道落地生产的下一道关卡——ConfBench 恰好把这道关卡的头一份体检报告交了出来。

⚖️ 理性看待

几个该打问号的地方,挑最要紧的说。

最该记住的一条:ConfBench 的「低精度区」是用 Augraphy 合成退化造出来的,不是真实部署里文档的自然低质量。 真实生产里的低质,更多来自布局罕见、手写、跨领域模板、语义歧义,而不是扫描退化。所以 ECARB 那个漂亮的 2.43× 是「在合成退化分布上」的路由收益——一个模型可能对「扫描糊了」判断得很准(ECARB 高),却对「这个表单没见过」判断失准。迁到你自己的真实流量上,这个倍率很可能缩水。论文 limitations 提了单领域,但没强调「合成 vs 自然」这个对外推更根本的限制。

其次几个样本规模上的硬约束:

  • 只用了 75 份 FCC 发票,单领域、单布局、单语言,外推到其他文档类型要打折
  • 暴露 token-level logprob 的开源模型只有 2 个(Qwen 3.6-27B、Gemma 3-12B),所以「logprob 三聚合谁更好」「策略最优性随模型翻转」这两条结论样本偏小,别太当定律
  • 跨模型比较有个没消除的混杂变量:专有模型 token 预算 40K、开源只有 8K,长文档截断会系统性压低开源模型的精度和置信度质量——开源 vs 专有的横向对比,你得自己打个折扣

另外,「模型能力主导校准」这条核心结论,在我看来更像经验相关、而非因果机制——论文展示了 Claude 家族内的单调关系,但「能力」是参数量、训练数据、对齐方式还是架构,没拆。跨家族参数量无效恰恰说明这事没那么简单,当成「经验观察」用没问题,别当成可迁移的定律。

最后一句实话:这是该细分方向目前最扎实的基线工作,数据、退化代码、评估库全开源——值得作为对照点和数据来源。但照搬到自己生产场景前,务必先在真实流量上复测一次 ECARB

作者:lusca
版本:lusca-paper-blog v1.5.0
出处:https://github.com/yjmm10/lusca-skill/tree/main/skills/lusca-paper-blog

相关文章
|
3天前
|
存储 弹性计算 缓存
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
本文更新了2026年阿里云全系列云服务器租赁活动报价,所有特惠资源均可前往阿里云活动中心选购,整体覆盖从个人入门到企业级高性能场景的全梯度需求。其中轻量应用服务器主打极致性价比,2核2G峰值200M带宽配置每日10点、15点限时抢购价仅38元/年,2核4G配置379元/年起;高性价比的经济型e实例、通用算力型u2i实例覆盖2核4G至4核32G全档位,适配开发测试与中小型企业业务;搭载英特尔至强6处理器的第九代c9i企业级实例算力较上代提升20%,支撑高并发生产环境,不同实例规格价差清晰,用户可根据自身业务负载与预算灵活选型。
1439 109
|
10天前
|
云安全 人工智能 运维
阿里云联动百位企业安全专家,共识Agent防御最佳实践
当Agent成为新员工,你的安全边界在哪里?
1932 8
阿里云联动百位企业安全专家,共识Agent防御最佳实践
|
4天前
|
编解码 人工智能 安全
2核4G/4核8G/8核16G阿里云服务器如何选择实例?经济型e、通用算力型u2i与计算型c9i选哪个?
本文介绍了阿里云2核4G、4核8G、8核16G三档主流配置下经济型e、通用算力型u2i和计算型c9i三种实例的最新活动价格与适用场景。同配置下三者价差显著,以2核4G为例,经济型e低至599.93元/年,计算型c9i则高达1742.08元/年。文章详细解析了各实例的性能定位:经济型e适合轻负载入门场景,u2i兼顾稳定算力与性价比,c9i凭借第9代至强处理器与芯片级安全能力支撑高性能业务。同时提示用户可叠加满减优惠券享受折上折,建议根据业务负载与预算综合决策。
513 112
|
4天前
|
人工智能 程序员 API
Codex 接入 DeepSeek-V4-Flash:还能补上识图,提供两套方案
Codex 接入 DeepSeek-V4-Flash 怎么配?本文覆盖 CLI 与桌面端,再用 qwen3-vl-flash 补识图,两套方案可直接照做
|
8天前
|
存储 人工智能 关系型数据库
阿里云AI产品与云产品最新组合套餐:Token Plan、AI coding及云服务器和建站等组合优惠价
阿里云推出全新“算力+模型+应用”一站式云与AI组合套餐活动,覆盖从个人开发者到中大型企业的全场景需求。核心亮点为分三档定价的Token Plan订阅服务,支持Qwen3.8-Max-Preview大模型调用,错峰时段最低可享0.2折优惠。活动同步推出AI Coding、智能体部署、云电脑托管、0代码建站等十余类场景化组合,搭配99元/年的普惠云服务器、88元/年的入门数据库等经典特惠产品,还为企业提供1V1定制化AI转型方案,大幅降低了不同用户群体拥抱AI的技术门槛与采购成本。
698 111
|
18天前
|
人工智能 JSON 安全
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
阿里云AI安全产品联动防御Fastjson攻击
2616 13
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
|
16天前
|
人工智能 前端开发 Linux
Codex 桌面版安装 + CC Switch 接入第三方 API 完整教程(2026 最新)
2026最新教程:手把手教你安装Codex桌面版,通过CC Switch v3.17.0一键接入Fenno等国产API(兼容OpenAI Responses格式),跳过账号登录,完整启用代码审查、多步任务与上下文感知功能。零基础友好,全程图文实操。(239字)
2228 3
|
5天前
Qoder 一周年 × Qwen3.8-Max 正式上线,多重好礼限时领
8月3日,Qwen3.8-Max 正式上线Qoder,迎来Qoder一周年。新老用户可领800次免费调用,下单再赠2000次;夜间(22:00–08:00)调用5折;邀请好友双方得积分与调用额度。
347 0
|
18天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max-Preview深度全解析:2.4万亿参数旗舰MoE模型+Token Plan限时优惠完整落地指南
2026年7月,全新旗舰级混合专家大模型Qwen3.8-Max-Preview正式开放抢先体验,作为通义千问Qwen3系列规格最高、综合推理能力顶尖的新一代模型,该模型总参数量达到2.4万亿(2.4T),是当前线上可调用的原生多模态旗舰模型,综合推理水准对标海外顶级Fable 5模型,在复杂工程开发、长文档深度分析、多步骤智能体自治、跨境多语言创作、海量数据挖掘五大高难度业务场景实现跨越式性能提升。
1530 3

热门文章

最新文章