做文档解析的人该看看 Infinity-Parser2:一个模型把版面、表格、公式、图表全端了

简介: Infinity-Parser2 是一款端到端多模态文档解析大模型,融合可控数据合成与多任务联合强化学习(GRPO),开源500万双语数据及Flash/Pro双版本模型,支持精准解析文本、表格、公式、图表等,显著提升RAG与文档智能效果。(239字)

氛围图

💡 一句话带走:Infinity-Parser2 把"可控数据合成 + 多任务联合强化学习"拧成一个端到端文档解析大模型,开源 500 万双语数据和两个模型,给"用一个模型替掉整条解析流水线"提供了很强的公开基线——做 RAG / 文档智能的人值得在自己数据上跑一遍。

做 RAG 或文档智能的人,多半都和 PDF 解析较过劲。你拿一份双栏论文、一张密密麻麻的财务表、一段手写公式塞给解析工具,结果版面串了行、表格糊成一团、公式变成乱码——然后下游 RAG 默默吞下这些垃圾,检索质量怎么调都上不去。

更烦的是,传统做法要拼一条流水线,每一环都得单独配一个模型:

  • 🔤 OCR 先过一遍,把文字啃出来
  • 📐 版面分析再来一遍,理清段落和阅读顺序
  • 🧮 表格识别单独一个模型,公式识别又一个,图表再一个

每一环都有自己的 bug,串联起来错误层层叠加。你花在"拼流水线"上的时间,往往比花在业务上的还多。

那有没有可能,一个模型把这些活儿全端了?🤔 INF 团队发的 Infinity-Parser2 想干的就是这件事——一个端到端的大模型,把文档的版面、表格、公式、图表,甚至化学式和文档问答,一口气都学会。

想自己动手试?

🎯 这篇论文到底想解决什么问题?

问题卡在两个结构性瓶颈上:

  • 🗃️ 训练数据又缺又不真。真实文档千奇百怪,人工标注又慢又贵;于是大家要么数据规模不够,要么用合成数据但合成得离真实太远,模型一上线就露怯。
  • 🏝️ 任务被拆成各自为政的孤岛。以前的解析系统把"看版面、找表格、认公式"当成各自独立的头或串行阶段,各干各的、没法联合优化——可这些任务明明高度耦合,版面认错了表格也跟着错。

Infinity-Parser2 的回答是同时治这两头:用一套"可控渲染"的数据合成引擎造出 500 万条双语(中英)训练样本(Infinity-Doc2-5M),再用"可验证的多任务奖励"把 8 个任务放在一起做强化学习联合训练。

它要证明的命题一句话——文档解析可以被一个统一的大模型端到端吃下,不必再拼流水线。我个人觉得这个方向是对的:pipeline 的工程债太重,端到端模型一旦够强,对做应用的人是实打实的减负。

🛠️ 它的思路是什么?

先说数据怎么来的,因为这是整篇报告我觉得最值得抄的部分。他们没去硬标 500 万条,而是造了一个 DOM-based 的文档合成引擎——简单说,反过来造文档。

DOM 文档合成引擎
图说:合成引擎分三步——先收集语料(纯文本、LaTeX、图片、图表),再配置版面与样式(字体、分栏、DPI、缩进),最后渲染成文档;固定布局和灵活布局走两条路径,渲染结果天然带精确坐标标注。

先有结构化的内容(一段段文字、一个个表格、一条条公式),再配上版面参数(字体、分栏、DPI、留白),用渲染引擎把它"排版"成 PDF 或图片。因为是先有结构再渲染,每一段文字、每一个表格单元格的坐标和内容都天然已知——ground truth 不用标,天生精确。这比拿真实 PDF 逆向标注省事太多,而且可控:想练双栏就批量造双栏,想练公式密集就批量造公式。

光有数据还不够,还得让模型同时学好这么多任务。模型走的是统一的 image-to-sequence:一页文档图片丢进去,自回归吐出一串 token,这串 token 可以是 markdown、json、公式的 LaTeX、表格的 HTML——具体由任务决定。训练分两步走:

  • 🎓 先做 SFT 监督微调,让模型学会"把文档图变成结构化输出"的基本能力
  • 🔁 再用 GRPO(Group Relative Policy Optimization,DeepSeek 带火的强化学习算法)做多任务联合 RL,在 8 个任务上一起迭代

这里最关键的是"可验证奖励"——为什么文档解析特别适合 RL?因为它的好坏很大程度上能自动判分:

  • 📋 表格还原得对不对,可以程序化地比对结构和文字
  • ➗ 公式还原对不对,可以用 LaTeX 语法树比对
  • 📌 版面位置对不对,可以用 IoU(交并比)算

公式细节我不展开(GRPO 的推导有点绕),你只要知道它的作用是让模型在"能被程序自动判分"的任务上自我迭代,不需要人工再打分——这也是这条路能 scale 起来的根本原因。

📈 效果到底怎么样?

先看最直接的——三个最常见的文档解析基准。Infinity-Parser2-Pro(35B 那个)在三个基准上都压住了对手:

  • olmOCR-Bench 拿 87.6,超过 dots.mocr(83.9)、PaddleOCR-VL-1.5(78.5)、DeepSeek-OCR-2(76.3)
  • ParseBench 拿 74.3,超过 Chandra-OCR-2(70.1)、Gemini-3.1-Pro(69.1),甚至 GPT-5.5(67.8)
  • OmniDocBench-v1.6 到 93.95,高于 MinerU2.5(92.98)和 dots.ocr(90.50)

文档解析三大基准
图说:olmOCR-Bench、ParseBench、OmniDocBench-v1.6 三个主流文档解析基准的对比,Infinity-Parser2-Pro 在三者上均居首。

老实说,单看 OCR 这个数字我并不意外——端到端大模型把小模型流水线卷下去是早晚的事。但让我觉得这篇报告有料的,是它顺带把各种"元素级"任务也刷上去了,而且不是只强在 OCR(下面这些指标都越接近 100 越好):

  • 表格:PubTabNet 94.76、FinTabNet 98.88(单位 TEDS,衡量表格结构还原得准不准)
  • 数学公式:CDM 均值 97.7(CDM 是公式 LaTeX 的字符匹配相似度,其中 SPE 子集 99.4)
  • 图表:Chart-to-JSON 在 strict / slight / high 三档拿到 61.7 / 68.9 / 73.7(AP 平均精度,从严到宽)
  • 化学式:CoSyn-Chemical 上 InChI 53.91、valid SMILES 86.72(两种把化学结构转成文本的表示法,valid SMILES 是"生成出的合法结构串占比")

我的解读是:这份"全面"恰恰是联合训练的价值——表格、公式、图表这些任务共享了文档理解的底层能力,单独训反而学不到这种共性。一个模型把这些都做了,意味着你不用再为每个元素类型单独部署一个模型,工程上清爽一大截。

不过得提醒一句:这些结果主要来自作者自测(technical report,没经同行评审),不同基准的评测协议和竞品版本我没能完全核对 (uncertain),所以"全面碾压"的措辞还是要打个折。

🤔 为什么你要关心?

你可能觉得文档 OCR 这种活儿不是早就解决了吗?还真没有——尤其是表格、公式、双栏、扫描噪声这些,至今是 RAG 和文档入库的"漏勺"。Infinity-Parser2 这类端到端模型,最直接的用处就是替掉你 pipeline 里那串拼起来的解析组件。

跨任务能力
图说:版面分析、表格、图表、化学式、文档问答、通用多模态等多项任务上的横向对比,模型在大多数任务上排第一或第二——说明它不只是 OCR 强,而是全栈。

落到实操,如果你做 RAG 或文档智能,我建议你关注三件事:

  • 🇨🇳 中文场景白捡一份大数据:它开源了 500 万双语样本(Infinity-Doc2-5M),对中文文档解析尤其值钱——中文高质量解析语料一直稀缺
  • ⚙️ 部署有得选:给了两个变体,Flash(2B,吞吐快 3.68 倍)适合线上、Pro(35B-A3B)适合要精度的场景
  • 🧪 合成思路能复用:DOM 合成那套完全可以抄去给你的领域(病历、合同、票据)造合成数据,不一定非得用它这个模型

再往远看一点,我有个判断:文档解析正在从"工程拼装"转向"单模型端到端",就像机器翻译当年从 pipeline 走向神经端到端一样。Infinity-Parser2 不是终点,但它是这条路上一座很显眼的里程碑。

🧊 冷静一下

几个该打问号的地方:

  • ⚠️ 结果是自测的。它是 technical report,没有同行评审;多个基准上"超 GPT-5.5、超 Gemini-3.1"出自作者自评,评测协议和竞品版本我没有完全核对 (uncertain),建议拿你自己场景的数据复测再下结论
  • benchmark 不等于你的真实文档。合成数据训出来的模型,遇到真实扫描件的脏噪声(印章、歪斜、水印)能不能稳,是另一个问题,作者自己也承认这个 gap
  • 联合 RL 是否对每个任务都是正贡献。8 个任务的奖励量纲和难度不一样,作者给了消融但不算深,我觉得这点还留了些疑问

作者:lusca
版本:lusca-paper-blog v1.2.8
出处:https://github.com/yjmm10/lusca-skill/tree/main/skills/lusca-paper-blog

相关文章
|
26天前
|
机器学习/深度学习 人工智能 API
Qwen3.8-Max 开源了:该不该从 Claude 切过去?
阿里正式发布2.4万亿参数旗舰Qwen3.8-Max,支持100万上下文与原生多模态,激活95B参数,推理成本仅6美元/百万token。下周将开源Max系列权重——史上首次,兼具强编码、长程智能体与办公自动化能力,但标准编程基准仍略逊Fable 5。(239字)
|
23天前
|
人工智能 API Apache
Qwen3.6-Fable-Fusion-711:209万下载是真的,「首个开源破700」得另说
HuggingFace 和本地 LLM 圈被一个名字长得像密码的模型刷屏——Qwen3.6-27B-Fable-Fusion-711-…-GGUF,12 天下载量从 55 万飙到 209 万。它是社区开发者 DavidAU 在阿里 Qwen3.6-27B 上做「多阶段微调 + 模型融合 + 去审查」后以 GGUF 量化打包发布,能在本地显卡直接跑。最抓眼的「首个开源突破 700 ARC-C」目前只有作者一方说法:媒体都转自同一导流站、评测框架都没交代,唯一相对独立的行业媒体标了 unverified。当热门的去审查开源模型看成立,当「开源追上闭源」看还早。
|
25天前
|
机器学习/深度学习 编解码 自然语言处理
SwanTale:字节把声音克隆和「自然语言导演」塞进了同一个模型
字节2026年8月发布语音大模型SwanTale技术报告:首创SwanVAE+Flow-matching Transformer+Unified MoE+GRPO框架,统一实现自然语言驱动(instruct TTS)与零样本音色克隆(zero-shot TTS),支持多说话人、环境音、音效共生于单条波形。闭源报告,重方法论启发。(239字)
|
25天前
|
人工智能 JSON 文字识别
为什么调一个文档抽取 pipeline 要花几周?IDP AutoOpt 让 agent 来替你
AWS IDP AutoOpt 是一个闭环式LLM智能体,自动优化文档处理流水线(OCR、Prompt、模型、Schema等)配置,在2小时内达到甚至超越人类专家水平,精度提升8.6%,成本降为1/4.6。其三大反直觉工程经验:强模型不可妥协、结构化领域技能优于源码灌入、上下文管理需精细阈值控制。(239字)
为什么调一个文档抽取 pipeline 要花几周?IDP AutoOpt 让 agent 来替你
|
26天前
|
人工智能 编解码 安全
英特尔中国加速适配国产AI模型MiniMax H3布局本地化部署
英特尔锐炫Pro B70完成对国产开源视频模型MiniMax H3的Day 0适配,支持15秒2K+立体声视频生成。依托32GB显存、367 TOPS算力及8卡混合并行方案,实现开箱即用、低成本本地部署,加速AI视频商业化落地。(239字)
194 1
|
26天前
|
缓存 人工智能 BI
最新版通义千问(Qwen3.8-Max)功能介绍及使用指南
通义千问Qwen3.8-Max是通义千问系列的最新旗舰大模型,凭借2.4万亿参数的MoE混合专家架构、100万Token超长上下文、原生多模态处理能力以及全栈代码与智能体协作能力,成为当前全球顶尖的通用大模型之一。它不仅在文本生成、逻辑推理上实现突破,更在长文档处理、图像视频理解、复杂工程开发、多智能体协作等场景构建了核心竞争力。本文将从核心架构、关键功能、使用入口、API调用、场景实战、避坑指南六大维度,全面解析Qwen3.8-Max,帮助开发者与普通用户快速掌握其能力与使用方法,实现从基础对话到复杂任务的高效落地。
289 1
|
26天前
|
人工智能 自然语言处理 机器人
阿里云千问大语言模型有哪些?主要模型能力和特性及选择参考
本文介绍了阿里云通义千问(Qwen)全系列大模型的产品布局与选型指南,该家族覆盖从十亿到万亿级参数的全梯度定位,包含Qwen3、Qwen-Max、Qwen-Plus、Qwen-Turbo、Qwen-VL多模态系列及RAG检索增强定制模型六大分支,在长文本处理、逻辑推理、多语支持、生态适配等方面具备显著优势,覆盖从简单高频任务到高精度复杂场景的全需求。文中给出了贴合业务场景的选型参考,同时同步了2026年的最新优惠:Qwen3.7-Max限时5折、Qwen3.7-Plus限时8折,搭配39元/月起的Token Plan低门槛接入,帮助用户以高性价比完成适配自身的大模型落地。
|
26天前
|
人工智能 缓存 编解码
阿里云大模型优惠:首购低至4.5折:可抵扣千问 3.5,支持千问、万相等全量模型
为了降低用户体验顶尖模型的门槛,活动特别推出了Qwen3.7-Max模型的限时5折优惠。该优惠覆盖了输入、输出、输入(Batch Chat)、输出(Batch Chat)、显式缓存创建、显式缓存命中这6个关键计费维度,全方位降低了调用成本。此外,用户还可以免费领取100万Tokens的试用额度,深度体验智能体能力的广度与深度,感受其出色的跨框架泛化能力,让复杂任务的自动化处理变得更加高效、流畅。
|
26天前
|
前端开发 数据挖掘 调度
阿里云通义千问的旗舰大模型qwen3.8-max介绍:核心能力、适用场景与最新优惠
本文介绍了阿里云通义千问系列最新旗舰Qwen3.8-Max大模型的核心能力与专属优惠。作为国内首个突破2.4万亿参数的原生多模态MoE架构模型,它支持百万级Token超长上下文,具备全栈代码工程能力与深度思考/极速响应双推理模式,可自主拆解复杂任务并调度多智能体协同执行,在专业办公自动化、科研数据分析等场景表现突出。当前该模型处于日更迭代的预览阶段,面向Token Plan订阅用户开放,叠加夜间22点至次日8点0.2折的错峰特惠,大幅降低了开发者与企业使用顶级旗舰模型的成本门槛。
|
26天前
|
存储 安全 开发工具
阿里云OSS使用教程(附vibecoding提示词
本文主要目的在于方便vibecodong的初学者快速理解OSS的概念,应用场景和部署实现,并在文末附上了可用提示词,方便新手能够快速升级数据存储方案,通过阿里云OSS实现项目数据存储的稳定和快速部署
473 1