离谱!我以为 OCR 还在一页页抠字,结果百度 1.2 万 Star Unlimited-OCR 直接把长文档一口气读完

简介: 百度开源 Unlimited-OCR,把图片、长文档、多页 PDF 这类非结构化资料推进到 Markdown、表格和可检索文本,适合 RAG、知识库和 Agent 文档入口。

嗨,我是小华同学,专注解锁高效工作与前沿AI工具!每日精选开源技术、实战技巧,助你省时50%、领先他人一步。👉免费订阅,与10万+技术人共享升级秘籍!

如果你还把 OCR 理解成“截张图、抠几个字”,那这次真的有点低估它了。

百度刚开源的 Unlimited-OCR,目标不是单页识别,而是把图片、长文档、多页 PDF 这一类“看得见但不好结构化”的资料,往 Markdown、表格、可检索文本 方向推进。

这篇不讲复杂论文公式,只用 3 分钟讲清:它为什么突然冲到 1.2 万 Star,以及程序员能拿它做什么。

官方截图:Unlimited-OCR 项目概览

这项目是什么

Unlimited-OCR 是百度开源的 OCR / 文档解析项目,项目标语很直接:Welcome the Era of One-shot Long-horizon Parsing。

翻译成人话就是:它想解决的不只是“识别一张图里的文字”,而是更接近 一次处理更长、更复杂的视觉文档。

它目前提供了几条开发者比较关心的入口:

能力 项目里怎么体现 对程序员的价值
单图解析 Transformers 推理示例 适合截图、票据、表单、扫描页
多页解析 infer_multi 和多图输入 适合多页文档、长材料拆页处理
PDF 路径 PDF 先转图片,再进入多页解析 适合接入已有文档流
服务化 vLLM / SGLang 支持 方便做 API、批量任务、内部工具
输出方向 Markdown、文本、表格等结构化结果 更容易接 RAG、搜索、归档和自动化

注意,这里最关键的不是“它也能 OCR”,而是 OCR 正在从工具函数,变成文档理解流水线的一部分。

白板定位对比图:普通 OCR 到长文档解析

为什么值得关注

很多团队其实都被“文档非结构化”卡过。

合同是 PDF,发票是图片,供应商报价是扫描件,历史资料是截图,表格嵌在报告里。你想让 AI 分析它,第一步往往不是写 Prompt,而是先把这些东西变成模型能吃的文本。

传统 OCR 当然能用,但经常会遇到几个问题:

第一,单页还行,长文档容易散。
页与页之间的上下文、表格结构、标题层级,一旦断开,后续做检索和问答就很麻烦。

第二,纯文本不够,结构更重要。
程序员真正想要的不是一坨字,而是 Markdown、表格、段落、字段,这样才能继续进数据库、知识库或者 Agent 工作流。

第三,批量化和服务化是刚需。
项目里已经给出 Transformers、vLLM、SGLang 的路线,这意味着它不是只停留在 Demo 截图,而是在往可接入工程链路的方向走。

能用来做什么

如果你做过企业系统、知识库、RPA、AI Agent 或数据中台,这类项目的想象空间会非常直接。

你可以把它理解成一个“文档入口层”:

趣味白板流程图:Unlimited-OCR 接入开发者流水线

几个比较实在的方向:

1. 给 RAG 做文档预处理
把扫描 PDF、图片报告、表格页面先转成更干净的 Markdown,再进入切分、向量化和检索。

2. 做内部资料归档
历史合同、培训材料、会议截图、票据凭证,可以先批量解析,再统一搜索。

3. 给业务系统补一个“看图录入”能力
比如表单录入、发票字段提取、报价单整理、客服截图整理,减少人工复制粘贴。

4. 给 Agent 加一双“读文档的眼睛”
很多 Agent 卡住,不是推理不行,而是看不到 PDF 和图片里的信息。OCR + 文档解析就是前置基础设施。

小白怎么理解

你可以把普通 OCR 想成一个很勤奋的打字员:你给它一张图,它把字敲出来。

而 Unlimited-OCR 更像一个升级版资料助理:它不只盯着一小块文字,而是尝试理解更长的页面、更复杂的排版,并把结果整理成后续程序更好处理的格式。

这也是为什么我觉得它适合收藏:它不一定马上替代你现有 OCR,但它代表了 OCR 的下一步方向。

但别无脑上

这类项目目前仍然有边界。

它不是万能文档大脑,也不是“丢任何 PDF 都 100% 正确”的魔法工具。项目 README 里给的 PDF 路径,本质上还是 先把 PDF 页面转成图片,再做多页解析;复杂表格、低清扫描、手写混排、极长文档,仍然需要测试和人工校验。

另外,它对 GPU、推理框架和依赖环境也有要求。比如 README 中 Transformers 示例测试在 Python 3.12.3 + CUDA 12.9,服务化路线还涉及 vLLM 或 SGLang。

所以更合理的期待是:先把它当成“文档解析基础组件”评估,而不是马上当成生产级万金油。

我的判断

Unlimited-OCR 火得快,核心不是因为“百度又开源了一个 OCR”,而是它踩中了一个越来越明显的趋势:

AI 应用越往企业和真实业务走,越需要把图片、PDF、表格、扫描件这些非结构化资料,稳定地变成可计算的数据。

这就是它对程序员的价值。

如果你最近在做知识库、企业搜索、Agent 自动化、文档审查、票据识别,这个项目值得先收藏。后面我也可以继续拆它的推理方式、部署链路,以及怎么接到自己的 RAG / Agent 项目里。

项目地址

GitHub:https://github.com/baidu/Unlimited-OCR

Hugging Face Model:https://huggingface.co/baidu/Unlimited-OCR

arXiv:https://arxiv.org/abs/2606.23050

相关文章
|
2月前
|
缓存 人工智能 自然语言处理
阿里云千问Qwen3.7模型怎么选?Max/Plus/Flash三大版本能力、速度、性价比横评
通义千问Qwen3.7系列分为Max、Plus、Flash三款核心模型,三款产品定位清晰、能力互补,同时共享百万级超长上下文窗口与长时间自治执行能力,但在模态支持、推理架构、输出上限、响应速度、计费成本上存在明显区分。结合实测数据从核心定位、基础参数、能力实测、成本性价比、场景适配五大维度完整拆解,帮助个人开发者、企业研发团队根据需求精准匹配模型,避免资源浪费与能力不足问题。
1358 2
|
2月前
|
人工智能 IDE 开发工具
【开发者必看】WindSurf官网下载安装:AI编程IDE让写代码更轻松
Windsurf 是 Codeium 推出的新一代 AI 原生 IDE,深度集成 Cascade 智能代理,支持实时代码库理解、多行智能补全、自然语言驱动的跨文件修改与错误诊断。区别于插件式方案,它从底层重构开发体验,免费版即享核心功能。(239字)
|
2月前
|
人工智能 缓存 JavaScript
保姆级教程:OpenCode 14 个社区插件 + 6 个实战案例,建议收藏,手把手带你打造最强 AI 编码环境
OpenCode 插件使用保姆级教程:14 个社区插件 + 6 个实战案例,从加载规则到开发实战,手把手带你打造最强 AI 编码环境。建议收藏!
1385 10
|
2月前
|
人工智能 文字识别 并行计算
离谱!我以为 OCR 还在一页页抠字,结果百度 1.2 万 Star Unlimited-OCR 直接把长文档一口气读完
百度开源 Unlimited-OCR,把图片、长文档、多页 PDF 这类非结构化资料推进到 Markdown、表格和可检索文本,适合 RAG、知识库和 Agent 文档入口。
514 3
离谱!我以为 OCR 还在一页页抠字,结果百度 1.2 万 Star Unlimited-OCR 直接把长文档一口气读完
|
3月前
|
人工智能 安全 Shell
Agent 工具越用越乱?5.1k Star Omnigent,直接给 Claude Code/Codex/Cursor 加一座调度塔
Omnigent 不是再造一个 AI Agent,而是给 Claude Code、Codex、Cursor、Hermes、Pi 等 Agent 加一层统一编排、策略治理、沙箱和协作的 meta-harness。
573 1
Agent 工具越用越乱?5.1k Star Omnigent,直接给 Claude Code/Codex/Cursor 加一座调度塔
|
2月前
|
JSON 人工智能 数据可视化
Claude Code 四大定制机制完全指南:CLAUDE.md、Hooks、Skills、Subagents 怎么选怎么用
本文详解Claude Code四大定制机制:CLAUDE.md(持久记忆)、Hooks(硬约束执行)、Skills(按需流程)、Subagents(隔离分工),涵盖配置模板、选型决策表及团队工程化分层实践,全部基于2026年7月2日官方文档。
1220 1
|
2月前
|
人工智能 监控 机器人
十个 AI Agent 工作流模板,照着搭就能用
AI Agent 不是高级聊天机器人,而是能自动执行完整工作流的智能协作者:读取、核对、决策、起草、更新,仅高风险环节交由人工拍板。文末分享10个开箱即用的模板——从邮件分类、研究简报到CRM补全、QA审查,聚焦解决重复性数字劳动,强调“先设计工作流,再写Prompt”,兼顾效率与可控性。
561 1
十个 AI Agent 工作流模板,照着搭就能用
|
2月前
|
人工智能 安全 网络安全
Hermes Agent 进阶教程:技能自进化、MoA 模型委员会与多后端部署实战
Hermes Agent 是 Nous Research 开源的自我改进型 AI 智能体(MIT 协议),首创内置学习闭环:自主创建技能、使用中持续优化、跨会话构建用户画像。截至2026年7月2日,GitHub Star 20.7万,v0.18.0版新增 /learn 技能蒸馏、双层记忆治理、MoA模型委员会、/goal 证据化完成判定等六大进阶能力,支持本地/Docker/SSH/Modal 等安全后端部署。(239字)
960 1
|
2月前
|
传感器 运维 安全
告别纸质记录:AR现场巡检如何重塑工业运维效率
随着工业4.0与数字化转型的深入,传统制造业及能源行业的运维模式正面临严峻挑战。长期以来,依赖纸质工单、人工记录和经验驱动的现场巡检方式,不仅数据滞后、易出错,更难以实现知识的沉淀与复用。增强现实(Augmented Reality, AR)技术的成熟,为现场运维带来了革命性的变革。通过将数字信息叠加于物理世界,AR现场巡检系统实现了从“被动记录”到“主动智能辅助”的跨越。本文将深入探讨基于云边端协同架构的AR现场巡检技术方案,分析其核心功能模块、数据流转机制以及在提升运维效率与安全性方面的最佳实践。

热门文章

最新文章