MinerU 生态实战_图片型PDF批量转Markdown

简介: MinerU云端服务提供零依赖PDF转Markdown方案:Python SDK或CLI工具,免GPU、免环境配置,支持批量处理扫描件。Flash模式免Token,精准模式免费申请Token,轻松应对图片型PDF解析需求。

mineru_cloud_batch_cover
图片型 PDF 没有文本层,pdfplumber 之类的文本提取工具拿它完全没辙。要把扫描件、截图型 PDF 转成 Markdown,必须走 OCR pipeline。MinerU 在这方面效果很好,版面分析、公式识别、表格结构化都能处理,但本地部署门槛不低——GPU、几个 G 的模型文件、CUDA 和 PyTorch 版本对齐,光配环境就可能折腾半天。

好消息是 MinerU 现在开放了完整的开发者生态(mineru.net/ecosystem),涵盖 Python / Go / TypeScript SDK、CLI、LangChain / LlamaIndex 集成、MCP 等大量接入方式。本文针对题主的需求,重点介绍最实用的两条路:Python SDK 和 CLI——不需要 GPU、不需要装模型、不需要折腾环境,直接调云端服务。


方案一:Python SDK(写 Python 的首选)

安装

pip install mineru-open-sdk

就这一行,没有 PyTorch、没有 CUDA、没有模型权重下载。

最简示例:3 行代码解析一个 PDF

from mineru import MinerU

client = MinerU()
result = client.flash_extract("扫描件.pdf")
print(result.markdown)

flash_extract 是免登录、免 Token 的轻量模式,拿来就能用。公式和表格识别默认开启,单文件最大 10MB / 20 页,日常够用。

批量处理:题主要的「能批量跑」

import os
from mineru import MinerU

client = MinerU()
pdf_dir = "/path/to/pdfs"

for fname in os.listdir(pdf_dir):
    if fname.endswith(".pdf"):
        pdf_path = os.path.join(pdf_dir, fname)
        result = client.flash_extract(pdf_path)

        out_path = os.path.join(pdf_dir, fname.replace(".pdf", ".md"))
        result.save_markdown(out_path)
        print(f"完成: {fname}")

如果文件多或者单个文件大,可以切换到精准模式。Token 在 mineru.net/apiManage/token 免费申请,支持最大 200MB / 200 页:

from mineru import MinerU

client = MinerU("your-api-token")

# 批量提交,边处理边返回
for result in client.extract_batch(["a.pdf", "b.pdf", "c.pdf"]):
    result.save_all(f"./output/{result.filename}/")
    print(f"{result.filename}: 完成")

精准模式还能输出 DOCX、HTML、LaTeX,用 extra_formats=["docx", "html"] 参数指定即可。


方案二:CLI 命令行工具

不想写 Python 代码的话,CLI 工具更直接。

安装

# Linux / macOS
curl -fsSL https://cdn-mineru.openxlab.org.cn/open-api-cli/install.sh | sh

# Windows (PowerShell)
irm https://cdn-mineru.openxlab.org.cn/open-api-cli/install.ps1 | iex

零依赖,单二进制文件,不需要任何运行时。

单文件解析

mineru-open-api flash-extract 扫描件.pdf

Markdown 结果直接输出到 stdout,免 Token。

批量处理

mineru-open-api extract --list files.txt -o ./results/

CLI 的 stdout 设计对自动化很友好,可以直接管道给下游工具:

mineru-open-api extract paper.pdf | some-llm-tool

两种方案快速对比

Python SDK CLI
适合谁 Python 开发者、需要在代码中集成 Shell 脚本、CI/CD、不想写代码
安装 pip install mineru-open-sdk 一行 curl/irm
免Token使用 flash_extract() flash-extract 命令
批量能力 extract_batch() 迭代器 --list 或通配符
输出格式 MD / DOCX / HTML / LaTeX / JSON MD / DOCX / HTML / LaTeX / JSON
编程集成 原生 Python 对象,.markdown .images 直接用 stdout 文本流,管道友好

和本地部署怎么选

云端方案(SDK / CLI)适合大多数场景:零 GPU、零环境配置,免费的 flash 模式就能覆盖日常需求。精准模式处理大文件、多格式输出也免费。

本地部署pip install magic-pdf[full])适合数据不能出内网的场景:完全离线运行,但需要 GPU(推荐 8GB+ 显存)和比较折腾的环境配置。

对于题主说的「批量跑图片型 PDF 转 Markdown」,Python SDK 的 flash_extract 就够了——装个包、写几行代码、不用管 GPU 的事。


相关链接

目录
相关文章
|
3月前
|
JSON 文字识别 数据格式
MinerU + RAG 集成实战:从 PDF 结构化解析到精准检索
本文详解 MinerU 与 RAG 的深度集成:针对 PDF 解析导致的召回瓶颈(如双栏错序、公式表格丢失),展示如何用 MinerU 实现结构化抽取(Markdown/JSON)、提升 Top-1 召回率25%,并提供 LangChain/LlamaIndex 全链路实战代码与生产避坑指南。
923 0
|
3月前
|
人工智能 JSON 文字识别
一行命令,让你的 Code Agent 会读PDF
一行命令 `npx skills add tanis90/pdf-converter-mineru`,即可为Claude Code、Cursor等主流Code Agent注入PDF阅读能力。基于上海AI Lab开源的MinerU引擎,支持扫描件OCR、表格/公式识别、中英混排,自动选择快读或高精模式,开箱即用,无需部署MCP服务。(239字)
3021 16
|
7月前
|
监控 API Docker
MinerU Docker 部署指南:PDF 结构化解析服务实践
MinerU 是面向开发者与科研用户的 PDF 结构化解析工具,支持将复杂版式、公式符号的科技文献精准转为 Markdown/JSON 等机器可读格式。基于“书生·浦语”大模型预训练需求研发,2.7.0 版本引入 hybrid 后端,融合 pipeline 与 VLM 优势,提升解析精度与多语言 OCR 能力。支持 Docker 部署,提供 vLLM 加速、API 服务与 Gradio 界面,开箱即用,助力科研数据高效处理。
3095 0
|
3月前
|
人工智能 自然语言处理 安全
Claude Code 全攻略:命令大全 + 实战工作流(建议收藏)
本文介绍了Claude Code终端AI助手的使用指南,主要内容包括:1)常用命令如版本查看、项目启动和更新;2)三种工作模式切换及界面说明;3)核心功能指令速查表,包含初始化、压缩对话、清除历史等操作;4)详细解析了/init、/help、/clear、/compact、/memory等关键命令的使用场景和语法。文章通过丰富的界面截图和场景示例,帮助开发者快速掌握如何通过命令行和交互界面高效使用Claude Code进行项目开发,特别强调了CLAUDE.md文件作为项目知识库的核心作用。
48493 72
Claude Code 全攻略:命令大全 + 实战工作流(建议收藏)
|
3月前
|
人工智能 API Docker
claude_code_mineru_skill
为Claude Code等Code Agent新增PDF解析能力!一行命令安装MinerU Skill,无需Docker、API Key或服务器,自动智能解析PDF/截图,支持复杂表格、公式与双栏论文,转为高质量Markdown供AI理解,大幅提升文档驱动开发效率。
1239 10
|
3月前
|
人工智能 数据可视化 API
一文看懂 OpenClaw:基础概念详解 + 部署实操教程
2026年初爆火的开源AI智能体OpenClaw(昵称“龙虾”),突破传统聊天AI局限,具备读写文件、运行代码、操控浏览器等“动手能力”。支持微信/飞书交互,兼容多模型,本地或云端一键部署,赋能办公、开发、生活与创作场景。
926 5
|
开发工具 git
Git从远程仓库拉取指定的分支
Git从远程仓库拉取指定的分支
5417 0
|
4月前
|
监控 BI API
喂饭级图文教程!OpenClaw阿里云/本地部署+免费API配置+接入8大股票分析Skills实战及避坑指南
市面上多数股票分析工具都是“单点突破”——有的只能抓数据,有的只会分析财报,有的仅能看舆情,工具间互不连通,用户需手动导出导入数据、反复切换平台,耗时耗力。而OpenClaw的8大股票分析Skills彻底改变这一现状,它们并非独立工具,而是构成“数据层→研究层→决策层”的完整链路,输入股票代码即可自动完成数据抓取、分析、风控、报告生成,让投研效率提升5倍。
3450 5
|
6月前
|
数据采集 人工智能 文字识别
PDF 转 Markdown 神器:MinerU 2.5 (1.2B) 部署全攻略
MinerU是由OpenDataLab推出的开源PDF解析工具,支持精准布局分析、公式识别与表格提取。本文详解其2.5-2509-1.2B版本在Linux下的部署流程,涵盖环境搭建、模型下载、核心配置及实战应用,助你高效处理复杂PDF文档,提升AI数据清洗效率。
3499 3
|
2月前
|
存储 人工智能 安全
企业内部 AI 助理落地:从架构设计到私有化的完整实践
为满足数据合规要求,公司基于OpenClaw框架私有化部署AI助理平台,支持知识库问答、工单辅助及Web/钉钉/企微多端接入;采用Qwen-7B本地模型+百炼API混合推理,结合BGE向量库与意图路由策略,在保障安全前提下实现降本增效。(239字)