Python3,区区9行代码批量提取PDF文件的指定内容,我被震惊了....

简介: 有了此方法,再也不需要手抄PDF文档了。

1、引言

小屌丝:鱼哥, 你有没有什么办法,提取PDF文档的内容。

小鱼:这个还问我??

小屌丝:哎呀,这个不是被难住了嘛 。

小鱼:有啥难得?提示你一下,

小屌丝:嗯,可以可以。

小鱼:去我的博文找,没记错的话,有两种方法提取pdf的文字。

小屌丝:好嘞, 我这就去…找找…

2000.jpg

小屌丝:鱼哥,鱼哥~

小鱼:怎么样,你的这个需求,解决了吧。

小屌丝:没呢,我想批量提取指定PDF文档的内容…

小鱼:批…量…

小屌丝:对啊,是批量,

小鱼:这…还挺…

小屌丝:挺费劲吗?

小鱼:挺好的 ,不费劲, 一口气,上7楼…

小屌丝:打住… 说正事! !

小鱼:好嘞…


想到提取PDF文件的内容,我们第一反应就是pypdf,

因为pypdf这个库我在很多篇文章都介绍过, 还蛮好用的。

但是,今天,我们不使用pypdf,而是使用另一个库,即:pdfminer。

sa.png


2、代码实战

2.1 介绍

pdfminer我相信很多同学都没听说过,除非,你经常提取/解析PDF文件的内容,否则,你对ta,只能是陌生。


其实,提取PDF文件内容解决方案,截止到现在, 只有pypdf 和pdfminer这两种。

所以, 如果你厌倦了, pypdf,那只能选择pdfminer了。


那什么是pdfminer 呢,或者 pdfminer有什么神奇之处呢?


  • 定义
  • PDFMiner是用于从PDF文档提取信息的工具;
  • 与其他PDF相关工具不同,它完全专注于获取和分析文本数据;
  • 功能
  • PDFMiner允许获取页面中文本的确切位置以及其他信息,例如字体或线条;
  • 它包括一个PDF转换器,可以将PDF文件转换为其他文本格式(例如HTML);

2.2 安装

由于pdfminer是python 的第三方库, 所以,需要安装,

老规矩, 直接pip 安装

安装


pipinstallpdfminer


安装完成

image.png


因为我们需要用到 pdfminer的high_level 方法,所以

这里必须要在安装pdfminer.six模块,否则会报错:


安装

pipinstallpdfminer.six


安装完成

image.png


其它安装方式,直接看这两篇:


2.3 实例

安装完成,我们就来写上代码,

我们先来捋顺一下思路,主要分3步:


  • 1、遍历pdf文件

注:如果文件夹的文件多个,需要单独提取目标pdf文件,否则都会轮巡匹配,费事费力费资源;

  • 2、提取pdf文档内容
  • 3、根据正则匹配,提取需要的文档信息

我们就根据这个思路,来提取"企业基本情况",代码如下:


代码示例

# -*- coding:utf-8 -*-# @Time   : 2022-12-10# @Author : Carl_DJfrompdfminerimporthigh_levelimportre,os#pdf文件路径#root:文件夹路径,dirs:文件夹下子目录名,files:文件夹下的文件forroot,dirs,filesinos.walk('./data/'):
#遍历pdf文件forfinfiles:
file_name=os.path.join(root,f)
iffile_name.endswith('.pdf'):
#提取整个 pdf 文本信息text=high_level.extract_text(file_name)
#提取 pdf文档中 "企业进本情况:" 后面的信息,利用正则进行匹配regex=r'企业基本情况-(.*?)\n'qy_base=re.findall(regex,text)
print(f'输出信息:{qy_base}')




pdf文件

image.png

运行结果

61.png


3、总结

看到这里,今天的分享,差不多就该结束了。

解析PDF是一件非常耗时和耗内存的工作,因此,pdfminer使用一种称作Lazy Parsing的策略,减少内耗…

小屌丝:怪不得, 提到批量提取pdf的文档内容, 你会犹豫了…

小鱼:对啊,因为我们的的测试文档内容很少,所以对内存的消耗相对来说没那么验证,当PDF文档的内容很多时, 就不得不使用pdfminer了。


并且, 关于pdf文档的内容提取,我们能多学习几个技能,就多学习几个技能。


技能多了,路就多了,最后,收入也就多了


我是小鱼


  • CSDN 博客专家;
  • 阿里云社区 专家博主;
  • 51CTO博客 专家博主&TOP红人
  • 51认证讲师;
  • 金牌面试官;


关注我,带你学习更多更有趣的Python知识。


目录
相关文章
|
9天前
|
人工智能 文字识别 数据挖掘
MarkItDown:微软开源的多格式转Markdown工具,支持将PDF、Word、图像和音频等文件转换为Markdown格式
MarkItDown 是微软开源的多功能文档转换工具,支持将 PDF、PPT、Word、Excel、图像、音频等多种格式的文件转换为 Markdown 格式,具备 OCR 文字识别、语音转文字和元数据提取等功能。
78 9
MarkItDown:微软开源的多格式转Markdown工具,支持将PDF、Word、图像和音频等文件转换为Markdown格式
|
12天前
|
JavaScript
jquery图片和pdf文件预览插件
EZView.js是一款jquery图片和pdf文件预览插件。EZView.js可以为图片和pdf格式文件生成在线预览效果。支持的文件格式有pdf、jpg、 png、jpeg、gif。
43 16
|
11天前
|
计算机视觉 Python
如何使用Python将TS文件转换为MP4
本文介绍了如何使用Python和FFmpeg将TS文件转换为MP4文件。首先需要安装Python和FFmpeg,然后通过`subprocess`模块调用FFmpeg命令,实现文件格式的转换。代码示例展示了具体的操作步骤,包括检查文件存在性、构建FFmpeg命令和执行转换过程。
35 7
|
2月前
|
自然语言处理 数据处理 Python
python操作和解析ppt文件 | python小知识
本文将带你从零开始,了解PPT解析的工具、工作原理以及常用的基本操作,并提供具体的代码示例和必要的说明【10月更文挑战第4天】
499 60
|
2月前
|
安全 Linux 数据安全/隐私保护
python知识点100篇系列(15)-加密python源代码为pyd文件
【10月更文挑战第5天】为了保护Python源码不被查看,可将其编译成二进制文件(Windows下为.pyd,Linux下为.so)。以Python3.8为例,通过Cython工具,先写好Python代码并加入`# cython: language_level=3`指令,安装easycython库后,使用`easycython *.py`命令编译源文件,最终生成.pyd文件供直接导入使用。
python知识点100篇系列(15)-加密python源代码为pyd文件
|
1月前
|
开发者 Python
Python中__init__.py文件的作用
`__init__.py`文件在Python包管理中扮演着重要角色,通过标识目录为包、初始化包、控制导入行为、支持递归包结构以及定义包的命名空间,`__init__.py`文件为组织和管理Python代码提供了强大支持。理解并正确使用 `__init__.py`文件,可以帮助开发者更好地组织代码,提高代码的可维护性和可读性。
51 2
|
2月前
|
Linux 区块链 Python
Python实用记录(十三):python脚本打包exe文件并运行
这篇文章介绍了如何使用PyInstaller将Python脚本打包成可执行文件(exe),并提供了详细的步骤和注意事项。
94 1
Python实用记录(十三):python脚本打包exe文件并运行
|
1月前
|
中间件 Docker Python
【Azure Function】FTP上传了Python Function文件后,无法在门户页面加载函数的问题
通过FTP上传Python Function至Azure云后,出现函数列表无法加载的问题。经排查,发现是由于`requirements.txt`中的依赖包未被正确安装。解决方法为:在本地安装依赖包到`.python_packages/lib/site-packages`目录,再将该目录内容上传至云上的`wwwroot`目录,并重启应用。最终成功加载函数列表。
|
2月前
|
Java Python
> python知识点100篇系列(19)-使用python下载文件的几种方式
【10月更文挑战第7天】本文介绍了使用Python下载文件的五种方法,包括使用requests、wget、线程池、urllib3和asyncio模块。每种方法适用于不同的场景,如单文件下载、多文件并发下载等,提供了丰富的选择。
|
2月前
|
数据安全/隐私保护 流计算 开发者
python知识点100篇系列(18)-解析m3u8文件的下载视频
【10月更文挑战第6天】m3u8是苹果公司推出的一种视频播放标准,采用UTF-8编码,主要用于记录视频的网络地址。HLS(Http Live Streaming)是苹果公司提出的一种基于HTTP的流媒体传输协议,通过m3u8索引文件按序访问ts文件,实现音视频播放。本文介绍了如何通过浏览器找到m3u8文件,解析m3u8文件获取ts文件地址,下载ts文件并解密(如有必要),最后使用ffmpeg合并ts文件为mp4文件。