pdf文件合并批量合并,转Word--python一招教会你

简介: pdf文件合并批量合并,转Word--python一招教会你

前言


在平时的日常学习生活或办公生活中,想必大家有过将pdf文件做批量合并,转Word等方面的操作吧,今天这篇文章就教大家使用python来实现pdf文件的批量合并,转Word操作。临近学期末,我这里就有一个这样的需求,在网页上有着几套选择题,我把它们存为pdf保存在了本地。为了更加方便的去查找相关字眼的题目,我就编写了一些python代码将多个pdf文件进行合并,并实现pdf文件转Word的功能。温馨提示:这些功能在现实中是需要收费的,作为我的粉丝,恭喜你们又学到了一招,学到就是赚到。丨

本案例很实用,建议点赞收藏!!!!

1.环境准备


   这里使用的第三方模块有:pdf2docx、PyPDF2,如果有未安装模块的伙伴可以在终端上使用以下命令进行安装:


1pip install pdf2docx 
2pip install PyPDF2


出现Successful代表模块安装成功!


 

2.功能函数模块的编写

2.1批合并功能的实现    

 

在前期环境准备工作完成以后,现在我们要做的就是编写处理业务功能的函数模块啦!

首先来编写实现多个pdf文件批合并功能,编写函数pdf_merge(),并提供两个参数:1、存放多个pdf文件的目录,2、批合并后生成的文件名。这里用os模块的listdir方法帮我们列出目录中的文件并给我们返回一个列表。在对该列表进行遍历并过滤出pdf文件,使用列表推导式的方式将目录中的pdf文件存入处理好的列表当中。并将列表中的pdf文件批量添加到该pdf文件管理器中,最后在将pdf管理器中的pdf文件对象进行写入(合并操作)就完成pdf的合并操作啦。

1def pdf_merge(target_path, fileName):
 2    '''
 3    :param target_path: 存放pdf文件的目录
 4    :return:转换后的文件名
 5    '''
 6    # target_path = '题目'
 7    pdf_lst = [f for f in os.listdir(target_path) if f.endswith('.pdf')]
 8    pdf_lst = [os.path.join(target_path, filename) for filename in pdf_lst]
 9
10    file_merger = PdfFileMerger()
11    for pdf in pdf_lst:
12        file_merger.append(pdf)  # 合并pdf文件
13
14    file_merger.write(fileName)  # 合并为merge.pdf
15    return fileName


2.2 pdf文件转Word功能的实现

现在开始编写pdf转word功能,定义函数并传入一个文件对象作为参数,这里先对pdf文件对象进行文件类型的判断,判断它是否为pdf文件。如果为pdf文件,就调用pdf2docx模块的Connverter类对该pdf文件对象进行处理,不为pdf文件就不对文件进行处理,并输出不是一个pdf文件。

1def pdf_docx(file):
 2    '''
 3    :param file:pdf文件
 4    :return:
 5    '''
 6    if file.endswith('pdf'):
 7        docx_file = file.replace('pdf', 'docx')
 8        pdf = pdf2docx.Converter(file)
 9        pdf.convert(docx_file, start=0, end=None)
10        pdf.close()
11        print(f'{docx_file}\t文件转为完成!')
12    else:
13        print(f'{file}不是一个pdf文件!')


以上就是两个功能函数的实现,现在来运行代码看看吧~



代码运行完毕,可以看到批合并的pdf文件和pdf转换的文件已经生成好啦~

最后奉上全部代码:


1import os, pdf2docx
 2from PyPDF2 import PdfFileMerger
 3
 4
 5def pdf_merge(target_path, fileName):
 6    '''
 7    :param target_path: 存放pdf文件的目录
 8    :return:转换后的文件名
 9    '''
10    # target_path = '题目'
11    pdf_lst = [f for f in os.listdir(target_path) if f.endswith('.pdf')]
12    pdf_lst = [os.path.join(target_path, filename) for filename in pdf_lst]
13
14    file_merger = PdfFileMerger()
15    for pdf in pdf_lst:
16        file_merger.append(pdf)  # 合并pdf文件
17
18    file_merger.write(fileName)  # 合并为merge.pdf
19    return fileName
20
21
22def pdf_docx(file):
23    '''
24    :param file:pdf文件
25    :return:
26    '''
27    if file.endswith('pdf'):
28        docx_file = file.replace('pdf', 'docx')
29        pdf = pdf2docx.Converter(file)
30        pdf.convert(docx_file, start=0, end=None)
31        pdf.close()
32        print(f'{docx_file}\t文件转为完成!')
33    else:
34        print(f'{file}不是一个pdf文件!')
35
36
37if __name__ == '__main__':
38    file = pdf_merge('题目', 'merge.pdf')
39    pdf_docx(file)


以上就是今天的全部内容了

相关文章
|
1月前
|
自然语言处理 数据处理 Python
python操作和解析ppt文件 | python小知识
本文将带你从零开始,了解PPT解析的工具、工作原理以及常用的基本操作,并提供具体的代码示例和必要的说明【10月更文挑战第4天】
326 60
|
1月前
|
安全 Linux 数据安全/隐私保护
python知识点100篇系列(15)-加密python源代码为pyd文件
【10月更文挑战第5天】为了保护Python源码不被查看,可将其编译成二进制文件(Windows下为.pyd,Linux下为.so)。以Python3.8为例,通过Cython工具,先写好Python代码并加入`# cython: language_level=3`指令,安装easycython库后,使用`easycython *.py`命令编译源文件,最终生成.pyd文件供直接导入使用。
python知识点100篇系列(15)-加密python源代码为pyd文件
|
15天前
|
开发者 Python
Python中__init__.py文件的作用
`__init__.py`文件在Python包管理中扮演着重要角色,通过标识目录为包、初始化包、控制导入行为、支持递归包结构以及定义包的命名空间,`__init__.py`文件为组织和管理Python代码提供了强大支持。理解并正确使用 `__init__.py`文件,可以帮助开发者更好地组织代码,提高代码的可维护性和可读性。
17 2
|
1月前
|
Linux 区块链 Python
Python实用记录(十三):python脚本打包exe文件并运行
这篇文章介绍了如何使用PyInstaller将Python脚本打包成可执行文件(exe),并提供了详细的步骤和注意事项。
54 1
Python实用记录(十三):python脚本打包exe文件并运行
|
1月前
|
Java Python
> python知识点100篇系列(19)-使用python下载文件的几种方式
【10月更文挑战第7天】本文介绍了使用Python下载文件的五种方法,包括使用requests、wget、线程池、urllib3和asyncio模块。每种方法适用于不同的场景,如单文件下载、多文件并发下载等,提供了丰富的选择。
|
1月前
|
数据安全/隐私保护 流计算 开发者
python知识点100篇系列(18)-解析m3u8文件的下载视频
【10月更文挑战第6天】m3u8是苹果公司推出的一种视频播放标准,采用UTF-8编码,主要用于记录视频的网络地址。HLS(Http Live Streaming)是苹果公司提出的一种基于HTTP的流媒体传输协议,通过m3u8索引文件按序访问ts文件,实现音视频播放。本文介绍了如何通过浏览器找到m3u8文件,解析m3u8文件获取ts文件地址,下载ts文件并解密(如有必要),最后使用ffmpeg合并ts文件为mp4文件。
|
1月前
|
Java Apache Maven
将word文档转换成pdf文件方法
在Java中,将Word文档转换为PDF文件可采用多种方法:1) 使用Apache POI和iText库,适合处理基本转换需求;2) Aspose.Words for Java,提供更高级的功能和性能;3) 利用LibreOffice命令行工具,适用于需要开源解决方案的场景。每种方法都有其适用范围,可根据具体需求选择。
|
1月前
|
Java Apache Maven
Java将word文档转换成pdf文件的方法?
【10月更文挑战第13天】Java将word文档转换成pdf文件的方法?
152 1
|
1月前
|
JSON 数据格式 Python
Python实用记录(十四):python统计某个单词在TXT/JSON文件中出现的次数
这篇文章介绍了一个Python脚本,用于统计TXT或JSON文件中特定单词的出现次数。它包含两个函数,分别处理文本和JSON文件,并通过命令行参数接收文件路径、目标单词和文件格式。文章还提供了代码逻辑的解释和示例用法。
42 0
Python实用记录(十四):python统计某个单词在TXT/JSON文件中出现的次数
|
1月前
|
索引 Python
PDF文件页面提取操作小指南
PDF文件页面提取操作小指南