开发者社区开发与运维文章正文

用python3快速读取30G+的txt文件

2024-09-25 177

版权

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介： 这篇文章介绍了如何使用Python分块读取大文件（如30G+的txt文件），通过设置每次读取的块大小来处理大型文本文件，以减少内存消耗并提高处理效率。

分块读取：

处理大文件是很容易想到的就是将大文件分割成若干小文件处理，处理完每个小文件后释放该部分内存。案例脚本如下：

# -*- encoding: utf-8 -*-

def read_in_chunks(file_path, chunk_size=1024*1024):
    """按块读取文本
    一个接一个地读取文件的懒惰函数（生成器）。
    默认块大小: 1M, 当然也可以设置默认块大小
    """
    file_object = open(file_path)
    while True:
        chunk_data = file_object.read(chunk_size)
        if not chunk_data:
            break
        yield chunk_data


if __name__ == "__main__":
    path = './path/filename.txt'
    chunks = read_in_chunks(path)
    for num, chunk in enumerate(chunks):
        print(f'{num} {chunk}')

        # 处理每一个块
        single_chunk = chunk.split('\n')
        for number, single in enumerate(single_chunk):
            print(f'{num} {number} {single}')

1、上面的代码中，每次读取1M的文件，直到把数据读取完。
2、对于35G的txt文件，测试用了3分钟读取完成。8G的文件用了不到1分钟。

文章标签：

Python

关键词：

Python文件

Python txt

Python txt文件

数据知道

游客akle7anmklvj6

11天前

机器学习/深度学习存储算法

解锁文件共享软件背后基于 Python 的二叉搜索树算法密码

文件共享软件在数字化时代扮演着连接全球用户、促进知识与数据交流的重要角色。二叉搜索树作为一种高效的数据结构，通过有序存储和快速检索文件，极大提升了文件共享平台的性能。它依据文件名或时间戳等关键属性排序，支持高效插入、删除和查找操作，显著优化用户体验。本文还展示了用Python实现的简单二叉搜索树代码，帮助理解其工作原理，并展望了该算法在分布式计算和机器学习领域的未来应用前景。

游客akle7anmklvj6

40 15 16

蓝易云

21天前

监控网络安全开发者

Python中的Paramiko与FTP文件夹及文件检测技巧

通过使用 Paramiko 和 FTP 库，开发者可以方便地检测远程服务器上的文件和文件夹是否存在。Paramiko 提供了通过 SSH 协议进行远程文件管理的能力，而 `ftplib` 则提供了通过 FTP 协议进行文件传输和管理的功能。通过理解和应用这些工具，您可以更加高效地管理和监控远程服务器上的文件系统。

蓝易云

51 20 20

威哥爱编程

27天前

存储数据采集数据处理

如何在Python中高效地读写大型文件？

大家好，我是V哥。上一篇介绍了Python文件读写操作，今天聊聊如何高效处理大型文件。主要方法包括：逐行读取、分块读取、内存映射（mmap）、pandas分块处理CSV、numpy处理二进制文件、itertools迭代处理及linecache逐行读取。这些方法能有效节省内存，提升效率。关注威哥爱编程，学习更多Python技巧。

威哥爱编程

93 8 8

威哥爱编程

28天前

存储 JSON 对象存储

如何使用 Python 进行文件读写操作？

大家好，我是V哥。本文介绍Python中文件读写操作的方法，包括文件读取、写入、追加、二进制模式、JSON、CSV和Pandas模块的使用，以及对象序列化与反序列化。通过这些方法，你可以根据不同的文件类型和需求，灵活选择合适的方式进行操作。希望对正在学习Python的小伙伴们有所帮助。欢迎关注威哥爱编程，全栈路上我们并肩前行。

威哥爱编程

82 4 4

游客akle7anmklvj6

1月前

存储算法 Serverless

剖析文件共享工具背后的Python哈希表算法奥秘

在数字化时代，文件共享工具不可或缺。哈希表算法通过将文件名或哈希值映射到存储位置，实现快速检索与高效管理。Python中的哈希表可用于创建简易文件索引，支持快速插入和查找文件路径。哈希表不仅提升了文件定位速度，还优化了存储管理和多节点数据一致性，确保文件共享工具高效运行，满足多用户并发需求，推动文件共享领域向更高效、便捷的方向发展。

游客akle7anmklvj6

57 12 12

bruce_xiaowei

2月前

计算机视觉 Python

如何使用Python将TS文件转换为MP4

本文介绍了如何使用Python和FFmpeg将TS文件转换为MP4文件。首先需要安装Python和FFmpeg，然后通过`subprocess`模块调用FFmpeg命令，实现文件格式的转换。代码示例展示了具体的操作步骤，包括检查文件存在性、构建FFmpeg命令和执行转换过程。

bruce_xiaowei

76 7 7

路边两盏灯

3月前

中间件 Docker Python

【Azure Function】FTP上传了Python Function文件后，无法在门户页面加载函数的问题

通过FTP上传Python Function至Azure云后，出现函数列表无法加载的问题。经排查，发现是由于`requirements.txt`中的依赖包未被正确安装。解决方法为：在本地安装依赖包到`.python_packages/lib/site-packages`目录，再将该目录内容上传至云上的`wwwroot`目录，并重启应用。最终成功加载函数列表。

路边两盏灯

45 0 0

蓝易云

3月前

开发者 Python

Python中__init__.py文件的作用

`__init__.py`文件在Python包管理中扮演着重要角色，通过标识目录为包、初始化包、控制导入行为、支持递归包结构以及定义包的命名空间，`__init__.py`文件为组织和管理Python代码提供了强大支持。理解并正确使用 `__init__.py`文件，可以帮助开发者更好地组织代码，提高代码的可维护性和可读性。

蓝易云

178 2 2

技能实验室

4月前

Java Python

＞ python知识点100篇系列（19）-使用python下载文件的几种方式

【10月更文挑战第7天】本文介绍了使用Python下载文件的五种方法，包括使用requests、wget、线程池、urllib3和asyncio模块。每种方法适用于不同的场景，如单文件下载、多文件并发下载等，提供了丰富的选择。

技能实验室

73 1 1

技能实验室

4月前

数据安全/隐私保护流计算开发者

python知识点100篇系列（18）-解析m3u8文件的下载视频

【10月更文挑战第6天】m3u8是苹果公司推出的一种视频播放标准，采用UTF-8编码，主要用于记录视频的网络地址。HLS（Http Live Streaming）是苹果公司提出的一种基于HTTP的流媒体传输协议，通过m3u8索引文件按序访问ts文件，实现音视频播放。本文介绍了如何通过浏览器找到m3u8文件，解析m3u8文件获取ts文件地址，下载ts文件并解密（如有必要），最后使用ffmpeg合并ts文件为mp4文件。

技能实验室

109 1 1

用python3快速读取30G+的txt文件

分块读取：

热门文章

最新文章

相关课程

相关电子书

相关实验场景

推荐镜像

热门

活动广场

任务中心

开发者评测

高校计划

乘风者计划

训练营

阿里云MVP

话题

直播

下载

镜像站

技术资料

插件

用python3快速读取30G+的txt文件

分块读取：

热门文章

最新文章

相关课程

相关电子书

相关实验场景

推荐镜像