python【包含数据预处理】基于词频生成词云图

简介: 背景目的有一篇中文文章,或者一本小说。想要根据词频来生成词云图。

背景目的

有一篇中文文章,或者一本小说。想要根据词频来生成词云图。

为什么中文需要分词

中文分词是理解和处理中文文本的关键步骤,它直接影响到后续的文本分析和信息提取的准确性和有效性。

  • 无明显单词分隔:中文文本不像英文那样使用空格来分隔单词,中文字符通常连续书写,没有明显的单词边界。
  • 语言单位:中文的基本语言单位是字,但单独的字往往不能表达完整的意思。中文的表达往往需要由多个字组成的词语来实现。
  • 语境依赖性:中文词语的意义很大程度上依赖于语境,相同的字在不同的词语中可能有不同的意义。
  • 词义丰富性:中文中的词语往往比单个的字具有更丰富的语义信息,分词有助于更准确地理解文本内容。
  • 语法复杂性:中文的语法结构相对复杂,词语的顺序、搭配和使用习惯对句子意义的影响很大。
  • 自然语言处理:在自然语言处理领域,分词是中文文本分析的基础步骤,无论是进行词性标注、命名实体识别还是句法分析,都需要先进行分词。
  • 信息检索和文本挖掘:分词可以提高中文信息检索和文本挖掘的准确性,有助于提取关键词和短语,从而更好地理解文本内容。

文本预处理

最终目的是,生成句子数组。

在进行中文文本分析前,必须执行数据预处理步骤,以提升后续处理的准确性和效率。这包括:

  • 移除文本中的特殊符号,因为它们通常不携带有用信息,且可能干扰分词算法。
  • 统一替换空格、换行符、制表符等空白字符为中文逗号,以保持句子的连贯性。
  • 删除无意义的英文字母,因为它们对于中文文本分析不是必要的。
  • 清除文本中的网址、图片链接、日期等信息,这些通常与文本的主题无关,可能会影响分析结果。

数据处理函数

处理文本,过滤不需要无意义的字符。

import re
 
 def data_process(str_data):
     # 定义正则表达式模式
     # 去除换行、空格
     str_data = re.sub(r'[\n\s]+', '', str_data)
     # 匹配网址
     url_pattern = r'http[s]?://(?:[a-zA-Z]|[0-9]|[$-_@.&+]|[!*\(\),]|(?:%[0-9a-fA-F][0-9a-fA-F]))+'
     # 匹配日期格式如 YYYY/MM/DD, YYYY-MM-DD, YYYY年MM月DD日
     date_pattern = r'\d{4}[/\-]?\d{1,2}[/\-]?\d{1,2}'
     # 匹配邮箱地址
     email_pattern = r'\b[A-Za-z0-9._%+-]+@[A-Za-z0-9.-]+.[A-Z|a-z]{2,}\b'
     # 匹配数字
     number_pattern = r'\d+'
     # 匹配英文字母
     english_letter_pattern = r'[a-zA-Z]'
 
     # 替换空白字符为空格
     str_data = re.sub(r'\s', ',', str_data)
 
     # 删除特殊符号、网址、日期、邮箱、数字和英文字母
     str_data = re.sub(url_pattern, '', str_data)
     str_data = re.sub(date_pattern, '', str_data)
     str_data = re.sub(email_pattern, '', str_data)
     str_data = re.sub(number_pattern, '', str_data)
     str_data = re.sub(english_letter_pattern, '', str_data)
 
     # 删除标点符号
     punctuation = r""""!!??#$%&'()()*+-/:;▪³/<=>@[\]^_`●{|}~⦅⦆「」、、〃》「」『』【】[]〔〕〖〗〘〙{}〚〛*°▽〜〝〞〟〰〾〿–—‘'‛“”„‟…‧﹏"""
     str_data = re.sub(f"[{re.escape(punctuation)}]+", '', str_data)
 
     return str_data.strip()
 
 sample_text = "这是一个例子。\n包含网址 http://example.com,参考文献[1]{,日期2024-06-18。"
 processed_text = data_process(sample_text)
 print(processed_text)

句子数组函数封装

读取txt文件生成句子数组

1718688956454.jpg

def getText(filename):
     sentences = []
     with open(filename, 'r', encoding='utf-8') as fp:
         for line in fp:
             processed_line = data_process(line)
             if processed_line:  # 检查处理后的句子是否为空或只包含空白字符
                 sentences.extend(re.split(r'[。!?]', processed_line))  # 使用更复杂的句子划分规则
         # 去除列表中的空字符串
     sentences = [sentence for sentence in sentences if sentence.strip()]
     return sentences

输出结果

1718689014356.jpg

分词和词频统计

jieba分词

Jieba分词是一个流行的中文分词Python库,它的主要特点和作用可以简单概括为:

  • 什么是Jieba分词:一个用于中文文本分词的库。
  • 做了什么:识别中文文本中的单词边界,将连续的文本切分成单独的词语。
  • 得到什么:提供分词后的结果,即文本中各个词语的列表。

1718689058981.jpg

Jieba 分词器属于概率语言模型分词,基于前缀词典实现高效的词图扫描,生成句子中汉字所有可能成词情况构建成有向无环图,然后采用动态规划寻找最大概率路径,找出基于词频的最大切分组合。对于不存在与前缀词典中的词,采用了汉字成词能力的 HMM 模型,使用了 Viterbi 算法。Jieba 的切分模式有全模式、精确模式、搜索引擎模式,更多详细信息可以查看 github 仓库。

以下是 Jieba 分词器中一些常用函数的:

函数名

描述

jieba.cut

对输入文本进行分词,返回一个可迭代的分词结果

jieba.cut_for_search

在搜索引擎模式下对输入文本进行分词,返回一个可迭代的分词结果

jieba.lcut

对输入文本进行分词,返回一个列表形式的分词结果

jieba.lcut_for_search

在搜索引擎模式下对输入文本进行分词,返回一个列表形式的分词结果

jieba.add_word

向分词词典中添加新词

jieba.del_word

从分词词典中删除指定词

jieba.load_userdict

加载用户自定义词典

jieba.analyse.extract_tags

提取文本中的关键词,返回一个列表形式的关键词结果

词频函数封装

统计句子列表中名词('n', 'nr', 'nz')的词频, 返回一个字典

import jieba.posseg as psg
 
 def getWordFrequency(sentences):
     """
     统计句子列表中名词('n', 'nr', 'nz')的词频
     :param sentences: 包含多个句子的列表
     :return: 包含名词词频的字典
     """
     words_dict = {}  # 用于存储词频的字典
     for text in sentences:
         # 去掉标点符号
         text = re.sub("[\s+.!/_,$%^*(+"']+|[+——!,。?、~@#¥%……&*()]+", "", text)
         
         # 使用结巴分词进行词性标注
         wordGen = psg.cut(text)
         
         # 遍历分词结果,统计名词词频
         for word, attr in wordGen:
             if attr in ['n', 'nr', 'nz']:  # 判断词性是否为名词
                 if word in words_dict.keys():
                     words_dict[word] += 1
                 else:
                     words_dict[word] = 1
     return words_dict
 
 if __name__ == "__main__":
     sentences = getText("../百度百科-黄河.txt")
     # pprint(sentences)
     words_dict = getWordFrequency(sentences)
     pprint(words_dict)

输出结果

1718689106621.jpg

由词频生成词云

完整代码

import re
 from pprint import pprint
 import jieba.posseg as psg
 from wordcloud import WordCloud
 import matplotlib.pyplot as plt

 def data_process(str_data):
     # 定义正则表达式模式
     # 去除换行、空格
     str_data = re.sub(r'[\n\s]+', '', str_data)
     # 匹配网址
     url_pattern = r'http[s]?://(?:[a-zA-Z]|[0-9]|[$-_@.&+]|[!*\(\),]|(?:%[0-9a-fA-F][0-9a-fA-F]))+'
     # 匹配日期格式如 YYYY/MM/DD, YYYY-MM-DD, YYYY年MM月DD日
     date_pattern = r'\d{4}[/\-]?\d{1,2}[/\-]?\d{1,2}'
     # 匹配邮箱地址
     email_pattern = r'\b[A-Za-z0-9._%+-]+@[A-Za-z0-9.-]+.[A-Z|a-z]{2,}\b'
     # 匹配数字
     number_pattern = r'\d+'
     # 匹配英文字母
     english_letter_pattern = r'[a-zA-Z]'
 
     # 替换空白字符为空格
     str_data = re.sub(r'\s', ',', str_data)
 
     # 删除特殊符号、网址、日期、邮箱、数字和英文字母
     str_data = re.sub(url_pattern, '', str_data)
     str_data = re.sub(date_pattern, '', str_data)
     str_data = re.sub(email_pattern, '', str_data)
     str_data = re.sub(number_pattern, '', str_data)
     str_data = re.sub(english_letter_pattern, '', str_data)
 
     # 删除标点符号
     punctuation = r""""!!??#$%&'()()*+-/:;▪³/<=>@[\]^_`●{|}~⦅⦆「」、、〃》「」『』【】[]〔〕〖〗〘〙{}〚〛*°▽〜〝〞〟〰〾〿–—‘'‛“”„‟…‧﹏"""
     str_data = re.sub(f"[{re.escape(punctuation)}]+", '', str_data)
 
     return str_data.strip()
 
 def getText(filename):
     sentences = []
     with open(filename, 'r', encoding='utf-8') as fp:
         for line in fp:
             processed_line = data_process(line)
             if processed_line:  # 检查处理后的句子是否为空或只包含空白字符
                 sentences.extend(re.split(r'[。!?]', processed_line))  # 使用更复杂的句子划分规则
         # 去除列表中的空字符串
     sentences = [sentence for sentence in sentences if sentence.strip()]
     return sentences
 
 def getWordFrequency(sentences):
     """
     统计句子列表中名词('n', 'nr', 'nz')的词频
     :param sentences: 包含多个句子的列表
     :return: 包含名词词频的字典
     """
     words_dict = {}  # 用于存储词频的字典
     for text in sentences:
         # 去掉标点符号
         text = re.sub("[\s+.!/_,$%^*(+"']+|[+——!,。?、~@#¥%……&*()]+", "", text)
 
         # 使用结巴分词进行词性标注
         wordGen = psg.cut(text)
 
         # 遍历分词结果,统计名词词频
         for word, attr in wordGen:
             if attr in ['n', 'nr', 'nz']:  # 判断词性是否为名词
                 if word in words_dict.keys():
                     words_dict[word] += 1
                 else:
                     words_dict[word] = 1
     return words_dict

 if __name__ == "__main__":
     sentences = getText("../百度百科-黄河.txt")
     # pprint(sentences)
     words_dict = getWordFrequency(sentences)
 
     # 创建 wordcloud 对象,背景图片为 graph,背景色为白色
     wc = WordCloud(font_path='../Hiragino.ttf', width=800, height=600, mode='RGBA', background_color=None)
     # 生成词云
     wc.generate_from_frequencies(words_dict)
     # 显示词云
     plt.imshow(wc, interpolation='bilinear')
     plt.axis('off')
     plt.show()

词云结果

1718689217705.jpg

作者:Wusp1994

链接:https://juejin.cn/post/7381423581018243112

相关文章
|
10天前
|
数据采集 自然语言处理 搜索推荐
python 【包含数据预处理】基于词频生成词云图
这段文本是关于如何使用Python基于词频生成词云图的教程。内容包括:1) 中文分词的必要性,因中文无明显单词边界及语言单位特性;2) 文本预处理步骤,如移除特殊符号、网址、日期等;3) 使用`data_process`函数清除无用字符;4) `getText`函数读取并处理文本为句子数组;5) 使用jieba分词库进行分词和词频统计;6) 示例代码展示了从分词到生成词云的完整流程,最后展示生成的词云图。整个过程旨在从中文文本中提取关键词并可视化。
45 5
python 【包含数据预处理】基于词频生成词云图
|
4天前
|
数据采集 自然语言处理 数据可视化
拿来及用的Python词云图代码 | wordcloud生成词云详解
词云也叫文字云,是一种可视化的结果呈现,常用在爬虫数据分析中,原理就是统计文本中高频出现的词,过滤掉某些干扰词,将结果生成一张图片,直观的获取数据的重点信息。今天,我们就来学习一下Python生成词云的常用库wordcloud。
|
17天前
|
数据采集 机器学习/深度学习 数据挖掘
使用Python进行数据预处理与清洗的最佳实践
本文探讨了Python在数据预处理和清洗中的关键作用。预处理包括数据收集、整合、探索、转换和标准化,而清洗则涉及缺失值、重复值、异常值的处理及数据格式转换。文中提供了使用pandas库进行数据读取、缺失值(如用平均值填充)和重复值处理、异常值检测(如IQR法则)以及数据转换(如min-max缩放)的代码示例。此外,还讲解了文本数据清洗的基本步骤,包括去除标点、转换为小写和停用词移除。整体上,文章旨在帮助读者掌握数据预处理和清洗的最佳实践,以提高数据分析的准确性和效率。
28 2
|
22天前
|
自然语言处理 Python
python生成词云图
python生成词云图
|
1月前
|
自然语言处理 数据处理 Python
python安娜卡列妮娜词云图制作
python安娜卡列妮娜词云图制作
|
Python
python编程:计算词频的函数绘制图形
python编程:计算词频的函数绘制图形
179 0
python编程:计算词频的函数绘制图形
|
6天前
|
机器学习/深度学习 人工智能 前端开发
Python中的模块化编程
【6月更文挑战第17天】Python模块化编程与软件架构设计的关键在于拆分任务到独立模块,提高代码的可维护性、可重用性和可扩展性。例如,学生管理系统可分解为录入、查询和删除模块。MVC和MVVM架构模式有助于组织代码,而微服务和函数式编程将在未来发展中扮演重要角色。通过示例代码,读者能学习如何实现这些概念,提升项目开发效率和质量。
154 57
|
13天前
|
测试技术 虚拟化 云计算
GitHub高赞!速通Python编程基础手册,被玩出花了!
随着云时代的来临,Python 语言越来越被程序开发人员喜欢和使用,因为其不仅简单易学,而且还有丰富的第三方程序库和相应完善的管理工具。 从命令行脚本程序到 GUI程序,从图形技术到科学计算,从软件开发到自动化测试,从云计算到虚拟化,所有这些领域都有 Python 的身影。 今天给小伙伴们分享的这份手册采用以任务为导向的编写模式,全面地介绍了 Python 编程基础及其相关知识的应用,讲解了如何利用 Python 的知识解决部分实际问题。
GitHub高赞!速通Python编程基础手册,被玩出花了!
|
2天前
|
数据挖掘 数据处理 Python
Python编程入门:从基础到实践
【6月更文挑战第26天】这篇文章引导读者逐步学习Python编程,从基础语法如变量、数据类型(整数、浮点数、字符串)到条件语句、循环(if/for/while),再到函数定义和模块导入。通过实例展示了Python在文本处理、数据分析(使用pandas)和Web开发(使用Flask)的应用。学习Python能为初学者开启更广阔的技术领域,如面向对象编程、并发和网络编程等。
|
4天前
|
Python
Python多进程编程详细剖析
Python多进程编程详细剖析
13 3