使用朴素贝叶斯对电影评论分类

简介: 使用朴素贝叶斯对电影评论分类

使用朴素贝叶斯对电影评论分类


1.数据集讲解:

该数据集是IMDB电影数据集的一个子集,已经划分好了测试集和训练集,训练集包括25000条电影评论,测试集也有25000条,该数据集已经经过预处理,将每条评论的具体单词序列转化为词库里的整数序列,其中每个整数代表该单词在词库里的位置。例如,整数104代表该单词是词库的第104个单词。为实验简单,词库仅仅保留了10000个最常出现的单词,低频词汇被舍弃。每条评论都具有一个标签,0表示为负面评论,1表示为正面评论。


训练数据在train_data.txt文件下,每一行为一条评论,训练集标签在train_labels.txt文件下,每一行为一条评论的标签;测试数据在test_data.txt文件下,测试数据标签未给出。


2.具体实现:

1.取出数据集:


从txt中取出训练集与测试集:

with open("test/test_data.txt", "rb") as fr:
  test_data_n = [inst.decode().strip().split(' ') for inst in fr.readlines()]
  test_data = [[int(element) for element in line] for line in test_data_n]
test_data = np.array(test_data)


2.数据处理:


对每条评论,先将其解码为英文单词,再键值颠倒,将整数索引映射为单词。


把整数序列编码为二进制序列。


最后把训练集标签向量化。

# 将某条评论解码为英文单词
word_index = imdb.get_word_index() # word_index是一个将单词映射为整数索引的字典
reverse_word_index = dict([(value, key) for (key, value) in word_index.items()])
# 键值颠倒,将整数索引映射为单词
decode_review = ' '.join(
  [reverse_word_index.get(i - 3, '?') for i in train_data[0]]
) 
\# 将评论解码
\# 注意,索引减去了3,因为0,1,2是为padding填充
\# "start sequence"序列开始,"unknow"未知词分别保留的索引
\# 将整数序列编码为二进制矩阵
def vectorize_sequences(sequences, dimension=10000):
  results = np.zeros((len(sequences), dimension)) # 创建一个形状为(len(sequences), dimension)的矩阵
  for i, sequence in enumerate(sequences):
    results[i, sequence] = 1 # 将results[i]的指定索引设为 1
  return results
x_train = vectorize_sequences(train_data)
x_test = vectorize_sequences(test_data)
\# 标签向量化
y_train = np.asarray(train_labels).astype('float32')


3.建立模型:


可选多项式模型或者伯努利模型。


二者的计算粒度不一样,多项式模型以单词为粒度,伯努利模型以文件为粒度,因此二者的先验概率和类条件概率的计算方法都不同。

计算后验概率时,对于一个文档d,多项式模型中,只有在d中出现过的单词,才会参与后验概率计算,伯努利模型中,没有在d中出现,但是在全局单词表中出现的单词,也会参与计算,不过是作为“反方”参与的。

当训练集文档较短,也就说不太会出现很多重复词的时候,多项式和伯努利模型公式的分子相等,多项式分母值大于伯努利分子值,因此多项式的似然估计值会小于伯努利的似然估计值。

所以,当训练集文本较短时,我们更倾向于使用伯努利模型。而文本较长时,我们更倾向于多项式模型,因为,在一篇文档中的高频词,会使该词的似然概率值相对较大。


使用拉普拉斯平滑


alpha:先验平滑因子,默认等于1,当等于1时表示拉普拉斯平滑。

# model = MultinomialNB()
model = BernoulliNB()
model.fit(X_train, y_train)


4.输出测试集上的预测结果:


将结果写入txt

# model evaluation
print("model accuracy is " + str(accuracy_score(y_test, y_pred)))
print("model precision is " + str(precision_score(y_test, y_pred, average='macro')))
print("model recall is " + str(recall_score(y_test, y_pred, average='macro')))
print("model f1_score is " + str(f1_score(y_test, y_pred, average='macro')))
des = y_pred_local.astype(int)
np.savetxt('Text3_result.txt', des, fmt='%d', delimiter='\n')


3.实验结果:

使用多项式模型:



使用伯努利模型:



在该场景下,两者差别不大。


实验总结


1.贝叶斯概率及贝叶斯 准则提供了一种利用已知值来估计位置概率的有效方法;

2.朴素贝叶斯假设数据特征之间相互独立,虽然该假设在一般情况下并不严格成立,但使用朴素贝叶斯进行分类,仍然可以取得很好的效果;

3.贝叶斯网络的优点:在数据较少的情况下仍然有效,可以处理多类别问题;

4.贝叶斯网络的缺点:对输入数据的准备方式较为敏感。

5.拉普拉斯平滑对于改善朴素贝叶斯分类器的分类效果有着积极的作用。


代码地址


代码地址点这里

目录
相关文章
|
3天前
|
人工智能 JSON 安全
|
3天前
|
云安全 人工智能 安全
|
3天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max-Preview深度全解析:2.4万亿参数旗舰MoE模型+Token Plan限时优惠完整落地指南
2026年7月,全新旗舰级混合专家大模型Qwen3.8-Max-Preview正式开放抢先体验,作为通义千问Qwen3系列规格最高、综合推理能力顶尖的新一代模型,该模型总参数量达到2.4万亿(2.4T),是当前线上可调用的原生多模态旗舰模型,综合推理水准对标海外顶级Fable 5模型,在复杂工程开发、长文档深度分析、多步骤智能体自治、跨境多语言创作、海量数据挖掘五大高难度业务场景实现跨越式性能提升。
723 0
|
3天前
|
人工智能 自然语言处理 数据挖掘
最新版通义千问(Qwen3.8-Max-Preview)功能介绍
2026年,通义千问正式推出全新旗舰级大模型 **Qwen3.8-Max-Preview 预览版**,作为首款突破万亿参数规格的新一代基座模型,该模型总参数量达到**2.4万亿**,采用全新迭代的MoE混合专家架构,综合推理性能、长文本处理、多模态理解、复杂任务规划能力全面超越前代Qwen3.7-Max版本,整体实力跻身全球第一梯队,可对标海外顶级旗舰模型,是当前面向复杂工程开发、多智能体协同、超长文档解析、专业办公自动化场景的最优国产基座模型。
742 0
|
5天前
|
人工智能
Qwen3.8抢先体验!正式版即将发布并开源!
千问Qwen3.8即将开源,参数达2.4T,进化速度以“天”计,实力媲美Fable 5。预览版Qwen3.8-Max已上线阿里Token Plan等平台,限时优惠:日间Credits低至1折,夜间更优,个人/团队版月付仅35元起!
674 27
|
4天前
|
人工智能 测试技术 语音技术
Qwen-Audio-3.0-TTS 正式发布!AI 语音从 “能说话” 升级到 “会带情绪表达”
阿里云发布Qwen-Audio-3.0-TTS语音合成大模型,支持细粒度标签控制(如[gasp][angry])、freestyle自由风格、16种语言及20种方言,声学鲁棒性强。含Flash(首包延时300ms)和Plus(全球榜单冠军)双版本,已在百炼平台开放调用。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
600 1
|
5天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max 预览版全解析:2.4 万亿参数旗舰模型,Token Plan 限时优惠指南
Qwen3.8-Max-Preview是通义千问Qwen3系列旗舰MoE大模型,参数达2.4万亿,综合推理能力居行业第一梯队。支持思考/快速双模式,擅长大模型五大高难场景。现于阿里云百炼Token Plan、Qoder及QoderWork上线体验,个人版低至39元/月。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
536 1
Qwen3.8-Max 预览版全解析:2.4 万亿参数旗舰模型,Token Plan 限时优惠指南
|
11天前
|
缓存 UED 开发者
Codex109天重置23次,明天还要再送一次
Codex近109天完成23次额度重置,7月14日将迎来第24次。Tibo高频响应用户反馈:优化GPT-5.6高消耗问题、补发失效福利、调整重置时间——形成“反馈→回应→修复→补偿”正向闭环,彰显以用户为中心的产品哲学。(239字)
953 12

热门文章

最新文章