达观杯文本智能处理挑战赛 练手代码实现

简介: 1 import pandas as pd 2 3 import imp 4 5 from sklearn.linear_model import LogisticRegression 6 7 from sklearn.
 1 import pandas as pd
 2 
 3 import imp
 4 
 5 from sklearn.linear_model import LogisticRegression
 6 
 7 from sklearn.feature_extraction.text import CountVectorizer
 8 
 9 
10 
11 
12 df_test = pd.read_csv(r'testset.csv')
13 
14 df_train = pd.read_csv(r'trainset.csv')
15 
16 df_train.drop(columns=['article','id'],inplace=True)
17 
18 df_test.drop(columns=['article'],inplace=True)
19 
20 
21 
22 vectorizer = CountVectorizer(ngram_range=(1, 2),min_df=3,max_df=0.9,max_features=10000)
23 
24 vectorizer.fit(df_train['word_seg'])
25 
26 x_train =vectorizer.transform(df_train['word_seg'])
27 
28 x_test =vectorizer.transform(df_test['word_seg'])
29 
30 y_train =df_train['class']-1
31 
32 
33 
34 lg = LogisticRegression(C=4,dual=True)
35 
36 lg.fit(x_train,y_train)
37 
38 
39 
40 y_test = lg.predict(x_test)
41 
42 
43 
44 df_test['class'] = y_test.tolist()
45 
46 df_test['class'] = df_test['class'] + 1
47 
48 df_result =df_test.loc[:,['id','class']]
49 
50 df_result.to_csv('./result.csv',index=False)
51 
52 
53 
54 print("完成")

运行结果是:

 

pandas.errors.ParserError: Error tokenizing data. C error: out of memory

 

这是因为我的电脑内存太小,导致了内存溢出,因此换一台电脑就可以得到最终得分为72分的答案了。笔者最终排名位于全国前300名,算是一个个人感觉还不错的成绩了。

 

目录
相关文章
|
机器学习/深度学习 算法 数据挖掘
阿里音乐流行趋势预测—冠军答辩(一)|学习笔记
快速学习阿里音乐流行趋势预测—冠军答辩(一)
780 0
|
数据采集 机器学习/深度学习 算法
阿里音乐流行趋势预测—冠军答辩(二)|学习笔记
快速学习阿里音乐流行趋势预测—冠军答辩(二)
445 0
|
2月前
|
传感器 机器学习/深度学习 数据采集
2022年第十一届认证杯数学中国数学建模国际赛小美赛:C 题 对人类活动进行分类 建模方案及代码实现
本文提供了2022年第十一届认证杯数学中国数学建模国际赛小美赛C题"对人类活动进行分类"的建模方案和Python代码实现,包括数据预处理、特征提取、LSTM网络模型构建和训练评估过程。
56 11
2022年第十一届认证杯数学中国数学建模国际赛小美赛:C 题 对人类活动进行分类 建模方案及代码实现
|
3月前
|
人工智能 Serverless 开发者
|
2月前
|
机器学习/深度学习 算法 机器人
【2023年第十三届APMCM亚太地区大学生数学建模竞赛】A题 水果采摘机器人的图像识别 Python代码解析
本文介绍了2023年第十三届APMCM亚太地区大学生数学建模竞赛A题的Python代码实现,详细阐述了水果采摘机器人图像识别问题的分析与解决策略,包括图像特征提取、数学模型建立、目标检测算法使用,以及苹果数量统计、位置估计、成熟度评估和质量估计等任务的编程实践。
67 0
【2023年第十三届APMCM亚太地区大学生数学建模竞赛】A题 水果采摘机器人的图像识别 Python代码解析
|
机器学习/深度学习 人工智能 编解码
课时1;跨越N次元 一键变身AI漫画人
课时1;跨越N次元 一键变身AI漫画人
178 0
|
数据采集 SQL 算法
阿里音乐流行趋势预测—亚军答辩(一)|学习笔记
快速学习阿里音乐流行趋势预测—亚军答辩(一)
416 0
|
人工智能 算法 机器人
AI技术让手办「整活」:3D建模居然可以这样简单
AI技术让手办「整活」:3D建模居然可以这样简单
222 0
AI技术让手办「整活」:3D建模居然可以这样简单
|
机器学习/深度学习 人工智能 前端开发
祝福视频生成器(一图一文AI生成)
祝福视频生成器(一图一文AI生成)
1217 0
祝福视频生成器(一图一文AI生成)
|
算法 大数据 开发者
阿里音乐流行趋势预测—亚军答辩(二)|学习笔记
快速学习阿里音乐流行趋势预测—亚军答辩(二)
248 0