语料准备

简介: 之前查找了很多资料,发现语料准备这块的方法论很有限,在我看来如果说AI是个学生,语料其实是教科书,是知识的海洋,是AI的粮食,非常重要。本文主要探讨有充分的语料基础后对语料进行预处理的办法。

之前查找了很多资料,发现语料准备这块的方法论很有限,在我看来如果说AI是个学生,语料其实是教科书,是知识的海洋,是AI的粮食,非常重要。
本文主要探讨有充分的语料基础后对语料进行预处理的办法。
1,众包打标签
2,手工规则提取
关键词特征,使用数据库进行批量标记。
实体识别后特征选取,使用分词工具根据词性来标记。
词频统计,对高频特殊词单独标记。
### Dialogflow 边标记边训练,不断校正测试效果。
Explosion.ai 的 Prodigy , 快速手工标记,后台学习,提供预判,个人觉得并不好用。
3, 专家手工打标签
推荐Excel,可以与数据库互传数据,可以指定标签词汇范围,进行快速输入。
我总觉得语料工具应该有更大的发展空间,需要做的更好!

目录
相关文章
|
1月前
|
机器学习/深度学习 自然语言处理 算法
机器翻译中的分词
机器翻译中的分词
38 2
|
1月前
|
机器学习/深度学习 自然语言处理
机器翻译中的词性标注
机器翻译中的词性标注
23 2
|
7月前
lda模型和bert模型的文本主题情感分类实战
lda模型和bert模型的文本主题情感分类实战
151 0
|
15天前
|
机器学习/深度学习 自然语言处理 数据可视化
BERT-IMDB电影评论情感分类实战:SwanLab可视化训练
这篇文章介绍了使用BERT模型进行IMDB电影评论情感分类的实战教程,涉及SwanLab、transformers和datasets库。作者提供了一键安装库的命令,并详细解释了每个库的作用。文章展示了如何加载BERT模型和IMDB数据集,以及如何利用SwanLab进行可视化训练。训练过程在SwanLab平台上进行,包括模型微调、指标记录和结果可视化。此外,还提供了完整代码、模型与数据集的下载链接,以及相关工具的GitHub仓库地址。
BERT-IMDB电影评论情感分类实战:SwanLab可视化训练
|
1月前
|
自然语言处理 Python
使用Python实现文本分类与情感分析模型
使用Python实现文本分类与情感分析模型
62 1
|
1月前
|
存储 机器学习/深度学习 算法
用Rapidminer做文本挖掘的应用:情感分析
用Rapidminer做文本挖掘的应用:情感分析
Bert可以提取关键词了:KeyBERT的介绍与使用
Bert可以提取关键词了:KeyBERT的介绍与使用
1656 1
Bert可以提取关键词了:KeyBERT的介绍与使用
|
11月前
|
自然语言处理 搜索推荐
|
机器学习/深度学习 人工智能 自然语言处理
深度学习应用篇-自然语言处理[10]:N-Gram、SimCSE介绍,更多技术:数据增强、智能标注、多分类算法、文本信息抽取、多模态信息抽取、模型压缩算法等
深度学习应用篇-自然语言处理[10]:N-Gram、SimCSE介绍,更多技术:数据增强、智能标注、多分类算法、文本信息抽取、多模态信息抽取、模型压缩算法等