浅析命名实体识别(NER)的三种序列标注方法

简介: 简述序列标注序列标注(Sequence Tagging)是NLP中最基础的任务,应用十分广泛,如分词、词性标注(POS tagging)、命名实体识别(Named Entity Recognition,NER)、关键词抽取、语义角色标注(Semantic Role Labeling)、槽位抽取(Slot Filling)等实质上都属于序列标注的范畴。

简述序列标注


序列标注(Sequence Tagging)是NLP中最基础的任务,应用十分广泛,如分词、词性标注(POS tagging)、命名实体识别(Named Entity Recognition,NER)、关键词抽取、语义角色标注(Semantic Role Labeling)、槽位抽取(Slot Filling)等实质上都属于序列标注的范畴。


简述命名实体识别


命名实体识别(Named Entity Recognition,简称NER),又称作“专名识别”,是指识别文本中具有特定意义的实体,主要包括人名、地名、机构名、专有名词等。


命名实体识别的作用


命名实体识别是信息提取、问答系统、句法分析、机器翻译、面向Semantic Web的元数据标注等应用领域的重要基础工具,在自然语言处理技术走向实用化的过程中占有重要地位。一般来说,命名实体识别的任务就是识别出待处理文本中三大类(实体类、时间类和数字类)、七小类(人名、机构名、地名、时间、日期、货币和百分比)命名实体。


命名实体识别的过程组成


命名实体识别通常包括两部分:

  1. 实体边界识别;
  2. 确定实体类别(人名、地名、机构名或其他)。


简述标签类型


进行命名实体识别时,通常需要对每个字进行标注,中文为单个字,英文为单词,空格分割。标注的标签类型如下表所示:

类型 说明
B Begin,代表实体片段的开始
I Internediate,代表实体片段的中间
M Middle,代表实体片段的中间
E End,代表实体片段的结束
S Single,代表实体片段为单个字
O Other,代表字符不为任何实体

简述序列标注的三种方法


实体识别三种常见的序列标注方法如下:

  1. BIO:标识实体的开始,中间部分和非实体部分
  2. BMES:增加S单个实体情况的标注
  3. BIOSE:增加E实体的结束标识


BIO-三位序列标注法(B-begin,I-inside,O-outside)

  • B-X代表实体X的开头
  • I-X代表实体X的中间或结尾
  • O代表不属于任何类型的

样例:

我 O
 是 O
 李 B-PER
 果 I-PER
 冻 I-PER
 , O
 我 O
 爱 O
 中 B-ORG
 国 I-ORG
 , O
 我 O
 来 O
 自 O
 四 B-LOC
 川 I-LOC
 。 O
复制代码


BMES-四位序列标注法(B-begin,M-middle,E-end,S-single)

  • B表示一个词的词首位值
  • M表示一个词的中间位置
  • E表示一个词的末尾位置
  • S表示一个单独的字词

样例:

我 S
 是 S
 四 B
 川 M
 人 E
复制代码


BIOES-四位序列标注法(B-begin,I-inside,O-outside,E-end,S-single)

  • B表示开始
  • I表示内部
  • O表示非实体
  • E表示实体尾部
  • S表示改词本身就是一个实体

样例:

我 O
 是 O
 李 B-PER
 果 I-PER
 冻 E-PER
 , O
 我 O
 爱 O
 中 B-LOC
 国 E-LOC
 , O
 我 O
 来 O
 自 O
 四 B-LOC
 川 E-LOC
 。 O
复制代码


总结


基本简单讲述了实体识别三种标注方法,从上面我们可以看出序列标注的各种标注方法大同小异。


相关文章
|
存储 Windows
怎样格式化硬盘?四种硬盘格式化方法(含详细图文步骤)
这篇内容介绍了硬盘格式化的方法,包括为何要格式化硬盘(如快速清空数据、建立新分区、修复错误、改变文件系统类型)和四种格式化方式:1) 使用文件管理器,2) 通过磁盘管理器,3) 利用分区工具DiskGenius,4) 使用diskpart命令。在执行格式化前,务必备份重要数据,因为格式化会导致数据丢失。
|
机器学习/深度学习 监控 数据可视化
训练损失图(Training Loss Plot)
训练损失图(Training Loss Plot)是一种在机器学习和深度学习过程中用来监控模型训练进度的可视化工具。损失函数是衡量模型预测结果与实际结果之间差距的指标,训练损失图展示了模型在训练过程中,损失值随着训练迭代次数的变化情况。通过观察损失值的变化,我们可以评估模型的拟合效果,调整超参数,以及确定合适的训练停止条件。
3158 5
|
4月前
|
人工智能 运维 安全
|
9月前
|
人工智能 自然语言处理 数据可视化
用Dify工作流打造你的AI测试智能体,效率提升500%
Dify助力测试智能化升级,通过可视化AI工作流实现测试用例自动生成,提升效率500%。告别手工编写,覆盖边界场景,降低维护成本,推动测试从“手工作坊”迈向自动化、智能化新时代,全面提升质量与交付速度。
|
监控 安全 Linux
/proc/cpuinfo 中的各个字段,都代表什么意思
`/proc/cpuinfo` 在 Linux 中显示 CPU 指令集信息,包括浮点运算、V86模式、调试、大页支持、时间戳计数器等。列表详细解释了各种 FLAG,如 FPU、VME、PSE、TSC 等,涉及处理器硬件功能和指令集。还包括多媒体扩展(MMX、SSE、SSE2)、超线程(HT)、虚拟化技术(VMX)、加密指令(AES)、高级向量扩展(AVX)等特性。
|
安全 网络安全 数据安全/隐私保护
GoIP
GoIP “【5月更文挑战第15天】”
1462 2
|
机器学习/深度学习 人工智能 自然语言处理
多模态AI核心技术:CLIP与SigLIP技术原理与应用进展
近年来,多模态表示学习在人工智能领域取得显著进展,CLIP和SigLIP成为里程碑式模型。CLIP由OpenAI提出,通过对比学习对齐图像与文本嵌入空间,具备强大零样本学习能力;SigLIP由Google开发,采用sigmoid损失函数优化训练效率与可扩展性。两者推动了多模态大型语言模型(MLLMs)的发展,如LLaVA、BLIP-2和Flamingo等,实现了视觉问答、图像描述生成等复杂任务。这些模型不仅拓展了理论边界,还为医疗、教育等领域释放技术潜力,标志着多模态智能系统的重要进步。
2903 13
多模态AI核心技术:CLIP与SigLIP技术原理与应用进展
|
Python
Python实现因子分析(附案例实战)
Python实现因子分析(附案例实战)
3377 0
Python实现因子分析(附案例实战)