NLP随笔(四)

简介: nlp技术包括基础技术和应用技术70 年代以后随着互联网的高速发展,语料库越来越丰富以及硬件更新完善,自然语言处理思潮由理性主义向经验主义过渡,基于统计的方法逐渐代替了基于规则的方法。

nlp技术包括基础技术和应用技术

70 年代以后随着互联网的高速发展,语料库越来越丰富以及硬件更新完善,自然语言处理思潮由理性主义向经验主义过渡,基于统计的方法逐渐代替了基于规则的方法。

从 2008 年到现在,由于深度学习在图像识别、语音识别等领域不断取得突破,人们也逐渐开始引入深度学习来做自然语言处理研究,由最初的词向量到 2013 年 word2vec,将深度学习与自然语言处理的结合推向了高潮,并且在机器翻译、问答系统、阅读理解等领域取得了一定成功。再到最近的emlo、bert等,也许正在揭开下一个篇章。

可以说,自然语言处理就是要计算机理解自然语言,自然语言处理机制涉及两个流程,包括自然语言理解和自然语言生成。自然语言理解是指计算机能够理解自然语言文本的意义,自然语言生成则是指能以自然语言文本来表达给定的意图

自然语言的理解和分析是一个层次化的过程,许多语言学家把这一过程分为五个层次,可以更好地体现语言本身的构成,五个层次分别是语音分析、词法分析、句法分析、语义分析和语用分析。

语音分析是要根据音位规则,从语音流中区分出一个个独立的音素,再根据音位形态规则找出音节及其对应的词素或词。

词法分析是找出词汇的各个词素,从中获得语言学的信息。

句法分析是对句子和短语的结构进行分析,目的是要找出词、短语等的相互关系以及各自在句中的作用。

语义分析是指运用各种机器学习方法,学习与理解一段文本所表示的语义内容。 语义分析是一个非常广的概念。

语用分析是研究语言所存在的外界环境对语言使用者所产生的影响

词法分析(lexical analysis)

词法分析包括汉语分词(word segmentation 或 tokenization)和词性标注(part-of-speech tag)等。

汉语分词:处理汉语(英文自带分词)首要工作就是要将输入的字串切分为单独的词语,这一步骤称为分词。

词性标注:词性标注的目的是为每一个词赋予一个类别,这个类别称为词性标记。比如,名词(noun)、动词(verb)等

另一方面是自然语言处理的应用技术,这些任务往往会依赖基础技术,包括文本聚类(Text Clustering)、文本分类(Text Classification)、文本摘要(Text abstract)、情感分析(sentiment analysis)、自动问答(Question Answering,QA)、机器翻译(machine translation, MT)、信息抽取(Information Extraction)、信息推荐(Information Recommendation)、信息检索(Information Retrieval,IR)等。

文本分类:文本分类任务是根据给定文档的内容或主题,自动分配预先定义的类别标签。包括单标签分类和多标签文本分类,。

文本聚类:任务则是根据文档之间的内容或主题相似度,将文档集合划分成若干个子集,每个子集内部的文档相似度较高,而子集之间的相似度较低。

文本摘要:文本摘要任务是指通过对原文本进行压缩、提炼,为用户提供简明扼要的文字描述。

情感分析:情感分析任务是指利用计算机实现对文本数据的观点、情感、态度、情绪等的分析挖掘。

自动问答:自动问答是指利用计算机自动回答用户所提出的问题以满足用户知识需求的任务。

机器翻译:机器翻译是指利用计算机实现从一种自然语言到另外一种自然语言的自动翻译。被翻译的语言称为源语言(source language), 翻译到的语言称作目标语言(target language)。

信息抽取:信息抽取是指从非结构化/半结构化文本(如网页、新闻、论文文献、微博等)中提取指定类型的信息(如实体、属性、关系、事件、商品记录等),并通过信息归并、冗余消除和冲突消解等手段将非结构化文本转换为结构化信息的一项综合技术。

信息推荐:信息推荐据用户的习惯、 偏好或兴趣, 从不断到来的大规模信息中识别满足用户兴趣的信息的过程。

信息检索:信息检索是指将信息按一定的方式加以组织,并通过信息查找满足用户的信息需求的过程和技术。

目录
相关文章
|
Web App开发 编解码 监控
防御性设计和开发
“防御性编程(Defensive programming)是防御式设计的一种具体体现,它是为了保证,对程序的不可预见的使用,不会造成程序功能上的损坏。它可以被看作是为了减少或消除墨菲定律效力的想法。”
1603 0
防御性设计和开发
|
2月前
|
人工智能 API 调度
万亿参数大模型平民化:Qwen3.8‑Max‑Preview 开发者上手全指南
随着AI产业向复杂工程开发、多智能体协同、超长文档深度解析方向演进,市场对于基座模型的综合推理、长文本理解、多模态处理与任务规划能力提出更高的要求。新一代旗舰基座Qwen3.8‑Max‑Preview预览版正式登场,作为突破万亿参数规格的大模型产品,总参数量达到2.4万亿,依托迭代升级的MoE混合专家架构,在推理性能、超长文本处理、多模态理解、复杂任务规划等维度实现全面升级,综合能力跻身全球第一梯队,对标海外顶级旗舰模型,为复杂工程开发、多智能体协同、超长文档解析、专业办公自动化场景提供优质国产基座选择。
318 2
|
29天前
|
人工智能 安全 调度
瞭望塔丨Agentic 时代,阿里云已全栈就绪
阿里云在 Agentic AI 时代的战略蓝图是构建从底层芯片到智能体原生云、全模态模型、 模型服务及上层应用的全栈服务架构。围绕 Agent 这一核心,阿里云对其产品、API、计费、 文档、官网进行了重新设计。阿里云将自身打造成为一台能够输出“智力”与“能力”的超级计算机,这不是一次简单的技术升级,而是一场从提供算力到交付生产力的范式变迁。
|
2月前
|
SQL 前端开发 Java
迈向生产级 AgenticOps:STAROps 如何构建可泛化的根因定位能力
AgenticOps 的关键不是 Agent 能调多少工具,而是根因判断是否准确。根因错了,影响评估、修复方案和变更执行都会围绕错误对象展开。STAROps 以 UModel、动态调查拓扑、RCA-Bench 和线上闭环四项能力,让 Agent 面对陌生故障仍能沿证据收敛到真实根因。
|
8月前
|
存储 安全 物联网
EPC/RFID超高频SGTIN-198编码解码
EPC/RFID超高频是物联网标识核心技术,以SGTIN-198为代表(198位二进制),支持GTIN-14与超大序列号(2¹²⁰),专用于医药追溯、高端制造、奢侈品防伪等高价值场景。兼容GS1标准,可双向转换条码,实现唯一身份编码、安全读写与全球溯源。
560 2
|
9月前
|
人工智能 监控 测试技术
AI Agent 职业路线:人机协作时代的技术人进阶体系与实践方法
本文提出AI Agent时代技术人的职业进阶框架:从“工具使用者”转向“智能体协作者/管理者”,构建范式转移、职业分层(执行层/协作者/集群管理者)、核心能力(需求拆解、批判校验、持续调优)与进阶路径(单点落地→多Agent编排→集群治理)四大维度,强调人机共生下的不可替代性。(239字)
548 1
|
7月前
|
人工智能 开发框架 机器人
OpenClaw到底是什么?一篇文章讲清楚AI智能体这个概念
OpenClaw是一款开源AI智能体工具,让大模型像人一样操作电脑:自动点击、输入、调用浏览器/邮件/命令行等工具,完成跨应用任务(如整理网页数据、生成报表、发邮件)。它代表“能动手”的AI执行者,区别于仅“动嘴”的聊天机器人。当前仍存速度、稳定性与安全挑战,但已初现未来人机协作新范式。
|
11月前
|
人工智能 自然语言处理 安全
2025年企业如何选择智能客服系统:企业级智能客服系统推荐
在数字化转型加速的今天,智能客服已成为企业提升服务效率与客户体验的核心工具。本文系统梳理主流智能客服解决方案,重点解析阿里云旗下瓴羊Quick Service如何依托通义大模型,实现全渠道、全链路、全场景的智能化服务升级,助力企业从“拥有”到“用好”,真正释放智能客服的增长潜力。
|
11月前
|
人工智能 监控 调度
哈希极化、拓扑盲点与拥塞抖动:主流端网协同方案如何缓解万卡集群通信瓶颈?
随着大模型参数规模迈向万亿级,万卡乃至十万卡 GPU 集群正成为 AI 训练基础设施的标配,而万卡集群三大通信瓶颈——哈希极化、拓扑盲点与拥塞抖动,对网络架构提出了前所未有的挑战。本文基于主流互联网大厂的公开实践,深入剖析超大规模集群中端网协同架构的设计思路,并探讨面向 MoE 与 DeepSeek 等新型模型的下一代 AI 网络演进方向。
哈希极化、拓扑盲点与拥塞抖动:主流端网协同方案如何缓解万卡集群通信瓶颈?
|
6月前
|
人工智能
(AI提示词技术分享)AI写小红书和公众号被限流?不是写得差,是"人味" 不够!4招教你写出有人味的内容
AI内容易被限流?主因非质量差,而是缺乏“人味”:段落节奏太均匀、表达过于客观、细节模糊。本文揭秘4招增人味——打破段落规律、注入主观判断、添加具体数据与感官细节、人工润色优化。平台反对的不是AI辅助,而是无人工痕迹的“机器文”。
957 4

热门文章

最新文章