语音识别技术|学习笔记

简介: 快速学习语音识别技术

开发者学堂课程【达摩院智能语音交互 - 语音识别技术:语音识别技术】学习笔记,与课程紧密联系,让用户快速学习知识。

课程地址https://developer.aliyun.com/learning/course/45/detail/976


语音识别技术


内容介绍:

一、语音识别技术

二、传统语音识别系统框图

三、传统框架:基于 GMM-HMM 的声学模型

四、语音识别声学模型研究进展


一、语音识别技术

语音识别实际上是实现智能语音交互的核心技术之一,它的目的是要将人的语音转化成机器可以理解的文字称之为 ASR。

image.png

从数学公式上面说,过程中实际上需要将接收到的语音文件以波形文件转换得到最终需要的文字系列,是一个最大后验判断和最大后验优化问题,相对应的通过条件概率可以转化成两项,分别称之为声学模型以及语言模型,构建整个语音识别系统平台,就是在优化声学模型与语言模型。


二、传统语音识别系统框图

image.png

传统的语音识别系统,就要包括三个模块或每次前端处理模型训练以及后端处理简单处理。

前端处理主要是对接收到语音信号进行一些锻炼检测以及进行一些降噪处理,然后提醒语音顺序特征,训练过程中主要是利用语料库里面的语音提及到了声学特征,利用一些训练准则去训练声学模型以及语言模型,后处理过程中主要是利用训练完成的模型以及也模型对新进来的语音信号,可以联合声学模型和语音模型进行结合得到识别结果。当然可以通过识别结果进行一定的模型去适应,进一步提升整个识别识别结果。


三、传统框架:基于 GMM-HMM 的声学模型

image.png

在传统的语音识别声学建模里面很主流的框架就是 GMM,在过程中,GMM 是对语音信号的统计特性进行建模,HMM 主要对语音的持续性进行建模。

image.png

语音声学建模一个比较大的突破是深度学习的引入,从传统的技艺 GMM-HMM 开始转换到了基于 DNN-HMM 项目的声学建模,过程中一个显著的改变就是利用 DNN 这种生产模型替代了传统的 GMM 来对语音的特性进行建模,可以获得显著的性能提升。


四、语音识别声学模型研究进展

模型结构

DNN,CNN,RNN,LSTM,TDNN,FSMN ....

优化方法

Cross Entropy

Sequence Discriminative Training: MMI,MPE, SMBR,LF-MMI.  

CTC

更深的模型结构

VDCNN, Highway/Residual-LSTM,DFSMN,TDNN-F

端到端语音识别

Raw waveform ASR.

Attention based ASR

关于语音识别声学模型的研究,从12年开始到目前可能过程中,有很多技术也出现语音识别声学模型获得很大的进展,相对应的有代表性的是可以分成上面的四个方面,后面也是模型结构,从最早前 DNN 然后到一些更加富有建模能力的模型,例如CNN、RNN、LSTM、TDNN、FSMN。另外还有优化的三个改变,从最早的 Cross Entropy,然后到一些近期的 Sequence Discriminative Training: MMI,MPE, SMBR,LF-MMI. 等等,然后比如说像 CTC 准则的应用,另外一个改变就是去进行一些更深的模型结构,被应用到建模里面,像 VDCNN, Highway/Residual-LSTM,DFSMN,TDNN-F,积极的一个研究点实际上是端到端语言能识别的语音声学建模,比如 Attention based ASR 语音识别系统等等。

相关实践学习
一键创建和部署高分电影推荐语音技能
本场景使用天猫精灵技能应用平台提供的技能模板,在2-5分钟内,创建一个好玩的高分电影推荐技能,使用模板后无须代码开发,系统自动配置意图、实体等,新手0基础也可体验创建技能的乐趣。
达摩院智能语音交互 - 声纹识别技术
声纹识别是基于每个发音人的发音器官构造不同,识别当前发音人的身份。按照任务具体分为两种: 声纹辨认:从说话人集合中判别出测试语音所属的说话人,为多选一的问题 声纹确认:判断测试语音是否由目标说话人所说,是二选一的问题(是或者不是) 按照应用具体分为两种: 文本相关:要求使用者重复指定的话语,通常包含与训练信息相同的文本(精度较高,适合当前应用模式) 文本无关:对使用者发音内容和语言没有要求,受信道环境影响比较大,精度不高 本课程主要介绍声纹识别的原型技术、系统架构及应用案例等。 讲师介绍: 郑斯奇,达摩院算法专家,毕业于美国哈佛大学,研究方向包括声纹识别、性别、年龄、语种识别等。致力于推动端侧声纹与个性化技术的研究和大规模应用。
相关文章
|
1月前
|
机器学习/深度学习 自然语言处理 算法
基于深度学习的语音识别技术应用与发展
在当今数字化时代,语音识别技术已经成为人机交互领域的重要组成部分。本文将介绍基于深度学习的语音识别技术在智能助手、智能家居和医疗健康等领域的应用与发展,同时探讨该技术在未来的潜在应用和发展方向。
51 4
|
4天前
|
自然语言处理 搜索推荐 数据挖掘
*语音识别技术将深刻影响未来的教育模式
【6月更文挑战第24天】*语音识别技术将深刻影响未来的教育模式
24 10
|
12天前
|
机器学习/深度学习 人工智能 搜索推荐
语音识别技术的现状与未来展望
【6月更文挑战第15天】**语音识别技术现状与未来:** 随AI发展,语音识别精度与速度大幅提升,应用广泛,从手机助手到智能家居。深度学习驱动技术进步,跨语言及多模态交互成为新趋势。未来,精度、鲁棒性将增强,深度学习将进一步融合,个性化和情感化交互将提升用户体验。跨领域融合与生态共建将推动技术普及,为各行业带来更多智能解决方案。但同时也需关注技术伦理和社会影响。
|
30天前
|
机器学习/深度学习 人工智能 算法
构建一个基于AI的语音识别系统:技术深度解析与实战指南
【5月更文挑战第28天】本文深入探讨了构建基于AI的语音识别系统,涵盖基本原理、关键技术及实战指南。关键步骤包括语音信号预处理、特征提取、声学模型、语言模型和解码器。深度学习在声学和语言模型中发挥关键作用,如RNN、LSTM和Transformer。实战部分涉及数据收集、预处理、模型训练、解码器实现及系统评估。通过本文,读者可了解构建语音识别系统的基本流程和技巧。
|
10天前
|
机器学习/深度学习 搜索推荐 安全
语音识别技术是一种将语音信号转换为文本或命令的技术,
语音识别技术是一种将语音信号转换为文本或命令的技术,
|
1月前
|
机器学习/深度学习 自然语言处理 语音技术
语音识别技术的原理与应用
语音识别技术的原理与应用
|
1月前
|
机器学习/深度学习 自然语言处理 人机交互
语音识别技术的发展与未来趋势:深度学习、端到端建模与多模态融合
语音识别技术的发展与未来趋势:深度学习、端到端建模与多模态融合
314 0
语音识别技术的发展与未来趋势:深度学习、端到端建模与多模态融合
|
6月前
|
机器学习/深度学习 人工智能 自然语言处理
听懂未来:AI语音识别技术的进步与实战
听懂未来:AI语音识别技术的进步与实战
382 0
|
语音技术 信息无障碍
直播源码搭建平台技术知识:实时语音识别字幕呈现功能
回到我们的直播源码平台开发上来,对于直播源码平台来说实时语音识别字幕呈现功能也是重要的功能之一,好了,正式进入我们今天的主题内容:直播源码搭建平台技术知识:实时语音识别字幕呈现功能!
直播源码搭建平台技术知识:实时语音识别字幕呈现功能
|
11月前
|
人工智能 编解码 API
C# 10分钟完成百度语音技术(语音识别与合成)——入门篇
C# 10分钟完成百度语音技术(语音识别与合成)——入门篇

热门文章

最新文章