达摩院公布语音AI新进展：移动端也能实现逼近真人的语音交互体验-阿里云开发者社区

达摩院公布语音AI新进展：移动端也能实现逼近真人的语音交互体验

2020-09-18 2282

版权

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介： 9月18日，在2020云栖大会上，达摩院公布了语音AI技术的最新突破：端上语音识别和语音合成能力首次达到媲美云端的水平，这意味着未来个人用户在移动终端即可轻松体验逼近真人的语音技术。据介绍，达摩院最新的语音技术已在淘宝直播、钉钉会议、高德导航等场景大规模应用，正全面对外开放。

9月18日，在2020云栖大会上，达摩院公布了语音AI技术的最新突破：端上语音识别和语音合成能力首次达到媲美云端的水平，这意味着未来个人用户在移动终端即可轻松体验逼近真人的语音技术。据介绍，达摩院最新的语音技术已在淘宝直播、钉钉会议、高德导航等场景大规模应用，正全面对外开放。

语音AI的核心是让机器听懂人话、并能开口说话，语音合成和语音识别技术是实现这些目标的基础。但由于过去几年业界在语音模型上未能有突破性创新，高精度的语音交互任务长期依赖云端算力，造成了语音指令处理不可避免的延时等问题。

此次达摩院率先在算法模型上实现创新，推出E2E-ASR端到端语音识别技术及全新的端上KAN-TTS语音合成技术，首次在移动终端上实现接近云端的语音识别与合成效果。

据介绍，在语音识别方面，达摩院提出SAN-M网络结构及基于SCAMA的流式端到端语音识别框架，提升计算效率的同时，还将高难度场景中的语音识别错误率降低近三成。达摩院研发的语音识别系统，可纯离线、低成本部署在手机端，原型系统不到40MB，识别效果媲美超过100GB的达摩院上一代DFSMN-CTC云端系统。

继去年发布仿真率可达97%的自研KAN-TTS语音合成模型后，达摩院此次在移动端实现了对语音模型的“大瘦身”，相比云端，端上模型大小压缩了101倍，计算量压缩35倍，通过终端算力即可快速复现逼近真人的语音。例如，高德地图近期发布了利用达摩院全新语音技术合成的李佳琦、林志玲、小团团等明星导航语音包，语音效果较之前更自然，断网状态下语音导航也不会中断。

达摩院语音实验室负责人鄢志杰表示，“在终端处理语音任务一直是学术界和工业界的难题，达摩院最新的语音技术有效释放了终端设备的能力，让终端也能轻松处理语音任务，我们相信，在终端算力和云端算力的协同支撑下，未来语音交互将无处不在。”

过去几年，阿里语音AI取得了一系列突破。2019年，阿里语音AI入选《麻省理工评论》“全球十大突破性技术”，是唯一上榜的中国科技公司;今年7月IDC发布的《中国AI云服务市场半年度研究报告》显示，阿里语音AI以44%的市场份额，在云上语音AI市场中位居第一。

原文链接：https://ai.51cto.com/art/202009/626207.htm
本文转载自51CTO，本文一切观点和机器智能技术圈子无关

机器智能技术结尾二维码.png

相关实践学习

达摩院智能语音交互 - 声纹识别技术

声纹识别是基于每个发音人的发音器官构造不同，识别当前发音人的身份。按照任务具体分为两种：声纹辨认：从说话人集合中判别出测试语音所属的说话人，为多选一的问题声纹确认：判断测试语音是否由目标说话人所说，是二选一的问题（是或者不是）按照应用具体分为两种：文本相关：要求使用者重复指定的话语，通常包含与训练信息相同的文本（精度较高，适合当前应用模式）文本无关：对使用者发音内容和语言没有要求，受信道环境影响比较大，精度不高本课程主要介绍声纹识别的原型技术、系统架构及应用案例等。讲师介绍：郑斯奇，达摩院算法专家，毕业于美国哈佛大学，研究方向包括声纹识别、性别、年龄、语种识别等。致力于推动端侧声纹与个性化技术的研究和大规模应用。

达摩院公布语音AI新进展：移动端也能实现逼近真人的语音交互体验

机器智能技术

热门文章

最新文章

相关课程

相关电子书

相关实验场景

探索云世界

热门

云计算

大数据

云原生

人工智能

数据库

开发与运维

活动广场

任务中心

训练营

直播

乘风者计划

下载

镜像站

技术资料

达摩院公布语音AI新进展：移动端也能实现逼近真人的语音交互体验

机器智能技术

热门文章

最新文章

相关课程

相关电子书

相关实验场景