用户和天猫精灵通过语音交互的一个典型流程分析-阿里云开发者社区

用户和天猫精灵通过语音交互的一个典型流程分析

2023-09-28 116

版权

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介： 用户和天猫精灵通过语音交互的一个典型流程分析

虽然从普通用户眼中，使用语音向天猫精灵发起指令，然后收到后者的语音回复，这个流程似乎很简单，但背后实际上有着人工智能中 ASR（语音识别）、NLP（自然语言处理）、TTS（语音合成）等自然语言处理技术的参与和整合。

我们先来看一个典型的用户通过语音同天猫精灵交互的流程图。

用户用语音唤醒天猫精灵，后者接收到用户语音，上传到智能应用平台。
平台使用 ASR（音频转文字）和 NLP（自然语言处理）技术，智能解析出用户发出语音包含的意图(通俗的说，即用户当前期望天猫精灵完成什么样的操作)。平台会自动将当前用户指令，匹配到开发人员创建的对应的技能和意图去。具体的匹配过程，就是将平台所有解析到的参数信息，通过 HTTPS 请求访问开发者提供的服务接口。
开发者负责实现的服务(托管在自己的应用服务器或者阿里云 Serverless 环境)，接收到平台发送的请求参数，执行业务逻辑(比如天气预报查询，智力题，语音游戏等)，并组装回复结果。
智能应用平台收到开发者服务执行完业务逻辑返回的响应数据后，使用 TTS（文字转音频）合成音频，并将音频推送回天猫精灵。
天猫精灵将收到的音频通过麦克风播报出来，本轮同用户的交互就完成了。

分析这个交互场景，不难发现，需要开发人员动手操作的流程包含以下两个方面：

在 AliGenie 技能应用平台上创建新的技能和意图，用于接收用户通过语音发送过来的请求。
应用开发人员自己选择在应用服务器还是 Serveless 运行环境里实现新的技能需要完成的业务逻辑编写。

相关实践学习

一键创建和部署高分电影推荐语音技能

本场景使用天猫精灵技能应用平台提供的技能模板，在2-5分钟内，创建一个好玩的高分电影推荐技能，使用模板后无须代码开发，系统自动配置意图、实体等，新手0基础也可体验创建技能的乐趣。

达摩院智能语音交互 - 声纹识别技术

声纹识别是基于每个发音人的发音器官构造不同，识别当前发音人的身份。按照任务具体分为两种：声纹辨认：从说话人集合中判别出测试语音所属的说话人，为多选一的问题声纹确认：判断测试语音是否由目标说话人所说，是二选一的问题（是或者不是）按照应用具体分为两种：文本相关：要求使用者重复指定的话语，通常包含与训练信息相同的文本（精度较高，适合当前应用模式）文本无关：对使用者发音内容和语言没有要求，受信道环境影响比较大，精度不高本课程主要介绍声纹识别的原型技术、系统架构及应用案例等。讲师介绍：郑斯奇，达摩院算法专家，毕业于美国哈佛大学，研究方向包括声纹识别、性别、年龄、语种识别等。致力于推动端侧声纹与个性化技术的研究和大规模应用。

用户和天猫精灵通过语音交互的一个典型流程分析

热门文章

最新文章

相关课程

相关电子书

相关实验场景