达摩院最新AI技术助力天猫双11，提供接近真人的语音交互体验-阿里云开发者社区

达摩院最新AI技术助力天猫双11，提供接近真人的语音交互体验

2019-11-13 837

版权

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介： 11月8日，记者了解到，阿里巴巴达摩院机器智能实验室最新研究成果——KAN-TTS将首次大规模应用于今年天猫双11，基于该技术，菜鸟热线机器人、语音机器人小蜜以及天猫精灵将为全球消费者提供接近真人的语音交互体验。

11月8日，记者了解到，阿里巴巴达摩院机器智能实验室最新研究成果——KAN-TTS将首次大规模应用于今年天猫双11，基于该技术，菜鸟热线机器人、语音机器人小蜜以及天猫精灵将为全球消费者提供接近真人的语音交互体验。

让机器开口说话是人工智能的基础技术之一，最早可追溯到1960年TTS（Text To Speech）技术的诞生，但要让机器发出生动逼真的声音一直都是业界的难题，据了解，传统语音合成技术需要海量文本和音频信息，合成的语音与原始音频的接近程度仅为85%到90%之间。

今年7月，达摩院发布新一代语音合成技术KAN-TTS，首次将该数字提高到97%以上。这被认为是入选MIT Technology Review 2019年“全球十大突破性技术”后，阿里巴巴语音技术实力的又一次跨越式提升。

基于迁移学习以及多种新型算法模型，KAN-TTS可根据特定发音人的风格快速生成高度相似的语音，并且大幅降低语音合成的门槛，手机录音十分钟，机器即可通过算法完成声音的模仿。

过去数月，KAN-TTS技术已实现了主流场景风格声音的全覆盖，可针对通用场景、客服场景、童声场景、英文场景和方言场景，提供 41种高品质的声音，例如温柔、甜蜜、严厉等风格。据达摩院专家透露，团队还计划用该技术来帮助视障和语言障碍人士实现无障碍沟通。

达摩院成立两年以来，阿里巴巴在视觉、语音以及自然语言处理等领域已创下了多项世界纪录，并且跃升为中国最大的人工智能公司。今年的杭州云栖大会上，阿里巴巴表示，阿里AI每天调用超1万亿次，服务全球10亿人，日处理图像10亿张、视频120万小时、语音55万小时及自然语言5千亿句。

相关实践学习

达摩院智能语音交互 - 声纹识别技术

声纹识别是基于每个发音人的发音器官构造不同，识别当前发音人的身份。按照任务具体分为两种：声纹辨认：从说话人集合中判别出测试语音所属的说话人，为多选一的问题声纹确认：判断测试语音是否由目标说话人所说，是二选一的问题（是或者不是）按照应用具体分为两种：文本相关：要求使用者重复指定的话语，通常包含与训练信息相同的文本（精度较高，适合当前应用模式）文本无关：对使用者发音内容和语言没有要求，受信道环境影响比较大，精度不高本课程主要介绍声纹识别的原型技术、系统架构及应用案例等。讲师介绍：郑斯奇，达摩院算法专家，毕业于美国哈佛大学，研究方向包括声纹识别、性别、年龄、语种识别等。致力于推动端侧声纹与个性化技术的研究和大规模应用。

达摩院最新AI技术助力天猫双11，提供接近真人的语音交互体验

开发者社区官方技术圈

热门文章

最新文章

相关课程

相关电子书

相关实验场景

探索云世界

热门

云计算

大数据

云原生

人工智能

数据库

开发与运维

活动广场

任务中心

训练营

直播

乘风者计划

下载

镜像站

技术资料

达摩院最新AI技术助力天猫双11，提供接近真人的语音交互体验

开发者社区官方技术圈

热门文章

最新文章

相关课程

相关电子书

相关实验场景