达摩院 KAN-TTS|学习笔记

简介: 快速学习达摩院 KAN-TTS

开发者学堂课程【达摩院智能语音交互 - 语音合成技术达摩院KAN-TTS】学习笔记,与课程紧密联系,让用户快速学习知识。

课程地址https://developer.aliyun.com/learning/course/46/detail/981


达摩院KAN-TTS


KAN-TTS

Knowledge-aware Neural TTS 系统中,结合传统语音合成技术与端到端语音合成技术。输入的文本经过与传统语音合成系统类似的模块,得到相应的语言学信息。

image.png

这些语言学信息再输入端到端模型进行建模,没有采用所有的语言学信息,因为经过细致的分析和实验,仅采用这些原学信息可以获得比采用所有语言学特征更好的效果。

为了进一步提高合成效果以及稳定性,还利用了上百个人的几百小时数据,构建了基于海量数据的多翻译成语音合成系统,并在多翻译能模型的基础上,尝试了针对特定发音人,特定风格数据的迁移学习。

实验结果表明,采用迁移学习后,合成效果得到了进一步提升,逼近了真实录音的效果。

之前介绍过端到端系统中存在效果不稳定的问题,最主要的是丢字漏字问题,以及多音字的发音错误问题,因为端到端系统直接输入文本,音库对于文本以及多音字的覆盖率是比较有限的。

在系统中,结合了传统的语音合成系统,其中利用了海量文本,相关数据训练的高稳定性的文本分析模块。在合成语音的稳定性上,可以得到传统语音合成系统相当的一个效果。

KAN-TTS优势

(1)优势一:高表现力

Knowledge-aware Neural TTS 系统相对于传统的 TTS 系统具有两大优势,一个是高表现力。

MOS是云合成领域主观测试打分标准,满分为五分,为了便于衡量合成语音与录音的差距,将录音的MOS作为基准,将各系统的MOS除以录音的MOS,分子越接近于百分百,说明合成的效果越好,录音的得分,始终为百分百。

image.png

从图上可以看到,传统的拼接合成系统和传统的参数系统分别可以获得85%-90%的接近录音程度,采用了 Knowledge-aware Neural TTS 系统,新歌 speaker 数据也可获得95%以上的接近录音的程度,采用了多发音能以及迁移学习技术之后,可以获得97%以上的相似度。可以听一下案例,例举了三个例子

传统的拼接合成系统的合成效果。

传统的参数合成的效果。

现在的合成效果。

(2)超低成本

第二个优势,是超低成本,现在这种定制方案相对于传统的定制方案,在需要的用户规模、需要的录音时间以及以及录音的成本上,相对于传统方案都有明显的一个优势

相关文章
|
10月前
|
人工智能 物联网
AI 绘画Stable Diffusion 研究(十七)SD lora 详解(上)
AI 绘画Stable Diffusion 研究(十七)SD lora 详解(上)
1255 0
|
11月前
|
人工智能 自然语言处理 异构计算
Stability AI发布基于稳定扩散的音频生成模型Stable Audio
近日Stability AI推出了一款名为Stable Audio的尖端生成模型,该模型可以根据用户提供的文本提示来创建音乐。
141 1
|
5天前
|
人工智能 数据处理 语音技术
通义语音AI技术问题之查看KAN-TTS在ModelScope上的模型列表如何解决
通义语音AI技术问题之查看KAN-TTS在ModelScope上的模型列表如何解决
22 10
|
3月前
|
机器学习/深度学习 人工智能 自然语言处理
Pika推出AI配音工具Sound Effects
【2月更文挑战第24天】Pika推出AI配音工具Sound Effects
88 1
Pika推出AI配音工具Sound Effects
|
8天前
|
人工智能 JSON 语音技术
Qwen2-Audio开源,让VoiceChat更流畅!
在一个通用的AI系统中,核心模型应该能够理解不同模态的信息。当前的大语言模型现在已经能够理解语言并进行推理,并且已经扩展到了更多的模态,包括视觉和音频。
|
3月前
|
人工智能 测试技术
AI视频理解模型MiniGPT4-Video发布
【4月更文挑战第13天】KAUST和哈佛大学联合研发的MiniGPT4-Video模型在AI视频理解上取得突破,能处理视觉信息和文本对话,提升视频内容分析能力。该模型在多个基准测试中超过现有最佳方法,尤其在有字幕的情况下表现优异。然而,受限于大型语言模型的上下文窗口,目前仅能处理有限帧数的视频,未来研究将致力于扩展处理长视频的能力。
143 5
AI视频理解模型MiniGPT4-Video发布
|
3月前
|
数据采集 人工智能 PyTorch
极智AI | 昇腾CANN ATC模型转换
大家好,我是极智视界,本文介绍一下 昇腾 CANN ATC 模型转换。
283 0
|
3月前
|
人工智能 缓存 自然语言处理
TTS它又来了!OpenVoice:一款借鉴于TTS实现的强大的AI语音克隆工具!
TTS它又来了!OpenVoice:一款借鉴于TTS实现的强大的AI语音克隆工具!
710 1
|
12月前
|
达摩院 并行计算 TensorFlow
|
机器学习/深度学习 人工智能 自然语言处理
Tacotron2、GST、Glow-TTS、Flow-TTS…你都掌握了吗?一文总结语音合成必备经典模型(四)
Tacotron2、GST、Glow-TTS、Flow-TTS…你都掌握了吗?一文总结语音合成必备经典模型
1023 0