2024通义语音AI技术图景,大模型引领AI再进化(3)

简介: 2024通义语音AI技术图景,大模型引领AI再进化

本文来源:阿里云语音AI


2024通义语音AI技术图景,大模型引领AI再进化(2)https://developer.aliyun.com/article/1587429

FunCodec

FunASR 的主要功能集中在对语音的识别和理解方面,相当于给机器加上了耳朵,而 FunCodec 的主要目标则是语音的量化表示与生成,即给机器加上嘴巴的能力。


语音量化(Speech Codec)的目的是将语音信号编码为一个个离散的token,在语音通信和存储领域具有广泛的应用场景。近些年,得益于深度神经网络的快速发展,研究者们提出了基于神经编解码的语音量化模型。与基于专家知识的传统语音量化方法相比,基于神经网络的模型在更低的码率下获得了更高的语音质量。


与此同时,语音的量化编码也使大规模语言模型LLM具备了统一建模语音和文本的能力,例如VALL-E语音合成模型、VioLA、AudioPALM等语音-文本理解模型等。在此背景下,我们开源了 FunCodec 语音量化编码工具包。


  • 它提供了SoundStream、Encodec等SOTA模型的开源实现,以及我们在标准学术数据和内部大规模数据上的预训练模型,希望以此加速该领域的相关研究;


  • 考虑到语音在时频域上的结构性,我们进一步提出了时频域的量化模型,它能够在保证量化语音质量的基础上,只需更少的参数和计算量。我们发现频域模型对包括语音在内的音频信号具备更好的建模能力,未来我们将会在FunCodec发布统一音频量化模型,能够处理各种各样的音频信号,包括:语音、声学事件、音乐等;


  • 为了探究声学-语义解耦对语音量化带来的影响,我们提出了semantic augmented 的 residual vector quantizer 模块,在极低比特率下展现了较高的语音质量。


以上所有模型都已在ModelScope开源。与语音量化模型一同,我们还会在FunCodec中发布LauraGPT、VALL-E、SpearTTS等基于离散token的语音合成模型。

image.png

FunCodec 模型结构

论文预印版下载地址:https://arxiv.org/abs/2309.07405v2


FunCodec开源代码:https://github.com/alibaba-damo-academy/FunCodec


FunCodec开源模型:https://www.modelscope.cn/models?page=1&tasks=audio-codec&type=audio


3D-Speaker开源项目


3D-Speaker是通义实验室语音团队今年推出的说话人相关的开源项目。3D-Speaker的名称有两层含义,一是包含声学信息、语义信息、视觉信息3种模态的说话人识别技术,二是开源了一个多设备(multi-Device)、多距离(multi-Distance)和多方言(multi-Dialect)中文说话人语音数据集。


3D-Speaker开源项目包含说话人识别,说话人确认以及说话人分割任务的训练及推理代码,以及ModelScope上开源的相关预训练模型。


项目地址:https://github.com/alibaba-damo-academy/3D-Speaker

image.png

3D-Speaker数据集,包含超过1万名说话人,其中训练集10000人,测试集240人。我们数据在录制时每个说话人同时在多个设备上进行录音,多个设备距离声源不同位置,有些说话人还使用多种方言。我们的数据集包括8种设备、14种中文方言以及0.1m~4m等12种距离。

image.png

针对说话人验证任务,我们提供了三个标准测试trials:Trials Cross-Device、Trials Cross-Distance和Trials Cross-Dialect。针对方言语种识别(LID)任务,我们也提供了一个标准测试集以让结果容易比较。3D-Speaker数据使用CC BY-SA 4.0协议。

image.png

我们数据网站地址https://3dspeaker.github.io/,提供了数据下载链接以及发布的baseline等信息。我们在文章中汇报的相关模型(ERes2Net、CAM++等)以及数据的一些预处理代码也已开源,请参考我们的开源项目https://github.com/alibaba-damo-academy/3D-Speaker。如果您基于3D-Speaker数据做出了优秀的结果,也非常欢迎向我们的榜单上提交您的结果。


相关论文:https://arxiv.org/pdf/2306.15354.pdf

 

Autolabeling开源项目


Autolabel 是我们今年推出的音频自动化标注工具,该工具集成了语音实验室多种原子能力,如语音降噪(ANS)、语音识别(ASR)、语音端点检测(VAD)、时间戳预测(FA)、韵律标注(PWPP)等,使得用户可以使用已有的音频,直接通过 一个Autolabel工具,获取音频所对应的文本、音素、音素时间戳、韵律标注等多种标注信息,适配于后续的语音合成及其他相关任务,如轻量化定制和大规模语音数据标注等。目前该工具的下载量达到11w+。


Modelscope地址:https://modelscope.cn/models/damo/speech_ptts_autolabel_16k

image.png

在Autolabel中,支持三种采样率(16k 24k 48k)音频的输入,首先通过ANS对其进行降噪,其次为保证切分后的音频长度合适且尽可能保留语音完整性,对降噪后音频进行多个阈值的VAD切分和ASR获取对应文本,然后通过文本转音素和FA获取音素及其对应时间戳,再根据文本和真实音频标注PWPP进行韵律标注预测,最后整理所有生成对应标注。其中如ANS和VAD对音频有特殊处理等为可选工具。

 

KAN-TTS开源项目


KAN-TTS是通义实验室语音团队开源的一套语音合成模型训练框架,包含Sambert、nsf-hifigan等模型的训练、推理脚本,能够训练出具有高自然度和韵律丰富度的语音合成模型。


KAN-TTS支持中、英、日、德、韩等十一种外语和上海话、四川话、粤语等多地方言的数据处理,目前KAN-TTS已在ModelScope开源社区贡献了40多个语音合成模型,覆盖多情感、多语言、个性化人声定制等多个类别。同时KAN-TTS还配套了自动化数据标注工具AutoLabel,开发者可根据这套toolkit自由定制自己的语音合成模型。


KAN-TTS github仓库地址:https://github.com/alibaba-damo-academy/KAN-TTS


KAN-TTS ModelScope模型列表:https://www.modelscope.cn/models?page=1&tasks=text-to-speech&type=audio

image.png

image.png 我们不断完善和更新开源项目内容,建立开放的开发者社区答疑,如果您有相关项目切磋交流,欢迎在项目中给我们留言。


相关文章
|
8天前
|
机器学习/深度学习 人工智能 自然语言处理
当前AI大模型在软件开发中的创新应用与挑战
2024年,AI大模型在软件开发领域的应用正重塑传统流程,从自动化编码、智能协作到代码审查和测试,显著提升了开发效率和代码质量。然而,技术挑战、伦理安全及模型可解释性等问题仍需解决。未来,AI将继续推动软件开发向更高效、智能化方向发展。
|
9天前
|
人工智能 自然语言处理 机器人
文档智能与RAG技术如何提升AI大模型的业务理解能力
随着人工智能的发展,AI大模型在自然语言处理中的应用日益广泛。文档智能和检索增强生成(RAG)技术的兴起,为模型更好地理解和适应特定业务场景提供了新方案。文档智能通过自动化提取和分析非结构化文档中的信息,提高工作效率和准确性。RAG结合检索机制和生成模型,利用外部知识库提高生成内容的相关性和准确性。两者的结合进一步增强了AI大模型的业务理解能力,助力企业数字化转型。
44 3
|
12天前
|
人工智能 弹性计算 Serverless
触手可及,函数计算玩转 AI 大模型 | 简单几步,轻松实现AI绘图
本文介绍了零售业中“人—货—场”三要素的变化,指出传统营销方式已难以吸引消费者。现代消费者更注重个性化体验,因此需要提供超出预期的内容。文章还介绍了阿里云基于函数计算的AI大模型,特别是Stable Diffusion WebUI,帮助非专业人士轻松制作高质量的促销海报。通过详细的部署步骤和实践经验,展示了该方案在实际生产环境中的应用价值。
43 6
触手可及,函数计算玩转 AI 大模型 | 简单几步,轻松实现AI绘图
|
5天前
|
机器学习/深度学习 人工智能 自然语言处理
AI技术在医疗领域的应用与前景####
本文探讨了人工智能(AI)在医疗领域的多方面应用,包括疾病诊断、个性化治疗、患者管理以及药物研发等。通过对现有技术的梳理和未来趋势的展望,旨在揭示AI如何推动医疗行业的变革,并提升医疗服务的质量和效率。 ####
24 5
|
8天前
|
人工智能 文字识别 运维
AI多模态的5大核心关键技术,让高端制造实现智能化管理
结合大模型应用场景,通过AI技术解析高端制造业的复杂设备与文档数据,自动化地将大型零件、机械图纸、操作手册等文档结构化。核心技术包括版面识别、表格抽取、要素抽取和文档抽取,实现信息的系统化管理和高效查询,大幅提升设备维护和生产管理的效率。
|
8天前
|
人工智能 新制造 芯片
2024年中国AI大模型产业发展报告解读
2024年,中国AI大模型产业迎来蓬勃发展,成为科技和经济增长的新引擎。本文解读《2024年中国AI大模型产业发展报告》,探讨产业发展背景、现状、挑战与未来趋势。技术进步显著,应用广泛,但算力瓶颈、资源消耗和训练数据不足仍是主要挑战。未来,云侧与端侧模型分化、通用与专用模型并存、大模型开源和芯片技术升级将是主要发展方向。
|
13天前
|
人工智能 自然语言处理 算法
企业内训|AI/大模型/智能体的测评/评估技术-某电信运营商互联网研发中心
本课程是TsingtaoAI专为某电信运营商的互联网研发中心的AI算法工程师设计,已于近日在广州对客户团队完成交付。课程聚焦AI算法工程师在AI、大模型和智能体的测评/评估技术中的关键能力建设,深入探讨如何基于当前先进的AI、大模型与智能体技术,构建符合实际场景需求的科学测评体系。课程内容涵盖大模型及智能体的基础理论、测评集构建、评分标准、自动化与人工测评方法,以及特定垂直场景下的测评实战等方面。
65 4
|
13天前
|
机器学习/深度学习 人工智能 算法
基于AI的性能优化技术研究
基于AI的性能优化技术研究
|
3天前
|
人工智能 弹性计算 数据可视化
解决方案|触手可及,函数计算玩转 AI 大模型 评测
解决方案|触手可及,函数计算玩转 AI 大模型 评测
14 0
|
12天前
|
机器学习/深度学习 人工智能 自然语言处理
AI在医疗领域的应用及其挑战
【10月更文挑战第34天】本文将探讨人工智能(AI)在医疗领域的应用及其面临的挑战。我们将从AI技术的基本概念入手,然后详细介绍其在医疗领域的各种应用,如疾病诊断、药物研发、患者护理等。最后,我们将讨论AI在医疗领域面临的主要挑战,包括数据隐私、算法偏见、法规合规等问题。
36 1

热门文章

最新文章

下一篇
无影云桌面