阿里云发布语音合成大模型Qwen-Audio-3.0-TTS。在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖及复杂声学鲁棒性方面升级,包含面向实时交互的Flash版本(首包延时300ms级别)和面向高质量生成的Plus版本。目前,在全球第三方权威榜单Artificial Analysis,Qwen-Audio-3.0-TTS-Plus斩获冠军,其预览版Fun-Realtime-TTS也曾在一个月前登顶该榜单。本文转自阿里云公众平台。在阿里云百炼体验:https://www.aliyun.com/product/bailian 以下是关于Qwen-Audio-3.0-TTS模型介绍:
Qwen-Audio-3.0-TTS支持freestyle自由风格模式,可通过角色设定控制情绪、场景和语速。新版本进一步支持结构化标签,用户可在文本中嵌入[gasp](抽气)、[giggles](轻笑)、[angry](愤怒)等标记,将控制精度从整段情绪细化到单字级别,适用于叙事、游戏、配音等场景。
Qwen-Audio-3.0-TTS覆盖中、英、日、韩、德等16种语言,新增阿拉伯语、越南语、马来语及菲律宾语。根据CV3-Eval多语种基准测试,在16种语言的词/字错误率评测中,模型在10种语言中取得最优成绩,韩语和马来语领先幅度较大。在16种语言的说话人相似度评测中,Plus版本取得全部SOTA。
研究团队设计了方言强化训练,让模型在韵律、声调与口语表达上接近母语者,覆盖广东、重庆、东北、陕西、上海、四川、云南等20种方言。
模型通过真实声学仿真训练,在克隆流程中嵌入语音增强能力,在高噪声、高混响条件下可过滤干扰。音频输出从24kHz提升至48kHz,单次语音合成可长达3分钟,并提供开箱即用的精品音色库。
即日起,两款模型已在阿里云百炼开放调用。