Qwen-Audio-3.0-TTS 正式发布!AI 语音从 “能说话” 升级到 “会带情绪表达”

简介: 阿里云发布Qwen-Audio-3.0-TTS语音合成大模型,支持细粒度标签控制(如[gasp][angry])、freestyle自由风格、16种语言及20种方言,声学鲁棒性强。含Flash(首包延时300ms)和Plus(全球榜单冠军)双版本,已在百炼平台开放调用。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens

阿里云发布语音合成大模型Qwen-Audio-3.0-TTS。在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖及复杂声学鲁棒性方面升级,包含面向实时交互的Flash版本(首包延时300ms级别)和面向高质量生成的Plus版本。目前,在全球第三方权威榜单Artificial Analysis,Qwen-Audio-3.0-TTS-Plus斩获冠军,其预览版Fun-Realtime-TTS也曾在一个月前登顶该榜单。本文转自阿里云公众平台。在阿里云百炼体验:https://www.aliyun.com/product/bailian  以下是关于Qwen-Audio-3.0-TTS模型介绍:

WX20260720-200359@2x.png

Qwen-Audio-3.0-TTS支持freestyle自由风格模式,可通过角色设定控制情绪、场景和语速。新版本进一步支持结构化标签,用户可在文本中嵌入[gasp](抽气)、[giggles](轻笑)、[angry](愤怒)等标记,将控制精度从整段情绪细化到单字级别,适用于叙事、游戏、配音等场景。


Qwen-Audio-3.0-TTS覆盖中、英、日、韩、德等16种语言,新增阿拉伯语、越南语、马来语及菲律宾语。根据CV3-Eval多语种基准测试,在16种语言的词/字错误率评测中,模型在10种语言中取得最优成绩,韩语和马来语领先幅度较大。在16种语言的说话人相似度评测中,Plus版本取得全部SOTA。

WX20260720-200459@2x.png

研究团队设计了方言强化训练,让模型在韵律、声调与口语表达上接近母语者,覆盖广东、重庆、东北、陕西、上海、四川、云南等20种方言。


模型通过真实声学仿真训练,在克隆流程中嵌入语音增强能力,在高噪声、高混响条件下可过滤干扰。音频输出从24kHz提升至48kHz,单次语音合成可长达3分钟,并提供开箱即用的精品音色库。


即日起,两款模型已在阿里云百炼开放调用。

相关文章
|
1月前
|
自然语言处理 API 语音技术
技术实践|开箱即用调用Qwen-Audio-3.0 系列模型API
阿里云百炼Qwen-Audio-3.0示例库上线!一站式整合语音识别(ASR)、语音合成(TTS)与实时语音对话(Realtime)三大能力,开箱即用、配置一个环境变量即可运行。覆盖非流式/流式识别、声音复刻、多语言合成、低延迟实时交互等场景,助力快速构建智能客服、数字人、会议纪要等应用。
836 0
|
19天前
|
人工智能 JSON API
全网刷屏的 Jev 模型正式开放!一手实战测评 + 保姆级教程
全网爆火的 Jev 模型是什么?有什么用?怎么使用?怎么接入 AI 编程工具?效果真的好么?傻子可懂的 Jev 保姆级实战教程 + 项目实战测评来啦
8845 25
|
3月前
|
人工智能 自然语言处理 Linux
Qwen-Audio-3.0-TTS:AI语音从“能说话”到“会带情绪表达”的技术跃迁
在AI语音合成领域,从“清晰发声”到“自然表达”一直是技术突破的核心方向。传统TTS模型往往只能实现文本到语音的机械转换,语调平直、节奏僵硬,缺乏人类说话时的情绪起伏、呼吸细节与场景适配性,难以满足影视配音、有声内容、智能交互等对语音表现力有高要求的场景。而Qwen-Audio-3.0-TTS的正式发布,彻底打破了这一局限,它基于通义千问新一代语音架构深度优化,实现了从“能说话”到“会带情绪表达”的跨越式升级,不仅能精准传递文本内容,更能通过细粒度情绪控制、自由风格指令、多语种方言适配、高保真音质输出,让AI语音拥有媲美真人的情感温度与表达张力,登顶全球语音合成权威榜单,成为下一代语音合成技术
516 1
|
人工智能 安全 Apache
QwenPaw:你的私人 AI 助理 —— 数据归你、记忆进化、多端触达的开源个人智能体
QwenPaw 是一款开源、本地优先的AI个人智能体(Apache 2.0),数据归属用户、记忆自主进化、支持钉钉/飞书/微信等多端触达。3行命令即可部署,内置Coding IDE、Persona人格、定时任务、MCP工具生态与多Agent协作,真正属于你的私有AI助理。
QwenPaw:你的私人 AI 助理 —— 数据归你、记忆进化、多端触达的开源个人智能体
|
4天前
|
人工智能 JSON 自然语言处理
2026 年 Jev 决策模型深度拆解:原理解读、实战测评与保姆级落地教程
有一款特殊AI模型在开发者圈子刷屏,它摒弃传统大模型擅长的对话聊天能力,专注做高速结构化决策,它就是TypeSafe AI推出的Jev模型。该模型由ChatGPT共同发明人Diogo Almeida主导研发,定位为**System One Model(系统一模型)**,对标人类大脑快速直觉判断的思维模式,在响应延迟、调用成本、结构化输出稳定性上相比传统生成式大模型有着巨大差异。本文会完整拆解Jev底层原理、三大核心原语能力、适用业务场景,同时提供可直接运行的curl、Python代码示例,并且结合多组实测数据,客观分析模型优势与能力边界,帮助普通开发者和AI应用从业者快速上手落地。
396 1
|
3月前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max-Preview深度全解析:2.4万亿参数旗舰MoE模型+Token Plan限时优惠完整落地指南
2026年7月,全新旗舰级混合专家大模型Qwen3.8-Max-Preview正式开放抢先体验,作为通义千问Qwen3系列规格最高、综合推理能力顶尖的新一代模型,该模型总参数量达到2.4万亿(2.4T),是当前线上可调用的原生多模态旗舰模型,综合推理水准对标海外顶级Fable 5模型,在复杂工程开发、长文档深度分析、多步骤智能体自治、跨境多语言创作、海量数据挖掘五大高难度业务场景实现跨越式性能提升。
2380 3
|
10月前
|
JavaScript Shell API
阿里云百炼 API 调用教程:准备 API-Key、配置环境变量和调用 API 流程
在使用阿里云百炼平台的大模型能力时,API 调用是核心环节 —— 无论是开发 AI 应用、测试模型效果,还是搭建智能服务,都需要通过 API 将大模型能力集成到自己的系统中。不过对很多开发者来说,从准备密钥到实际调用的流程可能存在疑问,比如 “API-Key 怎么获取”“环境变量配置有什么用”“不同语言怎么写调用代码”。本文结合最新的实操细节,用通俗的语言把整个流程拆解开,从账号准备到多语言调用,每一步都附具体操作和代码示例,帮大家快速上手。
20984 113
|
3月前
|
机器学习/深度学习 测试技术 PyTorch
英伟达三代旗舰显卡性能测试:5090、4090、3090
本文通过ResNet-50模型在CIFAR-10数据集上的PyTorch训练实测,对比RTX 3090/4090/5090三代旗舰显卡性能。结果显示:5090单精/混精吞吐达1076/1822 samples/s,较4090提升约50%,4090较3090提升约45%,为深度学习选卡提供实证参考。
英伟达三代旗舰显卡性能测试:5090、4090、3090