技术实践|开箱即用调用Qwen-Audio-3.0 系列模型API

简介: 阿里云百炼Qwen-Audio-3.0示例库上线!一站式整合语音识别(ASR)、语音合成(TTS)与实时语音对话(Realtime)三大能力,开箱即用、配置一个环境变量即可运行。覆盖非流式/流式识别、声音复刻、多语言合成、低延迟实时交互等场景,助力快速构建智能客服、数字人、会议纪要等应用。

一次把「语音识别 + 语音合成 + 声音复刻 + 实时语音对话」讲清楚。 全部示例开箱即用,配置一个环境变量就能跑起来。

从智能客服到数字人,从会议纪要到陪伴助手,语音正在成为人机交互最自然的入口。阿里云百炼的Qwen-Audio-3.0 示例仓库迎来一波重要更新——我们把 Qwen-Audio-3.0 系列最新能力打包成了一组「拿来即用」的百炼平台 DashScope Python / Java 示例。本文将带你快速过一遍三大基础模型的核心能力与进阶用法:从语音识别到语音合成,再到端到端实时语音对话,帮助你快速判断应该从哪个 API 开始。




一图看懂:三条产品线

如果把语音应用拆成输入、输出与交互三层,Qwen-Audio-3.0 系列可以分别承担“听懂”“开口”和“实时聊”。三类服务既能独立调用,也能组合成完整的语音 Agent。

图 1:从识别、合成到实时对话的能力地图

能力模块

核心 API

适合解决的问题

Qwen-Audio-3.0-ASR

语音识别

qwen-audio-3.0-asr-flash / streaming / filetrans

非流式识别、流式识别、长音频转写、说话人分离

Qwen-Audio-3.0-TTS

语音合成

qwen-audio-3.0-tts-flash / plus

自然语言指令、情感标签、声音复刻、多语言合成

Qwen-Audio-3.0-Realtime

实时语音对话

qwen-audio-3.0-realtime-flash / plus

低延迟、可打断的实时语音对话与语音 Agent

接下来按“听—说—聊”的顺序,拆开看每条产品线最值得关注的能力。

一、会「听」:Qwen-Audio-3.0-ASR 语音识别

适用场景  实时直播字幕、客服通话质检、全天会议纪要、通话录音批量转写。示例还覆盖“创建词表 → 查询状态 → 用 ID 识别 → 删除词表”的完整生命周期,并用 finally 保证资源释放。

识别侧覆盖三个典型场景,覆盖从“一段音频”到“一整天会议录音”的完整链路。

  • 非流式识别recognize_speech_qwen-audio_3.0_asr_flash):对音频 URL 做一次性识别,可传入对话上下文提升专有名词准确率,最大支持 5 分钟 / 2GB。
  • 流式识别recognize_speech_qwen-audio-3.0-asr-flash-streaming):基于 WebSocket 长连接,边说边出字;支持热词与对话上下文,适合实时字幕、通话质检等场景。
  • 录音文件转写recognize_speech_qwen-audio-3.0-asr-flash-filetrans):面向长音频的异步转写,最大支持 12 小时 / 2GB,并提供说话人分离能力。

进阶一:对话上下文,让 ASR 听懂语境

流式识别支持传入 Context:把前几轮的用户语音识别结果与模型回复一起带上,让 ASR 在特定语境下更容易识别品牌名、人名和行业术语。也可以直接把领域术语作为一条 user 消息传入,效果类似轻量级热词。

图 2:Context ASR 用历史对话完成同音词消歧

示例:传入历史对话或领域术语

context = {'context': [
    # 方式一:对话历史
    {'role': 'user',      'content': [{'type': 'input_text', 'text': '帮我查一下通义千问的最新版本'}]},
    {'role': 'assistant', 'content': [{'type': 'text',       'text': '通义千问目前最新版本是 Qwen3。'}]},
    # 方式二:领域词表
    {'role': 'user', 'content': [{'type': 'input_text',
     'text': '相关术语:语音实验室、通义千问、百炼平台、声音复刻、热词表'}]},
]}
recognition.start(raw_input=context)

服务端约束  input_text 与 text 类型各最多 5 条,每轮文本不超过 400 字符。示例代码内置自动裁剪逻辑,超限时保留最近几条。

进阶二:超级热词,关键术语必须识别准

热词表支持为每个词条指定 weight(1~5 为普通权重,50 为超级热词)。超级热词的召回率大幅提升,适合"无论如何都必须识别准"的关键术语:

my_vocabulary = [
    {'text': '语音实验室', 'weight': 4},   # 普通热词
    {'text': '通义千问',   'weight': 50},  # 超级热词
]
  • 数量:最多 50 个,不占用普通热词额度。
  • 模型:仅 Qwen-Audio-3.0-ASR 系列模型支持。
  • 取值:合法取值为 1~5 或 50,不存在 6~49 这一段。


示例代码(克隆仓库后进入对应目录,按其 README 安装依赖并运行)


二、会「说」:Qwen-Audio-3.0-TTS 语音合成

适用场景  数字人播报、有声书配音、方言内容、游戏 NPC、个性化语音助手、国际化多语言播报。

Qwen-Audio-3.0-TTS 主打“可控”与“像你”:通过自然语言指令、细粒度标签、参考音频和多语言提示,把音色、风格与表达方式放进同一套调用链,提供从基础合成到多语言全覆盖的示例。

图 3:TTS 的五个控制维度

维度一:指令控制:用一句话描述“怎么说”

流式合成、实时播放的亮点,是用一句自然语言instruction控制角色、情绪、场景与语速。

instruction = '年轻活泼的女性声音,声音清脆甜美,语速很快,适合介绍时尚产品'
instruction = '请用河南话表达'
instruction = '沉稳专业的男性播音员,字正腔圆'

维度二:情感与富语言标签:把表达写进文本

除了 instruction,也可以直接在文本中嵌入标签。原稿示例覆盖 14 个控制类标签与 7 个富语言标签,适合控制情绪、呼吸、笑声等非语言细节。

[excited]今天的天气真不错![laughing]我们一起出去玩吧!
[serious]请注意安全事项。[excited]好了,现在让我们开始吧!

支持 14 个控制类标签([excited] [sad] [angry] [whispers] [asmr] 等)和 7 个富语言标签([laughing] [sighing] [cough] 等),完整列表见指令控制详解示例

维度三:声音复刻与文本正则化

  • 声音复刻:用一段音频复刻专属音色,再用它合成任意文本,适合品牌音色、主播声音资产化等场景。
  • 文本正则化(TN):把“1毫升20%甘露醇需在15~20分钟内完成滴注”读成更自然的“一毫升百分之二十甘露醇需在十五到二十分钟内完成滴注”,确保数字、单位与号码的朗读质量。
# 输入文本
"在一次检测中,1毫升20%甘露醇需在15~20分钟内完成滴注"
# TTS 读出的效果
"在一次检测中,一毫升百分之二十甘露醇需在十五到二十分钟内完成滴注"

示例包含多段难读文本(历史计量、医疗用法、热线号码),每段附带听觉检查点,方便你验证合成效果。

维度四:All-in-One 多语言,一个音色说 11 种语言

使用单一音色 longanhuan_mtlv7 即可合成 11 种语言:中文、英文、日语、韩语、法语、德语、意大利语、葡萄牙语、越南语、印尼语、菲律宾语。切换语种时音色始终保持一致,非常适合国际化内容播报。

只需传入 language_hints 告诉模型输入语种,再配合 instruction 指定说话语言:

from dashscope.audio.tts_v2 import SpeechSynthesizer, SpeechSynthesisAudioFormat
import dashscope
synthesizer = SpeechSynthesizer(
    model='qwen-audio-3.0-tts-flash',
    voice='longanhuan_mtlv7',
    language_hints=['ja'],
    instruction='請講日語。'
)
synthesizer.streaming_call('東京は美しい都市です。')
audio = synthesizer.streaming_complete()


示例代码(克隆仓库后进入对应目录,按其 README 安装依赖并运行)


三、会「实时聊」:Qwen-Audio-3.0-Realtime 语音对话

如果说前两者是“听”和“说”,Qwen-Audio-3.0-Realtime 就是把两者合二为一的“边听边说”:一个基于 WebSocket 的端到端实时语音对话服务。

图 4:Realtime SDK 与 demo_app 的最小架构

配套的 Python SDK(fun_realtime/)刻意保持精简:只负责底层 WebSocket 连接、事件序列化、会话配置与音频编解码,不内置轮次状态机和路由器,因此可以直接嵌入自己的应用架构。SDK 本体仅依赖 websockets,不需要额外的音频硬件库。

  • 场景 A · 陪伴对话:纯提示工程,配置一个角色人设即可开始对话,约 50 行应用代码。
  • 场景 B · 工具智能体:注册工具、处理函数调用事件并回传结果,让语音助手能查天气、调接口、办实事,约 80 行应用代码。
  • 场景 C · 推理智能体:模型自己决定走哪条路:简单问题直接快答,复杂问题路由到外部推理流水线,先垫一句“让我想想”,再播报深度思考结果,约 100 行应用代码。

浏览器体验  配套 Web 示例启动后,浏览器打开 http://localhost:8080,即可体验上述三个场景。

想做更复杂的 Agent?

推荐看看 **qwen-audio-agent** —— 进一步提供了多轮记忆管理、声明式工具编排、多模态输入和生产级参考架构,适合从 demo 走向上线应用的团队。

示例代码(克隆仓库后进入对应目录,按其 README 安装依赖并运行)


四、三步跑起来

每个示例目录下都有独立 README.md,写清依赖、参数与预期结果;示例同时提供中英文说明。建议先从 Python 示例跑通,再按需要接入 Java 或自己的应用框架。

# 1. 克隆仓库
git clone https://github.com/aliyun/alibabacloud-bailian-speech-demo.git
# 2. 配置鉴权(在百炼控制台创建 API-KEY)
export DASHSCOPE_API_KEY=your-api-key
# 实时对话 / 部分示例还需要 space_id 或 workspace_id
export FUN_REALTIME_SPACE_ID=your-bailian-space-id
# 3. 进入任意示例目录,按其 README 运行即可
#    Python:pip install -r requirements.txt && python run.py
#    Java:  mvn clean package && sh run.sh

运行建议  先用短音频或短文本验证鉴权与网络,再逐步增加上下文、热词、工具调用和多语言控制,定位问题会更快。


写在最后

好的示例,本身就是最好的文档。无论你想做实时字幕、数字人、智能客服、多语言播报,还是一个会聊天、会调用工具、还能“思考”的语音智能体,这组 Qwen-Audio-3.0 模型示例都提供了可运行的起点。建议从一个最小示例开始,把它接进你的产品,再根据场景逐步加入 Context、热词、标签、声音复刻和 Agent 路由。


项目地址(欢迎 Star、Fork):

https://github.com/aliyun/alibabacloud-bailian-speech-demo


目录
相关文章
|
19天前
|
人工智能 缓存 前端开发
DeepSeek Harness 首发实测 + 入门教程,夯爆了!梁神我错了
DeepSeek Harness + DeepSeek V4 Pro 项目实战保姆级教程!手把手带你从零安装开源 AI 编程工具,开发架构图、知识讲解网站、3D 网页游戏、全栈 AI 应用 4 个项目,覆盖运行模式选择、插件安装与开发,看看能不能对标 Claude。
13114 84
DeepSeek Harness 首发实测 + 入门教程,夯爆了!梁神我错了
|
7天前
|
人工智能 自然语言处理 安全
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
本文聚焦阿里云2026年推出的三款自研AI办公产品,清晰拆解千问办公、Qoder Teams、Qoder CN的差异化定位与能力边界:千问办公主打职场全场景提效,支持自然语言指令一键完成PPT生成、数据分析等高频办公任务;Qoder Teams面向程序员团队,深度整合AI代码生成、团队协同与企业知识库能力;Qoder CN则专为金融、政务等强合规场景打造,实现数据不出境与VPC私有化部署。文章同步给出分场景选型指南与最新活动定价,帮助不同类型的企业按需组合产品,实现业务岗、研发岗与强合规场景的AI能力全覆盖。
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
|
2天前
|
缓存 人工智能 API
阿里云Qwen3.8‑Flash完整能力解析:模型特性、API调用实操与计费规则深度拆解
在AI应用快速落地的当下,开发者与企业选型大模型API,不再只单纯关注评测榜单分数,推理速度、上下文长度、多模态能力、工具调用稳定性以及实际调用成本,共同决定项目能否平稳上线。Qwen3.8‑Flash作为新一代多模态混合专家模型,主打高性能推理与低成本开销,面向编程开发、智能Agent工作流、超长文档解析、图文混合理解等高频场景,提供托管API服务,权重同时开放可供本地部署,兼容主流接口协议,能够无缝接入各类开发工具链。很多开发者在接入过程中,容易混淆普通按量Token计费、缓存计费、各类订阅计划之间的差异,造成实际账单超出预估。本文从模型底层架构、核心功能能力、适用场景、API调用实操、完
695 0
|
12天前
|
Web App开发 人工智能 API
16 个超火的 DeepSeek Harness 插件,大肥鱼已经落后 N 个版本了。。。
DeepSeek Harness 精选插件推荐合集,从图片识别、浏览器操控、多 Agent 协作到手机远程控制,一口气带你看完 DSH 社区热门的十几个插件,覆盖技能扩展、UI 界面增强、整活玩法三大类,让你的鲸鱼变得更强。
1736 4
|
13天前
|
人工智能 Java BI
【AI】DeepSeek Harness 安装、运行、管理插件
本文介绍了如何运行DeepSeek开源的Agent框架DeepSeek Harness(dsh)。主要内容包括:使用nvm安装适配的Node版本;通过代理加速克隆GitHub源码;使用pnpm安装依赖并启动项目;配置DeepSeek API Token;安装扩展功能的插件。该框架自带Web界面,支持模型适配、文件编辑等插件化功能
1918 1
|
人工智能 JavaScript 开发工具
DeepSeek Harness 本地安装与使用指南
DeepSeek Harness(DSH)是DeepSeek AI开源的Agent运行框架,支持本地文件操作、命令执行与工具调用。基于Cordis插件架构,具备高扩展性与强可控性,适合开发者搭建可控Agent环境或开展模型基准测试。当前为开发者预览版,需Node.js环境,推荐先用`npx @deepseek-ai/dsh web`快速体验。
5153 0
|
15天前
|
人工智能 JavaScript 测试技术
保姆级教程:DeepSeek Harness从安装到跑通测试,30分钟上手
DeepSeek Harness是DeepSeek开源的AI Agent运行时,主打“一行命令安装、5分钟跑通”。它让模型真正动手干活——读代码、跑测试、分析失败、生成修复方案。本文手把手教你30分钟从零上手,覆盖安装、配置、实测及避坑指南,助你快速掌握下一代AI编程范式。
|
8天前
|
人工智能 Linux iOS开发
Ollama使用教程:Ollama官网下载、Ollama本地部署大模型(2026最新)
Ollama 是一款免费开源的本地大模型运行工具,支持在 Windows/macOS/Linux 上离线运行 Qwen、DeepSeek、Llama 等主流开源模型,数据不出本机、隐私安全。提供 OpenAI 兼容 API,命令行一键拉取/运行/管理模型,无需联网,无调用限制,是开发者与 AI 爱好者部署本地 AI 助手的理想选择。(239 字)
|
14天前
|
人工智能 JavaScript 测试技术
从 0 到 1,DeepSeek Harness 保姆级安装与使用教程!
DeepSeek Harness是DeepSeek推出的开源Agent运行框架,秉持“一切皆插件”理念,支持模型、工具、技能、工作流等全模块自由替换与扩展。其核心Cordis内核实现动态插件管理,赋能Agent自进化。已成GitHub史上增速最快开源项目(15w+ Star),标志着国内大模型从拼价格转向重架构与生态的新拐点。
1349 6
从 0 到 1,DeepSeek Harness 保姆级安装与使用教程!

热门文章

最新文章