百炼声景模型新成员实测:Qwen-Audio-3.1-TTS-Next 的调用路径、时序控制与成本边界

简介: 阿里百炼新推Qwen-Audio-3.1-TTS-Next(9月21日上线),支持文本一键生成含人声、音效、环境声的时序化声景,告别单音色朗读。实测覆盖接口调用、时序控制与成本核算,提示词≤3000字符,成品≤120秒,输出200 token/秒,约0.24分/秒。

百炼模型矩阵这两天多了一个声景生成成员:Qwen-Audio-3.1-TTS-Next,9 月 21 日上架。它和传统语音合成的区别在于,一次生成里同时产出人声、音效与环境声,并按时序排好,而不是一段文字配一个音色的朗读。要不要接进业务,取决于三个问题:接口怎么接、时序怎么控、成本边界在哪。下面用半天 8 笔实测把这三件事过一遍。

能力面与调用路径

模态是 Text+Audio 进、Audio 出。官方给了两种落位:语音与对话(旁白、多人对话、播客、有声书、广播剧),综合声音场景(给台词配雨声、海浪、游戏音效)。提示词按官方六要素写:创作任务、人物及音色、台词(加引号、注明说话人)、表达方式、背景与音效、声音变化。

能力面自查一条命令:

bl model list --model qwen-audio-3.1-tts-next

返回里能看到上架时间 09-21、按 token 计价、适用场景列表。一个接口层差异要提前知道:它没有传统的“音色 ID”,角色音色写在提示词里。

调用路径有个坑:bl speech synthesize 目前仍按经典语音合成的请求体发(input.text 加 voice),对新模型返回 HTTP 400 text_prompt must not be empty.。合成走官方 HTTP 接口,先装 CLI 作为外围工具(官方 skill 包;合成要 API Key,签发入口):

curl -sS -X POST \
  "https://$WORKSPACE_ID.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/SpeechSynthesizer" \
  -H "Authorization: Bearer $DASHSCOPE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen-audio-3.1-tts-next",
    "input": {
      "text_prompt": "<你的剧本>",
      "format": "wav",
      "sample_rate": 48000,
      "channels": 2
    }
  }'

返回里三个字段:output.audio.url(成品地址,24 小时有效)、output.audio.duration(成品秒数)、usage(本单 token)。CLI 依然有用:查目录、看额度、逐单核账、bl speech recognize 回读成品。

时序控制:写作顺序就是控制杆

三场实测:298 字面馆广播剧(三个角色、两组环境声)出 32.08 秒成品,生成 121.6 秒;回读六句台词全对,人声第 2.7 秒进入、末句 27.8 秒收、余下 4 秒雨声收尾。439 字播客出 69.96 秒,生成 101.6 秒,约 1.45 倍。

角色音色需要固定时用参考音频:最多三条,@voice1 到 @voice3 引用,每条不超过 30 秒、10MB。本轮用 bl 先造两段音色样本、base64 回喂 references,复刻出 37.36 秒对话,回读全对。一个反直觉细节:环境声写在提示词最前面,它会先铺 18 秒环境声,人声 18.4 秒才进来。出场顺序完全按书写顺序走,节奏要显式写。

三场成品可试听:面馆广播剧、复刻对话、播客。

四个工种接力与一次调用的分工对比

两层边界

提示词上限 3000 字符,超了立刻报错(3058 字符 0.2 秒返回 text_prompt exceeds the maximum length of 3000 characters.)。成品时长上限 120 秒(播客 240 秒),超了静默截断:尾句丢失,响应里 finish_reason 仍显示 stop,账单按 120 秒照收。估时按 0.16 秒/字(对话多的按 0.12 到 0.15),接近上限就拆段生成。

成本账

每 1 秒生成内容记 200 个输出 token,8 笔全部吻合。按目录价(输入 6 元、输出 12 元每百万 token)折算,每秒约 0.24 分钱:

成品 生成耗时 费用(约)
6.6 秒(冒烟) 41.5 秒 2 分钱
32 秒(面馆广播剧) 121.6 秒 8 分钱
37 秒(复刻对话) 90.2 秒 12 分钱
70 秒(播客) 101.6 秒 17 分钱
120 秒(顶格独白) 174.6 秒 30 分钱

一集 4 分钟满格播客约 6 毛钱;本轮 8 笔、289 秒成品合计约 0.77 元。免费额度 90 天、每模型独立、仅北京地域;输出侧 100 万 token 约够 83 分钟成品。

核账两个细节。先记一个前提:核账这两条命令在 bl 帮助里标着 [Console],要 bl auth login --console 浏览器登录,和合成、回读用的 API Key 是两拨凭证。一是 bl usage free 面板有入账延迟,逐单对账走 bl log audit list --output json;二是语速参数不省钱,rate=1.6 把成品从 9 秒缩到 5.3 秒,计费量只从 1808 缩到 1688 个输出 token(-6.6%)。同一提示词两次的 md5 不同,满意版本立即归档。

每秒成品的成本

落地清单

环节 动作
摸底 bl model list --model qwen-audio-3.1-tts-next 免登录,核对模态、计价与适用场景
合成入口 CLI 的 bl speech synthesize 对 3.1-next 返回 400;走官方 HTTP,字段用 input.text_prompt,不传 voice
音色 无音色 ID,角色音色写提示词;需要固定音色用参考音频(≤3 条、每条 ≤30 秒 / 10MB、@voiceN 引用)
时序 出场顺序等于提示词书写顺序;环境声前置会拉长人声进入时间,节奏显式写
验收 bl speech recognize 回读成品逐句对稿,时间戳核对人声进出点
边界 脚本 ≤3000 字符;成品按 0.16 秒/字估时(对话多 0.12 到 0.15),接近 120 秒拆段
成本 输出 token = 秒 × 200;逐单核账 bl log audit list --output json;rate 不省内容量
复现 同提示词两次 md5 不同,满意版本归档到自有存储

两个入口:官方 skill 包与密钥签发。建议先按“先听见一版”的定位做小批量验证:播客与有声书初稿、NPC 台词与短剧声景的概念验证,都是低成本试水的合适场景。

相关文章
|
7天前
|
人工智能 JSON API
全网刷屏的 Jev 模型正式开放!一手实战测评 + 保姆级教程
全网爆火的 Jev 模型是什么?有什么用?怎么使用?怎么接入 AI 编程工具?效果真的好么?傻子可懂的 Jev 保姆级实战教程 + 项目实战测评来啦
6827 9
|
5天前
|
人工智能 测试技术 API
最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透!
Jev是TypeSafe AI推出的“系统一模型”,不生成文本,专做毫秒级结构化决策:Choice(多选)、Score(打分)、Noul(是非概率)。响应快193倍、成本低444倍,适合工单路由、内容审核、测试定级等高频判断场景。
1371 4
最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透!
|
5天前
|
人工智能 并行计算 PyTorch
秋叶 ComfyUI 2026 整合包 v3.2 完整部署教程:Python 3.13 + Torch 2.13 全栈升级
秋叶aaaki ComfyUI 2026年8月整合包v3.2正式发布!全面升级Python 3.13.11、PyTorch 2.13.0+cu130及ComfyUI v0.30.2,原生支持MiniMax H3、Wan 2.2、Qwen-Image-2.1等2026主流音视频/图像模型,解压即用,无需环境配置。
799 5
|
19天前
|
人工智能 自然语言处理 安全
阿里云千问办公 QwenWork详细介绍:产品核心能力、典型场景、价格及常见问题解答
千问办公是阿里云推出的一站式AI办公平台,主打"不止于对话,更注重交付",依托通义千问旗舰大模型,用户一句话即可完成数据分析、PPT生成、视频剪辑等复杂任务,直接输出可用成果。产品深度打通钉钉生态与企业OA,覆盖桌面端、网页端,提供企业标准版198元/人/月等多档订阅方案,新用户注册即赠2000积分,适配工程师、HR、财务等多职业办公场景,成为能动手干活的"全能AI同事"。
3421 10
|
13天前
|
缓存 IDE Java
【保姆级】Android Studio下载、安装和汉化教程(2026最新)
Android Studio 是 Google 官方推出的免费 Android 应用开发集成环境,基于 IntelliJ IDEA,内置模拟器、调试器、性能分析及 Compose 界面工具,功能全面,文档丰富,是安卓开发首选工具。(239字)
1491 1
|
18天前
|
IDE 开发工具
Qoder 上线 Sonus 模型,Computer Use 能力全面增强
Qoder国际版上线全新内置大模型Sonus(/ˈsoʊnəs/),全球领先,专精超长任务执行与电脑操作(Computer Use)。配合Qoder桌面端0.2.3版本,可自主完成编程、金融建模、科研及表格制作等复杂工作。现全面支持Qoder全系产品,效率提升3.2倍。
1884 9
Qoder 上线 Sonus 模型,Computer Use 能力全面增强

热门文章

最新文章