百炼语音模型矩阵的计费单位对照与企业侧核账路径

简介: 本文详解百炼语音模型计费单位混乱(字符/秒/Token)带来的核账难题,梳理目录查询、用量采集(唯审计日志可靠)、额度校验及成本归因路径,提供可复用的跨模型比价与预算换算方法,助力企业精准控本。

语音模型这一轮上新之后,百炼语音能力矩阵的目录价出现了三种计费单位。对企业来说,这不是一句"降价多少"能概括的事:账单核对、预算换算、调用留档,都要先解决"三行数字不能横着比"这件事。本文把这两天跑出来的路径整理成一份可复用的核账说明。

模型矩阵与单位分布

bl model list --capability TTS --page-size 60 --output json
bl model list --capability ASR --page-size 60 --output json

目录查询不需要登录,也不消耗额度,适合挂进定期巡检。返回里 prices[].priceUnit 是单位:合成 19 族中 cosyvoice、qwen3-tts 挂"每万字符",新上架的 3.1 挂"每百万tokens";识别 18 族中 fun-asr、paraformer、qwen3-asr 按秒,只有 3.1-ASR 按词元。同族之内价差可达七倍半,3.1-ASR 流式版本输入价 6 元,非流式 0.8 元,实时链路与离线批处理在目录里挨着排。单价明细以计费文档为准。

一次调用的用量从哪取

装 CLI 走官方 skill 包由 coding agent 代跑,终端 npm install -g bailian-cli 命令一致;合成与识别要 Key,控制台签发,参数见密钥文档。我对 Agent 说:

用百炼的 qwen-audio-3.1-tts-flash 把这份口播稿合成 wav,音色 longanhuan_v3.1,把这一单的用量字段原样贴出来。

它跑的是:

bl speech synthesize --text-file text-zh.txt --model qwen-audio-3.1-tts-flash --voice longanhuan_v3.1 --format wav --out new.wav --output json

核账面四条命令各有结果:bl usage stats --model qwen-audio-3.1-tts-flash --days 1 --output json 与 bl usage stats --days 1 --type Audio --output json 返回空 items,bl monitor metrics 的 model_usage、model_total_amount 返回空 series。账号级视图有数,但当天几十次调用糊在一起,隔离不出单个业务;--days 1 是滑动窗口,两次查询之间数字自己会变小,相减不成立。这几条在 bl 帮助里都标 [Console],要 bl auth login --console 浏览器登录,和合成用的 API Key 是两拨凭证。逐单粒度只有审计日志给:

bl log audit list --hours 1 --model qwen-audio-3.1-tts-flash --output json
bl usage free --model qwen-audio-3.1-tts-flash --output json

每条记录带 request_id、调用时间和 usage 原文。本文所有用量数字都抄自它。这条命令的帮助文本自己跟自己对不上:bl log audit list --help 的 Usage 行只列了 [--hours <n>],同页 --start-time 的说明却写着"overrides --days",真传 --days 得到 Unknown flag "--days"。采集脚本以报错为准,别以文案为准。

四条取数路只有审计日志通

额度与预算规则

3.1 合成与识别各有 1,000,000 词元额度,2026-12-21 到期,剩余分别为 998654 与 999556;paraformer-v2 是 36000 秒、到期显示 2099-01-01;cosyvoice 用版本名查额度返回空。通用规则是每模型独立、90 天有效期、仅北京地域、过期不补发、用尽不自动切换,见免费额度说明。这批调用实付 0 元,因为全部落在额度内,额度用尽之后按目录价计费。

额度查询按完整模型名,族名会返回 total=0(bl usage free --model qwen-audio-3.1-tts 就是这个结果),格式合法但语义为空,进报表前要能区分"查错了"和"用光了"。

还有一笔值得写进流程:额度显示已用 1346 词元,而四次合成的 total_tokens 相加 444+444+229+229 正好 1346。多出来的一次是辅助脚本在计费调用发出之后崩了,修好重跑等于同一份稿子合成两遍,不退费,只有额度差值能对出来。计费链路之前的语法检查,是省这笔钱的唯一办法。

成本落在哪一侧

同一份 133 字口播稿,模型侧记 253 个计费字符、输出 24.88 秒音频。3.1 折算 0.1554 元/万字符,cosyvoice-v3-flash 挂牌 1 元/万字符,差 6.44 倍;转写同一段音频,3.1-ASR 这一单 0.0004996 元,qwen3-asr-flash 0.00528 元、fun-asr 0.00506 元,与前者分别差 10.57 倍和 10.13 倍;折到每分钟,3.1 是 0.0012 元,另两代都是 0.0132 元。识别 18 族里 paraformer-v2 的目录单价最低(0.00008 元/秒)。

换算里有两个必须记住的系数:按字符收费时一个汉字算 2 个字符(133 字记 253),估预算要翻倍;跨模型的词元数不可比(同一段音频 3.1 记 368 个输入词元、qwen3-asr-flash 记 622 个,密度差 1.76 倍),能进财务报表的只有折回金额之后的数。

新模型这一单九成九的钱在输出侧

真正决定账单的是输出侧。这一单 94.93% 的钱花在输出词元上:输入 133 词元按 1.5 元/百万计不到一分钱,输出 311 词元按 12 元/百万计,是输入侧的 18.7 倍。稿子从 133 字压到 100 字,账单几乎不动;音频时长砍掉三分之一,账单才跟着砍三分之一。对有声内容、课程配音这类业务,控时长比控文案有效。

预算表里还要留一列给返回时间。同一份稿子,3.1 那一单 2.2 秒返回,cosyvoice-v3-flash 那一单 17.0 秒,差 7.7 倍;识别侧同一段音频三代模型分别用 0.9、0.9、1.7 秒。这一项不印在任何价目表上,却占同一批人力与同一套超时配置:一万条短语音串行跑,两代之间光等就差出约 41 小时。本轮里单价低的与返回快的恰好是同一代模型,两个倍数是分别跑出来的。

落地清单

环节 动作
取价 目录查询免登录、可定期跑;bl model list --model <版本名> --output json 返回族视图,必须按 items[].model 精确匹配,否则会把 v3.5-flash 的 0.8 元当成 v3-flash 的 1 元
音色 --voice 必填,--list-voices 对 3.1 返回"无内置音色列表",按官方音色页核对,3.1 的 ID 带 _v3.1 后缀,模型与音色不可混用
核账 逐单 usage 只走 bl log audit list,额度扣减用 bl usage free 对平
时长 CLI 产物 wav 头部帧数失真,wave 读出 44739.24 秒,真实 24.88 秒,按 (1194284-44)/(24000×2) 反算
重试 同稿同音色两次合成产物 MD5 相同,重试不产生额外随机成本
转写质量 方言、噪声、多说话人未测,上线前按自有素材补一轮

官方 skill 包与密钥签发是这套流程的两个入口,其余都可以脚本化。

相关文章
|
18小时前
|
安全 测试技术 开发工具
Grok 4.7进Copilot后,测试团队先别比谁更聪明:先测它会不会把任务做得更危险
本文探讨模型升级中易被忽视的质量风险,强调测试需兼顾结果(Outcome)与过程(Trajectory)。提出任务分层、策略约束、正反样本门禁、多轮等价评测及CI灰度机制,将模型切换转化为可观察、可审计、可回滚的工程实验。
|
18小时前
|
存储 人工智能 安全
阿里云国际代理商:云栖大会Agentic Cloud全解读 智能体从Demo到生产的工程化路径
本文介绍2026云栖大会上阿里云发布的Agentic Cloud战略:以智能体为中心的新型云架构,涵盖AI Native、Agent Native与Context Engine三层技术栈,并推出AgentCore、Agent Sandbox等生产级工具,推动AI从Demo迈向规模化落地。(239字)
|
16小时前
|
人工智能 运维 监控
GEO常态化运维:把AI搜索推荐当作长期运维对象来管理
GEO(生成式引擎优化)不是一次性项目,而是需持续运维的品牌信息资产。它确保企业在ChatGPT、文心一言等AI问答中被优先引用。效果衰减源于信息时效性与竞争动态性,须通过监控、响应、迭代、治理四层轻量运维体系长效维系,实现AI可见性、准确性与业务转化的稳态增长。(239字)
|
17小时前
|
人工智能 自然语言处理 安全
降本增效新引擎:国内智能客服系统厂商推荐及行业应用案例
阿里云瓴羊Quick Service是融合大模型与AI Agent的企业级智能客服平台,突破传统“问答”局限,实现查物流、改地址、退款等闭环操作。已服务5万+企业,AI问答准确率93%,自动处理80%以上重复咨询,支持多模态接入与私有化部署。
|
17小时前
|
安全 网络安全
平台正常运行,不代表安全防护已经到位
青岛某科技公司因未部署防火墙、日志留存不足、管理员账号失管等基础安全缺位被查。案例警示:网络安全需筑牢防护底座、规范日志管理、严控高权账号,并推动安全能力持续运营,形成“防护—监测—研判—处置”闭环。(239字)
20 0
|
3月前
|
人工智能 自然语言处理 API
百炼 MCP 市场实战,一句话查 A 股全市场数据
阿里云百炼MCP金融数据服务(market-cmapi00073529),集成financial-expert Skill,支持自然语言选股、基金经理分析、宏观查询、研报检索等,免费调用,3分钟快速上手,零代码获取结构化A股/基金/宏观数据。
|
2月前
|
人工智能 JSON API
百炼 Skills 实战:spark-video——让零基础用户一句话做出完整AI视频
spark-video 是百炼平台推出的AI视频端到端Skill,封装Qwen编剧、HappyHorse渲染、Qwen-VL质检、CosyVoice配音等多模态能力,用户仅需一句话描述+4次确认,即可零门槛生成完整MP4视频,费用透明、流程可控,专为小白打造“输入即成片”体验。(239字)
|
2月前
|
人工智能 自然语言处理 前端开发
百炼 Skills 实战:novel-game——让零基础用户把故事变成可玩的互动小说游戏
novel-game 是百炼官方推出的互动小说创作 Skill,无需编程即可一键生成完整视觉小说。融合 Qwen、Wan、HappyHorse、CosyVoice 多模态 AI,自动产出剧情、立绘、动画、配音及程序化音效,输出可离线运行的 React 游戏,支持分支叙事与多端适配。(239字)
|
2月前
|
人工智能 编解码 API
百炼多模态实战:happyhorse-prompt-studio 如何用 4 步引导解决 AI 视频提示词难题
HappyHorse视频生成效果差?根源在提示词不会写!`happyhorse-prompt-studio`是百炼官方Agent技能,通过4阶段结构化引导,将模糊需求转化为符合“场景+主体+动作+音声+品质”五要素的生产级提示词,显著提升视频生成成功率与一致性。(239字)
|
2月前
|
人工智能 API 双11
# 百炼 CLI 电商视觉全链路方案:从白底主图到展示视频的 AI 生产力升级
阿里云百炼CLI提供电商视觉全链路AI生产方案:6步生成白底图、场景图、模特穿搭、海报及展示视频,单SKU成本仅约10元,较传统摄影降本99.8%。支持可编程批量处理,适配中小电商、大促及跨境多平台需求。(239字)

热门文章

最新文章