AI 有声内容在 2026 年进入快速普及期:NotebookLM 更名为 Gemini Notebook 并支持 50 多种语言,ElevenLabs 估值达到 110 亿美元,豆包一键生成 AI 播客,喜马拉雅在 WAIC2026 展示了自研 AudiobookLM。在这个背景下,百炼平台通过 CLI 提供了另一种工程化路径:以 bl 命令为入口,把 TTS、ASR、语音翻译三项能力收进一个终端,用标准文件 I/O 串成端到端流水线。
本文从能力构成、模块实践、流水线串联到成本,给出一套完整的落地方案。
能力构成:三个命令与底层模型
百炼 CLI 在音频方向封装了三个核心命令:
| 命令 | 功能 | 底层模型 | 关键能力 |
|---|---|---|---|
bl speech tts |
文本转语音 | CosyVoice | 多音色、多情感、多角色、多语言 |
bl speech asr |
语音识别 | Paraformer | 说话人识别、时间戳对齐、标点恢复、章节分割 |
bl speech translate |
语音翻译 | 实时翻译引擎 | 中文与多语言互译,输出译文与语音 |
架构上有两个特征直接决定了使用方式:
- 无状态调用:每次
bl调用是独立进程,不共享上下文,音色、语速等参数每次显式传入。这使得脚本批量执行时输出风格完全可复现——参数固定后,一百次调用的音色和语速完全一致。 - 标准文件 I/O:输入输出均为标准文件(mp3、md),上一环节的输出可直接作为下一环节的输入,这是流水线串联的基础。
TTS 模块:CosyVoice 多音色合成实践
CosyVoice 支持 WebSocket 实时流式和 HTTP 批量两种接入方式。以下用三个代表场景说明其输出水平与调参要点。
广告配音。输入促销文案"双十二狂欢节!全场商品五折起,限时抢购不容错过!":
bl speech tts --text "双十二狂欢节!全场商品五折起,限时抢购不容错过!" --voice 激昂 --format mp3
音色与文体的匹配是第一要务:温柔音色念促销词像睡前故事,激昂音色下感叹号处有真实的语气上扬,"五折起"是自然连读而非逐字往外蹦。信息流广告和商品页旁白可直接使用,品牌 TVC 级配音仍建议专业配音员。
有声书朗读。输入抒情文本"那是一个秋天的傍晚,夕阳把天空染成了橘红色。微风拂过树叶,发出沙沙的声响。":
bl speech tts --text "那是一个秋天的傍晚……" --voice 温柔 --speed 0.9 --format mp3
默认语速下抒情段落偏赶,--speed 0.9 后从容感明显;"沙沙"这类拟声词处理自然,无逐字硬念。有声书市场 2026 年预计规模 139 亿美元,AI 配音把制作周期从数周缩到数小时;电台级情感演播目前合成音色尚达不到,商业出版级有声书仍需配音演员。
金句配音。输入"2025年IDEA大会高峰对话,五位嘉宾围绕AI时代创新格局展开深度讨论。":
bl speech tts --text "2025年IDEA大会高峰对话……" --voice 磁性 --speed 0.95 --format mp3
实测中长句会被一口气念完、重音落不到关键词上,手动断句并在关键词前补逗号后重音位置才正确——合成引擎按标点安排气口,文本预处理比调参数更有效。"2025年"正确读成"二零二五年",数字归一化处理干净。多句文本单次合成时句间停顿偏短,拆成多次调用再拼接可获得更自然的呼吸感,这也是无状态设计带来的细粒度控制方式。
ASR 模块:Paraformer 结构化转写实践
Paraformer 的转写结果直接落成结构化文本文件,可被下游脚本直接消费——这是与通义听悟、飞书妙记等界面型产品的出口差异:后者胜在有界面、有实时摘要,CLI 则把结果交给自动化链路。
会议纪要。输入一段 45 分钟的普通话项目例会录音:
bl speech asr --input meeting.mp3 --speaker-diarization --output transcript.md
输出按说话人分段:
[说话人1] 这周的重点还是把导出功能收尾,测试环境今天下午就能更新。
[说话人2] 那文档这块我来跟,周四之前给初稿。
未开启 --speaker-diarization 时输出为一整块连续文本,多人发言无法区分,该参数在会议场景应默认开启。标点恢复表现好:口语中的"嗯""然后"被合理断句,输出直接是可读的 markdown,可继续交给模型提炼待办与负责人。多人交叉说话的段落准确率会明显下降,重要会议建议对照原始录音复核关键结论。
章节整理。输入一期一小时的中文播客录音:
bl speech asr --input podcast.mp3 --output chapters.md
输出带时间戳的章节结构(如 ## 00:06:32 AI 播客工具的现状),时间戳可定位到句子级别。个别章节切分点会落在语义中间,需要手动微调切点;章节标题偏概括体,发布前宜自行润色。整体上把两三个小时的手工整理压缩为几分钟初稿加十几分钟微调。
翻译模块:多语言内容生产
内容出海链路。一期中文播客生成英文版:
bl speech translate --input podcast.mp3 --source zh --target en --output podcast-en.mp3
转写加翻译一步完成,再接一步 TTS 即可生成目标语言配音。两个实践要点:--source 参数不可省略——未指定源语言时中英混杂语音的识别结果明显劣化;专有名词宜在文稿层先统一为英文原词再翻译,可显著改善译文流畅度。原始内容越规范,多语言版本质量越稳,这条链路更适合有文稿意识的团队;同传级现场翻译仍属人类译员的领域,异步内容翻译是其主场。
端到端流水线:从会议录音到多语言音频
三个命令的价值在串联。示例链路"会议录音 → 转写纪要 → 金句配音 → 英文版":
# Step 1: 转写会议录音,按说话人分段
bl speech asr --input meeting.mp3 --speaker-diarization --output transcript.md
# Step 2: 将人工挑选的金句合成为音频
bl speech tts --text "这里粘贴从 transcript.md 里挑出的金句" --voice 磁性 --speed 0.95 --format mp3
# Step 3: 生成英文版语音
bl speech translate --input meeting.mp3 --source zh --target en --output meeting-en.mp3
批量场景将文案放入文本文件逐行处理:
# PowerShell:逐行读取文案并批量配音
Get-Content copy.txt | ForEach-Object {
bl speech tts --text $_ --voice 激昂 --format mp3 }
由于参数全部显式传入,批量执行的输出风格完全一致;调整某一环节的音色只需修改脚本参数。ASR 输出的结构化文本还可对接项目管理工具或知识库,实现"录音 → 纪要 → 待办"的自动流转。
成本参考
基于百炼官方定价(2026 年 7 月,来源:阿里云模型 studio 产品计费文档):
| 操作 | CLI 单次成本 | 传统方案参考 |
|---|---|---|
| TTS 配音(1 分钟音频,约 200 字) | ~0.034 元(标准语音合成 1.70 元/万字) | 50-200 元/分钟(专业配音员) |
| ASR 转写(1 小时音频) | ~3.5 元(实时转写约 0.06 元/分钟) | 100-300 元/小时(人工转写服务) |
| 语音翻译(1 分钟) | ~0.5 元(ASR + 翻译 + TTS 组合) | 200-500 元/分钟(同声传译) |
一套包含 6 步 TTS + 2 步 ASR + 2 步翻译的完整音频工坊,API 成本约 5 元。传统方案定价包含人工创意与质量把控,两者并非同一种商品;这个成本量级的实际意义在于试错——音色、语速、断句的每次调参重试仅花几分钱,可支撑高频实验与迭代。
上手指引
环境要求:Node.js 18 及以上,无需 GPU、Python 环境或音频处理库。
npm install -g bailian-cli
bl auth login
尚无百炼账号可先免费获取 API Key,或访问百炼控制台首页了解平台能力矩阵;CLI 安装详细文档见百炼 CLI 官方页面。
适用场景定位
这套流水线的目标用户特征是"高频 + 批量 + 需要接入自有流程":日更多条旁白的短视频团队、需要自动生成章节时间戳的播客制作方、批量生成再拼接的有声书生产、例会纪要自动化的协作团队、转写-翻译-配音三步串联的内容出海管线。
偶发性需求(偶尔生成一段音频)更适合 ElevenLabs、剪映这类带界面、可实时试听的产品——CLI 提供的是接口而非成品,界面与流程编排需自行搭建,且要求使用者具备基本的命令行与脚本能力。另外,涉及声音克隆时须遵守百炼平台使用规范,不得克隆未经授权的人声。
如果团队每周需要处理十几条配音、数小时录音转写或多语言版本生产,这三条命令可以把分散在多个工具间的手动搬运压缩为一条可定时执行的流水线,参数固定后输出质量稳定可复现。