驱动“超真人”虚拟助手Maya的实时语音对话模型CSM-1b开源!

简介: 3月14日,创造出病毒级虚拟助手 Maya 的Sesame团队开源了他们的语音生成模型 CSM-1b,可根据文本和音频输入生成 RVQ 音频代码。这意味着,我们每个人都可以0成本拥有一个真正的AI伴侣了,甚至可以自己动手搭建、测试和改进模型。

3月14日,创造出病毒级虚拟助手 Maya 的Sesame团队开源了他们的语音生成模型 CSM-1b,可根据文本和音频输入生成 RVQ 音频代码。这意味着,我们每个人都可以0成本拥有一个真正的AI伴侣了,甚至可以自己动手搭建、测试和改进模型。

模型尺寸:Sesame训练了三种模型大小,由backbone和解码器大小划分:

  • Tiny:1B backbone,100M 解码器
  • Small:3B backbone,250M 解码器
  • Medium:8B backbone,300M 解码器

本次Sesame开源的模型是tiny版本 CSM-1b,开源模型在魔搭社区和HuggingFace都可以下载到。一个微调版的CSM可以在Sesame官网博客文章中展示的交互式语音演示中体验。

模型:

https://www.modelscope.cn/models/sesameAILabs/csm-1b

CSM-1B体验:

https://modelscope.cn/studios/sesameAILabs/csm-1b/summary

微调版CSM体验(Maya效果):

Sesame官网:https://www.sesame.com/research/crossing_the_uncanny_valley_of_voice

01.会话语音模型

模型结构

CSM 是一种直接对 RVQ 标记进行操作的多模态文本和语音模型,使用了两个自回归变换器,在第零个码本处拆分变换器。第一个多模态主干网络处理交错的文本和音频以对第零个码本进行建模。第二个音频解码器对每个码本使用不同的线性头,并对剩余的 N – 1 个码本进行建模,以根据主干网络的表示重建语音。解码器比主干网络小得多,从而能够实现低延迟生成,同时保持模型的端到端。

CSM 模型推理过程

这两个转换器都是 Llama 架构的变体。文本标记通过 Llama 标记器生成,而音频则使用 Mimi(一种 split-RVQ 标记器)进行处理,以 12.5 Hz 的频率每帧生成一个语义码本和 N – 1 个声学码本。训练样本的结构为文本和音频的交替交错模式,说话者身份直接编码在文本表示中。

计算摊销

这种设计在训练过程中带来了巨大的基础设施挑战。音频解码器自回归处理有效批量大小为 B × S 和 N 个码本,即使模型很小,这种高内存负担也会减慢训练速度、限制模型扩展并阻碍快速实验。

为了应对这些挑战,该团队提出一种计算摊销方案,该方案可以缓解内存瓶颈,同时保持完整 RVQ 码本的保真度。音频解码器仅在音频帧的随机 1/16 子集上进行训练,而第零码本则在每个帧上进行训练。使用这种方法时,在训练过程中没有观察到音频解码器损失的明显差异。

摊销训练过程

效果评估

评估套件从四个关键方面衡量模型性能:文本忠实度、上下文利用率、韵律和延迟,从客观和主观指标两个方面进行全面的评估。

客观指标

传统基准,例如词错误率(WER)和说话人相似度(SIM),已经饱和,而包括 CSM 在内的现代模型现在在这些指标上实现了接近人类的表现。

词语错误率(Word Error Rate)和说话人相似度(Speaker Similarity)测试的客观指标结果显示,指标已饱和(与人类表现相匹配)。

为了更好地评估发音和上下文理解,Sesame引入了一套新的基于语音转录的基准。

  • 通过同形异义词消歧理解文本: 评估模型是否正确发音具有相同拼写的不同单词(例如,“lead” /lɛd/ 与“lead” /liːd/)。
  • 通过发音连续一致性理解音频: 评估模型是否能保持多轮语音中具有多种发音变体的特定单词的发音一致性。一个例子是“route”(/raʊt/ 或 /ruːt/),它会根据说话者所在地区和上下文而变化。

同形异义词消歧(Homograph Disambiguation)和发音一致性(Pronunciation Consistency)测试的客观指标结果,衡量每个模型正确发音的准确率百分比。下图比较了三种模型大小的客观指标结果。从同形异义词准确率和发音一致性的评估结果观察到,模型越大,性能越佳。这个结果支持了我们的假设,即缩放可以增强更真实语音的合成。

主观指标

Sesame团队使用Expresso数据集评估 CSM-Medium 生成的语音的自然度和韵律适宜性。向人类评估者展示成对的音频样本 - 一个由模型生成,另一个是真实的人类录音。听众根据 7 分偏好量表对生成的样本进行评分。

具体来说,在第一个 CMOS 研究中,提供了没有语境的生成音频和人类音频样本,并要求听众“选择哪种演绎更像人类语音”。在第二个 CMOS 研究中,提供了前 90 秒的音频和文本语境,并要求听众“选择哪种演绎更像对话的延续”。八十人受雇参与评估,平均每人对 15 个示例进行评分。

下图为Expresso 数据集上的主观评价结果。

无上下文:听众在不了解上下文的情况下选择“哪种演绎感觉更像人类语音” 。

上下文:听众在了解音频和文本上下文的情况下选择“哪种演绎感觉更适合继续对话”。

50:50 的胜负比表明听众没有明确的偏好。

上图显示了两项研究中真实人类录音与 CSM 生成的语音样本的胜率。在没有对话语境的情况下(顶部),人类评估者对生成的语音和真实语音没有明显的偏好,这表明自然度已经饱和。然而,当包含语境时(底部),评估者始终青睐原始录音。这些发现表明,在对话语音生成中,生成的语音和人类的韵律之间仍然存在明显的差距。

02.最佳实践

魔搭社区开发者第一时间部署体验了这个模型,本部分教你如何一步步在魔搭平台的notebook上运行CSM-1b模型。

step1: 申请魔搭免费实例

notebook地址:https://www.modelscope.cn/my/mynotebook

点击terminal,打开终端

step2:克隆代码

本次拉取的代码为基于gradio开发的版本,模型托管在modelscope上

git clone https://oauth2:Lj_V_qf8NsjT2RoCksjr@www.modelscope.cn/studios/sesameAILabs/csm-1b.git

step3:安装依赖

cd csm-1b
pip install -r requirements.txt

step4:运行命令

# 声明两个环境变量
export MS_TOKEN='xxxx' # MS_TOKEN 从https://www.modelscope.cn/my/myaccesstoken 获取
export WATERMARK_KEY="123 234 111 222 11"
cd csm-1b
python app.py

Github:

https://github.com/SesameAILabs/csm?tab=readme-ov-file

点击链接阅读原文,直达体验

csm-1b

目录
相关文章
|
人工智能 文字识别 安全
【WAIC 2025】AI安全的攻防前线:合合信息AI鉴伪检测技术
本文记录了作者在WAIC 2025上对合合信息AI图像鉴伪技术的深度探访,涵盖人脸视频篡改检测、AIGC图像识别、文档篡改检测三大核心技术,探讨AI时代内容安全的挑战与产业落地实践,展现图像伪造检测从技术到生态的系统化演进。
896 0
|
12月前
|
编解码 监控 测试技术
《3D可交互道具开发痛点解决:轻量化建模与解耦式逻辑实践》
本文围绕古风开放世界3D可交互道具开发,聚焦“视觉精度”与“性能消耗”的矛盾,分享轻量化建模与解耦式逻辑集成的实践方案。作者针对陶罐、木箱等道具,通过“结构分层优化+贴图智能复用+LOD动态适配”实现轻量化,将移动端单场景道具内存占用降至80MB以下;采用“模型渲染+交互触发+状态管理”组件化架构解耦逻辑,道具迭代效率提升60%;结合差异化碰撞体设计、跨平台动态适配优化性能与体验,解决加载延迟、闪退等问题。最终形成可复用开发规范,为开放世界可交互元素开发提供参考,助力平衡视觉表现、运行性能与开发效率。
843 3
|
缓存 边缘计算 监控
89_批量推理:异步API调用
在当今数据密集型应用和大模型部署的时代,批量推理已成为提升系统性能和资源利用率的关键技术。随着深度学习模型规模的不断扩大和应用场景的日益复杂,如何高效地处理大量推理请求成为技术团队面临的重要挑战。传统的同步API调用方式在面对高并发、大规模数据处理时,往往会遇到响应延迟高、资源利用不充分等问题。异步API调用作为一种更高效的处理模式,通过非阻塞操作和并发处理能力,为批量推理场景提供了理想的解决方案。
744 0
|
机器学习/深度学习 人工智能 自然语言处理
掌握从模型选型到部署优化的全流程
本文深入探讨了AI大模型的开发与应用,涵盖基础概念、模型架构、关键技术、训练方法、应用策略、评估优化及伦理安全七大核心内容。从人工智能的定义到深度学习、通用人工智能(AGI)的探索,再到Transformer架构、混合专家模型(MoE)等前沿技术,系统解析了构建智能系统的基石与工程效率的引擎。文章还介绍了提示工程、检索增强生成(RAG)、AI智能体等应用策略,强调了模型评估与优化的重要性,并探讨了AI伦理与安全的关键议题。适合希望全面了解AI大模型开发的技术人员与研究者参考。
805 0
|
人工智能 自然语言处理 PyTorch
Sa2VA:别再用PS抠图了!字节跳动开源Sa2VA:一句话自动分割视频,连头发丝都精准
Sa2VA 是由字节跳动等机构联合推出的多模态大语言模型,结合 SAM2 和 LLaVA 实现对图像和视频的精确分割和对话功能。
1563 15
Sa2VA:别再用PS抠图了!字节跳动开源Sa2VA:一句话自动分割视频,连头发丝都精准
|
传感器 供应链 监控
数字孪生:制造业的智能化转型
数字孪生技术利用物理模型、传感器数据和运行历史,在虚拟空间中映射实体装备的全生命周期,推动制造业智能化转型。本文探讨数字孪生在产品设计、生产过程和供应链管理中的应用,介绍成功案例,并展望其未来发展前景。
1013 6
|
自然语言处理 达摩院 数据挖掘
[大语言模型-论文精读] 阿里巴巴-通过多阶段对比学习实现通用文本嵌入
[大语言模型-论文精读] 阿里巴巴-通过多阶段对比学习实现通用文本嵌入