FunAudioLLM试炼

简介: 音频基座大模型FunAudioLLM,可以想你朋友一样和你对话,情感语境的识别,突破物理限制。

FunAudioLLM
音频基座大模型FunAudioLLM,包含两大模型SenseVoice和CosyVoice。开源代码库为https://github.com/FunAudioLLM。主要的作用SenseVoice是为了识别声音,CosyVoice则是为了生成有感情的朗读内容。
工作环境: https://www.modelscope.cn/studios/iic/SenseVoice,
https://www.modelscope.cn/studios/iic/CosyVoice-300M
语音识别最主要的功能就是方言的识别,尝试了一下甘肃的方言,没有识别:
image.png

使用音乐试一下是否可以生成想要的音乐模式,上传后可以识别,并且有对应的语气和情感的识别,功能还是非常具有眼前一亮的效果的。
image.png

识别语言的语气和情感则是区别机器和人的最重要的区别。并且可以实现不同语言语境的切换,非常厉害。
image.png

语言生成:
image.png

有多种的语音的生成,还可以具有不同的语言模式,整体生成的效果非常好,就和正常的朗读一般,这将对机器的发声非常有帮助。适应于不同的语境和不同的场景,例如机器拨打电话,就可以很大程度的模仿人类,或者车站播报,播报是相对于具有机械性质的语言模式。

AI代码分析,两个工程主要实现语言是python,工程的安装具有一定的挑战,并且AI的计算需要硬件的支持,这是非常大的痛点。
image.png

使用方式简单,就是只需要引入对应的module,然后调用即可。

from cosyvoice.cli.cosyvoice import CosyVoice
from cosyvoice.utils.file_utils import load_wav
import torchaudio

cosyvoice = CosyVoice('pretrained_models/CosyVoice-300M-SFT')
# sft usage
print(cosyvoice.list_avaliable_spks())
output = cosyvoice.inference_sft('你好,我是通义生成式语音大模型,请问有什么可以帮您的吗?', '中文女')
torchaudio.save('sft.wav', output['tts_speech'], 22050)

cosyvoice = CosyVoice('pretrained_models/CosyVoice-300M')
# zero_shot usage, <|zh|><|en|><|jp|><|yue|><|ko|> for Chinese/English/Japanese/Cantonese/Korean
prompt_speech_16k = load_wav('zero_shot_prompt.wav', 16000)
output = cosyvoice.inference_zero_shot('收到好友从远方寄来的生日礼物,那份意外的惊喜与深深的祝福让我心中充满了甜蜜的快乐,笑容如花儿般绽放。', '希望你以后能够做的比我还好呦。', prompt_speech_16k)
torchaudio.save('zero_shot.wav', output['tts_speech'], 22050)
# cross_lingual usage
prompt_speech_16k = load_wav('cross_lingual_prompt.wav', 16000)
output = cosyvoice.inference_cross_lingual('<|en|>And then later on, fully acquiring that company. So keeping management in line, interest in line with the asset that\'s coming into the family is a reason why sometimes we don\'t buy the whole thing.', prompt_speech_16k)
torchaudio.save('cross_lingual.wav', output['tts_speech'], 22050)

cosyvoice = CosyVoice('pretrained_models/CosyVoice-300M-Instruct')
# instruct usage, support <laughter></laughter><strong></strong>[laughter][breath]
output = cosyvoice.inference_instruct('在面对挑战时,他展现了非凡的<strong>勇气</strong>与<strong>智慧</strong>。', '中文男', 'Theo \'Crimson\', is a fiery, passionate rebel leader. Fights with fervor for justice, but struggles with impulsiveness.')
torchaudio.save('instruct.wav', output['tts_speech'], 22050)
相关文章
|
监控 安全 JavaScript
浅谈移动端设备标识码:DeviceID、IMEI、IDFA、UDID和UUID
场景 : 客户提出一个问题就是把用户的登录记录和设备绑定到一起,就是每个人都是固定的设备(可能是安全因素吧)。一开始想的是回去设备的IMEI号和用户账号绑定起来,结果发现IMEI不对外开发,只能另寻他法,最后通过获取设备序列号作为唯一标识。
浅谈移动端设备标识码:DeviceID、IMEI、IDFA、UDID和UUID
|
安全 数据安全/隐私保护
屏幕连点器, 自动连点器,手机自动点击器【autojs】
提供四种点击模式:单点、长按、滑动和随机区域点击
|
9月前
|
数据采集 人工智能 决策智能
黎跃春深度解析:从业务 SOP 到 AI 自动化,智能体运营工程的实战逻辑
黎跃春主讲的AI智能体运营工程师课程,聚焦真实业务场景,系统传授SOP数字化、RAG知识治理、Python自动化评估与Multi-Agent架构设计等实战能力,助力开发者打造稳定可进化的AI生产力系统,在成都等地实现30k+高薪突破。(239字)
|
4月前
|
运维 监控 API
不同厂商的大模型 API 格式不一样,怎么统一调用?
2026年国产大模型“百家争鸣”,但API格式、认证、流式响应、异步回调等差异巨大,对接5家厂商耗时长达两周。本文深度拆解五大差异维度,对比手写适配层、自建网关、聚合平台三种方案,揭示如何以最低成本实现多模型统一调用。
|
机器学习/深度学习 数据采集 人工智能
WebDancer:从零训练一个 DeepResearch 类智能体
WebDancer 是一款具备 Agentic 能力的智能体,能在开放网页环境中自主提问、搜索、推理并验证答案。它通过多步推理、信息整合与交叉验证解决复杂问题,如医学文献分析或政策追踪。WebDancer 采用 CRAWLQA 和 E2HQA 数据合成策略生成高质量训练数据,并结合 SFT(监督微调)+ RL(强化学习)双阶段训练方法,提升模型在动态环境中的适应性和泛化能力。其核心技术包括 ReAct 行为框架和 DAPO 强化学习算法,确保路径优化与策略稳定性。未来,WebDancer 将接入 Browser 工具链,拓展至代码沙盒、长文本写作等应用场景,进一步向通用智能体演进。
1872 27
|
11月前
|
人工智能 自然语言处理 算法
开发者视角的最新视频营销软件工具观察:关于算法合规、自动化工作流与商业场景适配的分析
当前, 短视频内容创作工具的发展路径呈现出明确的“AI+移动原生”倾向,旨在将复杂的视频生产全链路浓缩于手机端和加入自动化AI功能。这极大地降低了技术门槛与时间成本,以适应短视频营销高频、快反的本质需求。与此同时,合规性已成为企业级应用不可逾越的底线。采用能理解本土商业语境的文化算法,以及完成国家要求的大模型备案,是构建信任的关键。这确保了生成内容在法律层面的安全性,为企业规避了数据与版权纠纷风险,提供了长期运营的“安全护城河”。 更重要的是,新一代工具正从执行单点命令的“辅助工具”,进化为能理解商业意图并自主完成复杂任务的Agent。它能自动接管从需求解析、脚本生成到多模态素材合成的全流程
389 5
|
机器学习/深度学习 数据采集 人工智能
【claude官网中文版】国内如何使用claude?记住这十大技巧!
与AI进行对话时,提问方式直接影响到你得到的回答质量和效率。为了最大限度地发挥AI的优势
2094 70
|
敏捷开发 前端开发 测试技术
敏捷开发中的技术问题:不是节奏快了,质量就能好
敏捷开发强调快速迭代与高质量交付,但许多团队仅模仿流程,忽视技术支撑,导致代码混乱、测试缺失、部署风险高。本文剖析六大技术痛点:任务拆解失控、测试滞后、技术债积累、协作断裂、流程形式化、交付基础薄弱,结合实践提出改进策略。真正的敏捷,靠的不是流程表演,而是扎实的工程能力。
|
机器学习/深度学习 人工智能 搜索推荐
《探秘AI驱动的个性化推荐系统:精准触达用户的科技密码》
在这个信息爆炸的时代,AI驱动的个性化推荐系统应运而生,通过数据收集与处理、构建用户画像、核心算法(协同过滤与基于内容的推荐)及深度学习技术,精准洞察用户需求。它广泛应用于电商、视频平台等领域,提升用户体验和商业效益。尽管面临数据稀疏性、隐私保护等挑战,未来将更加精准、实时并注重用户隐私。
2344 1
《探秘AI驱动的个性化推荐系统:精准触达用户的科技密码》
|
JavaScript 前端开发
uniapp阻止事件冒泡
在 UniApp 中,阻止事件冒泡的方式与普通的前端开发类似,可以使用 @click.stop 或 @tap.stop 事件修饰符来阻止事件的进一步传播。

热门文章

最新文章