TEN VAD 与 Turn Detection 让 Voice Agent 对话更拟人

简介: GPT-4o 所展示对话式 AI 的新高度,正一步步把我们在电影《Her》中看到的 AI 语音体验变成现实。AI 的语音交互正在变得更丰富、更流畅、更易用,成为构建多模态智能体的重要组成部分。


image.gif 编辑

GPT-4o 所展示对话式 AI 的新高度,正一步步把我们在电影《Her》中看到的 AI 语音体验变成现实。AI 的语音交互正在变得更丰富、更流畅、更易用,成为构建多模态智能体的重要组成部分。

 

但是,“最后一公里”的挑战仍然存在:Voice Agent 依然不像真人一样交谈。

 

在真实对话里,插话、停顿、甚至讲话重叠都很常见。如果语音 AI 的回应太早、太晚、或者干脆没有回应,整个用户体验就会变得很“出戏”。对话中的“怎么说”往往比“说了什么”更重要。一段停顿可能代表犹豫、礼貌、自信等不同含义。为了让语音 AI 真正像人类一样交谈,它不能只是“听见”并“答复”——它需要真正倾听、理解上下文、并自然地应对。

 

为了解决以上问题,为大家介绍两款新模型:

-TEN VAD(语音活动检测)

-TEN Turn Detection(轮次检测)

 

这两个模型是由声网和RTE开发者社区主要支持,基于声网十余年实时语音深度研究成果与超低延迟技术积累所打造的高性能模型,能够让 AI Agent 的交互体验更加自然,任何人都可以自由使用。这两款模型也将作为开源对话式 AI 生态体系 TEN 的核心模块持续迭代优化。

 

模型链接:

TEN VAD模型链接:

https://modelscope.cn/models/TEN-framework/ten-vad

 

TEN Turn Detection模型链接:

https://modelscope.cn/models/TEN-framework/TEN_Turn_Detection

 

TEN VAD Github:

https://github.com/TEN-framework/ten-vad

 

TEN Turn Detection Github:

https://github.com/TEN-framework/ten-turn-detection

 

01.TEN VAD:语音活动检测

TEN VAD 是一个轻量的,低延迟,低功耗,高准确率语音活动检测模型,通常用于语音输入 LLM 前的预处理步骤:

  • 识别音频帧中是否有人声;
  • 判断一句话的开始和结束位置;
  • 过滤掉无关音频(背景噪音、静音等);

通过 TEN VAD 预处理,可以提升语音识别(STT)的准确性,同时显著降低处理成本——避免将无意义的声音送入到 STT 流程中从而产生开销。

 

目前 TEN VAD 已开源了 ONNX 模型及预处理代码,并同时提供了可供 Linux(.so)、Windows(.dll)、macOS & iOS(.framework)、Android(.so)、Web(.wasm)平台调用所需二进制文件及示例代码,开箱即用。

 

👉一键Start :https://github.com/TEN-framework/ten-vad

 

02.TEN Turn Detection:轮次管理

TEN Turn Detection 的核心功能是对话论次判断,在判断用户何时停止说话方面有不错的表现,这点对于 AI 语音交互的「自然感」方面十分重要。在真实交流中,AI 需要区分出「中途停顿」与「说完了」的差别。插话太早会打断人类思路,太迟回应则会显得迟钝、不自然。

 

TEN Turn Detection 支持中英文、支持全双工语音交互(允许用户和 AI 同时说话),并通过分析语言模式,判断说话者是在思考、犹豫,还是已经表达完毕,用以 AI 判断「该说」还是「该听」,从而让对话更加流畅自然。

 

03.性能对比

与目前常用的 WebRTC Pitch VAD 和 Silero VAD 相比,在公开的 TEN VAD 测试集上(来自多场景、逐帧人工标注),TEN VAD 展示出了更优的效果。

 

image.gif 编辑

 

在延迟方面 TEN VAD 同样领先。它能快速检测语音与非语音之间的切换,而 Silero VAD 则存在数百毫秒的延迟,导致人机交互系统的端到端延迟和打断延迟增加。

 

image.gif 编辑

而针对 TEN Turn Detection ,在多场景测试数据集上和其他同类开源模型进行对比,各模型的表现如下:

 

image.gif 编辑

一个真实用户案例显示,使用 TEN VAD 后,音频传输数据量减少了 62%,显著降低了语音服务成本。

04.实践教程

通过 git clone 使用:

1、克隆仓库

git clone https://github.com/TEN-framework/ten-vad.git
cd ten-vad
apt install libc++-dev

image.gif

2、进入 examples 目录

cd ./examples

image.gif

3、测试

python test.py s0724-s0730.wav out.txt

image.gif

TEN 轮次检测模型推理代码

from modelscope import AutoTokenizer, AutoModelForCausalLM
import torch
# Load model and tokenizer
model_id = 'TEN-framework/TEN_Turn_Detection'
model = AutoModelForCausalLM.from_pretrained(model_id, trust_remote_code=True, torch_dtype=torch.bfloat16)
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
# Move model to GPU
model = model.cuda()
model.eval()
# Function for inference
def analyze_text(text, system_prompt=""):
    inf_messages = [{"role":"system", "content":system_prompt}] + [{"role":"user", "content":text}]
    input_ids = tokenizer.apply_chat_template(
        inf_messages, 
        add_generation_prompt=True, 
        return_tensors="pt"
    ).cuda()
    with torch.no_grad():
        outputs = model.generate(
            input_ids, 
            max_new_tokens=1, 
            do_sample=True, 
            top_p=0.1, 
            temperature=0.1, 
            pad_token_id=tokenizer.eos_token_id
        )
    response = outputs[0][input_ids.shape[-1]:]
    return tokenizer.decode(response, skip_special_tokens=True)
# Example usage
text = "Hello I have a question about"
result = analyze_text(text)
print(f"Input: '{text}'")
print(f"Turn Detection Result: '{result}'")

image.gif

点击阅读原文,即可跳转模型链接~

https://modelscope.cn/organization/TEN-framework

目录
相关文章
|
8月前
|
机器学习/深度学习 安全 API
MAI-UI 开源:通用 GUI 智能体基座登顶 SOTA!
MAI-UI是通义实验室推出的全尺寸GUI智能体基座模型,原生集成用户交互、MCP工具调用与端云协同能力。支持跨App操作、模糊语义理解与主动提问澄清,通过大规模在线强化学习实现复杂任务自动化,在出行、办公等高频场景中表现卓越,已登顶ScreenSpot-Pro、MobileWorld等多项SOTA评测。
3881 7
|
12月前
|
存储 人工智能 NoSQL
万字解码 Agentic AI 时代的记忆系统演进之路
本文深入探讨了在 Agentic AI 时代,记忆(Memory) 作为智能体核心能力的定义、构建与技术演进。
3291 9
万字解码 Agentic AI 时代的记忆系统演进之路
|
11月前
|
人工智能 安全 数据可视化
配置驱动的动态Agent架构网络:实现高效编排、动态更新与智能治理
本文系统性地提出并阐述了一种配置驱动的独立运行时Agent架构,旨在解决当前低代码/平台化Agent方案在企业级落地时面临困难,为Agent开发领域提供了一套通用的、可落地的标准化范式。
768 18
配置驱动的动态Agent架构网络:实现高效编排、动态更新与智能治理
|
8月前
|
存储 人工智能 关系型数据库
LightRAG:图增强检索框架,索引速度提升10倍
LightRAG 是香港大学开源的轻量级检索增强生成系统,创新性采用双层知识图谱架构,结合向量与图谱检索,显著提升复杂查询的准确率与速度。相比 GraphRAG,索引快10倍,支持自动模式切换、多后端存储与异步批处理,助力企业级 RAG 系统高效落地。
|
10月前
|
存储 人工智能 前端开发
超越问答:深入理解并构建自主决策的AI智能体(Agent)
如果说RAG让LLM学会了“开卷考试”,那么AI智能体(Agent)则赋予了LLM“手和脚”,使其能够思考、规划并与真实世界互动。本文将深入剖析Agent的核心架构,讲解ReAct等关键工作机制,并带你一步步构建一个能够调用外部工具(API)的自定义Agent,开启LLM自主解决复杂任务的新篇章。
1932 6
|
人工智能 自然语言处理 API
百聆:集成Deepseek API及语音技术的开源AI语音对话助手,实时交互延迟低至800ms
百聆是一款开源的AI语音对话助手,结合ASR、VAD、LLM和TTS技术,提供低延迟、高质量的语音对话体验,适用于边缘设备和低资源环境。
5065 5
百聆:集成Deepseek API及语音技术的开源AI语音对话助手,实时交互延迟低至800ms
|
人工智能 数据处理 语音技术
Pipecat实战:5步快速构建语音与AI整合项目,创建你的第一个多模态语音 AI 助手
Pipecat 是一个开源的 Python 框架,专注于构建语音和多模态对话代理,支持与多种 AI 服务集成,提供实时处理能力,适用于语音助手、企业服务等场景。
1772 23
Pipecat实战:5步快速构建语音与AI整合项目,创建你的第一个多模态语音 AI 助手
|
人工智能 Java API
后端开发必看:零代码实现存量服务改造成MCP服务
本文介绍如何通过 **Nacos** 和 **Higress** 实现存量 Spring Boot 服务的零代码改造,使其支持 MCP 协议,供 AI Agent 调用。全程无需修改业务代码,仅通过配置完成服务注册、协议转换与工具映射,显著降低改造成本,提升服务的可集成性与智能化能力。
3377 1
|
文字识别 测试技术 语音技术
看听说写四维突破:Qwen2.5-Omni 端到端多模态模型开源!
今天,通义千问团队发布了 Qwen2.5-Omni,Qwen 模型家族中新一代端到端多模态旗舰模型。该模型专为全方位多模态感知设计,能够无缝处理文本、图像、音频和视频等多种输入形式,并通过实时流式响应同时生成文本与自然语音合成输出。
3776 6
看听说写四维突破:Qwen2.5-Omni 端到端多模态模型开源!

热门文章

最新文章