不用打字了,你说一句,云上的 Agent 就开始干活

简介: Qoder Cloud Agents上线实时语音交互,支持自然打断、双工对话与云端执行。无需打字,开口即用;语音与文字共享上下文,边说边干、随时叫停。通勤、会议、育儿等场景皆可无缝接入,原有Agent能力零改造复用。Beta阶段限时免费体验。

qoder cloud agents (1).png


Qoder Cloud Agents 上线实时语音交互。Forward Mode 的 Agent 模板,现在可以直接开口说话。


你不用再把想法攒成一段完整的指令,也不用等它把话说完才能插嘴。


01.png


想清楚一件事,和把它打出来,是两回事


你大概有过这种时刻:


事情在脑子里已经很清楚了——把上周那批异常订单捞出来,按门店分个组,跑不通的单独列一列。清楚到你几乎能听见自己说出这句话。


然后你打开对话框,开始打字。


打到一半你意识到,"上周"得写成具体日期;"异常"得说明是哪几类;"按门店分组"最好再补一句排序规则。原本三秒钟就能说完的事,你花了三分钟组织成一段书面语,然后按下回车,等。


这就是过去一年多我们和 Agent 相处的方式:你必须先把自己翻译成一段结构完整的文字,它才听得懂。


翻译是有成本的。成本高到,很多"顺手让 AI 干一下"的念头,在打字的第二行就放弃了。


现在你可以直接说。


02.png


你说着话,活在云上就干完了


打开语音之后,最先变化的不是"能用嘴了",而是节奏。


它不用等你说完。 语音输入和语音输出是同时进行的——你说到一半改主意,"等等,不要上周,要这个月的",它当场跟着拐弯,不会把那句错的执行到底。反过来它也可以插话:发现你要的字段其实不存在,它会当场开口提醒你,而不是闷头跑完再报一个错。


它不介意你中途换成打字。 有些东西天生不适合念出来:一串订单号、一段路径、一行配置。你可以直接在输入框里敲进去,语音和文字共享同一份实时上下文——嘴上指挥,手上补细节,中间不需要切换模式,也不会因为你打了一行字就退回文字模式。


最关键的是,活不是在你这台电脑上干的。


你说完一句话之后,真正的执行发生在云端:Agent 在云上的沙箱里读文件、跑脚本、调工具、连你授权过的系统。这意味着你不必一直盯着它——眼睛可以去看别的东西,手上可以做别的事。它在云上接着跑,并把执行状态和结果用语音反馈给你:


"三个门店的数据已经对齐,第四个门店的字段名不一样,按原来的规则处理了。"


听着不对,你随时可以开口把它叫住。打断在这条链路里是随时可用的,不用等它说完。


这是语音最容易被低估的一点:它不只是把手腾出来了,是把眼睛腾出来了。


连接断了也不用从头来。语音会话支持断线重连,重新连上之后,会话和上下文接着往下走。


几个大概能对上号的时刻:


  • 通勤路上。 想到一件事,说一句"把昨天那批异常订单整理成表,按门店分组"。到公司,表在那儿了。


  • 会开到一半。 有人问上个季度某个数,你不用中断会议翻系统,低声问一句,它在云上查完,把答案念给你。


  • 一个要跑二十分钟的活。 跑到第三步,它把状态报给你,你一听就发现方向偏了,当场开口改。而不是二十分钟后回来,看到一条卡在第三步的失败日志。


  • 孩子放学回来,情绪不太对。 他不会打开电脑打一段"我今天在学校被冷落了,我想聊聊"——但他会开口说。一个配好了儿童陪伴能力的 Voice Agent,能接住那句话——它会听出他语气里的失落,用有温度的语调回应,而不是像念稿子一样把安慰念一遍。带着耐心和边界感陪他聊下去。这件事如果没有语音,对一个八岁的孩子来说,根本不会发生。


03.png


语音不是多了一个功能,是 Agent 的界面变了


这一年,能语音对话的产品越来越多。大部分解决的是同一件事:让你能用说话代替打字。 能听懂,能应答,能顺手查两个东西。


这已经很有用。但这条路的能力边界,基本就是"一次对话里能完成的事"。


我们的做法不太一样。


在 QCA 里,语音负责的是跟你实时地聊:毫秒级响应、听得懂口语、能自然打断也能被打断,还能听出你话里的情绪,用有温度的语气回应——而不是机械地念稿。而你交代的活,是在云上真正跑起来的——沙箱、技能、工具、MCP、你授权过的密钥和文件权限,都在同一个会话里为这场对话服务。


你不会感觉到任何转接。你只是在说话,然后活干完了。语音对话、转写文字、工具调用、任务执行结果,全部写进同一份会话记录——事后要回溯,还是原来那个入口,一条时间线看到底。


"聊"和"干"不是两个系统。这是我们觉得最要紧的一点。


而且有些场景,键盘从来就不是选项:


一个八岁的孩子没法整段打字描述自己的情绪;一位正在做饭的家长腾不出手来打字指挥Agent;一个焦虑发作的人根本无法组织书面语。对他们来说,Agent 如果没有语音,就等于不存在。声音才是那扇最顺畅的门。


5eecdaf48460cde5d0e13a804b437e6722b3f2197de06f7975b8339e1c4c24831b75b38faadcd24bec177c308ebd530422cede56af8970cfeae8b3793d7b44b85c96f653d217df5fcd8400e65065c6c09a8d6a4c4812d6c04fb4c8ed7016461c.png


但语音只是门。真正拉开差别的是进门之后还能干什么。


哪怕是陪孩子聊天这种看起来"只需要说话"的场景也一样:聊到需要动手的地方——查一份资料、整理一段记录、生成一张图——同一个会话背后的沙箱会接着把它做完。语音负责把话说清楚,沙箱负责把语言之外的事办了。


再往远看一步。


Agent 的界面之所以一直是对话框,是因为过去人必须盯着盯着它每一步做对了没有,随时准备接手。对话框是一个监工的界面。


而当 Agent 真的能把一件多步骤的活自己干完,人需要的就不再是监工位,而是一个随时能开口、随时能把它叫住的入口。


这个入口最自然的形态,就是说话。


往回说一句实在的。对已经在用 QCA 的团队,这件事的意义不只是"我们的 Agent 会说话了"。


你花时间配好的模型、技能、工具和权限,本来只能通过一个输入框交付给你的用户。现在同一套东西,多了一种更接近人本能的交付方式——而你不需要为它重做一个 Agent。


04.png


现在就能用上


想直接体验: 进 Qoder Cloud Agents 控制台,切到 Forward Mode,打开一个 Agent 模板,顶上会有一个 Voice 标签。右边就是实时语音体验面板——点麦克风,直接开口说。


5eecdaf48460cde5d0e13a804b437e6722b3f2197de06f7975b8339e1c4c24831b75b38faadcd24bec177c308ebd5304e1f7719bb5f48788da894ed0baec6d572583c84d41de192f16fa879c7c36b22b8bf553aa1e7950854fb4c8ed7016461c.png


想接进自己的产品: 不必推倒重来。


从零搭一套能用的实时语音 Agent 不轻松:低延迟音频链路、双工打断、断线重连、还要在嘈杂环境里分清人声——这些都得自己啃,任何一环没调好,体验就崩了。这些我们已经做完了。你要做的只是打开一个开关。


你原来配好的那套东西——模型、技能、工具、MCP、环境、密钥、文件权限——语音直接复用,原有的 Agent 能力体系不用重建。同一个模板,长出两种入口需要文字的地方创建普通会话,需要语音的地方创建语音会话,两者各自独立、上下文互不串味。


协议上,语音和文字走同一条 WebSocket 全双工连接:语音走二进制帧,文字走结构化事件,打断和断线重连都在协议里,不用你自己在前端拼一套状态机。


我们把完整的接入示例开源了:github.com/QoderAI/forward-quickstart。克隆下来 npm install && npm run dev,本地就能跑通从创建身份、配模板、起语音会话到接实时事件的整条链路。(仓库里那个在线 Demo 出于安全考虑没有开语音中继,想体验语音,请走控制台或本地跑起来的 quickstart。)


5eecdaf48460cde5d0e13a804b437e6722b3f2197de06f7975b8339e1c4c24831b75b38faadcd24bec177c308ebd53045ff3cd67ab23014e4dcef5abdc62d53a65a1892f5bb17ceeeb06868f00cd61750f42bf367e2a77324fb4c8ed7016461c.png


Voice 当前处于 Beta,限时免费体验。


05.png


写在最后


回到开头那个场景。


事情在脑子里已经很清楚了。以前你要花三分钟把它翻译成一段书面指令,现在你只需要三秒钟,把它说出来。


省下的不是三分钟,是那些因为懒得打字而没发生的事


Qoder Cloud Agents 控制台已开放 Voice 配置,打开模板的 Voice 标签就能开始。现在是 Beta 限时免费体验的阶段,试错成本几乎为零。

目录
相关文章
|
18天前
|
人工智能 监控 安全
零代码改造:让 AI Agent Sandbox 不再是黑盒
OBI 基于 eBPF 在内核与库函数层零代码拦截通信,自动生成调用链与指标,内置 OpenAI、Anthropic、Gemini、Qwen 及自定义 LLM 网关的 GenAI 语义追踪,覆盖 LLM、工具、MCP 与 RAG 全链路,从性能、成本、安全三个维度透视沙箱执行。
|
1月前
|
Shell API 调度
DeepSeek Harness 一切皆插件:开源Agent框架强在哪,怎么装
DeepSeek Harness 开发者预览版 2026 年 8 月开源,口号"一切皆插件"。本文拆解插件化架构的 4 个好处,并带你跑通安装命令。
1451 3
DeepSeek Harness 一切皆插件:开源Agent框架强在哪,怎么装
|
7月前
|
人工智能 监控 安全
仅供学习:2026年AI量化交易革命:3步部署OpenClaw安装全自动股票交易skill实战指南(收益率5860%案例复刻)
2026年,AI Agent领域最震撼的突破来自OpenClaw(原Clawdbot)——这个能自主规划、执行任务的智能体,用50美元启动资金创造了48小时滚雪球至2980美元的奇迹,收益率高达5860%。其核心逻辑堪称教科书级:每10分钟扫描Polymarket近千个预测市场,交叉验证NOAA天气数据、体育伤病报告、加密货币链上情绪等多维度信息,捕捉8%以上的定价偏差,再通过凯利准则将单仓位严格控制在总资金6%以内,实现低风险高频套利。
6589 2
|
9月前
|
存储 人工智能 运维
云栖实录:重构可观测 - 打造大模型驱动的云监控 2.0 与 AIOps 新范式
大模型时代驱动智能运维变革,阿里云通过统一可观测平台、UModel数字孪生与AIOps Agent,实现数据、认知、决策的全链路升级,重构运维新范式。
1374 1
|
4天前
|
IDE 开发工具
额度再翻倍!每天 2000 Credits!
Qoder宣布9月17-19日每日额度升至2000 Credits!付费用户每天12:00可通过IDE/桌面端/CLI领取,专用于Sonus模型。额度当日有效、不累计、过期作废。
217 0
|
4天前
|
人工智能 运维 API
Qoder Cloud Agents 1.0发布
Qoder Cloud Agents 1.0 是一站式云端Harness托管平台,解决Agent“跑不稳、落不进业务、不敢上量”三大落地难题。支持多入口集成、企业级交付、多智能体协同与弹性调度,让开发者专注业务逻辑,快速实现从MVP到规模化生产的跨越。
114 1
|
5天前
|
IDE 开发工具
额度翻倍!还有四天
Qoder推出Sonus模型专属福利:9月16-19日,付费用户每日12:00可领1000 Credits,用于全球顶级Sonus模型——支持编程、长程任务、专业软件操作及公式表格处理。登录Qoder各端活动入口即可领取。
198 0
|
10天前
|
前端开发 IDE Android开发
Qoder 上新 Mobile Use,开始验证移动端应用
Computer Use 已经可以操作电脑,Browser Use 可以进入正在使用的浏览器。Qoder 推出 Mobile Use 插件(Beta),在安卓、鸿蒙与 iOS 上将代码修改接入真机或模拟器,完成运行、交互与结果确认。
173 1
|
13天前
|
安全 UED iOS开发
全新 Qoder 桌面端,现已支持移动端控制
Qoder移动端全新升级:支持手机语音发起任务,本地文件直连编码;实时跟进多线程任务,锁屏处理授权;图文/PDF/HTML/Markdown等产物手机直览;企业级安全管控,保障代码不外泄。效率与安全兼得。
157 0