动动嘴就能编程!阿里云千问Qwen3.5-Omni发布:全模态全球最强,支持113种语言,免费体验

简介: 阿里云发布全模态大模型Qwen3.5-Omni官网:https://t.aliyun.com/U/JbblVp 测试全球第一,支持113种语言识别与36种语音合成,首创“音视频Vibe Coding”——对镜头口述需求即可生成APP/网页/游戏代码。免费开放体验,开发者可通过阿里云百炼调用API。

刚刚,阿里云千问家族迎来新成员——Qwen3.5-Omni全模态大模型正式亮相。它在215项任务中拿下全球第一,能听懂113种语言和方言,甚至对着镜头说需求就能自动生成APP、网页、游戏代码。目前普通用户可免费体验,开发者可通过阿里云百炼调用API,阿里云百炼平台:https://www.aliyun.com/product/bailian  

阿里云百炼AI大模型平台.png

一、全模态王者:215项测试拿下SOTA

Qwen3.5-Omni采用混合注意力MoE架构,在海量文本、图像以及超过1亿小时的音视频数据上进行了原生多模态预训练。它支持图片、视频、语音、文字的全模态输入与输出。

在音视频理解、跨模态推理、智能体等215项第三方性能测试中,Qwen3.5-Omni全部取得SOTA(性能最佳),被评价为“目前全球最强的全模态大模型之一”。

关键对比数据:

  • DailyOmni、QualcommInteractive等视听交互测试:得分大幅领先Google Gemini-3.1 Pro
  • WenetSpeech嘈杂环境语音识别:错误率远低于Gemini
  • Multi-Lingual (30种语言) 语音生成质量:显著优于Gemini-2.5-Pro-TTS


关于Qwen3.5-Omni的详细介绍,请移步到阿里云通义大模型平台查看:https://www.aliyun.com/product/tongyi  如下图:

千问大模型.png

二、听懂113种语言,实时交互像真人

Qwen3.5-Omni支持113种语言及方言的语音识别,以及36种语言及方言的语音生成。就连使用人数不足百万的毛利语海南话,也能精准识别。

实时交互体验大幅升级:

  • 能高情商理解用户对话意图,区分有效回应与随口附和
  • 可根据指令自由调节语音、语调
  • 基于ARIA技术,生成语音更自然、稳定
  • 面对实时提问(如“今天天气怎样”),能自主调用工具获取最新信息

三、音视频Vibe Coding:动动嘴就能编程

这是最令人惊喜的能力。与纯文本或图片驱动的Vibe Coding不同,千问实现了音视频编程

打开摄像头,对着草图口述需求——哪怕包含复杂的产品逻辑——模型就能直接生成带有复杂UI的产品原型界面、网页、甚至小游戏。

这一能力并非刻意设计,而是模型在原生多模态能力持续扩展中自然涌现的结果。从此,“动动嘴即可编程”成为现实。

四、超长音频+画面校对,专业生产力工具

Qwen3.5-Omni能对视频中的画面主体、人物关系、对话逻辑、情绪起伏进行极致拆解,自动完成视频章节切片与时间戳标注。

  • 支持超过10小时的音频输入
  • 繁琐的视频后期梳理工作缩短至秒级
  • 大幅降低内容管理成本,适用于视频创作、内容审核等场景

五、如何体验与调用

  • 普通用户:前往 Qwen Chat 免费体验
  • 开发者和企业:通过阿里云百炼平台调用Qwen3.5-Omni模型的三种API版本:
  • Plus:高性能版
  • Flash:轻量快速版
  • Light:超低成本版

总结:Qwen3.5-Omni不仅刷新了全模态大模型的天花板,更用“音视频编程”打开了人机协作的新想象空间。无论是个人开发者想尝鲜,还是企业需要落地音视频理解、自动编程、多语言交互,现在都可以零门槛上手。更多关于阿里云千问Qwen3.5-Omni的介绍、调用及使用,请移步到阿里云百炼官方平台查看:https://www.aliyun.com/product/bailian  

目录
相关文章
|
人工智能 芯片
通义千问上新,可一键免费解析超万页文档、速读百份文档
通义千问上新,可一键免费解析超万页文档、速读百份文档
3530 0
|
6月前
|
机器学习/深度学习 人工智能 自然语言处理
以小胜大!千问Qwen3.5重磅发布,每百万Token仅0.8元
阿里巴巴开源全新一代千问Qwen3.5-Plus:全球最强开源大模型,3970亿参数、仅激活170亿,原生多模态,支持图文视频理解与长视频分析;推理吞吐量最高提升19倍,API价格低至0.8元/百万Token。
以小胜大!千问Qwen3.5重磅发布,每百万Token仅0.8元
|
26天前
|
人工智能 自然语言处理 API
阿里云千问Qwen3.5-Omni:原生全模态大模型核心功能全解析
在通用人工智能向全模态感知演进的关键阶段,阿里云千问推出的Qwen3.5-Omni,凭借原生端到端全模态架构、顶尖的音视频理解能力与丰富的交互特性,成为全模态大模型领域的标杆产品。该模型彻底打破文本、图像、音频、视频的模态壁垒,实现“看、听、说、读、思”一体化感知,在215项音频与音视频任务中斩获SOTA成绩,全面对标并部分超越国际顶尖模型,同时提供Plus、Flash、Light三种尺寸版本,适配从高性能推理到低延迟实时交互的全场景需求。本文将从核心架构、基础能力、进阶功能、API调用、应用场景五大维度,全面解析Qwen3.5-Omni的功能特性,帮助开发者与企业用户快速掌握其核心价值与落地
296 2
|
1月前
|
人工智能 自然语言处理 人机交互
最新版阿里云千问 Qwen3.5-Omni 功能介绍
在大模型技术迈入全模态原生交互的2026年,传统图文单模态模型的短板日益凸显,普遍存在音视频理解薄弱、实时交互生硬、多场景融合能力不足、无法适配视听指令开发等问题,难以满足实时对话、视频解析、音频翻译、视听编程等前沿AI应用需求。阿里云百炼重磅迭代**通义千问Qwen3.5-Omni原生全模态大模型**,作为千问系列主打全场景视听融合、实时智能交互、跨模态协同的旗舰级模型,凭借全新Thinker-Talker双架构设计、混合注意力专家机制,在215项第三方权威测试中斩获SOTA最优成绩,多项能力超越国际主流模型,成为当前全球综合实力顶尖的全模态AI模型。本文将全方位详解新版Qwen3.5-Om
406 0
|
5月前
|
人工智能 JavaScript API
OpenClaw(龙虾AI)零门槛实操手册:最新阿里云+本地部署、千问API适配与避坑指南
2026年,OpenClaw(曾用名Clawdbot、Moltbot,因Logo酷似小龙虾被网友亲切称为“小龙虾”)已成为现象级开源AI智能体平台,GitHub星标数量突破18.6万。其“本地优先”的架构设计与插件化扩展能力,让普通用户无需专业技术背景,即可通过自然语言指令实现任务自动化、多工具协同、数据处理等复杂需求,真正构建“能听懂、会执行”的专属数字助理。
886 0
|
8月前
|
人工智能 自然语言处理 文字识别
Qwen3-Omni新升级:声形意合,令出智随!
Qwen3-Omni-Flash-2025-12-01是全新升级的全模态大模型,支持文本、图像、音频、视频输入,实现自然语音与文本同步输出。全面优化音视频理解与生成,支持多轮流畅对话、自定义人设与系统指令,提升多语言及跨模态交互准确性,语音更拟人,图像视频理解更深入,打造“声形意合”的智能交互体验。(239字)
1045 0
|
4月前
|
人工智能 运维 安全
阿里云Qwen3.6-27B是什么?阿里云Qwen3.6-27B 解析:稠密架构、百万上下文与企业级部署
阿里云Qwen3.6-27B是通义千问团队推出的一款**270亿参数稠密型多模态大语言模型**,以“小参数、强性能”为核心定位,在编程能力、长文本处理、多模态理解与智能体执行等方面实现突破性表现,是面向开发者与企业的新一代开源旗舰模型。该模型采用Apache 2.0开源协议,支持完全商用、本地部署与二次开发,凭借稠密架构的简洁性、百万级上下文能力与媲美千亿模型的智能体表现,成为当前开源社区的热门选择。以下从技术架构、核心能力、性能表现、部署方式与应用场景等维度,全面解析Qwen3.6-27B的全貌。
3966 3

热门文章

最新文章