阿里云百炼产品月报【2026年9月】

简介: 阿里云百炼本月重磅升级:Qwen3.8全模态实时模型上线,Token Plan取消周限额、新增Essential套餐及Agent Harness工具权益;Flow Agent预置模板即开即用,MCP广场上新46项服务,覆盖科研、金融、多媒体等场景;应用与Skill广场新增超30款模板及解决方案,控制台全面焕新,助力企业高效构建AI应用。

image@1x (2).jpg

💨本月核心内容速递:

  1. 本月新上 12 款模型:Qwen3.8 系列全模态与实时交互密集落地,GLM-5.3、DeepSeek-V4.1-Flash 同步上架,检索侧新增 Qwen3.7 重排与向量模型。
  2. Token Plan 取消周限额、按 30 天订阅周期统一计量,新增 Essential 套餐与 Agent Harness 工具权益。
  3. Flow Agent汇聚了多种预置模板,即开即用。MCP 广场上线多款MCP服务,涵盖多个场景。Skill广场新增精选技能包。
  4. 云栖大会百炼专场论坛直播回放上线,Wan3.0-Video 后付费 7 折延期至 10 月 31 日;主推新发布《阿里云百炼 Agent Studio 产品手册》,系统讲解企业级 Agent 全栈服务平台。

产品动态

Token Plan 升级

  • 取消周限额,不再设置 7 天额度限制,升级为每月统一使用。自订阅当日起向后延伸 30 天作为订阅周期,订阅周期内累计消耗达到套餐额度后暂停服务,需等待下一个订阅月后额度恢复。
  • Token Plan个人版新增 Essential套餐,适用于已完成入门验证、需稳定承接日常单智能体任务的开发者与创作者。当前每月仅需79元即可体验。
  • 新增Agent Harness工具权益与用量,覆盖搜索、网页解析、图像生成、语音处理、代码执行等12项Agent开发常用能力。上述工具均通过MCP标准协议开放,可直接接入到自有 Agent应用,无需逐项单独采购。
  • 新增对Managed Agent托管智能体、RAG知识库、Memory记忆库与Sandbox安全沙箱几项服务的支持,采取后付费调用方式,可享受88折优惠。详细可查看Harness 权益。👉立即订阅

Flow Agent-快速开始页案例更新

  • 首页汇聚了覆盖多种场景的预置模板,帮助用户零门槛快速创建自己的智能体,即开即用。👉立即体验

Skill广场上新

  • Skill技能广场新增精选技能包,通过Skill连接Agent的无限可能。👉立即体验

百炼控制台界面全新升级

  • 导航重构:信息架构更清晰,核心功能一步直达。
  • 流程优化:模型调用、应用编排等关键路径大幅简化,能力入口聚合,操作路径更短。
  • 视觉焕新:界面更简洁,降低视觉负担。👉立即体验

应用广场上新

  • 应用广场模块更新,超多应用由云市场提供,覆盖多种业务场景使用。👉立即体验

  • 本月新增33个应用模版,上线4个解决方案,1个场景化方案专区。
  • Salesforce on Alibaba Cloud专区:Salesforce on Alibaba Cloud MCP服务的场景化方案专区。
  • 通义演示文稿PPT:将上传的文档(支持 PDF、Word、Excel、Txt等)通过AI技术按照用户要求,自动进行内容理解与结构化、大纲生成、规划页面、填充内容、生成/采用配图、排版渲染,自动生成高质量的PPT演示文稿。
  • Pixso(企业版):一款在线设计协作工具,覆盖原型、UI/UX设计、交互、设计交付全流程,在国内率先实现矢量网格等新型图形算法,产品性能稳定出色,兼容Figma 、 Sketch 、 XD 、 Axure 等主流UI/UX设计工具。
  • boardmix博思白板(企业版):一款集思维导图、流程图、多种创意表达绘图工具于一体的数字化多人在线实时协作平台,聚焦多人协作下的场景解决方案,加快团队之间的信息流转,降低协作成本,提高业务效率,让您数字化实时协作更顺畅、表达更简明高效。
  • Dreamfly品牌营销创意平台-图像增强版:产品从艺术风格选择开始,以项目方式组织主题、人物、场景和连续镜头,支持真人与动漫媒介的品牌短片、社媒视频和故事化内容生产。团队可以从推荐风格开始,也可以自由创作,并在项目中切换或融合风格,使同一主题下的内容保持清晰、连续的视觉方向。

应用模板名称

应用能力

飞猪旅行

整合飞猪旅游和高德地图功能,交通票务、酒店住宿、景点玩乐、地图路径与行程生成五大能力,辅助用户规划旅行方案。

高德地图

基于高德 22 个 MCP 工具的出行洞察 Agent,覆盖三个能力维度:交通态势、客流画像、基础地图。

创意设计团队

提供从创意构思、视觉方案到图片生成与版式

优化的一站式设计能力,帮助非专业用户快速

完成高质量视觉作品。

金融数据分析

通过拖拽构建工作流,通过大模型、条件判断、循环批处理等节点配置,把 AI 输出固定为稳定可重跑的 SOP

全能专家

提供通用Agent能力,可理解复杂任务并自主规划、调用工具和执行多步骤流程,适用于办公、分析与内容创作等场景。

PPT设计

根据主题和素材自动完成演示文稿大纲、页面设计与内容排版,支持快速生成结构清晰、风格统一的专业PPT。

社媒图文创作

面向公众号及社交媒体提供选题策划、图文撰写、封面设计与风格优化,快速产出适配不同平台的优质内容。

影视短剧创作

覆盖短剧策划、剧本生成、分镜设计与视频制作流程,帮助创作者快速完成从故事构思到成片输出的全链路创作。

法律合同审查

面向法务与业务人员提供合同预审、条款核查、风险识别、类案检索及交易对手尽调,辅助生成结构化审查意见。

Vox 贴纸动画

将人物或商品素材转化为Vox风格贴纸动画,支持动作编排、镜头设计与视频生成,快速制作生动有趣的动态内容。

科研文献查找分析

面向科研人员提供文献检索、期刊全文获取与内容分析能力,帮助快速定位权威资料、提炼核心观点并形成研究参考。

音视频处理

提供音视频素材解析、转写、剪辑与格式处理能力,可快速提取重点内容、生成结构化脚本并辅助完成多媒体制作。

脱口秀制作

覆盖脱口秀选题、段子创作、结构编排与表达打磨,帮助创作者快速形成节奏完整、风格鲜明的演出内容。

皮克斯动画

将创意描述或人物素材转化为皮克斯风格动画画面,支持角色设定、场景生成与镜头表现,快速完成视觉创作。

跨境电商商品数据分析

面向跨境电商经营场景,整合市场、商品、竞品与销售数据,辅助识别增长机会并生成可执行的经营分析建议。

跨境电商达人数据分析

面向跨境电商达人营销场景,分析达人画像、内容表现与带货数据,辅助筛选优质达人、评估合作价值并优化投放策略。

品牌设计师

提供品牌视觉定义、资产生成与规范输出能力,辅助建立统一品牌形象、沉淀可复用资产并规范视觉应用标准。

创意海报设计师

提供创意海报主视觉设计与多尺寸物料批量生成能力,辅助快速产出高质量素材、统一投放风格并提升设计效率。

电商视觉设计师

提供商品主图、卖点图与详情图成套设计能力,辅助打造高转化页面、精准传递卖点并提升店铺视觉品质。

剧本与分镜专家

提供剧本撰写、镜头规划与分镜板生成能力,辅助高效完成从脚本到分镜的全流程、精准把控节奏并降低沟通成本。

全球化设计师

提供多语言文案翻译与地区适配版式修改能力,辅助产出本地化设计物料、跨文化视觉表达准确并提升多地区投放效率。

社媒内容设计师

提供社交媒体封面与连续图文直接生成能力,辅助快速产出风格多样的平台适配内容、精准匹配调性并提升生产效率。

手绘插画专家

提供261种手绘风格匹配推荐与插画直接生成能力,辅助快速获得风格精准的手绘作品、丰富视觉表达并降低定制门槛。

IP形象标志专家

提供将概念压缩为简洁可爱的小尺寸识别的IP形象设计能力,辅助快速产出高辨识度IP、降低设计门槛并建立独特视觉符号。

LOGO设计专家

提供从品牌策略到Logo资产、行业化VI系统与可编辑手册的分阶段设计能力,辅助系统构建品牌视觉体系并沉淀品牌规范。

包装设计专家

提供包装信息分面、平面视觉设计与概念样机生成能力,辅助高效产出平面稿与样机效果、控制版式并确保交付准确。

轻量海报设计师

提供围绕主视觉和信息层级直接生成单张海报图片能力,辅助快速产出文字准确、层级清晰的海报成品、降低修改成本。

内容创意设计专家

整合创意海报、电商视觉、社媒内容、手绘插画与剧本分镜五大核心能力,辅助快速产出即用型设计物料并提升创作效率。

品牌视觉设计专家

整合品牌设计、IP形象、全球化适配与构图视觉五大能力,辅助系统搭建品牌视觉体系、输出可复用资产维护统一规范。

Salesforce 客服质检

智能分析客服对话,适合管理者高效质检,提升服务质量与体验。

Salesforce 客服助理

智能辅助解答与工单处理,适合客服人员高效响应,提升接待效率。

Salesforce 客户潜力与销售计划

智能评估客户潜力并制定计划,适合销售人员精准拓客。

Salesforce 经营财报分析助理

智能解读财报数据,适合财务人员快速分析,辅助企业经营决策。

MCP广场上新

  • 本月共上线46个MCP服务,主要涉及学术科研检索、智能办公处理、金融风控合规、多媒体生成及企业信息查询等场景。

MCP模板名称

MCP能力

切问搜索

通过标准 MCP 协议,为各类 MCP 客户端提供快速论文检索与复杂研究问题的深度搜索能力,帮助 AI 获取相关学术文献、论文元数据和结构化检索结果,让科研资料发现更高效。

Crossref 文献检索 MCP

通过 MCP 查询 Crossref 文献元数据,支持题名、DOI 与关键词检索,帮助科研助手筛选文献、核对引用条目,快速获取论文标题、作者、期刊、发表时间等信息。

Europe PMC 文献检索 MCP

通过MCP为科研助手提供文献元数据查询,辅助筛选文献与核对引用。

Crossref DOI 查询 MCP

通过MCP为科研助手提供文献元数据查询,辅助筛选文献与核对引用。

Snowcite 题名检索 MCP

基于 MCP 协议为科研助手提供文献元数据检索能力,可快速查询学术文献基础信息,辅助文献筛选、参考文献核对与引文整理。对接公开学术数据源,支持文献标题检索,返回文献标题、作者、期刊、发表年份、DOI 等核心元数据;采用标准化 MCP 接入,实例独立认证隔离,调用链路稳定。面向科研人员、AI 科研助手场景,可嵌入大模型 Agent 流程,自动完成文献溯源、引用格式化校验,省去手动查文献、核对参考文献的重复工作,提升文献调研与论文撰写效率。

OpenAlex 论文元数据 MCP

OpenAlex 论文元数据,通过MCP为科研助手提供文献元数据查询,辅助筛选文献与核对引用。

灵汐科技快速图片识别

提供基于人工智能的图像识别和描 述功能,通过MCP 协议,可以轻松集成到各种AI 应用和工具中,从而轻松的将图像分析功能应用到业务中。

CyberCut 智能切片

智能切片(长转短)MCP功能将长视频拆解为吸引人的爆款短视频,三种切片模式可选: 1、故事精简:抽取片段,并重组为有完整故事线的新短片 2、片段直剪:直接抽取符合要求的片段,保持原始内容、顺序不变 3、保留原片:保留被选中的视频区间,直接导出成片 帮助内容团队复用视频素材,并将视频处理接入 AI 智能体工作流。

音乐搜索服务

面向 AI 应用、智能硬件及智能体提供正版音乐搜索、歌曲详情查询和播放资源获取能力,通过标准 MCP 服务快速接入百万级正版授权曲库。

HR员工健康体检AI方案&报价

基于 MCP 的全国企业员工体检方案比价服务,AI 覆盖 600+ 体检机构,按预算与健康诉求一键生成可落地的团检方案与报价,省时省钱、招标比价必用。

运营商在网时长

输入手机号码,查询该手机号的在网时长,返回时间区间。

运营商在网状态

查询手机号在网状态,返回有在网、在网不在用、停机、销号状态,可查询实时状态,准确率99.99%。

AI合同全能专家

AI合同全能专家是为企业法务、采购、风控、商务团队打造的 AI 合同审查 MCP 服务,通过 MCP 协议向大模型应用输出合同审查类、合同比对类、合同调整类等能力(具体能力以服务端实时 Tool 清单 list_tools 为准,能力清单随服务迭代持续扩展),帮助企业降低合同审查门槛、提升合同处理效率、减少人工疏漏风险。

Almond 终端 AI 大脑·视觉理解

Almond 视觉理解 MCP 面向连锁门店与现场作业,通过标准化工具将图片交由多模态视觉模型与场景规则分析,覆盖后厨规范、食品安全、前厅服务、客房与公区、车间规范、消防安全六类场景,输出分析摘要、关注项、未发现项、无法判断项及分析限制,帮助百炼智能体快速获得可核查的现场视觉理解能力。

视频生成

智能视频生成与编辑服务,支持文生视频、图生视频与视频编辑全流程操作。文生视频支持 9 种宽高比,最高 1080P 分辨率,时长最多15 秒可调;图生视频以首帧图像为基础,结合文本引导生成运动流畅的视频内容;视频编辑支持风格变换、局部替换与内容修改,可结合参考图实现精准控制。适用于短视频创作、广告素材制作、分镜预演、产品演示、内容风格化处理等多元场景。

语音合成

智能语音合成服务,内置 130 余种预置音色,覆盖社交陪伴、有声书、客服、新闻播报、短视频配音等场景;支持中文普通话及粤语、东北话等方言,同时覆盖英、日、韩等 16 种以上语言。适用于智能客服、有声内容生产、短视频配音、出海营销、语音助手等场景。

图像生成

图像生成与编辑服务,擅长复杂文本渲染、图文混合布局与真实质感表现。支持图像创作、局部元素编辑、风格转换、多图融合、视频首帧生成、参考生图等操作。单次可生成最多 6张图像,最高支持 2048×2048 分辨率。适用于电商素材制作、品牌视觉设计、社交媒体内容创作、视频分镜制作、创意风格探索等多元场景。

语音识别

智能语音识别服务,基于 FunASR 系列模型,支持长音频异步转写,支持中、英、日、韩等 30 种语言,覆盖 pcm/wav/mp3/aac 等主流音频格式。具备说话人分离、热词增强、语义断句、标点恢复、字级时间戳与敏感词过滤等能力。适用于智能客服、会议纪要生成、音视频内容转写、多语言翻译等场景。

代码解释器

执行 Python 代码的能力,可用于数学计算、数据分析处理等任务。

Waiy Browser Agent

一款基于 MCP 协议的云端浏览器自动化工具。它允许 AI 智能体通过自然语言指令,在安全隔离的云端沙箱中自动执行网页浏览、点击、填写和信息提取等操作。调用方无需在本地安装浏览器或维护运行环境,即可轻松实现复杂的网页自动化任务。

AIDBS-DMS Agent数据网关

面向 Agent 的安全数据访问入口。它通过标准 MCP 协议,将数据库元数据和用户已获授权的数据内容安全可控地提供给智能体使用。Agent 的每次访问都受到独立身份、Access Token、数据网关 ACL、脱敏策略、安全策略和审计机制约束,避免智能体绕过原有的数据权限体系。

慧选牛牛-全球科技新闻舆情驱动

通过对于科技新闻事件中涉及的公司识别,能够覆盖宽基指数和全量A股,满足面向二级市场的主被动投资。在全部科技新闻中有较大比重为美股新闻,通过分析这部分的新闻,进行映射A股对应的板块,个股,可以为量化投资模型提供补充信息,辅助投资决策。

慧选牛牛-企业全维度信息查询与风险洞察

提供覆盖工商注册、股东治理、经营动态、司法涉诉、税务风险、环保处罚、供应链上下游、资质认证及舆情监测等 20 余个维度的结构化企业情报查询能力,帮助用户快速完成企业背调、准入评估与风险洞察。

夸克-去手写&水印

面向教育、办公和内容处理场景的 AI 文档净化服务,自动识别图片主体并完成裁剪矫正,去除手写答案、批改痕迹、划痕及常见水印,尽量保留原有印刷文字、表格和背景版式,便于重新练习、录入或归档。

夸克-题目识别&切题

面向教培、出版和题库建设的 AI 题目识别服务,理解整页试卷版面,识别题号、题干、选项、公式和配图,并按题目边界切分为可管理的单题结果,适用于错题整理、批量录题、教辅数字化和题库资源生产。

夸克-格式转换

面向办公和档案电子化场景的文档格式转换服务,将图片或扫描文档转换为 Word、Excel 或 PDF,识别并还原标题、段落、表格、图片和印章等版式信息,支持多页文档处理,便于继续编辑、数据分析或固定版式归档。

夸克-OCR内容识别

面向企业文档电子化和信息录入的综合 OCR 服务,支持印刷文字、手写文字、表格、公式、多语种以及证照、票据、车辆、医疗和商品包装等场景,提供可读文本、版面结构或业务字段,便于检索、分析和系统录入。

网页解析

基于静态 HTML 解析技术,快速获取目标 URL 的网页正文内容并输出为 Markdown 格式。内置网页抓取与定向索引能力,无需二次查询,支持 PDF 文档解析。

夸克-扫描文件&图像增强

面向办公、教育、档案与创作场景的 AI 扫描增强服务,覆盖扫描文件、试卷与票据增强、去阴影去屏纹、合同整理、线稿提取、画质增强和文档去底色等能力,将拍摄图片处理为清晰、规整、便于归档与后续识别的电子文档。

分贝通差旅

将机票、酒店、火车等差旅能力封装为可被智能体自主调用的工具。智能体能够理解自然语言中的出行意图,自动提取时间、地点、人数和偏好,调用实时资源完成行程规划与查询推荐,并根据多轮对话持续调整结果,衔接后续预订、订单查询及退改签流程。

运营商空号检测

通过手机号码查询其在网活跃度,返回包括空号、实号、停机、库无、沉默号、风险号等状态。

恒生商智-投资研究工具

面向投资研究场景,提供行业分析、宏观指标追踪、ETF概况、资金流向等15个API接口,覆盖申万一级行业分析、互联互通ETF、宏观环境等多维度市场数据,支持投资研究决策与策略构建。

恒生商智-基金分析服务

聚焦基金产品池的漏斗式筛选场景,支持基于名称匹配、规模体量、历史业绩、费率结构及特定业务标签等多种结构化指标进行组合检索。提供基金诊断、收益分析、持仓透视、基金经理评价等28个API接口,赋能AI应用在海量产品货架中实现敏捷、精准的条件定位与结果召回。

恒生商智-理财规划引擎

提供智能理财规划能力,支持保险规划、养老规划、子女教育投资建议、财富诊断等6个API接口,帮助投资者制定科学的资产配置方案,支持客群匹配和个性化规划服务。

北大法宝-法律智能检索

为法律咨询、合规审查、类案研判等场景提供法规检索、案例检索与引用核验,帮助用户在海量法律数据中快速找到可核对、可引用的依据。

银行卡开户行查询

通过银行卡号查询该银行卡详细信息,包括卡名称、银行卡卡种、卡品牌、银行卡发卡行、编号以及归属地等信息,支持多种银行卡查询,同时可校验银行卡真伪; 实时查询,准确高效。

银行卡综合要素验证

接口包括银行卡二要素鉴权、银行卡三要素鉴权及银行卡四要素鉴权,可根据需求选择使用,只需一次对接,银行卡全能校验。直连银联,权威核验,同时返回对应银行卡相关信息:卡名称、卡类型、银行名称等。

失信被执行人信息查询

查询个人失信被执行详细信息,包括主体名称,法院名称、案件状态,执行标的、案号、法定代表人、执行文号、发布日期、执行情况等。直连官方,实时查询。

手机在网状态查询

传入手机号码,查询该手机号的在网状态,返回内容有正常使用、停机、在网但不可用、不在网(销号/未启用/异常)、预销户等多种状态,支持携号转网号码查询。

Waiy Browser Agent

用自然语言操作云端隔离浏览器,完成网页浏览、点击填写、信息提取。调用方不用在本地装浏览器。

票据文件解析与格式转换

面向企业财务材料预处理,接收 OFD、PDF、PNG、JPEG 等票据文件的 HTTPS 地址,返回格式、页数与结构检查、OFD 基础解析、格式转换、指定页拆分、顺序合并及短时下载地址。转换、拆页、合并按成功输出页计量,OFD 解析按成功文件计量;检查、查询、下载、失败、超时和幂等重试不重复收费。多页文件按页处理并保持顺序;超大单页文件可能受处理上限约束,将返回明确错误提示。

万方文献检索

万方文献检索 MCP 服务是基于 MCP(模型上下文协议)标准封装的学术文献检索工具,为 AI Agent、科研助手、知识检索系统等场景提供统一的 API 调用能力。本服务连接万方数据开放文献检索平台,整合3亿+条全球优质学术资源,涵盖期刊论文、学位论文、会议论文、专利、标准、法规、科技成果等12类文献资源类型。通过 MCP 标准协议,开发者可在阿里云百炼平台上5分钟快速完成部署,无需管理资源和运维,即可让大模型具备专业的学术文献检索能力。

万方期刊全文

万方数据文献获取MCP服务基于MCP标准协议封装,专为学术文献的检索与获取而设计,能够为AI Agent、科研助手、知识检索系统等应用场景提供统一的API调用接口。服务聚焦于期刊论文类型,并具备三大核心能力:文献关键词检索、文献详情获取,以及基于语义的全文向量检索。同时,服务已与阿里云百炼平台完成无缝集成,开发者可通过一键部署,使大模型快速获得专业、高效的学术文献发现与获取能力。

玄瞳AI_快消行业图片识别处理

玄瞳AI快消行业图像识别处理,主要聚焦于计算机视觉领域,通过物体检测、图像分类、图像处理,提高人员工作效率、费用投放真实性转化率,降低图像数据审核成本,解决数据虚假问题,为企业实现智能化转型。

企业工商信息查询

传入公司名全称/注册号/社会统一信用代码中的任意一种,即可查询企业工商相关信息。返回企业信息,包括法人、注册资本、信用代码、登记机关、经营状态、电话号码等。

发票查验与⻛险核验

面向财务共享、费控、应付和审计团队,提供发票真伪核验、发票状态检测、全票面信息核对和批量查验能力。支持增值税普通发票、增值税专用发票、电子发票(普通/专用)、全面数字化电子发票、通行费、机动车、二手车及铁路、航空电子客票。可提交单张或 1–100 张发票,获得查验状态、发票状态预警、号码/日期/金额等字段差异和失败原因;批量任务按页回读,结果可导出四种格式留存。支持 HTTPS 文件、标准发票记录或查验字段输入,便于接入报销、应付和审计流程。数据源超时或不可用时返回对应状态,方便人工跟进。

能力下线

  • 阿里云百炼平台对产品架构进行了全面升级。原Agent1.0中的"长期记忆"核心能力已全面整合至全新的"记忆库"模块中。原Agent1.0中的"长期记忆"能力 将于2027年3月11日进行下线处理。具体信息可查看公告。

模型动态

💥本月上线了涵盖Qwen3.8全模态实时交互、GLM-5.3及DeepSeek-V4.1等前沿大模型,以及HappyOyster-1.0游戏引擎和多项专业向量检索工具在内的多款重磅模型。可查看下方表格。

模型类型

上架时间

模型规格

功能说明

决策模型

2026-09-24

Decision-Model-Preview

面向高频业务判断的结构化决策模型,可根据文本或业务状态并行完成分类、是非判断与评分,并返回概率分布和置信度,适用于工单分流、内容审核、智能体路由与结果校验等场景。

实时全模态

2026-09-21

Qwen3.8-Omni-Flash-Realtime

面向智能硬件、机器人与实时交互 Agent。支持多通道音频输入与多种通道布局,支持 60+ 语言音频输入和 30+ 语言语音输出;工具侧支持 Function Call 与 MCP 服务接入,具备工具发现、调用审批与结果续轮的完整事件链。可以在高速实时响应的同时,编排复杂业务逻辑和支持上百个工具的调用,同时拥有生动、多样的声音生成能力。

实时语音对话

2026-09-20

Qwen-Audio-3.1-Realtime-Plus

新一代实时全双工语音大模型,进一步增强口语推理、多轮指令遵循、共情表达与角色扮演能力,兼顾智能应答与自然对话节奏。模型优化噪声拒识、多人对话理解与动态语义感知,让开放场景下的打断、等待与接话更自然;支持多语言交流与智能工具调用,可连接知识库及业务系统,将任务执行结果自然融入对话。同时强化安全拒答与边界控制,为智能客服、办公协作、语音陪伴等应用提供更智能、自然、可靠的交互体验

世界模型

9月18日

HappyOyster-1.0-Adventure

HappyOyster Adventure 是实时交互、可探索互动的开放式世界模型。基于多模态(文本/图像)输入即可生成的世界场景,通过实时交互、位移和镜头控制进行沉浸式无边探索。

实时音视频同传

9月18日

Qwen3.8-Livetranslate-Flash-Realtime

Qwen3.8-LiveTranslate-Flash的实时版本,一款高精度、高响应、高鲁棒性的多语言实时音视频同传大模型。依托Qwen-Omni强大的基座能力、海量多模态数据、跨语言跨模态对齐和视觉增强等技术,通义千问3.8-LiveTranslate-Flash 实现了离线和实时两种音视频翻译能力,能听懂60种语言,会说29种语言。

实时语音合成

9月18日

Qwen-Audio-3.1-TTS-Flash

Qwen-Audio-3.1-TTS-Flash是面向实时交互场景的高性能语音合成大模型,支持多种语言和方言。该模型具有free-style指令遵循能力和细粒度标签控制能力,可更灵活地控制情绪、语气、角色、语速、音量等表达方式。同时,模型在声音复刻场景中,对于噪声、混响等复杂声学条件下具备更强鲁棒性,提升了音质、清晰度和整体表现力。Flash 版本重点优化实时合成体验,适用于语音助手、实时对话、智能客服等低延迟交互场景。

全模态

9月17日

Qwen3.8-Omni-Flash

Qwen3.8-Omni-Flash 支持文本、图片、音频和视频输入及文本输出,支持思考与非思考模式、Function Calling、联网搜索和上下文缓存,适用于音视频理解、多模态分析和智能体应用。

文本生成、深度思考

9月16日

GLM-5.3

GLM-5.3 是智谱最新旗舰大语言模型,编程与智能体能力全面进阶,达开源模型 SOTA 水平,内部编程基准较上代提升 50%,可端到端交付生产级成果。涌现网络安全能力,漏洞发现基准 CyberGym 创当前最佳。支持 1M 上下文、128K 输出与三档深度思考,胜任长程复杂任务。

文本生成、深度思考

9月13日

DeepSeek-V4.1-Flash

轻量旗舰模型,以 552B 总参数 MoE 实现越级智能,采用 Causal Encoder-Decoder 非对称架构,输入激活仅 8B、输出激活 16B,并具备原生多模态视觉理解能力。KV Cache 压缩至上一代 HBM 的 1/4、SSD 的 1/8,显著降低长上下文与 Agent 任务成本。支持 1M 上下文与 384K 最大输出,兼顾高吞吐、低延迟与极致性价比。

文本生成、深度思考、视觉理解

2026-09-02

Qwen3.8-Max-0902

Qwen3.8-Max-0902(别名qwen3.8-max-2026-09-02)是qwen3.8-max的快照版本。编码深度再突破,可驾驭更复杂的工程级项目与长程自主开发;协作智能体能力显著增强,在多工具调度与端到端交付中表现更从容;视觉理解全面精进,图表推理、文档解析与多模态感知更敏锐准确。延续 100 万上下文、思考模式与完整工具生态,在更高智能水平上持续进化。Qwen3.8-Max升级通知

排序模型

2026-09-01

Qwen3.7-Text-Rerank

基于Qwen3.7底座训练的多语言通用文本重排序模型。相较qwen3-rerank,在通用与Web检索、代码检索、指令遵循、Agentic与Memory检索等方面大幅提升;在MTEB、websearch等评测任务上均取得更优效果,其中websearch相对提升约35%。

文本向量

2026-09-01

Qwen3.7-Text-Embedding-Flash

基于Qwen3.7训练的轻量级多语言文本向量模型,面向成本和吞吐敏感场景。相较text-embedding-v4,在多语言覆盖(100到201种)、长文本处理(32K到128K)和Sparse Embedding等能力上大幅升级;在语义、跨语言及代码检索评测上整体效果基本持平,其中AIRBench-zh提升约3%。

最新活动

  • 云栖大会-从Model到 Token:阿里云百炼模型服务的技术创新、规模服务与行业实践直播回放。👉立即观看
  • 云栖大会-企业级Agent基础设施,加速业务转型与落地直播回放。👉立即观看
  • Wan3.0-Video模型限时后付费7折优惠,活动时间延期到2026年10月31日。👉立即体验
  • Token Plan 个人版 Quick Start,一份订阅,让 AI 编程与多模态创作开箱即用:33 个真实玩法抄作业| 主流 AI 工具直接接入| Credits 统一计量。👉立即订阅
  • Token Plan 组合购焕新,限时68元起!QoderCN、轻量应用服务器、无影云电脑任选搭配,token管够,全速开工。👉立即购买

精选好文

相关文章
|
16天前
|
人工智能 JSON API
全网刷屏的 Jev 模型正式开放!一手实战测评 + 保姆级教程
全网爆火的 Jev 模型是什么?有什么用?怎么使用?怎么接入 AI 编程工具?效果真的好么?傻子可懂的 Jev 保姆级实战教程 + 项目实战测评来啦
8425 20
|
15天前
|
人工智能 并行计算 PyTorch
秋叶 ComfyUI 2026 整合包 v3.2 完整部署教程:Python 3.13 + Torch 2.13 全栈升级
秋叶aaaki ComfyUI 2026年8月整合包v3.2正式发布!全面升级Python 3.13.11、PyTorch 2.13.0+cu130及ComfyUI v0.30.2,原生支持MiniMax H3、Wan 2.2、Qwen-Image-2.1等2026主流音视频/图像模型,解压即用,无需环境配置。
2714 14
|
15天前
|
人工智能 测试技术 API
最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透!
Jev是TypeSafe AI推出的“系统一模型”,不生成文本,专做毫秒级结构化决策:Choice(多选)、Score(打分)、Noul(是非概率)。响应快193倍、成本低444倍,适合工单路由、内容审核、测试定级等高频判断场景。
1976 4
最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透!
|
13天前
|
人工智能 编解码 并行计算
MiniMax-H3 一键整合包技术文档:8G 显存运行 AI 漫剧制作 —— 角色替换 / 动作迁移 / 文图生视频部署与调参指南
MiniMax H3 是 MiniMax 开源的全模态视频生成模型,支持文/图/音/视多条件输入,输出最高2K、15秒带双声道音频视频。本文档详述其Int8量化版在8GB显存下的本地一键部署、三段式工作流(EDIT/REPLACE/CONTINUE)、参数调优及常见问题排查。(239字)
|
9天前
|
人工智能 Linux 开发者
【2026国内使用】Codex安装过程一篇讲透(Win/Mac/Linux全支持)
Codex是OpenAI推出的AI编程智能体,可读取本地项目、理解需求并自动修改代码。支持桌面GUI、命令行(CLI)及VS Code/Cursor插件三种形态,覆盖可视化操作、终端高效开发与编辑器无缝集成场景,助开发者用自然语言驱动编码全流程。(239字)
【2026国内使用】Codex安装过程一篇讲透(Win/Mac/Linux全支持)
|
4天前
|
人工智能 JSON Linux
【全网最详细】ComfyUI使用教程:下载+本地部署+配置+工作流搭建一篇搞定(2026最新版)
ComfyUI是一款免费开源的本地AI绘图工具,采用节点式工作流设计,支持文生图、图生图、局部重绘、放大、换脸等多种功能。可离线运行,依赖显卡加速,无需联网。支持自定义流程保存与分享,插件生态丰富,适合进阶用户。(239字)
|
9天前
|
人工智能 JSON 编解码
【2026最新版】ComfyUI本地部署教程,新手也能看懂!
ComfyUI是本地运行的AI绘画工具,采用节点式工作流设计:通过拖拽连接“加载模型”“提示词编码”“采样”“解码”等模块,实现高度可控的文生图。新手推荐使用秋叶整合包,一键启动、内置模型管理与插件安装器,轻松上手。(239字)

热门文章

最新文章