Qwen3.8-Flash 上线千问AI平台:全新架构,迈向极致性价比

简介: Qwen3.8-Flash 现已上线千问AI平台,默认提供 100 万 token 上下文并内置官方工具,每 token 仅激活 6B 参数,适合高并发应用、工具驱动的工作流以及编程与协同办公助手。

2026-08-26模型发布

Qwen3.8-Flash 上线千问AI平台:全新架构,迈向极致性价比

一、概览

Qwen3.8-Flash 现已上线千问AI平台,模型名称为 qwen3.8-flash,可直接通过 API 调用。它默认提供 1,000,000 token 上下文并内置官方工具,在能力、延迟和成本之间取得了较好的平衡,适用于高并发应用、工具驱动的工作流,以及编程与协同办公助手。

该模型的主模型参数量为 125B,额外配备 51B 的 N-gram Embedding,每 token 激活 6B 参数。相比于 Qwen3.7-Plus,其训练开销仅约为前者的 1/9,同时在编码和办公任务上具有更强的能力。

模型所采用的新架构以 Qwen3.8-Flash-Next 的形式同步发布开源权重,作为 Qwen4 所用模型结构的先导预览,围绕 Attention、Residual、Embedding 和 Optimization 四个方面对模型做了系统升级。完整技术介绍见 Qwen3.8-Flash-Next:全新架构,迈向极致性价比

Qwen3.8-Flash 正式发布

二、模型详情

Qwen3.8-Flash:面向高并发与智能体场景的高性价比模型

Qwen3.8-Flash 是 Qwen3.8-Flash-Next 架构的生产版本,在千问AI平台上以 1M 上下文与内置官方工具的形态提供服务。它同时支持文本与图像输入,具备思考模式与可调的推理强度,可直接用于长文档处理、多轮工具调用和跨应用的智能体任务。

极致稀疏的 MoE 设计让它在保持较大专家池的同时,每 token 只路由少量专家,因此在高并发场景下仍能维持较低的调用成本与延迟;GDN 与 QSA 组合的注意力结构则让它在长上下文下的吞吐随上下文增长仍保持优势。

模型详情:Qwen3.8-Flash

三、核心参数

项目 取值
模型名称 qwen3.8-flash
上下文长度 1,000,000 token(默认)
输入模态 文本、图像
输出模态 文本
思考模式 支持,通过 enable_thinking 开启
推理强度 reasoning_effort 支持 xhighmediumlow
接口协议 兼容 OpenAI 的 Chat Completions 与 Responses API,以及兼容 Anthropic 的接口
工具调用 支持并行工具调用,内置官方工具

最新的参数与调用限制以模型详情页为准。

四、模型能力与评测

以下评测结果为 Qwen3.8-Flash-Next 的公开评测数据,千问AI平台提供的 Qwen3.8-Flash 与其同源。完整评测设置与脚注见 Qwen3.8-Flash-Next 技术介绍

编程与智能体任务

在智能体编程、仓库级代码生成、长周期办公与真实工具使用等任务上,模型在多项基准上取得了同规模激活参数下的领先结果,其中 DeepSWE 1.1、SWE-bench Pro、SWE-bench Multilingual、CoWorkBench、JobBench 与 Toolathlon Verified 均优于 Qwen3.7-Plus。

任务 Qwen3.8-Flash-Next Qwen3.8-27B Qwen3.7-Plus DeepSeek-V4-Flash-0731 Claude-Opus-4.6 (Max)
智能体编程 DeepSWE 1.1 58.7 42.2 16.5 54.4 --
智能体编程 SWE-bench Pro 62.5 61.7 55.8 56.0 53.4
多语言软件工程 SWE-bench Multilingual 81.0 73.8 75.8 -- 77.5
仓库级代码生成 NL2Repo-Bench 48.1 42.3 41.1 54.2 47.6
长周期办公 CoWorkBench 73.9 70.7 65.1 45.1 68.2
专业岗位任务 JobBench 55.7 33.4 27.6 41.3 36.6
前沿智能体任务 Agents' Last Exam Pass@1 24.3 / Score 51.2 Pass@1 20.4 / Score 42.9 Pass@1 13.2 / Score 33.6 Pass@1 25.2 / Score -- --
真实工具使用 Toolathlon Verified (Pass@1) 73.5 67.1 50.6 70.3 --
指令遵循 IFBench 81.3 79.5 79.1 79.2 62.5
科学推理 GPQA Diamond 91.7 89.2 90.3 90.8 91.3
跨学科推理 HLE 35.9 30.8 34.7 33.8 40.0
竞赛编程 LiveCodeBench v6 91.9 90.3 89.6 90.6 88.8

DeepSWE 1.1、SWE-bench Pro、SWE-bench Multilingual 使用 Claude Code 与 mini-SWE-agent 评测框架,temp=1.0、top_p=0.95、上下文窗口 256K;CoWorkBench 为内部长周期办公与生产力智能体基准;HLE 由 GPT-4o 评判;空白单元格(--)表示分数尚不可用或不适用。

多模态理解与界面操作

在多模态工具使用、应用复现、移动端与桌面操作、视觉网页开发等任务上,模型相比 Qwen3.7-Plus 有明显提升,尤其在 OSWorld 2.0 与 Vision2Web 上差距较大。

任务 Qwen3.8-Flash-Next Qwen3.8-27B Qwen3.7-Plus Claude-Opus-4.6 (Max)
多模态工具使用 ClawEval-MM Pass@3 64.4 / 均分 60.4 Pass@3 57.4 / 均分 56.9 Pass@3 57.4 / 均分 60.1 Pass@3 52.5 / 均分 54.7
应用复现 RecreationBench 49.9 47.1 30.2 --
移动端操作 AndroidWorld 84.5 81.9 81.0 62.0
桌面操作 OSWorld 2.0 Binary 19.4 / Partial 52.3 Binary 19.4 / Partial 48.0 Binary 2.8 / Partial 21.5 --
视觉网页开发 Vision2Web 64.0 62.9 42.1 --
具身智能 ERQA 72.3 65.5 69.8 40.8
长视频理解 LVBench 76.6 72.4 76.2 63.0
真实世界感知 RealWorldQA 88.5 85.9 86.9 73.9
视觉数学 MathVision 不含 CI 90.6 / 含 CI 95.7 不含 CI 90.0 / 含 CI 94.6 不含 CI 90.3 / 含 CI 88.7 不含 CI 65.5
科学图表分析 CharXiv (RQ) 不含 CI 84.6 / 含 CI 90.6 不含 CI 83.7 / 含 CI 90.2 不含 CI 85.8 / 含 CI 85.9 不含 CI 66.0

ClawEval-MM 以「pass@3 / 平均分」给出;OSWorld 2.0 以「binary / partial」给出;Vision2Web 取 frontend、webpage 与 website 三类平均;MathVision 与 CharXiv (RQ) 以「不含 CI / 含 CI」给出;空白单元格(--)表示分数尚不可用或不适用。

在 6B 激活参数下,其 Base 模型在 14 个预训练基准中的 8 个上取得最优结果,包括 MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM 与 MMMLU。

五、架构升级

Qwen3.8-Flash-Next 模型结构

Attention:GDN + QSA,高效记忆与精准检索

模型采用 Gated DeltaNet(GDN)与全局 Attention 的 Hybrid 架构:每四层中三层使用 GDN,将历史信息持续压缩到固定大小的状态中;另一层保留全局 Attention,负责精确检索全局信息。

全局 Attention 进一步引入 Qwen Sparse Attention(QSA)。轻量 indexer 先把序列聚合成 micro-block,在 block 粒度上估计上下文重要性,再选出最相关的区域执行 Attention,既减少了实际 Attention 的计算量,也显著降低了「寻找重要上下文」本身的 indexing 成本。可以简单理解为:GDN 负责高效「记住」,QSA 负责精准「查找」。

QSA 结构示意

在 1M token 上,QSA 的 Attention Kernel 在 Prefill 和 Decode 阶段分别实现最高 7.6× 和 4.9× 的加速;在 90% Cache 命中率下,相对 Prefill 吞吐随上下文长度增长显著提升,在 1M context 下达到 Qwen3.7-Plus 的 8.6×。

相对 Prefill 吞吐随上下文长度的变化

Gated Residual:给信息更多传递路径

Gated Residual(GR)把原本单一的 residual stream 扩展成 4 条并行分支,模型可以根据当前内容动态决定从不同分支读取多少信息、向不同分支写入多少信息。相当于把一条信息通道扩展成多条车道:有些分支负责局部信息传递,有些则可以把早期信息直接保留到很深的网络层。归一化后的 Gate 同时能够抑制 activation outlier、提升训练稳定性,Residual State 还支持使用 FP8 存储以降低访存开销。

N-gram Embedding:低成本扩展模型容量

普通 Embedding 根据单个 token 查表,N-gram Embedding 则结合当前 token 与前几个 token 组成的局部上下文进行查表,为常见短语和局部模式提供额外表示,可以在几乎不增加每 token 计算量的前提下增加大量参数。模型额外引入了 51B N-gram Embedding 参数;由于查询位置可以提前确定,这些参数可以存放在 Host Memory 中,通过异步 Prefetch 与模型计算重叠,无需长期占用 GPU 显存。

Optimization:架构与优化协同设计

模型使用 Muon Optimizer 训练,并围绕正交化精度、Muon 与 AdamW 的参数分工,以及融合参数矩阵的拆分做了针对性优化:Attention、GDN 和 MoE Expert 中的主要权重使用 Muon,Embedding、MoE Router、GR 低秩参数等继续使用 AdamW;工程实现中融合存储的 QKV、SwiGLU 和 GDN Projection 先按实际对应的独立线性变换拆分,再分别执行正交化。针对新架构重新拟合 Scaling Law 后,模型可以稳定使用更大的 Learning Rate 和 Batch Size。

六、开发接入

API 调用

千问AI平台支持行业标准协议,包括兼容 OpenAI 的 Chat Completions 和 Responses API,以及兼容 Anthropic 的接口。API Key 可在千问AI平台获取。

01"""

02Environment variables:

03  DASHSCOPE\_API\_KEY: Your API Key from https://platform.qianwenai.com/home

04  DASHSCOPE\_BASE\_URL: (optional) Base URL for compatible-mode API.

05    - Beijing: https://dashscope.aliyuncs.com/compatible-mode/v1

06"""

07from openai import OpenAI

08import os

09

10api\_key \= os.environ.get("DASHSCOPE\_API\_KEY")

11if not api\_key:

12    raise ValueError(

13        "DASHSCOPE\_API\_KEY is required. "

14        "Set it via: export DASHSCOPE\_API\_KEY='your-api-key'"

15    )

16

17client \= OpenAI(

18    api\_key\=api\_key,

19    base\_url\=os.environ.get(

20        "DASHSCOPE\_BASE\_URL",

21        "https://dashscope.aliyuncs.com/compatible-mode/v1",

22    ),

23)

24

25messages \= \[{
   "role": "user", "content": "Write a Python function to merge two sorted linked lists."}\]

26

27completion \= client.chat.completions.create(

28    model\="qwen3.8-flash",

29    messages\=messages,

30    extra\_body\={
   

31        "enable\_thinking": True,

32    },

33    reasoning\_effort\="xhigh",  \# supported levels are xhigh, medium, and low

34    stream\=True,

35)

36

37for chunk in completion:

38    if not chunk.choices:

39        continue

40    delta \= chunk.choices\[0\].delta

41    if getattr(delta, "reasoning\_content", None):

42        print(delta.reasoning\_content, end\="", flush\=True)

43    if getattr(delta, "content", None):

44        print(delta.content, end\="", flush\=True)

智能体框架与编程助手

Qwen3.8-Flash 可直接接入主流智能体框架与编程助手。

Claude Code:千问AI平台支持 Anthropic API 协议,可直接配合 Claude Code 使用。

01npm install -g @anthropic-ai/claude-code

02

03export ANTHROPIC\_MODEL="qwen3.8-flash"

04export ANTHROPIC\_SMALL\_FAST\_MODEL="qwen3.8-flash"

05export ANTHROPIC\_BASE\_URL=https://dashscope.aliyuncs.com/apps/anthropic

06export ANTHROPIC\_AUTH\_TOKEN=<your\_api\_key>

07

08claude

Codex:千问AI平台支持 OpenAI Responses 协议。在 ~/.codex/config.toml 中把 base_url 指向 https://dashscope.aliyuncs.com/compatible-mode/v1wire_api 设为 responses,并在 ~/.codex/model-catalog.local.json 中将 qwen3.8-flashcontext_window 配置为 1000000,即可开始使用。

01npm install -g @openai/codex

02

03export OPENAI\_API\_KEY=<your\_api\_key>

04

05codex

**Qoder CLI**[Qoder](https://qoder.com/) 与 Qwen 协同演进,专为智能体编程打造。

01curl -fsSL https://qoder.com/install | bash

02

03qoder

**Qwen Code**[Qwen Code](https://qwen.ai/qwencode) 针对 Qwen 系列模型做了深度优化。

01npm install -g @qwen-code/qwen-code@latest

02

03qwen

OpenClaw:通过千问AI平台连接 OpenClaw,完整配置见开发者文档

01curl -fsSL https://openclaw.ai/install.sh | bash

02

03export DASHSCOPE\_API\_KEY=<your\_api\_key>

04

05openclaw dashboard

七、立即体验

相关文章
|
28天前
|
人工智能 弹性计算 安全
从试点到规模化:2026企业级Agent解决方案落地路径全解析
2026年是企业级AI智能体规模化落地关键年。本文以瓴羊AgentOne为标杆,解析从PoC到生产的四大突破:长时任务、多Agent协同、弹性伸缩与全链路可观测,并提出“模型-技能-执行”三层解耦架构,强调场景优先、数据先行、安全内嵌、人机协同,助力企业真正实现AI增效。
|
1月前
|
人工智能 IDE 搜索推荐
阿里云Qoder CN原名通义灵码指南及收费价格,个人社区版免费使用哦
阿里云Qoder CN(原通义灵码)是面向开发者的AI智能编码助手,支持VS Code、JetBrains等IDE插件及独立IDE,覆盖代码补全、问答、Agent、RepoWiki等场景,提供多模型(Qwen/GLM/Kimi)支持与灵活计费版本。阿里云Qoder CN官网:https://t.aliyun.com/U/fEiOLV
|
8天前
|
缓存 人工智能 API
最新版阿里云通义千问大模型功能介绍:Qwen3.8全系列能力拆解、API实操、计费与选型全指南
大模型产业已经从早期简单问答时代,演进到长文本处理、原生多模态理解、长周期智能体自主执行、工程化代码开发的新阶段。通义千问作为国产主流基座大模型,持续迭代推出Qwen3.8完整产品矩阵,包含Max、Flash等多个版本,覆盖旗舰高性能、高性价比高速推理等不同定位,同时提供百万级上下文窗口、深度思考推理、图文视频多模态输入、函数工具调用、上下文缓存、结构化输出等全套能力,既可以用于网页端直接对话,也可以通过API接口集成到业务系统、Agent开发框架、各类AI开发工具当中,覆盖个人开发者、科研机构、中小企业、大型企业多元业务需求。
352 0
|
6天前
|
存储 人工智能 IDE
阿里云千问办公、Qoder CN和Qoder Teams有什么区别?看完直接选!
阿里云三款AI产品定位清晰:千问办公(QwenWork)专注通用办公自动化,面向非技术岗;Qoder CN是国内合规版AI编码平台,支持IDE/CLI/办公全场景;Qoder Teams是Qoder CN的企业团队版,提供席位管理、共享知识库与用量审计。
228 6
阿里云千问办公、Qoder CN和Qoder Teams有什么区别?看完直接选!
|
14天前
|
弹性计算 人工智能 API
DeepSeek Harness:阿里云百炼支持按量计费、Coding Plan、Token Plan方式配置接入
阿里云百炼支持DeepSeek Harness接入,提供按量计费、Coding Plan及Token Plan(个人/团队版)四种灵活配置方式,兼容OpenAI协议,开箱即用。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
|
12天前
|
人工智能 IDE API
阿里云Qoder CN服务平台完整功能解读:从本地IDE配置、终端CLI使用、云端部署到开放API全链路解读
软件研发工作包含需求拆解、代码编写、单元测试、故障排查、文档撰写、项目重构等大量重复性工作。传统开发模式下,开发者需要手动翻阅项目源码、查阅接口文档、调试报错堆栈,大型项目代码体量庞大,新人熟悉项目架构要耗费大量时间。普通代码补全工具只能完成单行片段生成,无法理解完整工程上下文,不能独立处理跨多文件的复杂开发任务。Qoder CN,前身是通义灵码,是面向软件研发全流程的AI智能体产品套件,不再局限于简单的代码片段补全,而是以编程Agent智能体为核心,覆盖本地桌面开发、终端命令行、云端托管运行、数字员工等多种形态,深度对接百炼平台Coding Plan、Token Plan订阅体系,支持Qwe
195 1
|
5天前
|
人工智能 安全 数据挖掘
阿里千问办公价格一览:个人免费版、标准版、高级版套餐权益对比
阿里千问办公QwenWork提供免费版(注册送2000积分,每日登录可领)与付费版(个人版、企业标准版198元/人/月、旗舰版等),支持多档模型、积分体系及VPC部署,详情见官网。阿里千问办公官网:https://t.aliyun.com/U/JNKJuO 阿里AI工作平台,一句话完成数据分析、PPT 生成、视频剪辑、网页搭建等复杂任务
263 0
|
1月前
|
人工智能 测试技术 Shell
Opencode最被低估的6个测试指令:每天帮你省下3小时重复劳动
本文详解Opencode六大自定义指令(如/test、/coverage),助测试工程师30分钟配置、每日省3小时,告别重复Prompt输入,实现测试流程自动化提效。
|
7天前
|
缓存 JSON API
DeepSeek‑V4完整技术解析:Flash与Pro双版性能、计费缓存机制、API实战调用全教程
在大模型工程落地过程当中,超长上下文能力一直是开发者的强需求,但长期面临两大行业痛点:一部分长上下文模型推理速度缓慢,无法支撑线上高并发实时业务;另一部分虽然性能强劲,但是调用成本居高不下,中小企业很难大规模上线。DeepSeek‑V4系列采用差异化双版本产品策略,同时推出`deepseek‑v4‑flash`与`deepseek‑v4‑pro`两款MoE混合专家架构大模型,分别面向轻量化高频业务、复杂深度推理两大赛道,两款模型统一标配**100万Token超长上下文窗口**,把百万级长文本处理能力下放到普通开发者与中小企业,打破长上下文大模型的落地壁垒。
192 0

热门文章

最新文章