Qwen3.8-Max-0902 更新解读:价格不变但每次请求额外消耗 38 个输入 token

简介: Qwen3.8-Max-0902版发布:编程能力跃升,CodeArena前端榜夺冠(1691分),8项编码测试全面超越前版;价格不变(输入$2/百万token、输出$6),但单次请求固定多耗38 token;100万上下文,支持图文输入与深度推理。

Qwen3.8-Max 的 0902 快照价格和上一版完全一样,每百万输入 token $2.00、输出 $6.00。它同时在每次请求上多花 38 个输入 token。 我们在三个长度不同的 prompt 上测了这个差值,每次都是 38,没有浮动。下面所有内容来自 2026 年 9 月 4 日的 实时目录和实时 API 调用。

我们测到了什么

同样的 prompt,同样的参数,两个模型字符串。 唯一的区别是哪个快照来应答。

Prompt qwen3.8-max qwen3.8-max-0902 差值
Reply with exactly: ok 28 66 +38
What is 2+2? 30 68 +38
Rewrite this GROUP BY as a window function. 33 71 +38

这些是 /v1/chat/completions 返回的 usage.prompt_tokens,请求体除模型字符串外完全相同。三个不同长度的 prompt 上偏移量恒定,说明这是加在每次调用前面的固定开销,而不是那种会随输入长度放大的分词器变更。

按每百万输入 token $2.00 算,38 个 token 是每次请求 $0.000076。几十次调用时它什么都不是,上了量就是真金白银:

请求数 多出的输入 token 多出的成本
10,000 380,000 $0.76
1,000,000 38,000,000 $76
10,000,000 380,000,000 $760

所以准确的总结是:单 token 价格没变,单次调用的底噪变了,这件事重不重要取决于你的请求次数而不是 token 总量。高频短 prompt 的负载感受最明显,因为 38 个 token 加在 28 个 token 的 prompt 上,输入侧直接翻了一倍还多。

价目表一模一样

每百万 token 费率 qwen3.8-max qwen3.8-max-0902
输入 $2.00 $2.00
输出 $6.00 $6.00
缓存读 $0.25 $0.25
缓存写 $2.50 $2.50
联网搜索 每次 $0.01 每次 $0.01

读取自 2026 年 9 月 4 日实时 /v1/models 响应里的 pricing 对象,每一格都对得上。能力有提升而不涨价属于好情况;这些费率跟上一代旗舰以及直连 QwenCloud 怎么比,见 Qwen3.8 Max 价格与接入指南。

阿里说改了什么

代码、协同智能体能力和视觉理解。 2026-09-02 快照的目录描述提到代码与协同智能体能力显著增强、视觉理解优化,同时明确保留上一版的 1M 上下文、深度推理模式以及图片和视频输入。

这段描述里没有的是 benchmark 数字,所以现在还没有可以拿去对榜单核实的东西。能力提升这部分请当作厂商说法,而 38 token 这个测量结果是可以独立验证的那部分,因为它确实可以。

上下文窗口那一行需要加个说明

两个版本都是 1M 上下文模型,但目录的上报方式不同。 不带日期的版本报 context_length: 1131072,0902 快照报 1000000。两者的描述都写 1M,最大补全长度也都是 131,072 token。

这看起来像能力缩水,但几乎可以肯定不是。1,131,072 等于 1,048,576 加 82,496,读起来像是「输入上限加一点余量」而不是一个干净的对外数字;1,000,000 才是那个整数营销口径。稳妥的解读是上报口径变了而不是模型变了。不稳妥的解读是看到数字变小就认定阿里缩了窗口,然后照着一个可能不存在的限制去做设计。

如果你的负载真的会逼近百万 token 的上下文,那就在你准备上线的那个快照上实测真实上限,而不是相信目录里的任何一个数字。1,000,000 token 以下在两个版本上都是安全的。

其余部分完全相同

属性 两个版本
最大补全 token 131,072
输入模态 文本、图片
输出模态 文本
端点 /v1/chat/completions/v1/responses
参数 temperaturetop_pmax_tokensstoptoolstool_choiceresponse_formatreasoning
分词器 qwen

参数列表逐字节一致,这也是迁移只需改一个字符串的原因:

- "model": "bailian/qwen3.8-max"
+ "model": "bailian/qwen3.8-max-0902"

一个值得知道的坑:空内容

两个版本都是推理模型,这会产生一种看起来像失败、其实不是的结果:

{"usage": {"prompt_tokens": 66, "completion_tokens": 20,
 "completion_tokens_details": {"reasoning_tokens": 20}}}

20 个补全 token,全部是推理 token,content 回来是空字符串。什么都没坏。在推理模型上把 max_tokens 设成 20,预算在吐出第一个可见字符之前就花在思考上了,响应在上限处被截断。

修法是调大 max_tokens,不是重试也不是换模型。实用规则:在推理模型上,max_tokens 要同时覆盖推理和回答,而推理不管你看不看得见都按输出费率计费。把 max_tokens 当成答案长度来估,正是一个好模型看起来坏掉的原因。

钉住日期,还是跟着指针走

bailian/qwen3.8-max-0902 是冻结的,bailian/qwen3.8-max 不是。 在生产环境中调用大模型时,使用 qwen-max-0902 这类带日期后缀的固定版本端点,与使用 qwen-max 浮动指针端点会产生不同的行为, 与 OpenRouter 等聚合网关均支持指定具体版本号来锁定模型快照,从而避免因底层模型静默更新导致输出特征发生漂移。

这些情况钉带日期的字符串:

  • 输出必须可复现,比如要过评审或审批流程。

  • 一个很大的 prompt 库是对着某一版验证过的,重新验证代价很高。

  • 你想自己决定行为什么时候变,而不是在生产环境里发现它变了。

这些情况用不带日期的字符串:

  • 你更愿意跟着阿里当前的推荐走,不想为此重新部署。

  • 你的 prompt 足够稳健,换快照不构成回归风险。

这是常见的取舍,两边都有代价:钉住意味着在你主动动手之前拿不到改进,跟着指针走意味着你产品底下的模型可能在你没发布任何东西的情况下变了。不管选哪个,都要有意识地选,因为「第一次随手打的那个字符串」正是一个模型被永久钉死然后悄悄过时的原因。

这个模型的位置

放到更大的盘子里看,Qwen3.8 Max 的 $2.00 / $6.00 是旗舰档的价格。Qwen3.8 Max vs DeepSeek V4 Flash 回答的是「有没有更便宜的替代」,Codex CLI 配置指南讲的是把它当编码后端来跑,而这恰好是 0902 快照声称提升最大的那类负载。

来源

价格、上下文长度、参数和模态读取自 2026 年 9 月 4 日的实时 /v1/models 端点。38 token 的差值是同一天对每个模型各发三次实时 /v1/chat/completions 调用测得的,请求体除模型字符串外完全相同。


参考来源

相关文章
|
9天前
|
人工智能 自然语言处理 安全
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
本文聚焦阿里云2026年推出的三款自研AI办公产品,清晰拆解千问办公、Qoder Teams、Qoder CN的差异化定位与能力边界:千问办公主打职场全场景提效,支持自然语言指令一键完成PPT生成、数据分析等高频办公任务;Qoder Teams面向程序员团队,深度整合AI代码生成、团队协同与企业知识库能力;Qoder CN则专为金融、政务等强合规场景打造,实现数据不出境与VPC私有化部署。文章同步给出分场景选型指南与最新活动定价,帮助不同类型的企业按需组合产品,实现业务岗、研发岗与强合规场景的AI能力全覆盖。
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
|
21天前
|
人工智能 缓存 前端开发
DeepSeek Harness 首发实测 + 入门教程,夯爆了!梁神我错了
DeepSeek Harness + DeepSeek V4 Pro 项目实战保姆级教程!手把手带你从零安装开源 AI 编程工具,开发架构图、知识讲解网站、3D 网页游戏、全栈 AI 应用 4 个项目,覆盖运行模式选择、插件安装与开发,看看能不能对标 Claude。
13305 91
DeepSeek Harness 首发实测 + 入门教程,夯爆了!梁神我错了
|
14天前
|
Web App开发 人工智能 API
16 个超火的 DeepSeek Harness 插件,大肥鱼已经落后 N 个版本了。。。
DeepSeek Harness 精选插件推荐合集,从图片识别、浏览器操控、多 Agent 协作到手机远程控制,一口气带你看完 DSH 社区热门的十几个插件,覆盖技能扩展、UI 界面增强、整活玩法三大类,让你的鲸鱼变得更强。
1824 4
|
15天前
|
人工智能 Java BI
【AI】DeepSeek Harness 安装、运行、管理插件
本文介绍了如何运行DeepSeek开源的Agent框架DeepSeek Harness(dsh)。主要内容包括:使用nvm安装适配的Node版本;通过代理加速克隆GitHub源码;使用pnpm安装依赖并启动项目;配置DeepSeek API Token;安装扩展功能的插件。该框架自带Web界面,支持模型适配、文件编辑等插件化功能
2022 1
|
10天前
|
人工智能 Linux iOS开发
Ollama使用教程:Ollama官网下载、Ollama本地部署大模型(2026最新)
Ollama 是一款免费开源的本地大模型运行工具,支持在 Windows/macOS/Linux 上离线运行 Qwen、DeepSeek、Llama 等主流开源模型,数据不出本机、隐私安全。提供 OpenAI 兼容 API,命令行一键拉取/运行/管理模型,无需联网,无调用限制,是开发者与 AI 爱好者部署本地 AI 助手的理想选择。(239 字)
|
人工智能 JavaScript 开发工具
DeepSeek Harness 本地安装与使用指南
DeepSeek Harness(DSH)是DeepSeek AI开源的Agent运行框架,支持本地文件操作、命令执行与工具调用。基于Cordis插件架构,具备高扩展性与强可控性,适合开发者搭建可控Agent环境或开展模型基准测试。当前为开发者预览版,需Node.js环境,推荐先用`npx @deepseek-ai/dsh web`快速体验。
5288 0
|
7天前
|
人工智能 监控 测试技术
Qwen3.8-Flash 来了,100万上下文、Agent、Coding 都加强了
8月26日,通义千问发布Qwen3.8-Flash-Next:125B参数、每Token仅激活6B,原生支持26万Token、可扩展至100万上下文;Coding、Agent与工具调用能力显著增强,面向真实软件工程任务,推动大模型从“回答问题”迈向“完成工作”。

热门文章

最新文章