Qwen3.8-Max-0902 更新解读:价格不变但每次请求额外消耗 38 个输入 token

简介: Qwen3.8-Max-0902版发布:编程能力跃升,CodeArena前端榜夺冠(1691分),8项编码测试全面超越前版;价格不变(输入$2/百万token、输出$6),但单次请求固定多耗38 token;100万上下文,支持图文输入与深度推理。

Qwen3.8-Max 的 0902 快照价格和上一版完全一样,每百万输入 token $2.00、输出 $6.00。它同时在每次请求上多花 38 个输入 token。 我们在三个长度不同的 prompt 上测了这个差值,每次都是 38,没有浮动。下面所有内容来自 2026 年 9 月 4 日的 实时目录和实时 API 调用。

我们测到了什么

同样的 prompt,同样的参数,两个模型字符串。 唯一的区别是哪个快照来应答。

Prompt qwen3.8-max qwen3.8-max-0902 差值
Reply with exactly: ok 28 66 +38
What is 2+2? 30 68 +38
Rewrite this GROUP BY as a window function. 33 71 +38

这些是 /v1/chat/completions 返回的 usage.prompt_tokens,请求体除模型字符串外完全相同。三个不同长度的 prompt 上偏移量恒定,说明这是加在每次调用前面的固定开销,而不是那种会随输入长度放大的分词器变更。

按每百万输入 token $2.00 算,38 个 token 是每次请求 $0.000076。几十次调用时它什么都不是,上了量就是真金白银:

请求数 多出的输入 token 多出的成本
10,000 380,000 $0.76
1,000,000 38,000,000 $76
10,000,000 380,000,000 $760

所以准确的总结是:单 token 价格没变,单次调用的底噪变了,这件事重不重要取决于你的请求次数而不是 token 总量。高频短 prompt 的负载感受最明显,因为 38 个 token 加在 28 个 token 的 prompt 上,输入侧直接翻了一倍还多。

价目表一模一样

每百万 token 费率 qwen3.8-max qwen3.8-max-0902
输入 $2.00 $2.00
输出 $6.00 $6.00
缓存读 $0.25 $0.25
缓存写 $2.50 $2.50
联网搜索 每次 $0.01 每次 $0.01

读取自 2026 年 9 月 4 日实时 /v1/models 响应里的 pricing 对象,每一格都对得上。能力有提升而不涨价属于好情况;这些费率跟上一代旗舰以及直连 QwenCloud 怎么比,见 Qwen3.8 Max 价格与接入指南。

阿里说改了什么

代码、协同智能体能力和视觉理解。 2026-09-02 快照的目录描述提到代码与协同智能体能力显著增强、视觉理解优化,同时明确保留上一版的 1M 上下文、深度推理模式以及图片和视频输入。

这段描述里没有的是 benchmark 数字,所以现在还没有可以拿去对榜单核实的东西。能力提升这部分请当作厂商说法,而 38 token 这个测量结果是可以独立验证的那部分,因为它确实可以。

上下文窗口那一行需要加个说明

两个版本都是 1M 上下文模型,但目录的上报方式不同。 不带日期的版本报 context_length: 1131072,0902 快照报 1000000。两者的描述都写 1M,最大补全长度也都是 131,072 token。

这看起来像能力缩水,但几乎可以肯定不是。1,131,072 等于 1,048,576 加 82,496,读起来像是「输入上限加一点余量」而不是一个干净的对外数字;1,000,000 才是那个整数营销口径。稳妥的解读是上报口径变了而不是模型变了。不稳妥的解读是看到数字变小就认定阿里缩了窗口,然后照着一个可能不存在的限制去做设计。

如果你的负载真的会逼近百万 token 的上下文,那就在你准备上线的那个快照上实测真实上限,而不是相信目录里的任何一个数字。1,000,000 token 以下在两个版本上都是安全的。

其余部分完全相同

属性 两个版本
最大补全 token 131,072
输入模态 文本、图片
输出模态 文本
端点 /v1/chat/completions、/v1/responses
参数 temperature、top_p、max_tokens、stop、tools、tool_choice、response_format、reasoning
分词器 qwen

参数列表逐字节一致,这也是迁移只需改一个字符串的原因:

- "model": "bailian/qwen3.8-max"
+ "model": "bailian/qwen3.8-max-0902"

一个值得知道的坑:空内容

两个版本都是推理模型,这会产生一种看起来像失败、其实不是的结果:

{"usage": {"prompt_tokens": 66, "completion_tokens": 20,
 "completion_tokens_details": {"reasoning_tokens": 20}}}

20 个补全 token,全部是推理 token,content 回来是空字符串。什么都没坏。在推理模型上把 max_tokens 设成 20,预算在吐出第一个可见字符之前就花在思考上了,响应在上限处被截断。

修法是调大 max_tokens,不是重试也不是换模型。实用规则:在推理模型上,max_tokens 要同时覆盖推理和回答,而推理不管你看不看得见都按输出费率计费。把 max_tokens 当成答案长度来估,正是一个好模型看起来坏掉的原因。

钉住日期,还是跟着指针走

bailian/qwen3.8-max-0902 是冻结的,bailian/qwen3.8-max 不是。 在生产环境中调用大模型时,使用 qwen-max-0902 这类带日期后缀的固定版本端点,与使用 qwen-max 浮动指针端点会产生不同的行为, 与 OpenRouter 等聚合网关均支持指定具体版本号来锁定模型快照,从而避免因底层模型静默更新导致输出特征发生漂移。

这些情况钉带日期的字符串:

  • 输出必须可复现,比如要过评审或审批流程。

  • 一个很大的 prompt 库是对着某一版验证过的,重新验证代价很高。

  • 你想自己决定行为什么时候变,而不是在生产环境里发现它变了。

这些情况用不带日期的字符串:

  • 你更愿意跟着阿里当前的推荐走,不想为此重新部署。

  • 你的 prompt 足够稳健,换快照不构成回归风险。

这是常见的取舍,两边都有代价:钉住意味着在你主动动手之前拿不到改进,跟着指针走意味着你产品底下的模型可能在你没发布任何东西的情况下变了。不管选哪个,都要有意识地选,因为「第一次随手打的那个字符串」正是一个模型被永久钉死然后悄悄过时的原因。

这个模型的位置

放到更大的盘子里看,Qwen3.8 Max 的 $2.00 / $6.00 是旗舰档的价格。Qwen3.8 Max vs DeepSeek V4 Flash 回答的是「有没有更便宜的替代」,Codex CLI 配置指南讲的是把它当编码后端来跑,而这恰好是 0902 快照声称提升最大的那类负载。

来源

价格、上下文长度、参数和模态读取自 2026 年 9 月 4 日的实时 /v1/models 端点。38 token 的差值是同一天对每个模型各发三次实时 /v1/chat/completions 调用测得的,请求体除模型字符串外完全相同。


参考来源

相关文章
|
22天前
|
缓存
阿里云Token Plan的Credits是如何计费的?1个Credits相当于多少Token?
阿里云百炼Token Plan采用动态Credits计费,1 Credits不固定对应Token数,实际消耗由模型类型、Token用量、思考模式及工具调用等共同决定。以qwen3.6-plus为例,输入/缓存/输出Token折算系数各异,百万Tokens成本低至1.12元,较按量计费最高省44%。新用户赠7000万Tokens。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
|
15天前
|
人工智能 自然语言处理 API
最新版阿里云Token Plan介绍:支持Qwen3.8-Flash、Qwen3.8-Max等最新模型,套餐最低39元起
阿里云百炼Token Plan推出个人版与团队版双轨订阅体系,以统一Credits抵扣全平台多模态旗舰模型及主流AI编程、智能体工具,覆盖从个人开发者到企业团队的不同使用强度需求。配套专属加油包、AI编程全能包、Agent部署托管等场景化组合购套餐,叠加限时折扣与夜间低至2折优惠,实现预算可控、多工具无缝接入,一站式降低AI大模型规模化调用成本。
|
1月前
|
人工智能 自然语言处理 安全
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
本文聚焦阿里云2026年推出的三款自研AI办公产品,清晰拆解千问办公、Qoder Teams、Qoder CN的差异化定位与能力边界:千问办公主打职场全场景提效,支持自然语言指令一键完成PPT生成、数据分析等高频办公任务;Qoder Teams面向程序员团队,深度整合AI代码生成、团队协同与企业知识库能力;Qoder CN则专为金融、政务等强合规场景打造,实现数据不出境与VPC私有化部署。文章同步给出分场景选型指南与最新活动定价,帮助不同类型的企业按需组合产品,实现业务岗、研发岗与强合规场景的AI能力全覆盖。
4262 5
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
|
2月前
|
人工智能
Qwen3.8抢先体验!正式版即将发布并开源!
千问Qwen3.8即将开源,参数达2.4T,进化速度以“天”计,实力媲美Fable 5。预览版Qwen3.8-Max已上线阿里Token Plan等平台,限时优惠:日间Credits低至1折,夜间更优,个人/团队版月付仅35元起!
4776 154
|
24天前
|
Web App开发 Rust Shell
Codex 常见报错排查指南:15 种典型症状与对应修复方法
本页是 Codex 报错精准排查指南:直击15类真实故障根因(非表面报错),覆盖 CLI、编辑器扩展、Chrome 插件等5大入口,含实测修复方案、版本对照与配置要点。拒绝“轮换 API Key”式瞎试,先定位入口,再查日志,最后升级或调整配置。(239字)
|
23天前
|
缓存 API 网络安全
Claude Fable 5.1 API 接入指南:模型标识、五级定价、effort 参数与缓存 TTL 详解
Claude Fable 5.1(2026年9月发布)核心变化:上下文1M token、输出128K、Adaptive thinking常驻开启(按$50/M token计费);effort调高增token用量而非单价;缓存读仅$0.25/M,复用百次成本降为Fable 5的1/3;TTL选型影响显著——5分钟档续期依赖活跃调用,空闲超时将倍增写入费。迁移仅需替换模型ID。
|
21天前
|
存储 人工智能 供应链
阿里云国际代理商:2026 AI 大模型出海 解析灵骏真武 M890
2026年,AI竞争转向底座能力。阿里云推出灵骏真武M890超节点——全球首款分钟级交付的64卡一体化PPU算力单元,搭载144GB HBM3显存、800GB/s卡间带宽,单机9TB显存池,可原生承载2.4万亿参数MoE模型训推一体,破解跨境算力供应与合规部署难题。(239字)
|
1月前
|
人工智能 自然语言处理 数据可视化
千问办公:一站式AI生产力平台,免费版、个人标准版、个人高级版配置价格,新用户注册送2000积分
千问办公是阿里巴巴推出的AI原生办公平台,基于Qwen3.8大模型,支持一句话完成PPT生成、数据分析、视频剪辑、网页搭建等复杂任务,直出可用成果。已覆盖桌面端、网页端及钉钉生态,深度融合IM、云盘与本地文件系统,真正实现“对话即交付”。
856 1
|
22天前
|
人工智能 自然语言处理 测试技术
阿里云千问qwen3.8-max、qwen3.7-max、qwen3.8-flash、qwen3.7-flash热门大模型对比与选择参考
本文对比了2026年阿里云千问系列中开发者使用最广的四款热门模型,分别拆解其定位、核心能力、适用场景与价格差异,覆盖从旗舰全能到高性价比多模态的全梯度选择。文中给出清晰选型参考,同步新人单模型100万Token免费额度、夜间调用5折等最新优惠活动,帮助开发者结合业务需求与预算,选出适配的千问模型。
|
24天前
|
人工智能 自然语言处理 运维
给 AI Agent 配专属工位:无影云电脑搭配 Token Plan 部署 ZCode/Hermes/OpenClaw/QwenPaw 完整指南
AI智能体技术快速普及之后,很多开发者与爱好者尝试在本地设备运行ZCode、Hermes Agent、OpenClaw、QwenPaw这类Agent工具,但是本地环境会遇到大量现实痛点:电脑关机、休眠就直接中断长周期任务;本地硬件性能不足,多任务并发出现卡顿崩溃;环境组件版本复杂,部署调试耗时很久;本地文件还存在被Agent误修改、误删除的风险。无影云电脑联合Token Plan推出“快速部署个人AI Agent”组合购活动,主打“Agent托管云电脑,给Agent配个工位”的产品理念,把算力运行环境和大模型调用额度打包,支持四大主流AI智能体一键镜像部署,实现7×24小时云端不间断运行,手机
158 2

热门文章

最新文章