Qwen3.8-Max 开源了:该不该从 Claude 切过去?

简介: 阿里正式发布2.4万亿参数旗舰Qwen3.8-Max,支持100万上下文与原生多模态,激活95B参数,推理成本仅6美元/百万token。下周将开源Max系列权重——史上首次,兼具强编码、长程智能体与办公自动化能力,但标准编程基准仍略逊Fable 5。(239字)

氛围图

💡 一句话带走:阿里把旗舰 Qwen3.8-Max(2.4 万亿参数、95B 激活、1M 上下文、原生看图看视频)发了,还宣布下周开源权重——这是 Max 系列头一回开源。多模态和"自主跑十天"的编码能力是真亮点,但标准编码基准它还排在 Claude Fable 5 后头;社区有人退订 Anthropic,也有人测了预览版直骂。把它说清楚:亮点和短板都在,能不能替 Claude,看你用在哪儿。

导语:开源旗舰这一周,卷到什么程度了?

如果你这两天没刷 AI 新闻,可能会错过一个画面:一周之内,Moonshot 的 Kimi K3、智谱的 GLM 5.2、DeepSeek-V4-Flash,再加上阿里刚发的 Qwen3.8-Max——中国几家开源旗舰扎堆亮相,密度高得有点反常。

而 Qwen3.8-Max 是其中声量最大的一个,原因就一句话:它是 Qwen-Max 这个旗舰系列头一回开源权重。以前 Max 系列是对标 GPT/Anthropic 顶级的闭源模型,你想用只能调 API;现在权重要放了——对"想自部署、想微调、不想被一家绑死"的开发者,这是个结构性利好。

但更勾人的是 Hacker News 上一条长评:一个叫 nerdalytics 的开发者说,他用预览版两周后退订了 Anthropic 订阅,"并不怀念 Fable"。另一边,也有人测完预览版直摇头,说它"一动就陷入自我怀疑循环,灾难性差"。

所以——它到底行不行?该不该动你正在用的 Claude?这篇是把那份完整事件报告"翻译"成人话的版本,把这事说清楚。

想看原文 / 自己动手?

这报告到底讲了啥?

先把基本面拉齐——Qwen3.8-Max 是阿里 Qwen 团队 8 月 3 号正式发布的旗舰大模型。几个关键数字:

  • 🧠 2.4 万亿(2.4T)总参数,但每次推理只激活约 95B——这是 MoE(Mixture of Experts,混合专家架构)的典型玩法。打个比方:一家公司有 2.4 万员工,但每个任务只派 95 个人上场。好处是模型容量撑得大、推理成本压得低
  • 👁️ 原生多模态:能吃文字、图片、视频,吐文字。不是后天拼上去的视觉模块,是训练时就融进去的
  • 📏 100 万 token 上下文(实际最大输入约 99 万)——大致等于一次性塞进去一整本长篇小说还多
  • 💰 定价 $2/百万输入、$6/百万输出,而且兼容 OpenAI 和 Anthropic 两套 API 协议,官方直接给了 Claude Code、Codex 等五种编码助手的接入示例——换句话说,迁移成本被压到了最低

时间线上也不复杂:7 月 19 号上海 WAIC 先放了 qwen3.8-max-preview 预览版让人试,8 月 3 号正式全量发布,下周(约 8/10 当周)开源权重——Max 本体加一个 27B 的"小弟"Qwen3.8-27B 一起,上 HuggingFace 和 ModelScope。

最该记住的一个定性:这是 Qwen-Max 系列第一次开源权重。官方给它贴的标签是"编码与协作(coding and cowork)"——翻译一下,他们想让它干的不是"帮我写个函数",而是"给我一个目标,你自己干十天半个月,把成品端上来"。

各方都怎么看?

官方怎么"卖"它?

这次官方宣传挺聪明,没怎么堆跑分,主要砸三个"无人工介入"的实战案例:让模型从零造一个叫 oh-my-cli 的编码工具,自己提需求、自己认领、自己写代码跑测试改 bug,跑了约 16 天攒下 265 个 commit;给它一篇论文和一堆 GPU,它花 5 天复现论文还顺手改进、在数学基准上比原方法高 2.7 个点;扔进一个 526 队的竞赛,24 小时干赢 87% 的队伍。

然后是一长串"跨职业广度"演示——律师、设计师、餐饮老板、结构工程师、量化研究员……官方的意思很直白:不只是码农的工具,是"几百个高价值职业"的干活搭子。

⚠️ 有句话得说清楚(报告里也标了):这三个案例是官方自报的演示(showcase),repo 虽公开,但"复现论文""竞赛""芯片设计"这些结果都是官方自己的评分脚本评的,没有第三方独立审计。当能力上界看,别当定论。

媒体:有人叫好,有人泼冷水

老牌科技媒体 Neowin 核对了参数和定价,给了一句挺狠的判断:这波中国开源旗舰密集出货,可能迫使 OpenAI 和 Anthropic 降价、给开发者更灵活的部署。对消费者,这话听着爽。

但行业媒体 Marktechpost 没跟着吹,反手提了三个保留意见,这几条是整份报告里最值得在意的:

  • 🧊 多模态那张对比表有点取巧:官方拿前代 Qwen3.7-Plus(较弱)比,而不是 Qwen3.7-Max(较强),代际提升的数字被夸大了
  • 🧊 训练曲线到顶后往下掉:官方自己的强化学习 scaling 曲线,在约 4000 个训练环境时到顶,之后反而下降——后续还能不能持续涨,存疑
  • 🧊 2.4T 权重你本地跑不动:这玩意儿是多节点数据中心级的,真要本地部署,现实路径是 27B 那个小弟,不是 Max 本体

开发者社区:夸的骂的都很具体

Hacker News 那个帖热度爆表(1069 赞、575 评论),声音很杂,但都有真东西:

  • 👍 eli:编码很强、web 设计一般;一个解析邮件头的刁钻任务上,比 Kimi K3 强还便宜 38%
  • 👍 nerdalytics(就是开头退订 Anthropic 那位):私人项目里 Qwen 干的活和 Fable 相当,还不撞"5 小时会话限制"——但工作场景他照样用 Anthropic + Claude Code,没换。他还甩了句狠的:"信美国公司和信中国公司,是在瘟疫和霍乱之间二选一"
  • 👎 isqueiros(注意他测的是预览版):直说"灾难性差",一动就陷进自我怀疑循环、拒绝 debug,坚守 Kimi K3
  • 🤔 还有不少人盯着 license——Kimi K3 是带限制的自定义协议、GLM 5.2 是 MIT,大家盼着 Qwen 走 Apache

把话说明白

把上面这些捋清楚,整件事的成色就清楚了。

站得住的有三件:多模态那一大片基准(视觉理解、OCR、视频、CAD)它确实领先,不是吹的;"自主跑十天的编码 agent"这个方向走在前面,oh-my-cli 那个 repo 公开可查,不是纯 PPT;而"Max 级首次开源"的象征意义可能比模型本身还大——它把旗舰级能力从 API 租赁变成了可以持有的资产。

有争议的在编码:那张编码 agent 表里,PaperBench(93.0)和 IFBench(82.8)它确实第一,但 SWE-bench Pro 只有 67.7(Claude Fable 5 是 80.0)、DeepSWE 56.6、FrontierSWE 73.5(Fable 5 是 88.8)都明显落后——长程自主跑有亮点,标准软件工程基准还在第二梯队追;再叠加官方几张表对比基线有点讨巧,"追平 Claude"这个说法打八折听更稳。

还没证实的有两点:Max 权重的 license(社区盼 Apache,但还没落定);多数深度好评基于预览版,正式版可能不同。

不过话说回来,2.4T 权重开源 ≠ 你本地能跑,真能上手的是 27B;那几个自主编码案例是官方自报 showcase、没第三方审计。所以它对不同人意味什么,看场景:私人项目、想自部署的人,等 27B 落地是个上手的机会;工作生产环境、稳定优先的人,等权重发布、license 落定、独立评测复核再动更稳——nerdalytics 那句"私人 sold、工作不换",是个挺务实的参照。

一句话收尾:Qwen3.8-Max 是个实打实的好模型,这波国产开源旗舰确实猛。但它不是"全面碾压 Claude",更像"不少地方追平、有些地方领先、有些地方还差一截"——而它真正的杀手锏,是"Max 级 + 开源"这个组合拳,这事儿别的家暂时还没跟上。


参考来源(带可信度,供查证)


作者:lusca
版本:lusca-report-blog v1.3.0
出处:https://github.com/yjmm10/lusca-skill/tree/main/skills/lusca-report-blog

相关文章
|
20天前
|
开发者 C++ iOS开发
70B 大模型塞进 4GB 显存——AirLLM 这个层加载思路很有意思
AirLLM 是一款创新的轻量级大模型推理框架,无需量化/剪枝,仅凭4GB显存即可运行70B甚至2.8T参数模型。其核心是“按层动态加载+预取优化”,将显存压力从全模型降至单层,兼顾可行性与精度,让消费级GPU轻松跑起超大模型。
192 4
|
1月前
|
人工智能 缓存 API
阿里云Token Plan 个人版发布!可抢先体验Qwen3.8-Max-Preview,最低39元1个月
阿里云Token Plan个人版上线!含Lite(39元/月)、Standard(139元)、Pro(499元)三档,支持Qwen3.8-Max-Preview等多模态模型,统一Credits抵扣,适配主流AI工具与Agent框架,助力开发者高效构建AI应用。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
618 0
|
20天前
|
缓存 人工智能 BI
最新版通义千问(Qwen3.8-Max)功能介绍及使用指南
通义千问Qwen3.8-Max是通义千问系列的最新旗舰大模型,凭借2.4万亿参数的MoE混合专家架构、100万Token超长上下文、原生多模态处理能力以及全栈代码与智能体协作能力,成为当前全球顶尖的通用大模型之一。它不仅在文本生成、逻辑推理上实现突破,更在长文档处理、图像视频理解、复杂工程开发、多智能体协作等场景构建了核心竞争力。本文将从核心架构、关键功能、使用入口、API调用、场景实战、避坑指南六大维度,全面解析Qwen3.8-Max,帮助开发者与普通用户快速掌握其能力与使用方法,实现从基础对话到复杂任务的高效落地。
232 1
|
1月前
|
人工智能
Qwen3.8抢先体验!正式版即将发布并开源!
千问Qwen3.8即将开源,参数达2.4T,进化速度以“天”计,实力媲美Fable 5。预览版Qwen3.8-Max已上线阿里Token Plan等平台,限时优惠:日间Credits低至1折,夜间更优,个人/团队版月付仅35元起!
2991 135
|
19天前
|
存储 弹性计算 缓存
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
本文更新了2026年阿里云全系列云服务器租赁活动报价,所有特惠资源均可前往阿里云活动中心选购,整体覆盖从个人入门到企业级高性能场景的全梯度需求。其中轻量应用服务器主打极致性价比,2核2G峰值200M带宽配置每日10点、15点限时抢购价仅38元/年,2核4G配置379元/年起;高性价比的经济型e实例、通用算力型u2i实例覆盖2核4G至4核32G全档位,适配开发测试与中小型企业业务;搭载英特尔至强6处理器的第九代c9i企业级实例算力较上代提升20%,支撑高并发生产环境,不同实例规格价差清晰,用户可根据自身业务负载与预算灵活选型。
2348 121
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
|
20天前
|
人工智能 定位技术 API
高德汽车业务 AI Native 工程实践|基于 Qoder 的业务知识工程建设实践
高德企业业务通过 Qoder 知识引擎构建业务知识的"生产—调优—更新—消费"体系,同一类错误不再发生第二次,任务一次性通过率从 37.3% 提升至 61.5%。
231 0
高德汽车业务 AI Native 工程实践|基于 Qoder 的业务知识工程建设实践
|
19天前
|
缓存 人工智能 Java
刚刚:Qwen3.8-Max发布:概述、功能、定价、速率限制与上下文、内置工具及API 参考指南
Qwen3.8-Max是阿里最新发布的2.4万亿参数MoE大模型,支持图文视频多模态输入,具备编程、法律、金融等数百专业任务能力,原生视觉理解+超长上下文(1M),端到端交付生产级成果。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
|
20天前
|
监控 Shell API
Qoder CLI /loop 大升级:Agent 自调节奏,盯盘场景交给它就行了
Loop Engineering 新增动态唤醒机制:`/loop` 不再依赖固定间隔,Agent 可自主决定检查频率、触发时机与终止条件。支持 Monitor 事件秒级响应、三模式自动路由、TUI 管理面板及持久化任务,让盯盘、告警监控等弹性场景真正实现“交出判断权”。
212 0
|
19天前
|
缓存 人工智能 API
阿里云百炼deepseek-v4-flash模型介绍:模型特点、适用场景、最新优惠及部署流程参考
本文全面解析了阿里云百炼平台托管的DeepSeek-V4-Flash大模型的核心参数与使用指南。这款总参284B、激活13B的轻量化MoE模型,原生支持百万级超长上下文,最大输出长度可达39万+Tokens,推理速度快、调用成本低,适配日常对话、批量文案处理、基础RAG等高并发普惠场景。文章同步梳理了北京、新加坡、法兰克福等全球5大部署节点的能力支持情况、分区域计费标准与限流规则,同时标注了预览版与2026年7月31日正式稳定版的版本差异,帮助开发者快速完成选型与API集成。