Qoder CLI 上的 Qwen3.8-Max-0902:与 Fable 5.1 同题实测

简介: 9月2日,Qwen3.8-Max-0902正式发布,Qoder CLI首发接入。经6大高难度真实任务与4套Agent基准评测,其在多模态审美、端到端长程任务执行及自主验收能力上全面领先,尤其在游戏生成、3D建模与创意绘画中表现卓越。

F3C3F3A3-8EF7-4F4B-9CF8-57AB22F7AA05.png


9 月 2 日,Qwen3.8-Max-0902 最新版正式发布,Qoder CLI 首发接入,同时,我们在第一时间完成了一轮完整评测:6 道高难度真实任务 + 4 套 Agent 基准,对照组覆盖 Claude Code(Fable 5 / 5.1)、Codex(GPT-5.6 Sol )、Antigravity(Gemini 3.8 Flash)。


评测跑完,Qoder CLI + Qwen3.8-Max-0902 的能力画像相当清晰。它有三大长板,每一项都在同题对照中得到了验证:


  1. 多模态审美:能准确读取输入的细节,并转化为高水准的视觉作品;
  2. 端到端更强:在需要持续投入、多轮自主操作的长程任务上保持稳定表现;
  3. 自主验收:自己写测试脚本、自己截图验收,直到通过自己设的标准;


福利:9 月 4 日 22:00 起,在 Qoder CLI 上使用 Qwen3.8-Max(目前默认是0902最新版)和Qwen3.8-Flash,夜间时段(每日 22:00 至次日 08:00,SGT)一律 4 折,前往 https://qoder.com/cli 即可安装使用。


评测方法


  • 同题同卷:同一道题、同一份 prompt 下发,单次运行,不重跑、不挑结果;
  • 环境隔离:每个模型在独立环境中运行,互不干扰,排除环境差异对结果的影响;
  • 统一验收口径:交付物统一为单文件 HTML,超时上限 2 小时;
  • 结果直出:产物零修饰、零筛选,运行结果直接呈现。


评价体系:


维度

考察内容

审美

Agent 对构图、配色、动效观感等的理解

理解

对题目细节与图片输入的识别还原

完成度

功能、逻辑与实现的完整程度

交互

交付物可玩性、操作体验


01.png


游戏生成

地铁跑酷


第二类任务我们看游戏。第一个 case 是地铁跑酷:三车道无尽跑酷,要求跳跃、翻滚、滑铲三套动作,能跳上火车车顶奔跑,四种改变玩法的道具(双倍分、喷气背包、超级跑鞋、悬浮板抵消一次撞击),外加计分存档、道具倒计时条等。


从画面完成度和操作流畅度看,Claude 和 Qoder CLI 明显胜出,拿起来就能玩。而 Qoder CLI 的优势更明显:


  • 玩法闭环更完整:题面要求的四种道具之外,它多做了磁铁道具,补上了暂停恢复、音效和静音键,这些题目没要求,但玩家默认该有;


  • 判定公平经过验证:"悬浮板抵消一次撞击"这类最容易做假的机制,它逐项验证了激活、吸撞、冷却期防连用,不是看起来能玩,是被证明能玩;


  • 交付前自己当了回测试:它给自己写了自动化验收脚本,用无头浏览器跑完 83 项检查、截下 8 个游戏状态的自测图才交卷,只有 Qoder CLi 完成了验收报告交付。


钉钉录屏_2026-09-07 164908.gif


网球对战游戏


第二个 case 是机器人网球:第三人称你 vs CPU,要求低多边形球场、机器人根据球的位置自动选择正手/反手/高压扣杀/抛球发球四种挥拍动作、落点预示环、真实网球计分、发球失误判罚。Qoder CLI 的优势更突出:


动作集更全面:题面要求的四种挥拍它全部实现,扣杀、抛球发球都有独立动作;Codex 版没有做高压扣杀;


规则理解更准确:15/30/40、平分、二发判罚之外,它还实现了题面没要求的抢七局,对于一个游戏开发来讲,他对游戏所在领域的规则探索更深入;


氛围感拉满:看台观众、击球音效加静音键,在 prompt 里没有专门提出,但 Qoder CLI 自主识别了在此背景下需要的氛围,有它们才像一场比赛而不是一个物理演示。


钉钉录屏_2026-09-07 165601.gif


02.png


纯代码 3D 建模


海盗船驶入日落


3D 场景是这次七道题里最考验空间几何能力的一道:船体、海面、落日光源要在同一个三维坐标系里各就各位,任何一处网格计算错误都会直接暴露成穿模。


实测下来, Gemini CLI 和 Codex 的产物都出现了穿模,船体部件互相穿透,模型经不起细看。建模完整、几何关系正确的只有 Claude 和 Qoder CLI。


而在这两个里,Qoder CLI 的光影处理更进一步:


第一是阴影更准。投影位置和落日光源方向一致,整个场景的光影是自洽的。


第三是背光面立体感十足。阳面受光、阴面渐暗,明暗过渡的逻辑完全正确,这不只是渲染做得好,更说明模型对光照方向和自然环境的理解本身是对的。


第三是场景更真实。日落的海面之上还加入了飞鸟,环境氛围补齐了最后一块。


钉钉录屏_2026-09-07 165748.gif


火箭发动机 3D 建模


这道题的难点在于零参考建模:火箭发动机结构复杂、公开资料只有照片和参数,没有任何现成 3D 素材可用,模型需要仅凭对机械结构的理解,用 Three.js 基础几何体从零造出一台发动机,考的是工程认知和程序化建模两种能力的叠加。


钉钉录屏_2026-09-07 170204.gif


结构精密,解释完整,符合物理规范:喷管、燃烧室、预燃室、涡轮泵逐一建模并标注,配有推力 230 吨、燃烧室压力 300 bar 的参数卡;页面角落还有一行主动声明,"参数为公开近似值,几何为解释性模型而非 CAD",对自己交付物的数据边界标注得清清楚楚。


交互顺畅:自动旋转、剖面视图、标签开关三个控制按钮全部可用,点击零件即可查看该部件的详情,看模型的体验接近一个成品级的产品演示页。


工程语义理解到位:各部件按真实的装配逻辑组织,预燃室驱动涡轮泵、涡轮泵向燃烧室供给推进剂、燃气经喷管膨胀排出,整条工质流路的空间关系与工作原理一致,零件之间的连接逻辑通畅。


03.png


多模态审美


两道题:一道看图作画,检验多模态理解;一道命题作画,检验风格约束下的创作能力。


柑橘切片上的舞者


这是一道创意生成题:输入一张真实的柑橘切片照片,要求把人体姿态与切片融合成一幅完整构图,切片要参与到画面里,不能只是摆在旁边当道具,考的是模型怎么理解这张图、怎么在它基础上再创作。


钉钉录屏_2026-09-07 171057.gif


首先是作画过程,Qoder CLI 的绘画流程和插画师的工作顺序基本一致:先起线稿定构图,再分层上色,然后刻画细节,最后加高光收尾。


另一个值得说的是,Qoder CLI 给出的构图是一位旋转中的芭蕾舞者:橙子切片是撑开的裙摆,果皮是裙边,果肉纹理是褶皱,几滴果汁是甩出的水珠,在思路和创意性上,表现更好。


中国剪纸动画


这是一道命题创作:中国剪纸风格的循环动画,配色限定朱红、金黄、靛蓝三色,要求呈现纸质纹理与视差效果,云飘、船行、鸟飞、日升全部无缝循环。限制条件越多,越考验创作能力。


钉钉录屏_2026-09-07 171233.gif


先看动效和造型:Qoder CLI 生成的动线都做到了无缝循环,运动轨迹自然,没有卡顿和跳帧。构图上画面按黄金比例分割,三色限定内做出了层次,大面积朱红与靛蓝形成冷暖对比,浅色的天空与流水相互呼应。远山、村落、近水三层景深依次递进,剪纸本是平面语言,同时在平面里做出了纵深。


04.png


写在最后


6 个 Case 跑完,我们对在Qoder CLI 上使用 Qwen-3.8-max-0902 的整体结论是:


  • 完成度:长需求清单落地率高,并出现自发编写验证脚本、自动截图验收的行为;


  • 审美:均达到全场前列水准,以及在模型构建中、图画创作中的构图能力是非常突出的长板;


  • 理解和逻辑:逻辑更通顺,更能读懂指令的上下文和背景,做出更优的判断;


  • 交互:会主动补体验细节,暂停、静音、道具等没要求也做了的,成品的完成度不止于一次性 demo。


总结这轮评测:在 Qoder CLI + Qwen3.8-Max-0902 的实测中,对于视觉呈现、审美、交互体验等场景下的能力更为突出。


同时,给正在选型的团队三条参考:


  • 任务复杂、需求清单长、对交付确定性要求高,Qoder CLI 是可靠的选择;


  • 无论选哪个模型,Harness 层都值得纳入技术决策,同一个模型,Harness 的差异可以直接反映在结果上;


  • 页面构建、动效交互、图画创作这类视觉生成类任务上,Qoder CLI + Qwen3.8-Max-0902 这套组合表现极佳,值得放进优选清单。


👇本次所有评测 Prompts 都在这里:

https://gist.github.com/sorrycc/2142edaa410e709414cfbd5e21f39d73


欢迎大家前往 Qoder CLI  体验最新版 Qwen3.8-Max。

目录
相关文章
|
21天前
定价问题
用户吐槽积分定价过高,6000积分仅够周末两天(周六晚+周日白天)使用,相较国际版2000积分明显缩水;原以为4000多积分充裕,实际迅速耗尽,直呼“用不起”,表达强烈不满与使用意愿下降。
183 0
|
21天前
|
缓存 人工智能 自然语言处理
阿里云Qwen3.8-Max最全介绍:模型能力、适用场景、使用教程与最新活动参考
本文介绍了阿里云通义千问旗舰基座Qwen3.8-Max,这款2.4万亿参数的MoE架构模型拥有百万级上下文窗口、原生多模态能力,在编程与智能体场景表现突出。文章覆盖五大地域部署差异、分地域Token计费标准、最新0902快照版本特性,同时提供两种接入教程,搭配新用户免费额度、夜间5折等最新活动,帮助开发者快速上手这款第一梯队大模型。
|
21天前
|
IDE 安全 测试技术
Agent式编程新工具Qoder CN全解:Quest2.0、专家团、沙箱、Hook与CLI全链路实操教程
Qoder CN依托Quest2.0任务引擎、专家团多智能体协同、Repowiki工程知识库、终端沙箱安全隔离、Hook扩展机制,完成从简单代码补全向工程级自主开发工作台的跨越。提供原生IDE、主流IDE插件、CLI命令行多形态接入,兼容多款主流大模型,兼顾个人开发者与企业团队的研发场景。
249 0
|
18天前
|
IDE 开发工具
Qoder 上线 Sonus 模型,Computer Use 能力全面增强
Qoder国际版上线全新内置大模型Sonus(/ˈsoʊnəs/),全球领先,专精超长任务执行与电脑操作(Computer Use)。配合Qoder桌面端0.2.3版本,可自主完成编程、金融建模、科研及表格制作等复杂工作。现全面支持Qoder全系产品,效率提升3.2倍。
1894 9
Qoder 上线 Sonus 模型,Computer Use 能力全面增强
|
21天前
|
人工智能 前端开发 开发者
整理了一个 GPT-6 Astra 游戏与交互作品合集,分享几个案例
Awesome GPT-6 Astra 是一个开源合集项目,收录4款由GPT-6 Astra辅助开发的交互作品:瓜体实验室、Mosswing、魔毯巫师与轨道花园,涵盖合成游戏、飞行挑战与粒子艺术。含体验入口、源码、Prompt及作者署名,旨在展示AI协作潜力,促进开发者交流。(239字)
|
13天前
|
IDE 开发工具
每日重置开启!每天领 500 Credits,体验 Sonus
Qoder国际版推出「每日重置」活动:9月15–19日,付费用户每日12:00可领500 Credits Sonus模型资源包(计费3.2x),次日12:00失效,不累计不补领。
551 0
|
22天前
|
人工智能
Qoder CN AI产品界的笑话
赠送的300Credits只改了24行代码
|
20天前
|
缓存 JSON API
阿里云千问Qwen3.8‑Max深度解析:核心能力、订阅计费规则、API接入配置与生产落地完整教程
Qwen3.8‑Max作为千问系列新一代MoE架构旗舰基座,总参数量达到2.4万亿,激活参数950亿,是面向复杂专业任务、长周期智能体、工程级代码开发、多模态深度解析的高阶大模型,原生支持文本、图像、视频多模态输入,最大上下文窗口达到百万Token,最大输出Token支持131072,内置深度思考推理链路,在编程、科研、法律金融专业分析、长视频文档解析、自主Agent任务等场景能力表现突出。很多开发者在项目前期直接接入该旗舰模型,却对模型能力边界、多种计费模式、订阅套餐权益、API参数配置、上下文缓存优化缺乏完整认知,出现成本失控、接口报错、长文本信息丢失、深度思考模式额外消耗大量Token等
1327 5
|
27天前
|
人工智能 安全 API
阿里云Token Plan 个人版Quick Start:最低39 元/月,主流AI工具直接接入,Credits 统一计量
阿里云百炼 Token Plan 个人版是面向个人开发者的 AI 大模型订阅服务,采用 Credits 统一计量,支持在 Claude Code、Cursor、Qwen Code 等主流 AI 编程和智能体工具中使用。目前提供 Lite、Standard、Pro 三档套餐及用量包,限时价格分别为 39 元/月、139 元/月、499 元/月。
阿里云Token Plan 个人版Quick Start:最低39 元/月,主流AI工具直接接入,Credits 统一计量
|
18天前
|
人工智能 自然语言处理 语音技术
阿里云千问大模型选择指南,覆盖六大核心模型方向,从文本到音视频全能力解析
本文为大家梳理了阿里云通义千问全系列大模型,覆盖通用文本、视觉语言、图片生成、视频生成、全模态、语音识别六大核心产品线,逐一拆解各主力版本的核心能力、技术优势与适用场景,同时汇总了按量折扣、夜间错峰、新人免费额度等最新优惠活动,帮助开发者快速完成模型选型,兼顾业务效果与调用成本。