爆火的《牛来》模型正式发布!DeepSeek 的排名又下降了。。

简介: 刚刚智谱全新模型 GLM-5.3-Flash 发布,能力对标 Claude Opus,价格只有 1/40?3 大项目实战测评,对比 DeepSeek V4 和 Kimi K3,看看开眼后的 GLM 模型效果到底如何?

大家好,我是程序员鱼皮。

前几天,海外 AI 平台 OpenRouter 和 OpenCode 上突然冒出了一个没有任何背景介绍的匿名模型 Ox-Alpha,俗称「牛来」模型。

没人知道它是谁做的,但开发者们试用之后纷纷上头了。上线首日直接冲到 OpenRouter 榜首,刷新了平台单日 Token 用量的历史纪录,甚至终结了 DeepSeek 在 OpenCode 连续 56 天霸榜的纪录!

ox 模型的 LLM Leaderboard 排名

谷歌还屁颠屁颠儿地跑出来蹭热度认领,说这是自家的模型,结果被全网笑惨了。

就在昨天,这个神秘模型终于正式揭晓身份。

它是智谱的 GLM-5.3-Flash,是国产模型!

GLM-5.3-Flash 是智谱的首个 原生多模态模型,采用全新架构,仅 320B 参数(激活仅 18B),能力就可以对标 Claude Opus 4.8,而且价格竟然只有 Opus 4.8 的 1/40 !

GLM-5.3-Flash 上线即开源,采用 MIT 协议,而且全部流量跑在 10 万张国产芯片上!

在 Artificial Analysis Intelligence Index 这个国际权威综合能力榜上,GLM-5.3-Flash 拿到了 57 分,跟 Claude Opus 4.8 持平,超过了 DeepSeek V4 Pro(53 分)和 DeepSeek V4 Flash(52 分)。在 Coding 方向的多项基准上也都逼近甚至超过了 Opus 4.8,但价格目前仅为 Opus 4.8 的 1/40,常规场景下也比涨价后的 DeepSeek V4 Flash 更便宜。

智谱 GLM-5.3-Flash 跑分图

一条新的 AI 模型斩杀线,正在形成。

以前大家默认 AI 具有前沿能力就意味着高昂的价格,GLM-5.3-Flash 把这个等式打破了。

GLM 终于开眼

对我来说,这次最兴奋的升级不是价格,而是原生多模态。

GLM-5.3 虽然编程能力很强,但它是个「瞎子模型」,写完代码之后没办法自己看一眼页面长什么样。同样的问题在测试 DeepSeek V4 Pro 的时候也遇到了,前端做出来的效果对不对、好不好看,模型自己完全判断不了。

AI 公司当然能意识到这个痛点,于是前阵子 DeepSeek V4 Flash 率先放出了多模态版本 DeepSeek-V4-Vision-Exp,这次智谱直接跟上,而且视觉能力是从预训练阶段就原生融入的,让 AI 天生就有一双慧眼。

也就是说,AI 写完一段前端代码之后,它自己就能截图看效果、发现布局错位或者配色不对、然后自己修复,不需要你人工介入一步步测试和验收了。这对 AI 编程的体验提升是巨大的。

官方提供了几个 Demo 案例,咱们一起来看看。

1、3D Blender 建模

GLM-5.3-Flash 在没有任何外部素材的情况下,自主运行了 16 个小时,用 Blender 从零搭建了一套约 400 平方米的专业主厨自宅和厨房。模型通过反复渲染、查看画面、定位问题、再迭代修正的方式,完成了整个场景构建。

2、设计稿到完整 APP

让 AI 基于参考页面的截图进行像素级复刻,模型会分析设计体系、页面关系、共享组件、导航结构和动效逻辑,然后逐页截图与参考图对比,持续修正差异,直到视觉还原度达标。

设计稿原型图:

设计稿原图

复刻出来的成品 APP,还原度很高:

3、主题视觉复刻

基于节日视觉设计,复刻红包封面的平面艺术风格和动态展示体验。

这个复刻效果,你觉得怎么样?

4、游戏复刻

让 AI 自主复刻经典的 Godot 游戏《喷射战士》。

好家伙,看看这个效果,我甚至以为是原作……

当然,官方 Demo 再好看也只是参考,到底好不好用还是得自己试了才知道。

下面我准备了 3 个项目来实测 GLM-5.3-Flash 的编程能力,从前端视觉复刻、全栈应用开发到多模态综合任务,由浅入深。

工具准备

这次实战我选用的 AI 编程工具是 ZCode,这是智谱 GLM 系列的官方 Harness 工具。

如果你平时就打算用 GLM 系列模型来 AI 编程,那 ZCode 是更好的选择,毕竟是角色专武嘛。它对自家模型 GLM-5.3-Flash 的多模态能力支持得最好,还内置了浏览器控制和电脑控制功能,模型可以直接操作浏览器、截图验证、自主调试。

打开 ZCode,会先让你登录授权,国内选择连接 BigModel 平台。

登录之后就进入了熟悉的 Agent 面板,跟 Codex 长得几乎一模一样,可以在对话框中直接切换使用最新的 GLM-5.3-Flash 模型。

另外,为了让 AI 运行时能够获取到最新的信息,还需要准备好联网搜索插件 Firecrawl、以及获取最新文档的插件 Context7。分别到各自的官网安装就好了,ZCode 会自动识别出本地已经安装的技能。

ZCode 自带浏览器控制和电脑控制功能,开启之后模型就能直接打开浏览器截图验收、操作桌面应用。需要先在设置里点击授权,允许辅助功能和屏幕录制权限。

准备工作搞定了,下面开始实战。

GLM-5.3-Flash 实战测评

实战 1、复刻 Apple Vision 产品页

第一个任务,我想测的是 GLM-5.3-Flash 的视觉理解能力,看看到底有多强?

最直观的方式就是让 AI 去复刻一个视觉效果很复杂的网页。我选了 Apple Vision Pro 的官方产品页,这个页面有大量的滚动触发动画、3D 产品展示、深色科技感背景和精致的文字排版节奏,是公认难度很高的前端设计。

提示词里我要求 AI 先用 Firecrawl 抓取目标页面的结构信息,然后充分利用视觉理解能力,先截图分析目标网站的布局和风格,开发过程中每完成一个模块就自己截图对比验证,不满意就优化,直到满意再交付。

我特地开启了完全访问模式,让 AI 可以自由安装依赖和启动服务,省去中间的确认环节:

AI 拿到任务之后,先加载 Firecrawl 技能联网抓取了 Apple Vision Pro 产品页的网页结构,然后加载浏览器自动化技能,对目标页做了 8 个不同滚动位置的截图分析,提取出页面的章节节奏、双导航结构、文字韵律等设计细节。

做完这些准备工作之后,AI 才正式开工写代码。

整个开发过程中,AI 会不断截图对比自己的成品和 Apple 目标页的效果,发现差异就调整。比如它会检查缩放舞台的文字与产品淡出时序是不是跟原版一致,章节标题的亮度对不对,媒体辉光效果够不够。

经过了 12 轮截图验证,AI 花了大约 19 分钟完成了整个任务,并且自动帮我启动了项目:

来看看成品效果。在没有使用任何 Apple 官方图片素材的情况下,整体布局的还原度相当高!

举个例子,对比一下导航栏的复刻效果,双层导航结构、胶囊按钮、产品子导航的排列方式都还原了:

整个页面的深色科技氛围和原版很相似,文字的排版节奏也是对味儿的:

虽然没有真实的产品摄影图片,但整体的视觉还原度已经很不错了。如果把正式的产品图片替换上去,基本可以直接当成一个完整的产品宣传页来使用。

以后如果你想做个产品宣传网站,直接把要复刻的网址或者 UI 截图发给 AI,它就能帮你搭出来个八九不离十的版本,然后再手动微调细节就行了。

实战 2、全栈 AI 绘图工具

第二个任务我换了方向,测试 GLM-5.3-Flash 的全栈工程能力。

我选了跟之前测评 GLM-5.3 时完全一样的案例,让 AI 开发一个 AI 智能绘图工具。

用户输入自然语言描述,后端调用大模型生成 draw.io 兼容的 XML 图表结构,前端嵌入 draw.io 开源编辑器实时渲染,还支持连续对话修改。

之所以用同一个案例,是为了跟之前在 DeepSeek Harness 里测试的 GLM-5.3、DeepSeek V4 Pro、Kimi K3 做横向对比,看看 GLM-5.3-Flash 在 ZCode 环境下表现如何。

而且 GLM-5.3-Flash 本身就支持 API 接入,正好可以作为这个应用内置的 AI 模型,一举两得。

提示词跟之前完全一样,只是把内置的 AI 模型从 DeepSeek V4 Pro 换成了 GLM-5.3-Flash。

AI 通过 Firecrawl 联网抓取了 draw.io 仓库结构和嵌入协议文档,发现了一个关键信息:draw.io 支持 AUTOSAVE 事件,编辑器会主动推送 XML,这样就能实现双向实时同步,不需要魔改源码。

大约 46 分钟后,AI 完成了任务,主要的时间都花在了自动化验证上。

来看看成品效果。刚打开页面我就被吸引到了,这个 UI 设计很有科技感,而且 draw.io 的集成非常自然,不像是生硬嵌入的第三方组件,而是融合成了产品本身的一部分。

我让 AI 帮我画出 DeepSeek Harness 的架构图。左侧可以实时看到 AI 工作的过程,右侧显示了一个加载动画。

生成完成后,右侧立刻渲染出了完整的架构图,分层清晰,而且保留了 draw.io 原本的元素编辑能力,可以直接拖拽和修改。

更强的是,网站支持连续对话修改。比如我说「帮我把 Harness 服务层这块的背景改为红色」,AI 就能精准定位到对应的元素并修改样式,右侧画布也会实时更新。

不过偶尔也会出现 AI 生成的 XML 跟 draw.io 不兼容的情况,弹出解析错误的提示。之前我用 Kimi K3 跑同一个案例的时候也遇到过类似的问题,这估计是目前 AI 生成结构化代码时的通病了。

看了 GLM-5.3-Flash 生成的效果后,再跟之前在 DeepSeek Harness 里测试的其他模型对比一下。

之前 GLM-5.3 做的版本界面科技感最强,把 draw.io 深度融合到了自己设计的界面中,生成的架构图分层清晰,连续对话修改也很顺畅:

DeepSeek V4 Pro 的版本虽然功能跑通了,但整体界面粗糙,draw.io 是直接整个嵌入的,给人的感觉很生硬:

Kimi K3 的版本前端设计挺好看,draw.io 的融合度也不错,但后端偶尔翻车,会直接把 XML 源码糊在界面上而不是渲染成图形。

综合来看,GLM-5.3-Flash 这次的前端效果比 GLM-5.3 和 Kimi K3 略逊一筹,主要体现在界面精致度上。

后端能力比 GLM-5.3 弱了一些,偶尔会出现 XML 不兼容的情况,跟 Kimi K3 的水平差不多。但综合效果明显超过 DeepSeek V4 Pro,毕竟 draw.io 的集成方式和整体产品设计意识都好了不止一个档次。

实战 3、3D 联机对战游戏

最后一个任务我想测的是 GLM-5.3-Flash 的多模态综合理解能力和长程工程能力。

一方面看它能不能从图片中提取视觉信息并转化成实际的代码产出,另一方面看它能不能在复杂的大项目中稳定运行而不翻车。

最近《牛来》不是很火么?

于是我让 AI 开发一个 3D 双人联机实时拳击对战游戏《牛来格斗》,致敬拳皇和奥特曼格斗进化系列的经典对战体验。

关键在于,我会提供 6 张《牛来》动画电影的角色原片图片,让 AI 分析这些角色的造型、体态比例和色彩风格,然后把它们还原成游戏中的可选角色。

这个任务对多模态能力的要求非常高,AI 不仅要理解格斗游戏的玩法机制,还得从图片中提取视觉信息并转化成 3D 角色建模。

AI 拿到 6 张参考图之后,通过联网搜索获取了拳皇和街霸的核心机制,然后分析参考图确定了 4 个可选角色的方案:

整个 ZCode 的开发体验还是很丝滑的。AI 自己就能打开内嵌浏览器,操作页面然后截图验证效果,发现问题就自己修复,不需要我做任何干预。

苦苦等待了 2 个多小时,AI 终于完成了任务。总共经历了 4 轮完整的开发 - 验证循环,长程任务没有翻车。

我已经开始期待成品了……

打开游戏主页,《牛来》那股抽象的味儿扑面而来~

试试人机练习模式,先选择你的斗士。这 4 个角色的 3D 建模我觉得还不错,金黄色的牛麻麻、橙色的小牛来、斑点金钱豹、棕色的牛霸霸,跟我给的参考图还是挺像的吧?

开始对战!

角色的出招方式很丰富,轻拳、重拳、轻踢、重踢、防御、闪避一应俱全。

看我豹拉一脚把牛来踹了个跟头,打的牛来叫「妈妈」:

就你欺负我儿子牛来是吧?

牛麻麻亲自下场,先给你来一连串牛家拳,15 连击!

还可以释放必杀技,蛮牛冲撞!特效还可以,打击感十足~

每个角色的必杀技风格都不一样,小牛来的必杀是「飞天小牛弹」,会把对手轰出画面,动画效果很流畅:

再试一下局域网联机功能。虽然能够正常加入房间开局,但双方的画面并没有实时同步。说明 GLM-5.3-Flash 在处理复杂的实时网络同步逻辑上还有一些不足。这也算是意料之中的事,WebSocket 状态同步本来就是后端最难搞的场景之一。

但游戏单机对战的体验确实超出了我的预期。一个 AI 从 6 张图片出发,自己搜索格斗游戏的设计规范,自己分析角色造型转化成 3D 建模,最后做出一个有连招系统、必杀技特效、完整 UI 流程的格斗游戏,整个过程不需要人工干预。

视觉理解能力对 AI 编程的加持,在这个测评中体现得淋漓尽致。

我的感受

三个项目都跑完了,聊聊我的真实感受。

这次 GLM-5.3-Flash 最大的亮点毫无疑问是视觉理解能力。之前测试 DeepSeek V4 Pro 和 GLM-5.3 的时候,前端效果好不好看、布局有没有错位,模型完全判断不了,只能靠人工验收或者 Playwright 做一些基础的文字化断言。

现在 GLM-5.3-Flash 能自己截图验证了,整个开发体验完全不一样。复刻 Apple 产品页的时候 AI 做了 12 轮截图对比,开发格斗游戏的时候 AI 通过截图抓到了一个纯代码审查根本发现不了的视觉 Bug。这种「写完代码自己看一眼效果」的能力,对 AI 编程来说真的是质的提升。

除了模型能力之外,大家最关心的肯定还是性价比。我开通了 GLM Coding Plan 的 Pro 套餐,三个项目跑完之后看了一下使用统计,5 小时额度才花了 40% 左右,这周才花了 8% 的额度。

换算一下,GLM-5.3-Flash 相比 GLM-5.3 额度翻了 3 倍,而且非高峰时段(包括周末全天)积分消耗减半。按照 Pro 套餐的周额度和我实际消耗的比例来算,跑完这 3 个项目的成本才不到 10 块钱。而且我测的项目复杂度都不低,如果你只是日常写点小工具、做个页面的话,一周的额度根本用不完。

相比之下,DeepSeek 八月份全面提价之后,同样的任务量如果用 V4 Pro 来跑,估计要花几十块,V4 Flash 来跑也要花 20 多块,差距一目了然。

此外,智谱也学会 Codex 那一套了,GLM-5.3-Flash 发布当天直接重置了所有用户的使用限额。对用户来说这当然是好事,白票一波新模型的机会,说不定以后有事儿没事儿就能重置一波呢?

不过 GLM-5.3-Flash 的能力上限肯定是比不过 GLM-5.3 这个旗舰模型的。在 AI 绘图工具的横评里能明显看出,GLM-5.3 做出来的产品可用性和精细度还是更高一截。

GLM-5.3-Flash 的定位是 日常好用、高性价比的牛马模型,大部分任务它都能胜任,偶尔遇到需要极致效果的场景再切换到旗舰模型就好。

综上,我单方面不负任何责任地宣布,DeepSeek 的排名又下降了一位。

OK 就分享到这里,本文会收录到我免费开源的 《AI 编程零基础入门教程》,上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。

开源指路:https://github.com/liyupi/ai-guide

鱼皮的 AI 编程教程

我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~

也欢迎在评论区分享你自己使用 GLM-5.3-Flash 模型的体验。

相关文章
人工智能 缓存 前端开发
11880 61
人工智能 JavaScript 开发工具
4768 17
Web App开发 人工智能 API
1321 1
人工智能 Java BI
1400 1
开发工具 Swift git
1943 6
人工智能 JavaScript 测试技术
2295 2
人工智能 自然语言处理 安全
829 0
人工智能 JavaScript 测试技术
1155 4
缓存 JavaScript Shell
2084 3

热门文章

最新文章