把 GLM-5.3 接入到 DeepSeek Harness,夯爆了!

简介: GLM-5.3 + Kimi K3 + DeepSeek V4 Pro 模型同时接入 DeepSeek Harness,前端 + 后端全栈 2 大任务横评测试,到底谁是 AI 编程之王?

大家好,我是程序员鱼皮。

最近 AI 圈儿真是过年了,前脚 DeepSeek V4 Pro 正式版和 DeepSeek Harness 同时发布,后脚智谱就放出了全新的 GLM-5.3 模型。

听说 GLM-5.3 模型的基座跟 GLM-5.2 完全一样,还是 743B 参数,单纯通过后训练把性能提升了 50%。

测不完,根本测不完……

既然现在 GLM、DeepSeek、Kimi 几家国产模型打得这么凶,那干脆在同一个擂台上打一场呗?

我相信你们肯定也想看对吧~

刚好最近大火的 DeepSeek Harness(DSH)支持接入第三方模型,于是我决定把 DSH 当做一个统一的评测工具,把这三家的最新模型放在完全一致的工具链环境下测试,只有模型本身不同,尽量做到公平对比。

DeepSeek Harness 工具

点个收藏,我们开始。

模型接入 DeepSeek Harness

首先要把 GLM-5.3 和 Kimi K3 模型接入 DeepSeek Harness,这里我就以 GLM-5.3 为例。

如果你还没有安装和使用过 DeepSeek Harness,可以看看我之前的 《DeepSeek Harness 保姆级教程》,从安装到上手只要几分钟。

视频教程:https://www.bilibili.com/video/BV1VkgK6NEZS

这里我只讲怎么在已有的 DeepSeek Harness 里接入第三方模型。

1)打开 DSH 的 Web 界面,点击左下角的「设置」按钮。

2)进入「模型」标签页,点击「添加提供方」。

3)选择模型提供方为 zai-coding-cn,然后到 智谱开放平台 获取你的 API Key 填进去就行。

4)展开自定义设置,点击「获取可用模型」。不过因为 GLM-5.3 太新了,默认不会被自动拉取到。

所以需要手动点击「添加模型」,填入 glm-5.3,然后保存。

搞定!现在就可以在对话框中选择并使用 GLM-5.3 模型了~

用同样的方法把 Kimi K3 也添加进来。DeepSeek V4 Pro 是 DSH 安装成功后默认接入的,不需要额外配置。

三个模型都就位了,下面开始正式比拼。

测试说明

为了公平对比,三个模型全部在 DeepSeek Harness 的标准模式下运行,统一使用各模型的默认推理档位,工具链完全一致,提示词完全相同。而且全程不做人工干预,给完提示词就让 AI 自己跑到底。

DSH 会自动扫描我本地安装的技能目录,比如我这里装了 Firecrawl 联网搜索技能、Context7 文档查询技能等,三个模型跑任务时都可以使用这些技能来搜索资料。

实战 1、致敬《牛来》的 3D 跑酷游戏

最近有一部国产动画电影叫《牛来》,因为建模极度粗糙、剧情抽象离谱,在社交媒体上反向爆火了。

上映第一天票房才 3420 元,结果因为猎奇打卡,短短十几天就冲到了 900 多万。

用半佛老师的话来说:

  • 如果你花一个多小时去了解这个电影,你就浪费了人生的一个小时。
  • 但如果你花了 30 块去看了《牛来》,那说明你真的有 30 块钱。

我决定让 3 个模型致敬这部电影,做一个《3D 网页跑酷游戏》。

提示词里我故意不做太多功能约束和技术限制,就是想看看模型自己能发挥到什么程度,能不能把电影里的元素还原出来。值得一提的是,我让 AI 用 Loop Engineering 的方式推进,做完一步就自己验证一步,出了问题自己修复。

OK,开跑!

GLM-5.3 成品效果

先来看 GLM-5.3 的效果。

进入主界面,可以看到一段故事描述。

有看过《牛来》的朋友吗?这个描述跟电影剧情还挺贴的,草原上的小牛犊牛来,跟随云雀坠入一场大梦,穿过迷雾、狼群与轰鸣的伐木场,唯有向前奔跑才能学会勇敢…… 还挺励志。

进入第一关「晨曦草原」,你别说,这个牛的建模真的挺抽象的,尤其是牛脸竟然还直勾勾地对着你……

旁边还有个云雀好友陪着牛牛向前奔跑,有点还原电影那个味儿了。

游戏操作支持左右移动、跳跃和滑铲,手感还挺流畅的,可玩性不错。

吃到一定数量的幸运草之后,可以释放大招,进入「豹拉疾冲」状态,全屏加速 + 无敌。

解释一下,豹拉是电影里牛来的好朋友,这个大招名字起得挺有意思的。

游戏有好几个关卡,而且每一关的主题和机制都不一样。比如「狼群夜袭」这关,你身后真的有狼在追你,还有一个贴合剧情的技能叫「妈妈的守护」,我直接一个泪目。

可惜,最终牛牛我倒在了第四关。

看看这个死亡结算画面,我真的没绷住,怎么还喷出一团血花了呢?

细节,真的细节……

DeepSeek V4 Pro 成品效果

再来看看 DeepSeek V4 Pro 的版本。

主界面还挺像那么回事,也还原了云雀和牛来的故事背景。

进入游戏。

额…… 怎么硕呢?

界面真的是干净得一鲏啊!

不过还原了云雀和好友豹拉,它们会陪着牛牛一起奔跑。

移动、跳跃和滑铲功能都是正常的,不过看到这个滑铲效果我真没绷住…… 好家伙,眼珠子都给我铲出来了?

仔细看的话,道路两侧的图标明显飘在了草坪上面。还有就是游戏节奏太慢了,刚开局跑了好久第一个障碍物才出现,也没什么技能和特殊的关卡机制,可玩性较差。

牛牛只有一条命,撞到石头之后直接进入死亡结算画面:

整体来看,中规中矩吧。

Kimi K3 成品效果

最后看看 Kimi K3 的版本。

主界面的配色平平无奇,跟其他模型一样,也把电影剧情概括了一下。

进入游戏,界面风格还可以,远处的大山绘制得不错。但是主角牛牛就平平无奇了,不够抽象,看起来就是一组普通的方块。

虽然牛牛有 3 条命,也可以吃金币,但是没有什么技能和特殊机制,整个游戏就是单纯跑跑跑。

我的豹子朋友呢?云雀呢?

还有这个下雨效果,直接来一个全屏网格?这就有点敷衍了吧……

而且最致命的问题是,整个游戏时不时会出现明显的卡顿,帧率不够稳定。

最后是平平无奇的结算画面,一般。

实战 1 对比

三个版本都跑完了,胜负应该已经很明显了。

GLM-5.3 的版本完成度最高,多关卡、多技能、剧情还原度强,可玩性远超其他两个。

DeepSeek V4 Pro 实现了基本玩法,但是节奏偏慢、细节粗糙。

Kimi K3 虽然场景画面还行,但游戏机制太单一,还有卡顿问题。

综合来看:

  • 前端效果 GLM ≈ Kimi > DeepSeek
  • 可玩性是 GLM > DeepSeek > Kimi
  • 画面抽象程度是 GLM > DeepSeek > Kimi

整体游戏完成度上,GLM 5.3 遥遥领先。

实战 2、AI 绘图工具

上一个任务是前端游戏,第二个任务当然要换个方向,测试模型的全栈工程能力。

我让 3 个模型开发一个《AI 绘图工具》,用户输入自然语言描述需求,后端调用大模型生成 draw.io 格式的图表,前端嵌入 draw.io 开源编辑器,用户可以直接在线编辑和修改生成的图表。

这个任务同时考验对 draw.io 开源代码的理解、后端 AI 调用链路的设计、前端复杂组件的集成、以及整体产品设计的合理性。

为了方便测试,我直接在提示词里把 API Key 提供给了 AI,省去手动配置环境变量的步骤。

GLM-5.3 成品效果

先看看 GLM-5.3 的效果。

整个页面很有科技感,左侧是 AI 对话框,右侧是画布编辑器。

产品引导做得也很到位,告诉你可以用一句话画出专业图表,还给了几个示例类型。

我让 AI 帮我画出 DeepSeek Harness 的架构图。可以实时看到 AI 深度思考和生成 XML 代码的过程,右侧显示了一个炫酷的 Loading 动画。

生成完成后,右侧立刻渲染出了完整的架构图,分层很清晰,而且保留了 draw.io 原本的元素编辑能力,可以直接拖拽和修改。

更强的是,它支持连续对话修改。比如我说「帮我把 DeepSeek Harness Core 这里变成红色」,AI 就能精准定位到对应的元素并修改样式,右侧画布实时更新。

整体效果非常不错,图片导出功能也能正常使用。

而且你会发现 GLM-5.3 把 draw.io 的编辑能力深度融合进了自己设计的界面中,看起来就像一个完整的产品,而不是生硬地嵌入了一个第三方组件。

DeepSeek V4 Pro 成品效果

再来看看 DeepSeek V4 Pro 的表现。

打开界面,右侧画布竟然是一坨空白加一个大大的 Loading 图标?

而且左下角的提示文字还出现了溢出,这把 DeepSeek V4 Pro 的前端确实拉了。

AI 生成图表的功能是可以正常使用的,但是没有实时展示 AI 思考过程的能力,你只能等它全部生成完了,才能看到结果。

最关键的是,DeepSeek V4 Pro 很明显是直接把 draw.io 整个嵌入到了前端页面中,没有做任何深度集成。给人一种很生硬的感觉,跟 GLM 那种把 draw.io 能力自然融合到自己界面中的做法差距明显。

Kimi K3 成品效果

最后看 Kimi K3。

Kimi K3 这次生成的界面布局跟 GLM 类似,也把 draw.io 自然融合到了项目中,整体界面风格非常 nice。

不过 draw.io 的图标和菜单栏还是原封不动地保留了下来,融合度比 GLM 略逊一筹。

AI 生成图表的功能正常,同样支持连续对话修改。

但是,后端逻辑明显没做好提示词约束和工具校验,有时候 AI 生成的内容会翻车,直接把 XML 源码糊在界面上而不是渲染成图形。

整体来看,Kimi K3 的前端设计能力跟 GLM-5.3 相当,但后端稳定性差了一截。

实战 2 对比

这个任务 GLM-5.3 的综合表现最好,界面设计、AI 深度思考实时展示、连续对话修改、draw.io 深度融合,每一环都做到位了。

Kimi K3 的前端设计能力很强,但是后端偶尔会翻车。

DeepSeek V4 Pro 虽然也正常实现了核心功能,但是界面粗糙,集成方式生硬,表现最差。

我的感受

两个项目全部跑完了,聊聊我的真实感受。

显然,即使是在 DeepSeek Harness 这个 DeepSeek 的「角色专武」环境下,GLM-5.3 的表现依然很出色。

我选的这两个任务覆盖了纯前端 3D 游戏和全栈 AI 应用两个完全不同的方向,可以看出 GLM-5.3 在任务理解、代码生成质量、产品设计意识这几个维度上都明显领先。

然后聊聊大家非常关心的成本问题,猜猜我花了多少 money 呢?

由于 GLM-5.3 我使用的是编码套餐,不太好直接统计实际消耗金额,我只能拿积分来算了。

两个项目累计消耗了 1151 积分,由于我订的是 Pro 套餐(538 元/月),每周额度是 6 万积分,算下来这次的消耗只占了周额度不到 2%,折算成钱连 3 块都不到。

由于我的 Kimi K3 套餐过期了,新的抢不到,所以是直接用 API Key 接入的,总共消耗了 31.07 元;涨价之后的 DeepSeek V4 Pro 消耗了 13.99 元。

单从我的实际花销来看,GLM-5.3 按照套餐来算,性价比是最高的。一周 6 万积分随便你跑,根据我这次测试的这种任务来看,做几十个小项目不成问题。

而且 GLM-5.3 会在发布两周后开源权重。

在开源世界里,GLM-5.3 目前可以说是编程能力的天花板。

而且智谱在发布文章中提到,Hugging Face 之前遭遇安全攻击的时候,Anthropic 的 Mythos 模型只面向约 150 家大型机构提供服务,更多的中小企业和开源项目在最需要帮助的时候,反而用不上最强的防御工具。

当攻击能力在扩散,防御能力就不能只掌握在少数人手中。GLM-5.3 的开源给所有人提供了一把防御的盾牌,这件事本身的意义可能比跑分更重要。

最后哔哔

最后多说几句,这次横评让我对国产模型的编程能力更有信心了。GLM-5.3、Kimi K3、DeepSeek V4 Pro 这几家打得不可开交,对我们用户来说是好事儿,起码有了更多的选择。

OK 就分享到这里,本文会收录到我免费开源的 《AI 编程零基础入门教程》,上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。

开源指路:https://github.com/liyupi/ai-guide

鱼皮的 AI 编程教程

我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~

也欢迎在评论区聊聊:你现在主力用哪个国产编程模型?GLM、Kimi 还是 DeepSeek?

相关文章
|
存储 缓存 文件存储
如何保证分布式文件系统的数据一致性
分布式文件系统需要向上层应用提供透明的客户端缓存,从而缓解网络延时现象,更好地支持客户端性能水平扩展,同时也降低对文件服务器的访问压力。当考虑客户端缓存的时候,由于在客户端上引入了多个本地数据副本(Replica),就相应地需要提供客户端对数据访问的全局数据一致性。
33252 201
如何保证分布式文件系统的数据一致性
|
设计模式 存储 监控
设计模式(C++版)
看懂UML类图和时序图30分钟学会UML类图设计原则单一职责原则定义:单一职责原则,所谓职责是指类变化的原因。如果一个类有多于一个的动机被改变,那么这个类就具有多于一个的职责。而单一职责原则就是指一个类或者模块应该有且只有一个改变的原因。bad case:IPhone类承担了协议管理(Dial、HangUp)、数据传送(Chat)。good case:里式替换原则定义:里氏代换原则(Liskov 
36821 22
设计模式(C++版)
|
存储 编译器 C语言
抽丝剥茧C语言(初阶 下)(下)
抽丝剥茧C语言(初阶 下)
|
机器学习/深度学习 人工智能 自然语言处理
带你简单了解Chatgpt背后的秘密:大语言模型所需要条件(数据算法算力)以及其当前阶段的缺点局限性
带你简单了解Chatgpt背后的秘密:大语言模型所需要条件(数据算法算力)以及其当前阶段的缺点局限性
24905 16
|
机器学习/深度学习 弹性计算 监控
重生之---我测阿里云U1实例(通用算力型)
阿里云产品全线降价的一力作,2023年4月阿里云推出新款通用算力型ECS云服务器Universal实例,该款服务器的真实表现如何?让我先测为敬!
36824 15
重生之---我测阿里云U1实例(通用算力型)
|
SQL 存储 弹性计算
Redis性能高30%,阿里云倚天ECS性能摸底和迁移实践
Redis在倚天ECS环境下与同规格的基于 x86 的 ECS 实例相比,Redis 部署在基于 Yitian 710 的 ECS 上可获得高达 30% 的吞吐量优势。成本方面基于倚天710的G8y实例售价比G7实例低23%,总性价比提高50%;按照相同算法,相对G8a,性价比为1.4倍左右。
|
存储 算法 Java
【分布式技术专题】「分布式技术架构」手把手教你如何开发一个属于自己的限流器RateLimiter功能服务
随着互联网的快速发展,越来越多的应用程序需要处理大量的请求。如果没有限制,这些请求可能会导致应用程序崩溃或变得不可用。因此,限流器是一种非常重要的技术,可以帮助应用程序控制请求的数量和速率,以保持稳定和可靠的运行。
29949 52

热门文章

最新文章