刚刚 DeepSeek V4.1 Flash 正式发布,竟然干掉了自家的 Pro 模型?!梁圣回归
大家好,我是程序员鱼皮。
刚刚,DeepSeek 正式发布了 V4.1 Flash 模型。
它是一个 552B 参数的 MoE 模型,采用了全新的模型结构,原生支持多模态视觉理解,而且直接开源了。

这次更新力度很大。DeepSeek 网页版原来的快速、专家、识图 3 个模式直接合并成了一个入口,用户不需要再手动选模式了,AI 会根据任务复杂度自动调度,检测到图片就自动激活视觉能力。

炸裂的是,DeepSeek 官方称:V4.1 Flash 在性能、费用、速度、总用时等各项指标上已经全面超越 V4 Pro!
好家伙,自家的快速模型吊打旗舰模型?
要知道,DeepSeek 的 Flash 模型比 Pro 模型便宜好几倍!效果反而更好?
那之后谁还会用 Pro 模型啊?

果不其然,官方已经下线了旧的 V4 Flash 和 V4 Flash Vision Exp 模型,而且 9 月 14 日 V4 Pro 也要正式下线,到时候所有发给 V4 Pro 的请求全部自动路由到 V4.1 Flash。
相当于 Flash 彻底把 Pro 干掉了……
那 Flash 模型真的比 Pro 强么?差距有多少?我打算自己测一测。
于是我准备了 2 个不同类型的项目,同时拉上很火的 GLM-5.3-Flash 做横向对比。
这次测试我特意从日常使用场景出发,DeepSeek 的两个模型放在 DeepSeek Harness 里跑,GLM-5.3-Flash 放在智谱自家的 ZCode 里跑。你平时用哪个模型就搭配对应的自家工具,往往能获得更好的效果。
怎么用 V4.1 Flash
如果你用的是 DeepSeek Harness,更新一下版本,V4.1 Flash 就可以直接在模型列表里选了,不需要额外配置。

如果你是通过 API 调用 V4.1 Flash,现在模型名简化成了 deepseek-flash,不用修改 base_url。之前的 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 也会自动路由到新模型,不用改代码。
项目实战测评
3D 程序化城市生成器
第一个案例对标的是 OpenAI 官方展示馆里那个用 GPT-5.5 做的程序化城市生成器,我之前测 GPT-6 Astra 的时候用过同一段提示词,效果非常惊艳。这次拿同样的提示词让 3 个 Flash 级模型来做,正好能看出差距。
提示词很简单,我让 AI 做一个程序化 3D 城市生成器的网页应用,至少包含重庆、上海、西安、深圳、江南五种城市风格,切换风格之后建筑形态、色调和地形要有明显差异。编辑器布局和参数维度怎么设计我一个字都没提,让 AI 自己去搜官方那版的产品设计,在此基础上做中国版。

来看看三个模型各自做出了什么效果。
DeepSeek V4.1 Flash
V4.1 Flash 拿到任务后,先用 Firecrawl 联网搜索了官方 Showcase 的产品设计,分析完参数维度之后才开始写代码。AI 选的技术栈是 Vite + TypeScript + Three.js,没有多余的框架依赖。
整个过程跑了 250 步,LLM 推理只花了 18 分钟,输出速度达到了每秒 287 tokens。不过工具调用花了 83 分钟,总用时被拉得比较长。

看看成品效果。第一眼看上去感觉还不错,错综复杂的重庆山城给做出来了,右侧有完整的城市生成器控制面板,城市风格、布局参数、天际线、地块配比全都能自由调整。

通过拖拽和滚轮可以自由移动和放大视角,能看到更多细节,比如道路上行驶的车流。
右侧面板里还能自由调整建筑密度、街区尺度、街道形态、商业和居住占比等等。

切换到上海,你能认出来中间那几栋最高的建筑么?

整体功能虽然完成了,但是精细度还差点儿意思。比如看看西安城市的效果,很难说一眼就能认出来是古都的感觉。

DeepSeek V4 Pro
V4 Pro 的最大问题是没有视觉能力。AI 写完代码之后没办法自己截图看一眼效果对不对,只能通过调用子 Agent 让其他有视觉能力的模型帮忙验证。

先看看重庆的效果,建模的精细度明显不如 V4.1 Flash,尤其是这个橙色的大桥,有点出戏。

再切换到上海。
额,这个东方明珠我怎么看怎么像糖葫芦,而且怎么还建在水上了呢?

直接就是一个大失败啊!
还好我替你们测了,不要浪费钱去做这玩意啊!
GLM-5.3-Flash
再看看 GLM-5.3-Flash 生成的效果,第一眼看上去还不错,建筑上的灯光效果做了出来,这个夕阳的氛围也挺有意境。

不过放大看细节就露馅了,有明显的穿模问题,画面中还有很多飞来飞去的小方块,不知道是什么东西。

看看上海的东方明珠,我觉得比前两个略好一点,但也有明显的 Bug,塔尖凭空悬浮了,而且好多大楼直接建到了水上……

看到这里,我个人认为 V4.1 Flash 的完成度和细节丰富度最高,GLM-5.3-Flash 的氛围感做得不错但细节 Bug 更多,可以说二者半斤八两吧。至于 V4 Pro 的效果,确实是三者之间最拉的。
GPT-6 Astra
之前我用同一段提示词测 GPT-6 Astra 的时候,AI 只用了 18 分钟就交卷了,而且每种城市的精细度都非常高。

整个的建模正确性也更高,可以说 GPT-6 Astra 完爆这三个 Flash 级模型,差距一眼就能看出来。

不过这也是理所应当的,毕竟 Astra 是全球顶级模型,价格贵了不知道多少倍,跟 Flash 模型比效果就有点欺负人了……
AI 智能绘图工具
第二个项目考的是全栈工程能力。我让 AI 开发一个 AI 智能绘图工具,用户通过自然语言描述,AI 自动生成可编辑的流程图、架构图和思维导图,前端在 draw.io 编辑器的基础上二次开发,加上 AI 对话面板,支持连续对话修改图表。

DeepSeek V4.1 Flash
V4.1 Flash 先联网抓了 draw.io 官方的嵌入协议文档和 GitHub 仓库,研究了一遍源码之后找到了零改动嵌入的方案,然后才开始写代码。
打开成品页面,整个界面布局很有科技感,AI 把 draw.io 深度融合到了项目里,连产品名都自己取了一个叫 DrawMind。左侧是 AI 对话面板,右侧是完整的 draw.io 画布编辑器。

我让 AI 画一个微服务电商系统的架构图,能实时看到 AI 的思考过程,而且输出速度非常快,20 秒左右就完成了。

画出来的架构图效果很好,分层清晰、节点整齐、没有错位,这点比之前用 V4 Pro 来画的要好不少。

更关键的是连续对话修改的能力。我说「把业务服务层的背景改为红色」,AI 精准定位到了对应的元素并修改样式,右侧画布实时更新,改得又快又准。

我又试了一些其他类型的图,流程图、思维导图都能正常生成,没有出现生成失败的情况,比较稳定。

GLM-5.3-Flash
再来看看 GLM-5.3-Flash 在 ZCode 里做出来的版本,花了大约 46 分钟。
界面同样很有科技感,而且也成功把 draw.io 深度融合了进去:

生成架构图的效果也不错,分层清晰,但是有时候会有些连线错位的问题:

同样支持连续对话修改:

不过多试几遍就会发现,偶尔会出现生成的 XML 跟 draw.io 不兼容的情况,画布上弹出解析报错,稳定性差了一些。

DeepSeek V4 Pro
V4 Pro 做出来的版本就差了不少。
最明显的问题是 draw.io 被很生硬地嵌入到了页面里,左下角的文字还出现了溢出,右侧画布默认显示的是一大坨空白和加载图标。

AI 生成图表的功能是可以正常使用的,但是没有 AI 思考过程实时输出的能力,生成速度和准确度也都一般。

简单总结一下,显然 V4.1 Flash 的整体完成度最高,draw.io 成功集成、生成速度快、连续对话修改精准,而且只花了 21 分钟。
GLM-5.3-Flash 的前端效果跟 V4.1 Flash 不相上下,但耗时翻倍到 46 分钟,偶尔还会出现 XML 兼容性问题。
V4 Pro 成功垫底,界面生硬、功能粗糙、没有思考过程输出。
测试总结
两个项目跑完,我觉得 V4.1 Flash 确实做到了全面超越 V4 Pro。
首先,原生多模态太方便了!
V4 Pro 写完前端之后看不到自己画面长什么样,只能瞎猜或者调用子 Agent 帮忙看一眼,这个体验非常割裂。V4.1 Flash 直接自己截图验证,该修就修,生成的质量明显高了一档。
然后是 速度。我额外做了一个对比测试,让两个 DeepSeek 模型用相同的提示词各写一篇一万字的小说。

结果 V4.1 Flash 的输出速度达到了 160 TOK/s,V4 Pro 只有 50 TOK/s,差了整整 3 倍!
首 token 延迟也差很多,V4.1 Flash 只要 0.3 秒,V4 Pro 要 1.1 秒。日常用的感受就是 V4.1 Flash 秒回,V4 Pro 要稍微等一下。写代码的时候这个差距体感更明显,287 TOK/s 的速度下屏幕上的代码几乎是瞬间刷出来的。
再看看 花了多少钱。
V4 Pro 光是做一个 3D 城市生成器就花了大约 16 元,而 V4.1 Flash 开发完两个项目才花了不到 10 元,平均每个项目 5 元左右。

另外 DeepSeek 今天同步调整了 Flash 系列的定价,空闲时段缓存命中的输入价格降到了 0.02 元 / 百万 token,日常开销低了很多。
看来 DeepSeek 可以重新作为日常 AI 编程和办公的推荐模型了。
我单方面不负责任地宣布:梁神回归!

最后再分享个小故事,关于 V4 Pro 下线这件事,DeepSeek 的本意是给用户免费升级模型,V4 Pro 的请求自动路由到 V4.1 Flash,还按更便宜的 Flash 价格计费。
听着是好事对吧?
结果反而遭到了一堆开发者的吐槽。很多人已经把 V4 Pro 接进了自己的线上产品,提示词、参数、业务逻辑全部是按 V4 Pro 的行为特征调过的,突然换一个模型底座,输出风格和能力边界都会变,线上产品可能直接出问题。

还有人担心 V4.1 Flash 虽然跑分超过了 V4 Pro,但在自己的特定场景下不一定更好,「全面超越」和「我的场景也超越」是两回事。
这种情况在 AI 行业已经不是第一次了,几乎每一家厂商做模型升级的时候都遇到过类似的争议……
你怎么看?