买了 Codex Max 20 Pro,我的主力却换成了 DeepSeek-V4-Flash——因为它快得不可思议

简介: 花大价钱订阅的顶级编码服务,最终输给了一个"快"字。两张真实截图,说明白这个选择![封面:AI 芯片闪电冲刺,甩开沉重的旧时代](https://oscimg.oschina.net/oscnet/upb32a147db61bdd588f9a17318139cf97237.png)我买了 Code

花大价钱订阅的顶级编码服务,最终输给了一个"快"字。两张真实截图,说明白这个选择


封面:AI 芯片闪电冲刺,甩开沉重的旧时代

我买了 Codex Max 20 Pro,但这周开始,我的主力开发模型就换成了 DeepSeek-V4-Flash 正式版。 不是 Codex 不好,是 Flash 太快了——快到什么程度?快到文章后面那两张截图,看完你就懂。

先说清楚:钱是真花出去了

上个月初,我给自己办了一张 Codex Max 20 Pro 的订阅。理由和很多人一样:它是当下顶配的编码服务,Agent 能力、长上下文、处理复杂工程任务的宣传样样齐全,价格也是实打实的不便宜。想着"贵的总归是好的,一步到位",痛痛快快付了钱。

最初几天确实新鲜。界面流畅、任务完成度在线,一些大型重构场景表现得体面。我一度以为,AI 编程的"终极形态"也就这样了——直到我顺手把 DeepSeek-V4-Flash 正式版接回了 Claude Code。

7 月 31 日 DeepSeek-V4-Flash 正式版上线,1M 上下文,官方基准全面超过自家 V4-Pro-Preview、赢了 GLM-5.2。我本来只是抱着"测一测"的心态接上去,结果一用就再也没换回去。

先认识:DeepSeek-V4-Flash 正式版是什么

可能还有朋友没关注到这个新模型,先补个背景。DeepSeek-V4-Flash 是 DeepSeek 在 7 月 31 日正式上线公测的编码主力模型,官方定位就是 Agent 场景,有几个点值得先交代:

  • 1M 上下文:正式版提供 1M 上下文的版本(deepseek-v4-flash[1m]),长对话、大项目上下文都不怵——这正是我敢把整个工程交给它的底气
  • 官方数据确实能打:上线时官方直接甩出了与 V4-Pro-Preview、GLM-5.2 的 Agent 基准横评,全面超越自家 Pro-Preview,9 项基准全胜 GLM-5.2
  • 最让我意外的是它的实现路径:V4-Flash-0731 的模型结构、尺寸和 preview 版本完全一致,只重新做了后训练(post-training)——没有加参数、没有换架构,纯粹靠训练方法论就把 Agent 能力拉到了超过自家 Pro 的程度,这也说明模型能力提升不一定只靠堆规模

DeepSeek-V4-Flash 正式版 API 上线公测

我当时本来只是抱着"测一测"的心态把它接回 Claude Code,结果这一测,就再也没换回去。

为什么?因为"快"这个字,对日常开发是致命的

买之前我想象中的体验是:顶级模型 + 顶级服务 = 顶级生产力。

用了几天之后我悟了:模型能力 95 分和 92 分的差别,你一天可能都感觉不到;但响应快 3 倍和慢 3 倍,你十分钟就能感知到。

Codex 的问题不在能力,在于它慢。每次提需求,都要等一段明显的心跳空白期——思考、规划、再动手。如果你像我一样一天要在编辑器里进出几十个来回,这种等待会不断打断你的思路。等它出结果的时间,够你自己想清楚下一步怎么做了。

DeepSeek-V4-Flash 给我的体感是完全反过来的:你提需求、它干活、你看结果,节奏跟得上你的思维。 响应几乎即时,长对话不拖沓,1M 上下文扛着项目代码也流畅。这种感觉用一句话形容就是——你还没走神,它已经干完了。

快得不可思议:接个电话的功夫,任务就干完了

两张截图:一个电话的功夫,功能就做完了

光说"快"太空泛,上证据。下面这两张是我真实工作的截图,都是 Flash 干的活。

给 Online 图表加复制功能:前后端 5 个文件的改动清单

任务全程耗时 2 分 11 秒,接个电话就完事了

第一张,是给 JeecgBoot 的 Online 图表加"复制"功能的完整任务。 后端:新增 POST /online/graphreport/head/copy 接口、Service 接口 + 实现(复制图表头 + 字段 + 参数三张表,事务、缓存清空、重名去重、名称加"副本",异常处理一个不少);前端:API 封装 + 列表页"复制"按钮 + 确认弹窗 + 刷新逻辑。前后端 5 个文件,全程耗时 2 分 11 秒。

截图里我自己画的红框和批注还记得很清楚——当时接了个电话回来,发现活已经干完了,顺手就在截图里写了句"真快啊,我接了个电话,就完事了!"这不是段子,是当天的真实反应。

接口权限分析:提问与思考过程

接口权限分析:代码与结论,整个回答 16 秒

第二张,是个日常小任务: 扔给它一个删除接口的 URL,问"这个接口有没有权限注解"。它思考了 11 秒、搜了 3 处代码,把 OnCgformHeadController.delete 方法翻出来,@RequiresPermissions("online:form:delete")@AutoLowApp 注解、类级权限配置,连"类里其他方法也都带注解、权限体系完整"这种补充结论都给了。整个回答 16 秒完成。

16 秒查完一个接口的权限体系、2 分 11 秒做完一个前后端完整功能——这就是我这几天的日常。这种节奏下,我实在没有理由再切回那个让我等心焦的 Codex。

能力没有缺席:它不是"快而弱"

有人可能会问:快是快,能力跟得上吗?这正是我敢换的理由——Flash 是"够强 + 最快"的那个,不是"最快但凑合"的那个。

看官方给的 Agent 基准横评(V4-Flash 正式版 vs V4-Pro-Preview vs GLM-5.2):

基准测试 V4-Flash 正式版 V4-Pro-Preview GLM-5.2
Terminal Bench 82.7 72.1 81.0
CyberGym 76.7 52.7 -
Toolathlon 70.3 55.9 59.9
DSBench-Hard 59.6 31.1 54.5
DeepSWE 54.4 - 46.2
NL2Repo 54.2 - 48.9

DeepSeek-V4-Flash 正式版 Agent 基准横评

全面压制自家 Pro-Preview,9 项基准全胜 GLM-5.2。而且有个耐人寻味的细节:Flash 正式版的模型结构和 preview 完全一致,没有加参数、没有换架构,纯粹重新做了后训练——靠训练方法论就把 Agent 能力推到超过自家 Pro 的程度。这说明 DeepSeek 团队这波是真的很用力。

落到真实使用上,我这几天的感受是:改 Java 改完自动编译验证、批量改 YML 配置缩进分毫不差、跨模块追版本号沿着继承链往上游找、范围控制干净不越权——上个月我吐槽过的那些"工程基本功"问题,正式版里一个都没再遇到。

性价比:这账不用算,体感就赢了

Codex Max 20 Pro 的价格摆在那儿,按月真金白银地扣。DeepSeek-V4-Flash 的 API 呢?便宜到几乎可以忽略不计——而且我有 1M 上下文的版本可用,长对话、大项目上下文都不怵。

同一个 Claude Code 工作流,模型从"贵"换成"快",体验不降反升,成本反而断崖式下降。 这种落差体验一次,就回不去了。

短板也照说:它不是没有边界

既然是实测,公道话也得讲清楚:

  • 图片理解还是明显短板。 涉及读界面截图、分析配图这类任务,Flash 目前处理不了,得降级到外部视觉模型。对纯文本编程影响不大,但想做全栈视觉任务的朋友要注意这个边界
  • "会验证、会追查"的工程习惯能不能长期保持,比能力本身更值得观察。 毕竟 Flash 正式版才上线几天,长周期稳定性还需要更多时间验证
  • Codex Max 20 Pro 不是一无是处。 它在部分深度重构场景确实有独到之处,我只是说日常主力选型上,Flash 的"快"让它赢了

总结:贵不等于生产力,"快"才是

这几天下来,我对"顶级订阅"这件事的心态已经彻底变了。

以前我的选型逻辑是:能力天花板越高越好,价格贵点没关系。现在我的逻辑是:能力到第一梯队就够用,速度决定日常生产力,价格决定能不能无脑用。 三个维度里,DeepSeek-V4-Flash 占了两项——它足够快,也足够便宜,能力还站在第一梯队。

Codex Max 20 Pro 的订阅我暂时没退,偶尔深度的重构任务还会切过去用。但打开编辑器的那一刻,默认接上的永远是 DeepSeek-V4-Flash。不是我喜新厌旧,是"快的不可思议"这件事,一旦体验过就真的回不去了。


目录
相关文章
|
18天前
|
人工智能 API 数据库
Claude Code 接入 Grok-4.5
AI 专题研究 Claude Code 通过 CCR 接入 xAI Grok4.5 的完整配置与避坑指南 当前可用版本:Claude Code 通过 Claude Code Router(CCR)接入 xAI Grok4.5。 这版文档按我实际验证过的配置写,避免再回到旧版的错误路由和鉴权问题。
282 1
Claude Code 接入 Grok-4.5
|
7天前
|
缓存 人工智能 自然语言处理
阿里云百炼 Token Plan 订阅制升级:个人版上线、团队版降价,一把 API Key 跑通 Qwen3.8-Max-Preview 与 HappyHorse 1.1
阿里云百炼Token Plan全新升级:个人版39元起/月,团队版低至150元/席位/月;统一Credits抵扣,支持Qwen3.8-Max-Preview(2.4T)、HappyHorse视频等150+全模态模型;夜间调用低至0.2折,单Token成本锐减98%。阿里云百炼Token Plan官网:https://t.aliyun.com/U/EsRjVx
204 1
|
19天前
|
人工智能 缓存 JavaScript
当AI学会自己“探索性测试”,纯手工点点点的QA还能活多久?
本文探讨AI时代测试工程师的生存危机与转型机遇:当AI不仅能生成用例,更能自主探索、发现未知缺陷,手工测试正被“绕过”而非简单替代。文章剖析AI探索性测试的三层架构、真实效能对比,并指出测试人的新定位——从执行者转向策略设计者与AI教练。核心能力不再是“点点点”,而是定义风险、校准AI、沉淀测试知识。
|
19天前
|
人工智能
2.4 万亿参数 Qwen3.8-Max 发布,三平台一键上手实操,阿里云百炼预览版限时 1 折优惠
阿里云千问Qwen3.8-Max正式发布,参数量达2.4T,代码与办公场景表现卓越。现可通过百炼TokenPlan、Qoder、QoderWork三渠道抢先体验Preview版,享白天1折、夜间再享2折优惠,正式版即将开源。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
700 2
|
3天前
|
缓存 人工智能 API
阿里云百炼deepseek-v4-flash模型介绍:模型特点、适用场景、最新优惠及部署流程参考
本文全面解析了阿里云百炼平台托管的DeepSeek-V4-Flash大模型的核心参数与使用指南。这款总参284B、激活13B的轻量化MoE模型,原生支持百万级超长上下文,最大输出长度可达39万+Tokens,推理速度快、调用成本低,适配日常对话、批量文案处理、基础RAG等高并发普惠场景。文章同步梳理了北京、新加坡、法兰克福等全球5大部署节点的能力支持情况、分区域计费标准与限流规则,同时标注了预览版与2026年7月31日正式稳定版的版本差异,帮助开发者快速完成选型与API集成。
|
11天前
|
存储 Linux iOS开发
【2026最新】MarkText下载中文版|MarkText安装使用图解(超详细)
MarkText 是一款免费开源的 Markdown 编辑器,支持所见即所得实时渲染,无需分屏预览。跨平台(Windows/macOS/Linux),内置中英文界面、数学公式(KaTeX)、代码高亮,可一键汉化,是 Typora 的优秀免费替代品。(239字)
|
11天前
|
设计模式 算法 Java
干掉成山的 if-else:工厂造、策略选,一文讲透两个模式的配合
写给被成堆 if-else 折磨的后端同学:拆开工厂模式和策略模式,搞懂创建与选择的解耦,配合 Spring 实战消灭分支地狱。
77 1
干掉成山的 if-else:工厂造、策略选,一文讲透两个模式的配合
|
12天前
|
人工智能 BI API
阿里云Qwen3.8-Max-Preview介绍:核心能力、适用场景、支持订阅计划与最新活动
阿里云于2026年7月19日发布Qwen3.8-Max-Preview,为通义千问首个2.4T参数原生多模态旗舰模型,采用第三代MoE架构,支持百万Token上下文、全栈代码工程、原生多模态处理及多智能体协作,较Qwen3.7-Max全面跃升。模型处于"日更进化"预览阶段,现推出限时优惠:常规时段1折、夜间0.2折(22:00-次日08:00),适用于Qoder CN全系产品。个人版Token Plan低至39元/月,团队版150元/席位/月起,配合新用户25元体验包及14天Pro Trial,是开发者与企业低成本体验顶级大模型的绝佳窗口。
|
12天前
|
SQL 关系型数据库 数据库
当 PostgreSQL 坐稳数据底座,Agent 还差什么才能真正跑起来?
本文介绍阿里云RDS PostgreSQL构建的AI Agent“三件套”:Supabase(统一数据接口)、知识图谱(语义理解与推理)和In-DB Agent Runtime(安全代码执行)。三者共用同一数据库与Kong网关,实现多模态、强事务、云原生协同,让Agent真正具备“取数、理解、执行”闭环能力。
88 1
|
19天前
|
存储 数据可视化 安全
2026企业智能体平台完整选型指南 主流Agent工具能力差异分析
本文系统解析企业Agent平台选型逻辑,提出全域管控、开发架构、跨系统编排、生态协同、部署模式五大评估维度,对比通用SaaS、低代码底座、垂直行业工具等五类平台定位,并按企业规模与合规要求提供差异化选型建议,助力科学决策。

热门文章

最新文章