DeepSeek V4 Flash 正式版:成绩碾压 Pro 预览版,白菜价

简介: DeepSeek V4 Flash 正式版上线公测:Agent 基准远超 V4-Pro 预览版,第三方指数反超 Pro,输出 2 元/百万token

大家好,我是程序员天天困。

10 天前写 Qwen3.8 那篇的时候,我提过一句:DeepSeek V4 满血版最快 7 月 20 号上线。昨天晚上刷朋友圈看到有朋友说 deepseek-v4-flash-0731 官方上线了,这次是真来了——不过先到场的不是 Pro,是 DeepSeek V4 Flash 正式版,API 直接上线公测,没有发布会,就悄悄更新了一条日志。官方也同步预告了:V4-Pro 正式版会尽快发布,只是具体时间没给。

这篇我把这件炸圈的事拆成四块讲:官方成绩单写了什么、成绩为什么这么离谱、白菜价有多白菜、后端开发怎么切换。看完你再决定要不要把 API 换过去。

一、官方成绩单:9 项 Agent 基准,远超 V4-Pro 预览版

DeepSeek V4 Flash 正式版这次最狠的不是便宜,是 Agent 成绩单。

官方更新日志里的原话是「Agent 能力大幅增强,基准测试远超 V4-Pro-Preview」,后面跟了一串数字:

  • Terminal Bench 2.1: 82.7
  • NL2Repo: 54.2
  • Cybergym: 76.7
  • DeepSWE: 54.4
  • Toolathlon verified: 70.3
  • Agent Last Exam: 25.2
  • Automation Bench (Public): 25.1
  • DSBench-FullStack: 68.7
  • DSBench-Hard: 59.6

Terminal Bench:让 AI 在真实终端环境里完成任务的基准测试,从改配置、跑脚本到修 bug,考的是「让 AI 自己去操作系统」的本事。你可以理解为 AI 界的现场实操考试。

其中 Terminal Bench 2.1 是被引用最多的一个,82.7 分已经把自家 V4-Pro 预览版甩在身后。

不过有个细节我得说清楚:官方注明了这些分数是在 DeepSeek 自研 Harness 极简模式(还没发布)下跑的,max 档位、topp=0.95、temperature=1.0。自研框架测自家模型,分数先打个折,这点上我站理性派。

二、第三方也盖章了:智能指数反超自家 Pro

官方自测可以打折听,但这次第三方评测跟官方数字对上了,这是我说「碾压」不心虚的原因。

Artificial Analysis(AA):独立第三方 AI 评测机构,用统一测试集给各家模型排智能指数(Intelligence Index),相当于大模型圈的第三方验货。

AA 在发布当天(2026-07-31)就把 Flash-0731 放上了榜单:智能指数 50 分,比 4 月发布的 Flash 预览版高 10 分,比自家 V4-Pro 还高 6 分,只比 OpenAI 最便宜款 GPT-5.6 Luna(51 分)低 1 分(GLM-5.2、Muse Spark 1.1 同为 51 分,开源榜第一的 Kimi K3 为 57 分)。而且它跑完整套测试用的 token 比上一版还少了 12%——效率和分数一起涨。

一个激活参数只有 130 亿的轻量模型,把参数规模大得多的自家旗舰预览版反超了。三个月前没人信这个。

三、最离谱的一条:结构没动,只重做了后训练

Flash 正式版真正炸圈的不是分数,是官方日志角落里那句话:模型的结构、尺寸和预览版一模一样,只把后训练整个重做了一遍。

284B 总参数、13B 激活参数,一个数都没改。4 月预览版发布时,官方还自己承认「高难度 Agent 任务和 Pro 有差距」;三个月后,同一个身子,把 Pro 反超了。

MoE(混合专家架构):把一个大模型拆成很多个「专家子模型」,每次推理只点亮其中一小部分参数,用更少的算力干活。284B 是仓库里全部的货,13B 是每次实际搬出来的。

打个比方,这就好比同一台发动机:参数规模是排量,排量定了极速上限;后训练是变速箱调校,决定你实际开起来是肉还是跟脚。Flash 这次相当于没换发动机,光把调校重做了一遍,加速直接快了一档——说明它之前压根没摸到自己的上限。

四、白菜价:2 元 vs 6 元 vs 12 美元

价格这块不用算太细也能看懂:Flash 的单价是自家 Pro 的三分之一,输出价只有 OpenAI 最便宜型号 Luna 的四分之一左右。

官方定价页写得明明白白(每百万 token,美元按 1:7.2 折算):

模型 输入(缓存命中) 输入(未命中) 输出
DeepSeek V4 Flash 正式版 0.02 元 1 元 2 元
DeepSeek V4 Pro 预览版 0.025 元 3 元 6 元
GPT-5.6 Luna(刚降 80%) $0.02 $0.2 $1.2
GPT-5.6 Terra(刚降 20%) $0.2 $2 $12

网友调侃:据说 DeepSeek V4 Flash 正式版(GA)在部分 Agent 基准上接近 Claude Opus 4.8 的水平,降价之后,直接就把(传说中的)GPT-5.6 Luna 按在地上摩擦(吊打)了

这里有个背景值得说道:OpenAI 就在 Flash 上线前一天(7 月 30 日)宣布 GPT-5.6 降价,Luna 直接降了 80%。结果降完价,Luna 的输出价($1.2)依然是 Flash 的 4 倍多,Terra 更是它的 40 多倍($12 vs 2 元)。

「白菜价」三个字不是修辞——官方定价页就是这么标的。

可能有人会问:这么便宜,是不是在烧钱抢市场,早晚要涨价?

以 2026 年 8 月初为准,官方定价页已经写明「即将采用峰谷定价」,高峰时段(北京时间 9:00~12:00、14:00~18:00)价格翻倍——涨价机制已经在路上了,但不等于整体涨价。另外 AA 的数据显示,Flash-0731 跑同样测试用的 token 还少了 12%,说明低价有一部分是效率撑起来的,不全是补贴。真要在生产环境长期跑,盯住官方定价页比听任何人的推测都靠谱。

五、后端开发怎么看:切换成本几乎为零

最后说点实际的。对后端开发,这次更新最容易被忽略的一条是:换到 Flash 正式版的成本几乎为零

API 调用方式不变,把模型名改成 deepseek-v4-flash 就行。官方还原生支持 OpenAI 的 Responses API 格式,并且针对性适配了 Codex——不用改 Base URL 就能切模型:

# 官方示例:只改 model 参数即可切换到 V4 Flash 正式版
from openai import OpenAI
client = OpenAI(api_key="你的key", base_url="https://api.deepseek.com")
resp = client.chat.completions.create(
    model="deepseek-v4-flash",  # 之前是 deepseek-v4-pro
    messages=[{
   "role": "user", "content": "帮我看看这段代码的 bug"}],
)
print(resp.choices[0].message.content)

Responses API:OpenAI 推出的新一代 API 接口格式,把对话、工具调用、推理过程统一进一个响应对象里,专门给 Agent 类应用用。你可以理解成「给 AI 干活的接口,比聊天接口更粗的管道」。

不过我也得泼盆冷水:Flash 不支持视觉输入,知识密集型任务和 Pro 还有差距——官方自己说过 Flash 的世界知识「稍逊一筹」,代码里 API 文档、库行为这类事实问题最好人工复核。我的用法是:跑量任务全给 Flash,卡壳的难题再切 Pro 或别的旗舰,各干各的活。

以 2026 年 8 月初为准,DeepSeek V4 Flash 正式版交出的答案是:后训练做到位,便宜的小模型照样能把旗舰预览版拉下马。另外官方更新日志里也写了一句:V4-Pro 正式版将会尽快发布,定价页还注明 8 月初会给 Pro 接入 Responses API——想等旗舰正式版的,留意官方更新日志就好。真正的问题留给行业——当 13B 激活参数已经够用的时候,旗舰模型的护城河还剩多少。


我是程序员天天困,持续分享编程干货。觉得有用的话记得点赞收藏和关注~也欢迎在评论区聊聊:Flash 正式版这个成绩和价格,你准备切过去当主力 API 吗?还是继续观望?

相关文章
|
3天前
|
云安全 人工智能 运维
阿里云联动百位企业安全专家,共识Agent防御最佳实践
当Agent成为新员工,你的安全边界在哪里?
1723 1
阿里云联动百位企业安全专家,共识Agent防御最佳实践
|
10天前
|
人工智能 JSON 安全
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
阿里云AI安全产品联动防御Fastjson攻击
2434 13
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
|
11天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max-Preview深度全解析:2.4万亿参数旗舰MoE模型+Token Plan限时优惠完整落地指南
2026年7月,全新旗舰级混合专家大模型Qwen3.8-Max-Preview正式开放抢先体验,作为通义千问Qwen3系列规格最高、综合推理能力顶尖的新一代模型,该模型总参数量达到2.4万亿(2.4T),是当前线上可调用的原生多模态旗舰模型,综合推理水准对标海外顶级Fable 5模型,在复杂工程开发、长文档深度分析、多步骤智能体自治、跨境多语言创作、海量数据挖掘五大高难度业务场景实现跨越式性能提升。
1153 2
|
13天前
|
人工智能
Qwen3.8抢先体验!正式版即将发布并开源!
千问Qwen3.8即将开源,参数达2.4T,进化速度以“天”计,实力媲美Fable 5。预览版Qwen3.8-Max已上线阿里Token Plan等平台,限时优惠:日间Credits低至1折,夜间更优,个人/团队版月付仅35元起!
1129 47
|
9天前
|
人工智能 前端开发 Linux
Codex 桌面版安装 + CC Switch 接入第三方 API 完整教程(2026 最新)
2026最新教程:手把手教你安装Codex桌面版,通过CC Switch v3.17.0一键接入Fenno等国产API(兼容OpenAI Responses格式),跳过账号登录,完整启用代码审查、多步任务与上下文感知功能。零基础友好,全程图文实操。(239字)
840 0
|
9天前
|
自然语言处理 测试技术 API
通义千问Qwen3.8-Max-Preview全功能解析:2.4万亿参数旗舰模型深度使用指南
在大模型技术持续迭代的当下,通义千问推出的Qwen3.8-Max-Preview作为新一代旗舰预览版模型,凭借2.4万亿参数的超大规模、多模态融合能力与全场景适配特性,成为开发者与企业用户探索AI应用的核心工具。该模型采用稀疏混合专家(MoE)架构,是通义千问首个突破万亿参数的多模态模型,可同时处理文本、图像、视频与文档等多种数据形态,在全栈代码开发、复杂逻辑推理、长文档分析与多智能体协作等场景实现跨越式升级。本文将全面拆解Qwen3.8-Max-Preview的核心功能,详解API调用流程与配置方法,覆盖多场景实战技巧,帮助用户快速掌握这款旗舰模型的使用方法,充分释放其性能潜力。
586 2
|
12天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max 预览版全解析:2.4 万亿参数旗舰模型,Token Plan 限时优惠指南
Qwen3.8-Max-Preview是通义千问Qwen3系列旗舰MoE大模型,参数达2.4万亿,综合推理能力居行业第一梯队。支持思考/快速双模式,擅长大模型五大高难场景。现于阿里云百炼Token Plan、Qoder及QoderWork上线体验,个人版低至39元/月。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
753 1
Qwen3.8-Max 预览版全解析:2.4 万亿参数旗舰模型,Token Plan 限时优惠指南