DeepSeek V4 Pro 正式版、Grok 4.6 同夜发布

简介: DeepSeek V4 Pro 正式版(0813)与 Grok 4.6 同夜上线。跑分、价格、选型一次讲清,帮你判断主力 API 要不要换

大家好,我是程序员天天困。

今早一觉醒来刷短视频,刷到个大消息:昨晚 DeepSeek V4 Pro 正式版和 Grok 4.6 撞一块儿发了——DeepSeek 官方定价页 MODEL VERSION 那一栏,悄悄从 Preview 换成了 DeepSeek-V4-Pro-0813;xAI 官博几乎同一时间挂出《Introducing Grok 4.6》。没开发布会,两家都挑了大半夜直接换节点、发博客。

这篇把两件事拆成四块讲:Pro 正式版跑到什么档位、Grok 4.6 升级了什么、价格差几倍、该怎么选。看完你再决定手上的 Agent 服务应该交给谁。

一、DeepSeek-V4-Pro-0813 转正:跑分拉满,但先别急着吹

先看确认到的事实。DeepSeek 官方定价页已经把模型版本号更新为 DeepSeek-V4-Pro-0813

不过调用名仍然是 deepseek-v4-pro,base_url 和接口格式都没变——也就是说,存量代码不用动一行,请求已经走到新节点上了。

DeepSeek-V4-Pro-0813:DeepSeek V4 旗舰的正式版(GA),1.6T 总参、49B 激活的大规模混合专家模型,上下文窗口 1M token,主打高难度推理、全代码库分析和长程 Agent 任务。你可以把它理解为 DeepSeek 这套"满血发动机"的正式调校版。

功能上,Pro 正式版把 Flash 早就有的那套都补齐了:JSON 结构化输出、工具调用、Responses API、Anthropic API、Chat Prefix Completion,FIM 补全只在非思考模式下开放。最大输出 384K,并发限制 500(Flash 是 2500)。

跑分是这次最热闹的部分。DeepSeek 还放了张 Agent 对照表,10 项新测全集中在 Agent 场景,都是官方自测口径:

  • Terminal-Bench 2.1:87.9%
  • CyberGym:83.3%
  • Toolathlon-Verified:74.1%
  • DSBench-FullStack:71.1%
  • DSBench-Hard:67.2%
  • DeepSWE:62.7%
  • NL2Repo:61.5%
  • HLE(带工具):60.0%
  • AutomationBench:31.8%
  • Agents' Last Exam:25.7%

这张是 DeepSeek 官方放出来的对照表,好处是能直接看到 0813 和 Opus-4.8、Fable 5 在同一口径下的横向差距。逐项看的话,0813 其实不只是"接近"——Cybergym 83.3 比 Fable 5 的 83.1 高了 0.2,DeepSWE 62.7 比 Opus-4.8 的 58.0 高了近 5 分,HLE 带工具 60.0 也高于 Opus-4.8 的 57.9,Terminal-Bench 87.9 比 Opus-4.8 的 85.0 高了近 3 分。DeepSWE 从预览版的 12.8 直接拉到 62.7,是这次涨幅最大的一项。

但"接近 Fable 5"这个说法得拆开看。Terminal-Bench 87.9 对标的是表里 "Fable 5 (w/ fallback)" 那一列的 88.0,确实只差 0.1;可换几个基准差距就出来了:Toolathlon-Verified 74.1 比 Fable 5 的 77.9 低 3.8,DSBench-FullStack 71.1 比 Fable 5 的 77.2 低 6.1,DeepSWE 62.7 比 Fable 5 的 70.0 低 7.3。如果拿第三方平台上的全局最佳来比,差距更大——benchlm 显示 Toolathlon-Verified 最高是 Claude Opus 5 的 80.6,DeepSWE 最高是 GPT-5.6 Sol 的 72.7。

另外 SWE-bench Verified、GPQA 这些通用基准 DeepSeek 这次没重新测,沿用的还是 4 月预览版技术报告的数字。第三方综合分也能说明位置:Artificial Analysis 给 V4 Pro 0813(Max Effort)的智能指数是 53,在 605 个模型里排第 23,比 Grok 4.6、GPT-5.6 Sol 的 61 低 8 分,比 Fable 5 Max 的 62 低 9 分——这是九项基准加权后的独立测评,比单看一项跑分靠谱。

所以这张成绩单,单看 Agent 跑分确实猛,甚至几项超过了上一代 Opus-4.8,但和 Fable 5 是有输有赢,离第三方榜单上的全局最佳(Opus 5、GPT-5.6 Sol)也还有差距——"接近 Fable 5"是挑了最接近的一项说,不是全面追平。

二、Grok 4.6:参数没堆,把后训练重做了一遍

Grok 4.6 的发布路径完全是另一种风格——Musk 7 月 28 日在 X 上预告"8 月 7 日左右",结果跳票到 8 月 12 日才由官博正式上线。

Grok 4.6:xAI(SpaceXAI)的前沿模型,据 Musk 在 X 上披露沿用 1.5T 参数规模,定位编码、Agent 任务和知识工作,上下文 500K token,支持文本和图像输入、纯文本输出,输出长度不设上限。

xAI 官博里最值得留意的一点是:这一版不是靠堆参数,而是做了比 4.5 更长的补充训练,用模型生成的推理和工程数据重做了 SFT 轨迹,再在知识工作、通用编码、内核优化、Web 开发、CAD 等一堆 Agent 环境里跑 RL。说白了,跟 DeepSeek Flash 正式版一个路数——同一副身板,把后训练推倒重来。

官方跑分(x.ai/news/grok-4-6):

基准 Grok 4.6 High Grok 4.5 High GPT-5.6 Sol Max Fable 5 Max
AA Intelligence Index 61 56 61 62
GDPVal-AA v2 1753 1526 1728 1741
CursorBench v3.2 69.9% 66.7% 67.2% 70.5%
DeepSWE v1.1 65.9% 54% 73% 70%
FrontierCode v1.1 61.3% 56.6% 60.6% 63.6%
Terminal-Bench v3.0 26% 15.7% 34.6% 34.1%

AA 智能指数 61,追平 GPT-5.6 Sol,只比 Fable 5 Max 低 1 分。但 Terminal-Bench 26% 这个数偏低,和 DeepSeek Pro 0813 的 87.9% 不能直接比——两边版本号(v3.0 vs v2.1)、测试口径都不一样,别被数字落差带节奏。

在哪能用:Grok 4.6 已经是 Cursor 和 Grok Build 的默认模型,首周给 2 倍赠送额度;API 走 grok-4.6,OpenRouter、Vercel、Cloudflare 都能调。定价 $2/百万输入、$6/百万输出,缓存命中 $0.50;prompt 超过 200K 后翻倍到 $4/$12,还有个快两倍、价格也翻倍的 fast 变体。

三、两张价格表摆一起,差距比想象的大

把同夜发布的两个旗舰加上自家小弟 Flash 放一起看,价格差距比跑分差距扎眼多了(按每百万 token、美元计):

模型 上下文 输入(缓存未命中) 输入(缓存命中) 输出 并发
DeepSeek V4 Pro 0813 1M $0.435 $0.003625 $0.87 500
DeepSeek V4 Flash 0731 1M $0.14 $0.0028 $0.28 2500
Grok 4.6(<200K) 500K $2.00 $0.50 $6.00
Grok 4.6(≥200K) 500K $4.00 $1.00 $12.00

Pro 0813 的输出价只有 Grok 4.6 的七分之一左右,缓存命中价更是差了一百多倍。这还不是全部——DeepSeek 定价页脚注里挂了一句话:计划在近期整体上调 API 价格,"预计涨幅显著",具体以官方通知为准。Flash 上线时提过的峰谷定价还没落地,这次又加了一层整体涨价预警,长期跑生产的话,账单不能只按今天的数字算。

另外有个反馈值得留意:据智东西报道,X 上有开发者贴出对比,网页端和 API 端调同一个 0813 节点,思维链的说话风格差得挺明显,API 端话术偏生硬、语序别扭。DeepSeek 还没回应,如果你是把 Pro 直接面向 C 端输出,建议先灰度对比一轮。

可能有人会问:Pro 都正式版了,还有必要留 Flash 吗?

至少以 8 月中的口径,有。Flash 并发是 Pro 的 5 倍、输出价是 Pro 的三分之一,跑量的客服、检索、简单代码改写走 Flash 更划算;Pro 留给全代码库重构、长链路 Agent、1M 长文档这类真吃难度的任务。两家同夜发布也说明一件事:旗舰不再是"一个模型打天下",而是按难度和成本分层路由。

四、后端怎么接:模型名不变,但有两个坑要记

DeepSeek 这边切换成本几乎为零,base_url 和 model 名都不用改,后端已经自动切到 0813 节点:

from openai import OpenAI
client = OpenAI(api_key="sk-***", base_url="https://api.deepseek.com")
resp = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[{
   "role": "user", "content": "审查这段登录接口的鉴权逻辑"}],
)
print(resp.choices[0].message.content)

Grok 4.6 同样兼容 OpenAI 格式,但走 xAI 官方 base_url、推荐用 Responses API:

from openai import OpenAI
client = OpenAI(api_key="xai-***", base_url="https://api.x.ai/v1")
resp = client.responses.create(
    model="grok-4.6",
    input=[{
   "role": "user", "content": "把这个产品原型做成可交互的 React 页面"}],
)
print(resp.output_text)

两个坑记一下:一是 Grok 4.6 官方文档强烈建议设 prompt_cache_key(Chat Completions 用 x-grok-conv-id 头),不设的话多轮对话经常被路由到冷缓存服务器,缓存命中价形同虚设;二是 DeepSeek Pro 并发只有 500,做批量压测前记得提工单,别上线当晚才撞限流。

我的选型建议很直接:跑量任务继续 Flash,复杂 Agent 和长文档分析切 Pro 0813 试两周,需要把产品想法一步做成可交互前端、或者本来就在 Cursor/Grok Build 里干活的,Grok 4.6 值得花一周做对比。三家都按用量付费,切换成本就是一个 model 字段的事。

这一夜真正的信号不是谁跑分第一,而是旗舰模型的主战场已经从参数量挪到了后训练和单价——DeepSeek V4 Pro 正式版把价格压到 Grok 的七分之一,Grok 用 AA 61 分证明 1.5T 后训练也能摸到前沿。但两家官方自测的跑分都得先打个折,等 Artificial Analysis、终端基准和生产环境的第三方数据出来再下结论也不迟。


我是程序员天天困,持续分享编程干货。觉得有用的话记得点赞收藏和关注~也欢迎在评论区聊聊:DeepSeek V4 Pro 正式版 和 Grok 4.6 你打算先试哪个,还是继续等下半年的开源旗舰?

相关文章
|
1月前
|
缓存 人工智能 算法
DeepSeek-V4-Pro 正式版深夜突袭:Agent 评测暴涨 50 分,一套代码通吃 OpenAI 与 Anthropic 双生态
JeecgBoot AI专题研究 DeepSeekV4Pro 正式版全面拆解——Agent 能力跃迁、双 API 兼容与缓存降本实战![DeepSeekV4Pro 正式版发布概念图](https://oscimg.oschina.net/oscnet/up45eab3ac316682157a43
1040 1
DeepSeek-V4-Pro 正式版深夜突袭:Agent 评测暴涨 50 分,一套代码通吃 OpenAI 与 Anthropic 双生态
|
28天前
|
缓存 安全 程序员
智谱GLM-5.3发布同基座纯靠后训练编程涨50还点亮网安技能树
智谱 8 月 14 日发布 GLM-5.3,与 5.2 同基座、纯后训练,编程内部基准提升 50%,CyberGym 拿下开源第一,两周后开源权重
智谱GLM-5.3发布同基座纯靠后训练编程涨50还点亮网安技能树
|
1月前
|
人工智能 物联网 Shell
Wan2.2 全栈落地指南:ComfyUI‑AKI 秋叶整合包 + 本地源码 + 云端 API,8G 显卡全自动 AI 漫剧生产线(附全套可复制指令)
本资源包提供Wan2.2视频模型(5B本地版/14B云端API)全栈解决方案,含ComfyUI-AKI秋叶整合包、6.6TB AI-Tools工具库及完整实操指令。支持8G低配本一键部署,覆盖剧本生成、分镜绘图、动态渲染到自动成片的AI漫剧流水线,兼顾变现与技术学习。(239字)
|
1月前
|
云栖大会
2026云栖大会定档!
2026云栖大会定档,9月22日-24日·杭州,三日畅享票免费申领中!
|
9天前
|
人工智能 监控 安全
GPT-6发布15小时:Altman道歉赔额度,有人已经把活交给它
从GPT6这个模型怎么样,到案例怎么样,本文一点点的给你嚼碎了告你。
|
30天前
|
IDE Java Linux
JDK11|Java11下载、安装、配置、运行程序全流程教程(2026实测)
JDK 11 是 Java 的长期支持(LTS)版本,2018年9月发布,模块化、`var` 类型推断、HTTP Client 等特性趋于成熟,目前仍是企业存量项目、高校教学和招聘的主流基准版本。(239字)
|
1月前
|
机器学习/深度学习 安全 API
DeepSeek V4 Pro和Grok 4.6前后脚发布,这次拼的不是参数,是训练路径
8月12日深夜,DeepSeek-V4-Pro-0813与xAI Grok 4.6几乎同步发布:前者架构不变,靠后训练大幅提升Agent能力(Terminal Bench达87.9);后者通过跨领域强化学习增强长程任务执行。二者路径不同,却共同指向“更便宜、更实用”的Agent时代。
178 0
|
1月前
|
数据采集 人工智能 运维
实习运维日常|不靠工作挤时间,利用下班碎片时间慢慢打磨大模型适配站内内容
小张是计算机专业实习生,白天专注阿里云运维与站点维护,下班后坚持用碎片时间精细化打磨站内内容,优化结构化排版、FAQ模块及OSS规范,提升通义千问收录稳定性与语义识别精度,实现从运维新手到AI适配实践者的扎实成长。
|
1月前
|
安全 数据挖掘 测试技术
教育培训系统源码开发流程解析:从UI设计、功能开发到服务器部署全流程介绍
教育培训系统源码开发已经成为众多培训机构、企业教育平台布局线上业务的重要方式。本文详细介绍教育培训系统开发完整流程,包括需求分析、UI设计、功能模块开发、系统测试以及服务器部署等关键环节,同时解析课程管理、在线直播、考试测评、数据统计等核心功能。
|
1月前
|
监控 JavaScript 小程序
离散与流程制造可参考的生产管理系统有哪些?
文章区分离散(BOM 工单装配)、流程(配方批次转化)两类制造的核心管理差异,拆解产品结构、生产模式、追溯三大区分维度,测评轻流、黑湖、新核云、云表、Odoo。轻流一套平台可分别搭建 BOM 工序与配方分级追溯体系,同时适配混合制造企业,给出模式判定与选型校验标准。

热门文章

最新文章