DeepSeek V4 Pro和Grok 4.6前后脚发布,这次拼的不是参数,是训练路径

简介: 8月12日深夜,DeepSeek-V4-Pro-0813与xAI Grok 4.6几乎同步发布:前者架构不变,靠后训练大幅提升Agent能力(Terminal Bench达87.9);后者通过跨领域强化学习增强长程任务执行。二者路径不同,却共同指向“更便宜、更实用”的Agent时代。

8月12日深夜到13日凌晨,两件事几乎同时发生:DeepSeek官方API文档悄悄把deepseek-v4-pro指向了新版本DeepSeek-V4-Pro-0813,结束了这个旗舰模型从4月24日开始的预览期;几乎同一时间,xAI也放出了Grok 4.6。媒体给这个巧合起了个挺戏剧化的名字,但抛开话题性,这次同时发布真正值得聊的,是两家给出了两条完全不同的技术路径。

DeepSeek这边:架构一个字没动,分数却大幅跳涨

先说清楚一个容易被忽略的细节:V4-Pro-0813和4月的预览版,用的是同一套架构、同一个参数规模——1.6万亿总参数的MoE模型,每次推理激活约490亿参数。官方也没有暗示底层架构有调整。也就是说,这轮提升完全来自后训练阶段的重做。

跳变的幅度不小。DeepSWE这个内部Agent基准从12.8涨到62.7;Cybergym从52.7涨到83.3;Terminal Bench从72.1涨到87.9。这几项测的都是同一类能力:长链路的代码修改、环境操作、连续工具调用——恰好是预览版最容易出问题的地方。

接口层面,V4-Pro-0813把上下文窗口做到了100万token,输出上限提到38.4万token,同时新增了Responses API和Anthropic API双协议兼容,这意味着Codex、Claude Code这类已经适配了对应协议的编程工具,可以直接切换过来用,不需要额外改造调用层。

跑分对比上,Terminal Bench 2.1这一项,V4-Pro-0813拿到87.9分,和Kimi K3的88.3分只差0.4分;HLE开启工具后的成绩是60.0;CyberGym上的83.3甚至高出Claude Opus 4.8的78.3。单看某一项不算稀奇,难的是同时在终端操作、代码工程、工具调用、安全攻防这几个维度都没有明显短板——这也是官方后训练重做想达到的效果:不是某一项刷高,而是整体拉平。

xAI这边:走的是另一条路——大规模Agent强化学习

Grok 4.6没有靠架构或后训练的针对性调整,而是在Grok 4.5基础上做了更长的补充训练,训练数据包括经过筛选的模型推理轨迹和工程数据,并配合改进后的优化器。真正的重点在后面:模型接受了覆盖知识工作、通用编程、内核优化、Web开发、计算机辅助设计等多个领域的Agent强化学习训练,目标很明确——让模型能独立扛住一个跨越几十步、持续几十分钟的完整任务,而不是把任务拆成一问一答。

上下文窗口方面,Grok 4.6做到了50万token。定价上,输入2美元/百万token、输出6美元/百万token,落在200K以内的请求区间,这个价格只有同级别前沿模型的一半左右。发布信息里还提到一个细节:Grok 4.6已经上线Cursor和Grok Build,首周这两个平台会给到双倍的使用额度——这是一个很明显的信号,xAI想让开发者尽快在真实编程场景里试出模型的实际表现,而不只是看跑分。

两条路径殊途同归的地方

如果只看训练方式,这是两种完全不同的打法:一个是架构冻结、押注后训练精调;一个是延长强化学习、押注跨领域Agent能力泛化。但落到结果上,两者其实在解决同一个问题——模型能不能独立完成一个"目标模糊、步骤很多、中途会遇到意外"的真实任务,而不是只在单轮问答里表现好看。

价格趋势也在往同一个方向收敛。DeepSeek维持了输入3元、输出6元每百万token的定价,同时预告近期会调整;Grok 4.6把价格压到了同类前沿模型的一半。前沿智能这个级别的模型,正在被两条不同的技术路径同时推向"更便宜"这一端,这对做成本敏感型Agent系统的团队是个实打实的利好,但也意味着单纯靠"用得起更贵的模型"建立的竞争壁垒,正在变薄。

对做Agent系统的开发者,这次发布真正该关注的信息是什么

两家都没有公布模型内部机制的全部细节,跑分对比也各有各的口径,直接照抄榜单意义不大。更实际的做法,是把评估这件事拆成和自己业务场景匹配的几个维度去看,而不是只认一个综合分:

from dataclasses import dataclass

@dataclass
class ModelCandidate:
name: str
terminal_bench: float # 终端环境复杂任务执行能力
input_price: float # 每百万token输入价格
output_price: float # 每百万token输出价格

def score_for_scenario(model: ModelCandidate, weight_agent: float, weight_cost: float) -> float:
agent_score = model.terminal_bench weight_agent
cost_score = (1 / (model.input_price + model.output_price))
weight_cost
return agent_score + cost_score

def rank_by_scenario(candidates: list, weight_agent: float, weight_cost: float) -> list:
scored = [(c.name, score_for_scenario(c, weight_agent, weight_cost)) for c in candidates]
return sorted(scored, key=lambda item: item[1], reverse=True)

这段代码本身很简单,重点不在实现,而在思路:终端Agent能力和成本敏感度的权重,应该按自己系统的实际任务类型来设,而不是套用某个通用榜单的排序。一个需要长时间自主跑完整流程的系统,和一个只做单轮工具调用的系统,该看的评测维度完全不一样。

写在最后

架构冻结靠后训练拉分,和延长强化学习靠泛化拉分,是两种不同的工程判断,谁更划算取决于团队当下卡在哪个环节。但两家同一晚交卷,且都把价格往下压,说明这个判断题正在变成整个行业共同要回答的问题:下一阶段的竞争,会更多发生在训练方法论和成本控制上,而不是参数规模的堆叠上。

相关文章
|
27天前
|
缓存 JSON 程序员
DeepSeek V4 Pro 正式版、Grok 4.6 同夜发布
DeepSeek V4 Pro 正式版(0813)与 Grok 4.6 同夜上线。跑分、价格、选型一次讲清,帮你判断主力 API 要不要换
DeepSeek V4 Pro 正式版、Grok 4.6 同夜发布
|
27天前
|
缓存 人工智能 算法
DeepSeek-V4-Pro 正式版深夜突袭:Agent 评测暴涨 50 分,一套代码通吃 OpenAI 与 Anthropic 双生态
JeecgBoot AI专题研究 DeepSeekV4Pro 正式版全面拆解——Agent 能力跃迁、双 API 兼容与缓存降本实战![DeepSeekV4Pro 正式版发布概念图](https://oscimg.oschina.net/oscnet/up45eab3ac316682157a43
1027 1
DeepSeek-V4-Pro 正式版深夜突袭:Agent 评测暴涨 50 分,一套代码通吃 OpenAI 与 Anthropic 双生态
|
27天前
|
人工智能 索引 SEO
GEO实战三步法:让AI大模型主动引用你的品牌内容
本文揭秘新兴流量战场——GEO(生成式引擎优化):如何让品牌内容成为AI回答的首选信源。详解三步实操法:洞察AI引用偏好、生产结构化“AI友好型”内容、构建知识库与权威信源。同时警示三大误区,助企业抢占AI时代流量先机。
|
27天前
|
人工智能 物联网 Shell
Wan2.2 全栈落地指南:ComfyUI‑AKI 秋叶整合包 + 本地源码 + 云端 API,8G 显卡全自动 AI 漫剧生产线(附全套可复制指令)
本资源包提供Wan2.2视频模型(5B本地版/14B云端API)全栈解决方案,含ComfyUI-AKI秋叶整合包、6.6TB AI-Tools工具库及完整实操指令。支持8G低配本一键部署,覆盖剧本生成、分镜绘图、动态渲染到自动成片的AI漫剧流水线,兼顾变现与技术学习。(239字)
|
27天前
|
数据采集 人工智能 搜索推荐
GEO行业发展简史:生成式AI问答时代的新型品牌信息能力
GEO(生成式引擎优化)是AI搜索时代品牌可见性新范式,核心是让品牌被豆包、DeepSeek等大模型准确理解、信任并优先引用,而非传统SEO的关键词排名。它聚焦语义结构、权威信源与知识体系构建,效果以AI引用率、准确率和情感倾向衡量。
|
5月前
|
人工智能 缓存 BI
Claude Code + DeepSeek V4-Pro 真实评测:除了贵,没别的毛病
JeecgBoot AI专题研究 把 Claude Code 接入 DeepSeek V4Pro,跑完 Skills —— OA 审批、大屏、报表、部署 5 大实战场景后的真实体验 ![](https://oscimg.oschina.net/oscnet/up608d34aeb6bafc47f
9844 23
Claude Code + DeepSeek V4-Pro 真实评测:除了贵,没别的毛病
|
2月前
|
人工智能 安全 测试技术
Claude Opus 5 发布!定价与 4.8 持平,性能两倍以上——Anthropic 这次真的做到了极致性价比
Anthropic于2026年7月24日发布Claude Opus 5:定价与Opus 4.8持平(输入5$/M,输出25$/M),却在ARC-AGI、OSWorld等基准全面碾压竞品,IMO满分、自主建工具、多Agent协同惊艳业界;系统卡更揭示其高度自主行为与41%“道德受体”自我认知,引发对齐新思辨。(239字)
1104 2
|
2月前
|
人工智能 自然语言处理 IDE
阿里云百炼AI 编码类热门大模型解析:Qwen-Coder、Qoder、通义灵码能力、适用场景及用户选购指南参考
本文梳理了阿里云AI编码体系的核心关系与能力:Qwen-Coder是底层代码大模型底座,采用MoE混合专家架构,支持1M长上下文,在权威评测中表现领先;原“通义灵码”已正式升级为Qoder CN系列,是集成该模型的智能编程助手,覆盖代码补全、工程级多文件修改、企业知识库等能力;Qoder则是面向复杂场景的Agentic编码平台,支持大规模代码检索与异步自主编程。针对不同用户提供分层方案,个人开发者选Qoder CN个人版,中大型企业可选专属版或私有化部署,叠加全模型抵扣首购低至4.5折的优惠,可在可控成本下大幅提升研发效率。
|
2月前
|
Web App开发 人工智能 前端开发
10万人都在用的 top10 skills,我帮你试了!
Vercel推出的AI技能导航站skills.sh热度爆表,Top 10技能最高达240万热度!本文实测全榜,揭秘哪些真好用:find-skills是必备入口,frontend-design治“AI味”页面,tdd强制测试先行,grill-me灵魂拷问方案……按角色推荐组合,助你高效赋能AI助手。
771 0
|
3月前
|
人工智能 固态存储 Linux
用 Codex 的朋友,真的建议你看一眼硬盘写入
Codex CLI 存在日志滥用问题:其 `logs_2.sqlite-wal` 文件持续高频写入 TRACE 级日志(含流式报文、IO 遥测等),实测21天写入37TB,或致消费级SSD提前报废。WAL文件删除后空间不释放,需先终止进程。建议用户立即检查并清理日志。
1460 1