DeepSeek V4 Pro、Grok 4.6都来了:老金的观点说给你听

简介: 今天DeepSeek V4 Pro和Grok 4.6都来了。如果你只是想知道这两个东西跟你有什么关系,我先把结论放前面。DeepSeek V4 Pro确实更强了,但我日常大概率还是会继续用Flash。大量查资料、改东西、跑代码、跑Agent,这些每天反复发生的活,我要的不是每次都上最强模型,而是足够聪明、速度快,而且可以放心大量用的模型。Pro是很强,但它反而让我更确定Flash该怎么

今天DeepSeek V4 Pro和Grok 4.6都来了。

如果你只是想知道这两个东西跟你有什么关系,我先把结论放前面。

DeepSeek V4 Pro确实更强了,但我日常大概率还是会继续用Flash。大量查资料、改东西、跑代码、跑Agent,这些每天反复发生的活,我要的不是每次都上最强模型,而是足够聪明、速度快,而且可以放心大量用的模型。

Pro是很强,但它反而让我更确定Flash该怎么用了。

然后说Grok 4.6,它让我第一次觉得,Grok可能真的要从一个很强的模型,变成我每天干活的主力工具了,因为它除了模型,还加了很多其他内容。

先说DeepSeek

这次V4 Pro绝对有点东西,尤其Agent和Coding,涨得非常猛。Terminal Bench 2.1已经做到87.9,Fable 5是88.0,只差0.1。

当然,这里一定得说清楚,这只是Terminal Bench 2.1这一项,不代表综合能力已经全面追平Fable 5。

但至少在Agent Coding这个维度,它确实已经摸到最顶级闭源模型那一档了。

问题是,我自己选模型的时候,从来不会只看谁分高。

我更在意的是:为了多出来的这点能力,我到底要多花多少钱?

现在V4 Pro常规输入、输出的价格差不多都是Flash的3倍。

Image

3倍价格,有没有给我3倍体验?

我觉得没有,因为体感上很难感受出来,没功能加持,也都是1M的,只是在参数上有差别,这个很难体验得到。

因为我每天真正交给AI的,大部分根本不是什么世界级难题。

Image

反而查资料、改文件、整理内容、写点代码、跑自动化、让Agent处理一堆琐碎但又不得不做的活,这些才是大头。

这种事情我为什么要每次都上Pro?

所以V4 Pro出来以后,我反而更确定了:Flash就是我的日常主力。

大量、高频、琐碎的任务全部扔给Flash。真碰上Flash明显啃不动、需要更强推理和Agent能力的任务,我可能会直接上顶级模型了。

对我来说,这才是DeepSeek这次更新最实际的意义,虽然参数上差距很大,但它还是没有多模态,多少有点儿遗憾,我平时很常见的操作就是甩个截图过去。

Grok 4.6:让我有了付费冲动

再来说说Grok,Grok 4.6这次模型能力本身已经相当夸张。xAI公布的数据里,Artificial Analysis Intelligence Index拿到61分,Fable 5 Max是62分。

只差1分。

GDPVal-AA v2上,Grok 4.6甚至做到1753,超过Fable 5 Max的1741;APEX-Agents也做到57.5%。

当然,它不是每项都赢。

但到了这个级别以后,我其实已经没那么在乎今天谁61、谁62了。

Image

因为真正让我重新看Grok的,是我突然发现,最近这些更新根本不是一个一个独立的事儿,它们正在往一起拼,凑一桌大棋。

大概可以说成,Grok 4.6是脑子,Grok Bot开始负责出去干活,Imagine开始接视觉生产,以及还有视频模型,Grok Build负责代码和应用,再把搜索、Deep Research可以把X的实时信息接进来。

这样看,Grok卖给你的,就不只是一个模型了。

讲下面之前先插一嘴,Grok的限制比较弱,不论大语言模型还是生图,生视频模型。。你懂的,能让你心情愉悦。

Grok Bot:直接给你的Agent配一台顶级电脑

这里面我最感兴趣的,其实是刚上线的Grok Bot,他非常符合老金我的元架构那套理念,去建造了N多个Agent来做不同的事情。

并且它解决了一个现在Agent特别烦的问题。

很多Agent看起来什么都会,真正让它干活的时候却会发现:这个网站没有API,那个软件没有MCP,这一步需要登录,下一步还得点个按钮。

然后AI干到这里,两手一摊,停了。

Grok Bot的思路简单粗暴:既然这些东西人能在电脑上操作,那我直接给AI一台电脑不就完了?

而且它给了一周免费试用,不得不说,财大气粗。。

Image

它给每一个Grok Bot都配了个云电脑,可以打开网页、登录软件,在不同应用之间来回操作。

配置还很厉害。。CPU是8核的,内存16G,硬盘128G的。

我特别喜欢它的交互方式,和我们经常使用的某信、某书等,IM软件的体感是一样的。

Image

你不需要先研究工作流怎么搭、节点怎么连、Agent怎么配置。

你就像给同事发微一样,这个事你帮我处理一下。

然后它自己去干。需要你授权的时候回来找你,需要你判断的时候再问你。其他时间,你完全可以去干别的。

这才是我觉得Grok Bot有意思的地方。它不是把“AI回答问题”又做强了一点,而是在改变你跟AI协作的方式。

以前是你坐在AI旁边,一步一步带着它干。现在越来越像你把任务交给一个同事,然后等它回来找你。

更有意思的是,你还可以有很多个Bot。

一个处理邮箱,一个处理费用,一个处理Bug,一个做其他事情,上面甚至还能再放一个Bot去协调其他Bot。

这时候它已经开始有点不像AI工具了。

它开始有点像一支真的AI团队了。

不过有一说一,它现在还有点儿蠢,比如它给的文件是它本地(也就是云端的)的本地地址。。。我完全打不开等等的问题频频发生,玩玩可以,要能用,可能还得过段时间。国内的全币信用卡,可直接使用。

300美元/月很贵,但Heavy这次居然让我觉得有点“量大管饱”

然后再回头看价格,就有意思了。

SuperGrok是30美元一个月,Heavy是300美元一个月。

300美元当然不便宜,不过你更应该算下,这300美元,到底能替掉我现在多少工具,又能帮我多干多少活?

Grok现在已经把聊天、搜索、Deep Research、代码、Agent、图片、视频、Build往一套产品里塞。

而且Heavy目前还包含Grok Bot的Early Beta资格,并且可以领一个月Cursor Ultra。

Cursor Ultra本身就是200美元一个月,不是每个月送200美元,是只送一个月。

Image

但即便如此,它还是让我第一次觉得:300美元Heavy看起来很贵,可对于真正把AI当生产工具的人,它开始有点量大管饱了。

Grok生图,也开始从“能玩”变成“真能干活”

还有一个最近特别容易被忽略的,是Imagine Image 2.0。

它现在已经不只是输入一句提示词,然后给你吐几张图。

上传或生成图片后,系统会自动把画面识别画面里的具体对象和区域,也可以直接圈一个区域,只改这里,其他部分基本保持不变。

这里拿我本人的照片举个栗子。

ImageImage

然后最多可以同时使用5张参考图,还能直接移除背景,输出透明背景。

甚至一张横图做好以后,你突然想改成9:16,它也不只是把左右两边咔嚓裁掉,而是会把缺失的画面继续补出来。

我们看下Grok image 2.0和GPT 2的生图效果对比,这个是单纯比美感,图片来自社区。

Image

Image

你也可以在Grok App里直接调用Imagine Image 2.0生图,然后转成视频。

对于真正天天做公众号封面、小红书、PPT、产品图的人来说,这可比排行榜上又涨几分有感多了。

我开始觉得,Grok可能会成为新的王者

所以现在再把最近xAI这些更新连起来看,我的感觉已经完全不一样了。

Grok 4.6负责想,Grok Bot负责出去干,Imagine负责视觉,以及甚至它的视频模型不算差,最后Grok Build还能负责把东西做出来。

再把搜索、Deep Research、X实时信息全部接进去。

我以前选AI的时候,最关心的问题是:

谁最聪明?

现在这个问题对我越来越不重要了。

因为当最顶级的几个模型已经只差那么一两分的时候,我真正关心的问题已经变成了:

我把一件事交给你,你到底能帮我做到哪一步,是告诉我应该怎么做,还是帮我写一份方案?

还是你能自己去查资料、打开软件、操作电脑、写代码、改图片,最后直接把做完的东西交回来?

这才是我觉得下一阶段真正会拉开差距的地方。

DeepSeek我肯定还会继续用,而且Flash大概率依然会是我处理大量日常任务的主力。

但如果问我最近哪个产品让我越来越想掏钱,我现在反而会选Grok。

因为大家最后愿意长期付钱买的,可能根本不是排行榜上的那1分。

而是谁真的能把活干完。

如果xAI继续沿着这条路跑下去,我觉得Grok真的有可能成为下一阶段的新王。


谢谢你读我的文章。
如果觉得不错,随手点个赞、在看、转发三连吧🙂
如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章。

飞书开源知识库(实时更新 交流群):

https://tffyvtlai4.feishu.cn/wiki/OhQ8wqntFihcI1kWVDlcNdpznFf

相关文章
|
1天前
|
人工智能 监控 安全
GPT-6发布15小时:Altman道歉赔额度,有人已经把活交给它
从GPT6这个模型怎么样,到案例怎么样,本文一点点的给你嚼碎了告你。
|
2月前
|
缓存 UED 开发者
Codex109天重置23次,明天还要再送一次
Codex近109天完成23次额度重置,7月14日将迎来第24次。Tibo高频响应用户反馈:优化GPT-5.6高消耗问题、补发失效福利、调整重置时间——形成“反馈→回应→修复→补偿”正向闭环,彰显以用户为中心的产品哲学。(239字)
1815 12
|
22天前
|
JavaScript API 开发者
DeepSeek Harness 刚发布,先让它做了个网页
DeepSeek Harness(DSH)是DeepSeek开源的Agent执行框架,践行“Model + Harness = Agent”理念。v0.1开发者预览版发布次日即实测成功:一行命令`npx @deepseek-ai/dsh web`启动,自动完成搜索、规划、写HTML、本地验证全流程,支持插件扩展与完整执行轨迹追踪。(239字)
483 1
DeepSeek Harness 刚发布,先让它做了个网页
|
20天前
|
弹性计算 小程序 iOS开发
阿里云无影云电脑个人版指南:快速购买、选择无影套餐、配置云电脑、连接及使用全流程
阿里云无影云电脑个人版,支持Windows/macOS/手机多端接入,提供黄金至黑金6档灵活套餐(14.9元/月起),含系统盘、数据盘、带宽及灵豆配额,适用于办公、学习、设计与游戏。一键配置、即连即用,休眠不计费,数据安全可靠。
242 2
|
19天前
|
人工智能 测试技术 Shell
OpenCode开源AI编程助手实操:替代Claude Code对接百炼完整教程
在AI编程Agent快速普及的当下,很多开发者习惯使用闭源编程代理工具完成项目重构、bug修复、新功能开发,但闭源工具存在诸多现实痛点。一方面工具完全绑定自家模型,无法自由切换推理后端;另一方面账号风控策略严苛,容易出现账号受限、调用中断的情况,企业内部开发还会面临代码数据外送带来的数据安全风险。OpenCode作为一款开源AI编程代理框架,被很多开发者视作Claude Code的优质替代方案,它不绑定任何大模型厂商,支持对接云端大模型服务,也可以接入本地私有化部署模型,同时完整复刻终端Agent的文件读写、命令执行、项目分析等核心能力,搭配百炼平台的各类代码大模型,就可以搭建一套完全自主可控
213 1
|
22天前
|
人工智能 缓存 算法
最新版通义千问(Qwen3.8‑Max‑Preview)功能介绍
随着AI智能体从简单问答走向长周期自主任务执行,市场对大模型的综合能力提出更高要求,不仅需要强悍的文本推理,还需要原生多模态理解、百万级超长上下文、稳定的链式工具调用、大型工程项目完整交付能力。Qwen3.8‑Max‑Preview作为通义千问系列新一代旗舰预览基座,总参数规模达到2.4万亿,采用MoE混合专家架构,定位为**代码工程+专业办公**双核旗舰模型,完成从纯文本向原生多模态的跨越,在长链路Agent自治、全栈软件开发、大批量复杂文档分析、多模态专业办公场景实现能力跨越式提升。该预览版本率先开放于百炼平台,支持Token Plan订阅模式调用,适配OpenClaw、Hermes Ag
681 2
|
21天前
|
人工智能 缓存 物联网
AI漫剧画质一致性工程优化:Stable Diffusion+ComfyUI人设锁定与帧间防抖量产方案
本文提出AI漫剧量产画质维稳方案,聚焦人设锁定、画风统一与帧间稳定三大痛点。基于SD模型调优、ComfyUI节点改造与OpenClaw调度优化,从权重固化、IPAdapter适配、时序矫正、色彩均值统一、任务队列管控五方面系统解决五官漂移、风格跳变、频闪断层等问题,适配8G/12G显卡,提供完整可运行代码与标准化配置。(239字)
|
21天前
|
缓存 编解码 并行计算
模型能装进显存,训练为什么还是 OOM?把 PyTorch 显存拆成 5 笔账
模型权重能够装进显存,不代表训练就能正常运行。本文拆解 PyTorch 训练中的参数、梯度、优化器状态、激活值和临时工作区,并给出显存监测代码及 OOM 排查顺序,覆盖梯度累积、混合精度、Gradient Checkpointing 和 LoRA 等常用方案。
|
24天前
|
人工智能 缓存 API
‌DeepSeek V4 Pro在阿里云怎么调用?阿里云百炼支持‌DeepSeek V4 Pro吗?
阿里云百炼正式支持DeepSeek V4 Pro(模型ID:deepseek-v4-pro),支持OpenAI/DashScope/Anthropic兼容调用,享免费100万Tokens。支持思考模式、Function Calling及百万级上下文,可按量付费或订阅TokenPlan(个人版39元/月)。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
|
1月前
|
缓存 安全 Windows
老金实测:提示词删82%之后,MiniMax退步,GPT-5.6没省Token
![Image](https://ucc.alicdn.com/pic/developer-ecology/p3shvhj26rigq_6b49b01aa4e3434ba10e05398fbd2cb5.png) 前段时间,老金不是发了一个解读A社发表的删除80%的提示词的文章了么。 这两天真的把Meta\_Kim的重构了,然后在Claude Code和Codex里,跑了一套48次的A/B实测