今天DeepSeek V4 Pro和Grok 4.6都来了。
如果你只是想知道这两个东西跟你有什么关系,我先把结论放前面。
DeepSeek V4 Pro确实更强了,但我日常大概率还是会继续用Flash。大量查资料、改东西、跑代码、跑Agent,这些每天反复发生的活,我要的不是每次都上最强模型,而是足够聪明、速度快,而且可以放心大量用的模型。
Pro是很强,但它反而让我更确定Flash该怎么用了。
然后说Grok 4.6,它让我第一次觉得,Grok可能真的要从一个很强的模型,变成我每天干活的主力工具了,因为它除了模型,还加了很多其他内容。
先说DeepSeek
这次V4 Pro绝对有点东西,尤其Agent和Coding,涨得非常猛。Terminal Bench 2.1已经做到87.9,Fable 5是88.0,只差0.1。
当然,这里一定得说清楚,这只是Terminal Bench 2.1这一项,不代表综合能力已经全面追平Fable 5。
但至少在Agent Coding这个维度,它确实已经摸到最顶级闭源模型那一档了。
问题是,我自己选模型的时候,从来不会只看谁分高。
我更在意的是:为了多出来的这点能力,我到底要多花多少钱?
现在V4 Pro常规输入、输出的价格差不多都是Flash的3倍。

3倍价格,有没有给我3倍体验?
我觉得没有,因为体感上很难感受出来,没功能加持,也都是1M的,只是在参数上有差别,这个很难体验得到。
因为我每天真正交给AI的,大部分根本不是什么世界级难题。

反而查资料、改文件、整理内容、写点代码、跑自动化、让Agent处理一堆琐碎但又不得不做的活,这些才是大头。
这种事情我为什么要每次都上Pro?
所以V4 Pro出来以后,我反而更确定了:Flash就是我的日常主力。
大量、高频、琐碎的任务全部扔给Flash。真碰上Flash明显啃不动、需要更强推理和Agent能力的任务,我可能会直接上顶级模型了。
对我来说,这才是DeepSeek这次更新最实际的意义,虽然参数上差距很大,但它还是没有多模态,多少有点儿遗憾,我平时很常见的操作就是甩个截图过去。
Grok 4.6:让我有了付费冲动
再来说说Grok,Grok 4.6这次模型能力本身已经相当夸张。xAI公布的数据里,Artificial Analysis Intelligence Index拿到61分,Fable 5 Max是62分。
只差1分。
GDPVal-AA v2上,Grok 4.6甚至做到1753,超过Fable 5 Max的1741;APEX-Agents也做到57.5%。
当然,它不是每项都赢。
但到了这个级别以后,我其实已经没那么在乎今天谁61、谁62了。

因为真正让我重新看Grok的,是我突然发现,最近这些更新根本不是一个一个独立的事儿,它们正在往一起拼,凑一桌大棋。
大概可以说成,Grok 4.6是脑子,Grok Bot开始负责出去干活,Imagine开始接视觉生产,以及还有视频模型,Grok Build负责代码和应用,再把搜索、Deep Research可以把X的实时信息接进来。
这样看,Grok卖给你的,就不只是一个模型了。
讲下面之前先插一嘴,Grok的限制比较弱,不论大语言模型还是生图,生视频模型。。你懂的,能让你心情愉悦。
Grok Bot:直接给你的Agent配一台顶级电脑
这里面我最感兴趣的,其实是刚上线的Grok Bot,他非常符合老金我的元架构那套理念,去建造了N多个Agent来做不同的事情。
并且它解决了一个现在Agent特别烦的问题。
很多Agent看起来什么都会,真正让它干活的时候却会发现:这个网站没有API,那个软件没有MCP,这一步需要登录,下一步还得点个按钮。
然后AI干到这里,两手一摊,停了。
Grok Bot的思路简单粗暴:既然这些东西人能在电脑上操作,那我直接给AI一台电脑不就完了?
而且它给了一周免费试用,不得不说,财大气粗。。

它给每一个Grok Bot都配了个云电脑,可以打开网页、登录软件,在不同应用之间来回操作。
配置还很厉害。。CPU是8核的,内存16G,硬盘128G的。
我特别喜欢它的交互方式,和我们经常使用的某信、某书等,IM软件的体感是一样的。

你不需要先研究工作流怎么搭、节点怎么连、Agent怎么配置。
你就像给同事发微一样,这个事你帮我处理一下。
然后它自己去干。需要你授权的时候回来找你,需要你判断的时候再问你。其他时间,你完全可以去干别的。
这才是我觉得Grok Bot有意思的地方。它不是把“AI回答问题”又做强了一点,而是在改变你跟AI协作的方式。
以前是你坐在AI旁边,一步一步带着它干。现在越来越像你把任务交给一个同事,然后等它回来找你。
更有意思的是,你还可以有很多个Bot。
一个处理邮箱,一个处理费用,一个处理Bug,一个做其他事情,上面甚至还能再放一个Bot去协调其他Bot。
这时候它已经开始有点不像AI工具了。
它开始有点像一支真的AI团队了。
不过有一说一,它现在还有点儿蠢,比如它给的文件是它本地(也就是云端的)的本地地址。。。我完全打不开等等的问题频频发生,玩玩可以,要能用,可能还得过段时间。国内的全币信用卡,可直接使用。
300美元/月很贵,但Heavy这次居然让我觉得有点“量大管饱”
然后再回头看价格,就有意思了。
SuperGrok是30美元一个月,Heavy是300美元一个月。
300美元当然不便宜,不过你更应该算下,这300美元,到底能替掉我现在多少工具,又能帮我多干多少活?
Grok现在已经把聊天、搜索、Deep Research、代码、Agent、图片、视频、Build往一套产品里塞。
而且Heavy目前还包含Grok Bot的Early Beta资格,并且可以领一个月Cursor Ultra。
Cursor Ultra本身就是200美元一个月,不是每个月送200美元,是只送一个月。

但即便如此,它还是让我第一次觉得:300美元Heavy看起来很贵,可对于真正把AI当生产工具的人,它开始有点量大管饱了。
Grok生图,也开始从“能玩”变成“真能干活”
还有一个最近特别容易被忽略的,是Imagine Image 2.0。
它现在已经不只是输入一句提示词,然后给你吐几张图。
上传或生成图片后,系统会自动把画面识别画面里的具体对象和区域,也可以直接圈一个区域,只改这里,其他部分基本保持不变。
这里拿我本人的照片举个栗子。


然后最多可以同时使用5张参考图,还能直接移除背景,输出透明背景。
甚至一张横图做好以后,你突然想改成9:16,它也不只是把左右两边咔嚓裁掉,而是会把缺失的画面继续补出来。
我们看下Grok image 2.0和GPT 2的生图效果对比,这个是单纯比美感,图片来自社区。


你也可以在Grok App里直接调用Imagine Image 2.0生图,然后转成视频。
对于真正天天做公众号封面、小红书、PPT、产品图的人来说,这可比排行榜上又涨几分有感多了。
我开始觉得,Grok可能会成为新的王者
所以现在再把最近xAI这些更新连起来看,我的感觉已经完全不一样了。
Grok 4.6负责想,Grok Bot负责出去干,Imagine负责视觉,以及甚至它的视频模型不算差,最后Grok Build还能负责把东西做出来。
再把搜索、Deep Research、X实时信息全部接进去。
我以前选AI的时候,最关心的问题是:
谁最聪明?
现在这个问题对我越来越不重要了。
因为当最顶级的几个模型已经只差那么一两分的时候,我真正关心的问题已经变成了:
我把一件事交给你,你到底能帮我做到哪一步,是告诉我应该怎么做,还是帮我写一份方案?
还是你能自己去查资料、打开软件、操作电脑、写代码、改图片,最后直接把做完的东西交回来?
这才是我觉得下一阶段真正会拉开差距的地方。
DeepSeek我肯定还会继续用,而且Flash大概率依然会是我处理大量日常任务的主力。
但如果问我最近哪个产品让我越来越想掏钱,我现在反而会选Grok。
因为大家最后愿意长期付钱买的,可能根本不是排行榜上的那1分。
而是谁真的能把活干完。
如果xAI继续沿着这条路跑下去,我觉得Grok真的有可能成为下一阶段的新王。
谢谢你读我的文章。
如果觉得不错,随手点个赞、在看、转发三连吧🙂
如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章。
飞书开源知识库(实时更新 交流群):
https://tffyvtlai4.feishu.cn/wiki/OhQ8wqntFihcI1kWVDlcNdpznFf