DeepSeek V4 Pro、Grok 4.6都来了:老金的观点说给你听

简介: 今天DeepSeek V4 Pro和Grok 4.6都来了。如果你只是想知道这两个东西跟你有什么关系,我先把结论放前面。DeepSeek V4 Pro确实更强了,但我日常大概率还是会继续用Flash。大量查资料、改东西、跑代码、跑Agent,这些每天反复发生的活,我要的不是每次都上最强模型,而是足够聪明、速度快,而且可以放心大量用的模型。Pro是很强,但它反而让我更确定Flash该怎么

今天DeepSeek V4 Pro和Grok 4.6都来了。

如果你只是想知道这两个东西跟你有什么关系,我先把结论放前面。

DeepSeek V4 Pro确实更强了,但我日常大概率还是会继续用Flash。大量查资料、改东西、跑代码、跑Agent,这些每天反复发生的活,我要的不是每次都上最强模型,而是足够聪明、速度快,而且可以放心大量用的模型。

Pro是很强,但它反而让我更确定Flash该怎么用了。

然后说Grok 4.6,它让我第一次觉得,Grok可能真的要从一个很强的模型,变成我每天干活的主力工具了,因为它除了模型,还加了很多其他内容。

先说DeepSeek

这次V4 Pro绝对有点东西,尤其Agent和Coding,涨得非常猛。Terminal Bench 2.1已经做到87.9,Fable 5是88.0,只差0.1。

当然,这里一定得说清楚,这只是Terminal Bench 2.1这一项,不代表综合能力已经全面追平Fable 5。

但至少在Agent Coding这个维度,它确实已经摸到最顶级闭源模型那一档了。

问题是,我自己选模型的时候,从来不会只看谁分高。

我更在意的是:为了多出来的这点能力,我到底要多花多少钱?

现在V4 Pro常规输入、输出的价格差不多都是Flash的3倍。

Image

3倍价格,有没有给我3倍体验?

我觉得没有,因为体感上很难感受出来,没功能加持,也都是1M的,只是在参数上有差别,这个很难体验得到。

因为我每天真正交给AI的,大部分根本不是什么世界级难题。

Image

反而查资料、改文件、整理内容、写点代码、跑自动化、让Agent处理一堆琐碎但又不得不做的活,这些才是大头。

这种事情我为什么要每次都上Pro?

所以V4 Pro出来以后,我反而更确定了:Flash就是我的日常主力。

大量、高频、琐碎的任务全部扔给Flash。真碰上Flash明显啃不动、需要更强推理和Agent能力的任务,我可能会直接上顶级模型了。

对我来说,这才是DeepSeek这次更新最实际的意义,虽然参数上差距很大,但它还是没有多模态,多少有点儿遗憾,我平时很常见的操作就是甩个截图过去。

Grok 4.6:让我有了付费冲动

再来说说Grok,Grok 4.6这次模型能力本身已经相当夸张。xAI公布的数据里,Artificial Analysis Intelligence Index拿到61分,Fable 5 Max是62分。

只差1分。

GDPVal-AA v2上,Grok 4.6甚至做到1753,超过Fable 5 Max的1741;APEX-Agents也做到57.5%。

当然,它不是每项都赢。

但到了这个级别以后,我其实已经没那么在乎今天谁61、谁62了。

Image

因为真正让我重新看Grok的,是我突然发现,最近这些更新根本不是一个一个独立的事儿,它们正在往一起拼,凑一桌大棋。

大概可以说成,Grok 4.6是脑子,Grok Bot开始负责出去干活,Imagine开始接视觉生产,以及还有视频模型,Grok Build负责代码和应用,再把搜索、Deep Research可以把X的实时信息接进来。

这样看,Grok卖给你的,就不只是一个模型了。

讲下面之前先插一嘴,Grok的限制比较弱,不论大语言模型还是生图,生视频模型。。你懂的,能让你心情愉悦。

Grok Bot:直接给你的Agent配一台顶级电脑

这里面我最感兴趣的,其实是刚上线的Grok Bot,他非常符合老金我的元架构那套理念,去建造了N多个Agent来做不同的事情。

并且它解决了一个现在Agent特别烦的问题。

很多Agent看起来什么都会,真正让它干活的时候却会发现:这个网站没有API,那个软件没有MCP,这一步需要登录,下一步还得点个按钮。

然后AI干到这里,两手一摊,停了。

Grok Bot的思路简单粗暴:既然这些东西人能在电脑上操作,那我直接给AI一台电脑不就完了?

而且它给了一周免费试用,不得不说,财大气粗。。

Image

它给每一个Grok Bot都配了个云电脑,可以打开网页、登录软件,在不同应用之间来回操作。

配置还很厉害。。CPU是8核的,内存16G,硬盘128G的。

我特别喜欢它的交互方式,和我们经常使用的某信、某书等,IM软件的体感是一样的。

Image

你不需要先研究工作流怎么搭、节点怎么连、Agent怎么配置。

你就像给同事发微一样,这个事你帮我处理一下。

然后它自己去干。需要你授权的时候回来找你,需要你判断的时候再问你。其他时间,你完全可以去干别的。

这才是我觉得Grok Bot有意思的地方。它不是把“AI回答问题”又做强了一点,而是在改变你跟AI协作的方式。

以前是你坐在AI旁边,一步一步带着它干。现在越来越像你把任务交给一个同事,然后等它回来找你。

更有意思的是,你还可以有很多个Bot。

一个处理邮箱,一个处理费用,一个处理Bug,一个做其他事情,上面甚至还能再放一个Bot去协调其他Bot。

这时候它已经开始有点不像AI工具了。

它开始有点像一支真的AI团队了。

不过有一说一,它现在还有点儿蠢,比如它给的文件是它本地(也就是云端的)的本地地址。。。我完全打不开等等的问题频频发生,玩玩可以,要能用,可能还得过段时间。国内的全币信用卡,可直接使用。

300美元/月很贵,但Heavy这次居然让我觉得有点“量大管饱”

然后再回头看价格,就有意思了。

SuperGrok是30美元一个月,Heavy是300美元一个月。

300美元当然不便宜,不过你更应该算下,这300美元,到底能替掉我现在多少工具,又能帮我多干多少活?

Grok现在已经把聊天、搜索、Deep Research、代码、Agent、图片、视频、Build往一套产品里塞。

而且Heavy目前还包含Grok Bot的Early Beta资格,并且可以领一个月Cursor Ultra。

Cursor Ultra本身就是200美元一个月,不是每个月送200美元,是只送一个月。

Image

但即便如此,它还是让我第一次觉得:300美元Heavy看起来很贵,可对于真正把AI当生产工具的人,它开始有点量大管饱了。

Grok生图,也开始从“能玩”变成“真能干活”

还有一个最近特别容易被忽略的,是Imagine Image 2.0。

它现在已经不只是输入一句提示词,然后给你吐几张图。

上传或生成图片后,系统会自动把画面识别画面里的具体对象和区域,也可以直接圈一个区域,只改这里,其他部分基本保持不变。

这里拿我本人的照片举个栗子。

ImageImage

然后最多可以同时使用5张参考图,还能直接移除背景,输出透明背景。

甚至一张横图做好以后,你突然想改成9:16,它也不只是把左右两边咔嚓裁掉,而是会把缺失的画面继续补出来。

我们看下Grok image 2.0和GPT 2的生图效果对比,这个是单纯比美感,图片来自社区。

Image

Image

你也可以在Grok App里直接调用Imagine Image 2.0生图,然后转成视频。

对于真正天天做公众号封面、小红书、PPT、产品图的人来说,这可比排行榜上又涨几分有感多了。

我开始觉得,Grok可能会成为新的王者

所以现在再把最近xAI这些更新连起来看,我的感觉已经完全不一样了。

Grok 4.6负责想,Grok Bot负责出去干,Imagine负责视觉,以及甚至它的视频模型不算差,最后Grok Build还能负责把东西做出来。

再把搜索、Deep Research、X实时信息全部接进去。

我以前选AI的时候,最关心的问题是:

谁最聪明?

现在这个问题对我越来越不重要了。

因为当最顶级的几个模型已经只差那么一两分的时候,我真正关心的问题已经变成了:

我把一件事交给你,你到底能帮我做到哪一步,是告诉我应该怎么做,还是帮我写一份方案?

还是你能自己去查资料、打开软件、操作电脑、写代码、改图片,最后直接把做完的东西交回来?

这才是我觉得下一阶段真正会拉开差距的地方。

DeepSeek我肯定还会继续用,而且Flash大概率依然会是我处理大量日常任务的主力。

但如果问我最近哪个产品让我越来越想掏钱,我现在反而会选Grok。

因为大家最后愿意长期付钱买的,可能根本不是排行榜上的那1分。

而是谁真的能把活干完。

如果xAI继续沿着这条路跑下去,我觉得Grok真的有可能成为下一阶段的新王。


谢谢你读我的文章。
如果觉得不错,随手点个赞、在看、转发三连吧🙂
如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章。

飞书开源知识库(实时更新 交流群):

https://tffyvtlai4.feishu.cn/wiki/OhQ8wqntFihcI1kWVDlcNdpznFf

相关文章
|
8天前
|
存储 弹性计算 缓存
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
本文更新了2026年阿里云全系列云服务器租赁活动报价,所有特惠资源均可前往阿里云活动中心选购,整体覆盖从个人入门到企业级高性能场景的全梯度需求。其中轻量应用服务器主打极致性价比,2核2G峰值200M带宽配置每日10点、15点限时抢购价仅38元/年,2核4G配置379元/年起;高性价比的经济型e实例、通用算力型u2i实例覆盖2核4G至4核32G全档位,适配开发测试与中小型企业业务;搭载英特尔至强6处理器的第九代c9i企业级实例算力较上代提升20%,支撑高并发生产环境,不同实例规格价差清晰,用户可根据自身业务负载与预算灵活选型。
1828 118
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
|
9天前
|
人工智能 程序员 API
Codex 接入 DeepSeek-V4-Flash:还能补上识图,提供两套方案
Codex 接入 DeepSeek-V4-Flash 怎么配?本文覆盖 CLI 与桌面端,再用 qwen3-vl-flash 补识图,两套方案可直接照做
1380 11
|
15天前
|
云安全 人工智能 运维
阿里云联动百位企业安全专家,共识Agent防御最佳实践
当Agent成为新员工,你的安全边界在哪里?
1962 9
阿里云联动百位企业安全专家,共识Agent防御最佳实践
|
9天前
|
编解码 人工智能 安全
2核4G/4核8G/8核16G阿里云服务器如何选择实例?经济型e、通用算力型u2i与计算型c9i选哪个?
本文介绍了阿里云2核4G、4核8G、8核16G三档主流配置下经济型e、通用算力型u2i和计算型c9i三种实例的最新活动价格与适用场景。同配置下三者价差显著,以2核4G为例,经济型e低至599.93元/年,计算型c9i则高达1742.08元/年。文章详细解析了各实例的性能定位:经济型e适合轻负载入门场景,u2i兼顾稳定算力与性价比,c9i凭借第9代至强处理器与芯片级安全能力支撑高性能业务。同时提示用户可叠加满减优惠券享受折上折,建议根据业务负载与预算综合决策。
551 113
|
6天前
|
编解码 弹性计算 云计算
MiniMax-H3 视频生成模型 — 一键部署与使用指南
MiniMax-H3是MiniMax开源的33B全模态视频生成模型,支持文生视频、图生视频、参考生视频三种模式,原生输出2K/15秒带立体声音频视频,已原生适配ComfyUI,并可通过阿里云计算巢一键部署。(239字)
|
21天前
|
人工智能 前端开发 Linux
Codex 桌面版安装 + CC Switch 接入第三方 API 完整教程(2026 最新)
2026最新教程:手把手教你安装Codex桌面版,通过CC Switch v3.17.0一键接入Fenno等国产API(兼容OpenAI Responses格式),跳过账号登录,完整启用代码审查、多步任务与上下文感知功能。零基础友好,全程图文实操。(239字)
3222 5
|
9天前
|
人工智能 JSON Shell
2026AI漫剧本地全开源方案(附各个软件模型链接),8G显卡也能流畅运行
这是一套完全本地化部署的AI漫剧生成技术链路:涵盖LLM剧本分镜生成、FLUX文生图(IP-Adapter人脸锁定)、StoryDiffusion时序连贯控制、LTX-2.3唇形同步视频生成,及ComfyUI全流程调度。零云端费用,仅耗硬件算力,单集2–4小时可产出竖屏短视频,适配抖音/B站分发。
|
7天前
|
人工智能 API 开发工具
2026 零基础本地 AI 漫剧完整实操教程(8G 笔记本显卡可用|附可直接复制命令与代码)
本方案提供完全离线、本地运行的漫剧全自动制作流程:RTX3060/4050 8G显卡即可驱动,涵盖Qwen写分镜→ComfyUI统一角色绘图→LTX2.3图生微动画→Qwen3-TTS本地配音→FFmpeg自动合成,全程无水印、免API、不限次。专为低显存优化,解决变脸、闪烁、爆内存三大痛点。(239字)

热门文章

最新文章