找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4668

积分

0

好友

608

主题
发表于 2 小时前 | 查看: 3| 回复: 0

今天 DeepSeek V4 Pro 和 Grok 4.6 都来了。

如果你只想知道这两个东西跟自己有什么关系,我先把结论放在前面。

DeepSeek V4 Pro 确实更强了,但我日常大概率还是会继续用 Flash。大量查资料、改东西、跑代码、跑 Agent,这些每天反复发生的活,我要的不是每次都上最强模型,而是足够聪明、速度快、可以放心大量用的模型。

Pro 很强,但它反而让我更确定 Flash 该怎么用了。

再说 Grok 4.6,它让我第一次觉得,Grok 可能真的要从一个很强的模型,变成我每天干活的主力工具了。因为它除了模型,还加了很多其他东西。

先说 DeepSeek

这次 V4 Pro 绝对有点东西,尤其 Agent Coding,涨得非常猛。Terminal Bench 2.1 已经做到 87.9,Fable 5 是 88.0,只差 0.1。

当然,这里一定得说清楚,这只是 Terminal Bench 2.1 这一项,不代表综合能力已经全面追平 Fable 5。

但至少在 Agent Coding 这个维度,它确实已经摸到最顶级闭源模型那一档了。

问题是,我自己选模型的时候,从来不会只看谁分高。

我更在意的是:为了多出来的这点能力,我到底要多花多少钱?

现在 V4 Pro 常规输入、输出的价格差不多都是 Flash 的 3 倍。

DeepSeek V4 Flash与Pro模型细节参数对比

3 倍价格,有没有给我 3 倍体验?

我觉得没有。体感上很难感受出来,功能加持也没有,都是 1M 上下文,只是参数上有差别,这个很难体验得到。

因为我每天真正交给 AI 的,大部分根本不是什么世界级难题。

DeepSeek V4 Pro与Flash模型参数规格对比

反而查资料、改文件、整理内容、写点代码、跑自动化、让 Agent 处理一堆琐碎但又不得不做的活,这些才是大头。

这种事情我为什么要每次都上 Pro?

所以 V4 Pro 出来以后,我反而更确定了:Flash 就是我的日常主力。

大量、高频、琐碎的任务全部扔给 Flash。真碰上 Flash 明显啃不动、需要更强推理和 Agent 能力的任务,我可能会直接上顶级模型了。

对我来说,这才是 DeepSeek 这次更新最实际的意义。虽然参数上差距很大,但它还是没有多模态,多少有点儿遗憾。我平时很常见的操作就是甩个截图过去。

Grok 4.6:让我有了付费冲动

再来说说 Grok。Grok 4.6 这次模型能力本身已经相当夸张。xAI 公布的数据里,Artificial Analysis Intelligence Index 拿到 61 分,Fable 5 Max 是 62 分。

只差 1 分。

GDPVal-AA v2 上,Grok 4.6 甚至做到 1753,超过 Fable 5 Max 的 1741;APEX-Agents 也做到 57.5%。

当然,它不是每项都赢。

但到了这个级别以后,我其实已经没那么在乎今天谁 61、谁 62 了。

Grok 4.6在AA Intelligence Index上的性能表现对比

因为真正让我重新看 Grok 的,是我突然发现,最近这些更新根本不是一个一个独立的事儿,它们正在往一起拼,凑一桌大棋。

大概可以说成:Grok 4.6 是脑子,Grok Bot 开始负责出去干活,Imagine 开始接视觉生产,另外还有视频模型,Grok Build 负责代码和应用,再把搜索、Deep Research 把 X 的实时信息接进来。

这样看,Grok 卖给你的,就不只是一个模型了。

讲下面之前先插一嘴,Grok 的限制比较弱,不论大语言模型还是生图、生视频模型……你懂的,能让你心情愉悦。

Grok Bot:直接给你的 Agent 配一台顶级电脑

这里面我最感兴趣的,其实是刚上线的 Grok Bot。它非常符合老金我那套元架构理念——去建造 N 多个 Agent 来做不同的事情。

并且它解决了一个现在 Agent 特别烦的问题。

很多 Agent 看起来什么都会,真正让它干活的时候却会发现:这个网站没有 API,那个软件没有 MCP,这一步需要登录,下一步还得点个按钮。

然后 AI 干到这里,两手一摊,停了。

Grok Bot 的思路简单粗暴:既然这些东西人能在电脑上操作,那我直接给 AI 一台 云电脑 不就完了?

而且它给了一周免费试用,不得不说,财大气粗。

Grok Bot订阅选项页面:免费试用、Ultra与SuperGrok Heavy

它给每一个 Grok Bot 都配了个云电脑,可以打开网页、登录软件,在不同应用之间来回操作。

配置还很厉害:CPU 是 8 核的,内存 16G,硬盘 128G。

我特别喜欢它的交互方式,和我们经常使用的某信、某书等 IM 软件的体感是一样的。

Grok Bot Sales Outbound任务执行界面与消息队列

你不需要先研究工作流怎么搭、节点怎么连、Agent 怎么配置。

你就像给同事发消息一样,这个事你帮我处理一下。

然后它自己去干。需要你授权的时候回来找你,需要你判断的时候再问你。其他时间,你完全可以去干别的。

这才是我觉得 Grok Bot 有意思的地方。它不是把"AI 回答问题"又做强了一点,而是在改变你跟 AI 协作的方式。

以前是你坐在 AI 旁边,一步一步带着它干。现在越来越像你把任务交给一个同事,然后等它回来找你。

更有意思的是,你还可以有很多个 Bot。

一个处理邮箱,一个处理费用,一个处理 Bug,一个做其他事情,上面甚至还能再放一个 Bot 去协调其他 Bot。

这时候它已经开始有点不像 AI 工具了。

它开始有点像一支真的 AI 团队了。

不过有一说一,它现在还有点儿蠢,比如它给的文件是它本地(也就是云端的)的本地地址……我完全打不开等等的问题频频发生。玩玩可以,要能用,可能还得过段时间。国内的全币信用卡可直接使用。

300 美元/月很贵,但 Heavy 这次居然让我觉得有点"量大管饱"

然后再回头看价格,就有意思了。

SuperGrok 是 30 美元一个月,Heavy 是 300 美元一个月。

300 美元当然不便宜,不过你更应该算下:这 300 美元,到底能替掉我现在多少工具,又能帮我多干多少活?

Grok 现在已经把聊天、搜索、Deep Research、代码、Agent、图片、视频、Build 往一套产品里塞。

而且 Heavy 目前还包含 Grok Bot 的 Early Beta 资格,并且可以领一个月 Cursor Ultra。

Cursor Ultra 本身就是 200 美元一个月。注意,不是每个月送 200 美元,是只送一个月。

SuperGrok Heavy关联Cursor Ultra权益说明页面

但即便如此,它还是让我第一次觉得:300 美元 Heavy 看起来很贵,可对于真正把 AI 当生产工具的人,它开始有点量大管饱了。

Grok 生图,也开始从"能玩"变成"真能干活"

还有一个最近特别容易被忽略的,是 Imagine Image 2.0。

它现在已经不只是输入一句提示词,然后给你吐几张图。

上传或生成图片后,系统会自动识别画面里的具体对象和区域,也可以直接圈一个区域,只改这里,其他部分基本保持不变。

这里拿我本人的照片举个栗子。

Imagine Image 2.0 AI服装换装操作界面与效果对比

Imagine Image 2.0局部编辑功能:将手持物品改为书本

然后最多可以同时使用 5 张参考图,还能直接移除背景,输出透明背景。

甚至一张横图做好以后,你突然想改成 9:16,它也不只是把左右两边咔嚓裁掉,而是会把缺失的画面继续补出来。

我们看下 Grok Imagine 2.0 和 GPT-Image 2 的生图效果对比,这个是单纯比美感,图片来自社区。

Grok Imagine 2.0与GPT-Image 2生成效果对比:办公桌场景

Grok Imagine 2.0与GPT-Image 2生成效果对比:街头人像场景

你也可以在 Grok App 里直接调用 Imagine Image 2.0 生图,然后转成视频。

对于真正天天做公众号封面、小红书、PPT、产品图的人来说,这可比排行榜上又涨几分有感多了。

我开始觉得,Grok 可能会成为新的王者

所以现在再把最近 xAI 这些更新连起来看,我的感觉已经完全不一样了。

Grok 4.6 负责想,Grok Bot 负责出去干,Imagine 负责视觉,甚至它的视频模型也不算差,最后 Grok Build 还能负责把东西做出来。

再把搜索、Deep Research、X 实时信息全部接进去。

我以前选 AI 的时候,最关心的问题是:谁最聪明?

现在这个问题对我越来越不重要了。

因为当最顶级的几个模型已经只差那么一两分的时候,我真正关心的问题已经变成了:我把一件事交给你,你到底能帮我做到哪一步?

是告诉我应该怎么做,还是帮我写一份方案?

还是你能自己去查资料、打开软件、操作电脑、写代码、改图片,最后直接把做完的东西交回来?

这才是我觉得下一阶段真正会拉开差距的地方。

DeepSeek 我肯定还会继续用,而且 Flash 大概率依然会是我处理大量日常任务的主力。

但如果问我最近哪个产品让我越来越想掏钱,我现在反而会选 Grok。

因为大家最后愿意长期付钱买的,可能根本不是排行榜上的那 1 分。

而是谁真的能把活干完。

如果 xAI 继续沿着这条路跑下去,我觉得 Grok 真的有可能成为下一阶段的新王。

以上是本次分享的全部内容,更多关于 AI 模型与 Agent 的深度讨论,欢迎来云栈社区一起交流。




上一篇:pdf-inspector:Firecrawl开源PDF智能分类与Markdown提取工具,支持OCR分流
下一篇:Nginx 限流实战:漏桶算法 limit_req 防刷防爬配置详解
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-8-14 09:22 , Processed in 1.415607 second(s), 41 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表