Grok,终于学会看片了?
马斯克的一条推文,就像一个深水炸弹,瞬间在科技圈炸开了锅。他兴奋地宣布:Grok现在可以分析任何视频了!


为了证明这点,他放出了一段长达63秒的高清视频,主角竟然是早已离我们远去的篮球巨星科比·布莱恩特。


视频中的科比,穿着笔挺的黑西装,坐在洛杉矶璀璨夜景前的真皮沙发上,身旁放着他标志性的篮球。他对着镜头,用那熟悉的语调,为一项全新的产品“代言”:“听着,我是科比·布莱恩特。今晚,我们不谈绝杀球,我们来聊聊下一个令人痴迷的东西——Grok 4.5。”
结尾,他还不忘甩出那句经典的曼巴语录:“Grok 4.5。伟大是挣来的。曼巴Out。”如果不是知道科比已经离世,几乎所有人都会对这段毫无破绽的视频信以为真。
好在,打假的任务现在可以交给AI了。Grok展现出惊人的能力,不仅能迅速吃透长视频,甚至还能对极度逼真的伪造视频进行技术溯源。
最令人印象深刻的例子是,有人让Grok“看”了一段30分钟的完整访谈,它仅仅用了大约36秒,就生成了一份详细的文字摘要。


Grok的“神级”打假秀
如果普通人刷到这段科比的视频,很可能会在社交媒体上疯狂转发,甚至认为这是科比生前未公开的珍贵商业代言。但在Grok的“火眼金睛”下,这一切无所遁形。
看完视频后,Grok交出了一份教科书级的分析报告。

它敏锐地指出:“这是一段AI生成的深度伪造视频。科比·布莱恩特已于2020年去世,因此整段视频完全是合成的。”更令人称奇的是,它还直接对生成技术进行了溯源。

当被追问“这到底是哪个AI做的?”时,Grok分析认为,考虑到其发布时机和内容,最大的可能是xAI自家的视频生成模型Grok Imagine Video 1.5。其推理逻辑也很清晰:这段63秒的视频远超市面上纯文本生成视频通常10到15秒的极限,它几乎可以肯定是采用了“图像参考+文本提示+唇形同步”的混合工作流,进行多段拼接而成的。当然,它也不忘补充,其他可能性还包括 OpenAI 的 Sora 2 或 Google 的 Veo 3。
然而,一个本质问题随之而来:Grok真的“看懂”视频了吗?
很快就有技术大牛站出来“打假”了。一位开发者一针见血地指出:严格来说,Grok处理的根本不是动态画面,而是视频的字幕信息。真要一帧一帧地去渲染分析,背后所需的算力将是一个天文数字。它本质上是一个极其高效的文本摘要引擎,而非真正的视频分析师。

此外,AI的“老毛病”——幻觉,依然存在。有人拿自己11分钟的视频去测试,发现摘要里的信息不是转录错误,就是通篇胡编。还有人用它来分析X平台的直播,发现效果时好时坏,极不稳定。

Grok到底行不行?直接上陶哲轩的“死亡难题”
为了验证Grok对无字幕、纯视觉内容的解读能力,我们决定亲自上手,给它来一场真正的压力测试。我们挑选了一个数学界的“死亡难题”——科拉茨猜想(Collatz conjecture),也就是那个著名的 3n+1 问题。
这个猜想是数学界公认的泥潭,数学家们往往互相警告不要轻易涉足。提出近一个世纪以来,始终没人能给出完整的证明,也没有找到一个反例。2019年,著名数学家陶哲轩(Terence Tao)就在这个问题上取得了突破,超越了过去几十年所有人的成就。当时,国外的科普网站Quanta专门为此发了一篇报道。

报道中,附带了一段解释科拉茨猜想的动画视频。全程没有一个字,只有不断变化的数字节点和连接它们的线条。面对这样一个没有字幕、纯粹基于图形逻辑的视频,Grok的表现出乎我们所有人的意料。
它不仅能准确解读出视频的核心内容,甚至还对动画的视觉特点和数学意义进行了归纳总结。
“视频展示的是以数字 1 为根节点,逐步构建的 Collatz 逆向树/图。每个节点是一个正整数,边表示 Collatz 规则下的前驱关系:
• 如果一个数 n 是偶数,则 n/2 指向它;
• 如果一个数 m 满足 3m+1=n (且 m 为奇数),则 m 指向 n。
动画从最简单的‘主干’开始,逐步向外扩展所有能最终到达 1 的正整数,直观呈现‘所有正整数最终都会进入 4→2→1 循环’这一猜想的结构。”

这个结果表明,至少在理解结构性、逻辑性的纯视觉画面时,Grok所展现的能力远不止“读字幕”那么简单。
更有趣的是,就在我们进行这项测试的前一天,OpenAI 宣布其下一代模型 Astra 解决了10个长期存在的数学开放问题。这让“AI教父”杰弗里·辛顿(Geoffrey Hinton)之前的一段长访谈显得格外有预见性。在那段50多分钟的视频里,辛顿预测AI将在10到20年内产生人类无法理解的新型数学。

我们把这段超长访谈也直接丢给了Grok。结果,Grok轻松拿下。它基于视频字幕和相关帖子标注,整理出了一份清晰的核心观点与时间线,并精准归纳出访谈的四大基调:对AI意识的态度、对控制与对齐的悲观看法、对AI代理(Agent)风险的担忧,以及被现实进展不断压缩的时间线预测。

这个结果确实让人惊艳。看来,Grok这个模型在视频理解上的性能提升,是实打实的。

AI 36秒“看完”30分钟,我们人类去干嘛?
30分钟的视频信息量,AI只用36秒就能消化完毕,这无疑是一种降维打击。泡杯咖啡的功夫,一部微电影或一集播客的核心金句和逻辑脉络就被整理好,摆在你面前。对于信息大爆炸时代的网友们来说,这简直是救星。
“我太需要这个了!因为现在的播客都太长了!”有网友如此高呼。这功能简直就是为收藏夹里那些“永远听不完”的播客量身定制的。

还有人感慨,未来已来。不是因为处理速度快,而是从今往后,很多事我们或许再也不用亲自动手了。

而在众多网友分享的使用案例中,一个最令人动容的真实故事,让这项技术有了温度。有人的祖母摔倒了,髋部骨折。他利用Grok分析了马斯克在达沃斯论坛上的长篇演讲,不仅找到了提及用擎天柱机器人帮助老人的片段,还精准定位了时间戳。那一刻,AI真的变成了从信息海洋中捞起的那根“救命稻草”。

但这也不禁抛出一个老问题:AI什么都干了,那人类去干嘛?

细思极恐:我们正在把大脑“外包”吗?
一位学者对此发表了一篇引人深思的小作文,堪称对人类命运的终极拷问。她警告说,长此以往,人类将丧失阅读、写作和批判性思考的能力——因为我们已经把大脑该干的活儿,全都外包了出去!

“我们的大脑像肌肉一样,不用则废。神经可塑性是双向的。”深度阅读、持续专注、记忆回溯、批判性思维、写作与言语推理——这些能力一旦被推给工具,或被碎片化的信息流取代,就将不可逆转地退化。你以为你可以每天消费几百条36秒的摘要,但或许你失去的,是在冗长对白中捕捉微妙情绪的能力,是在复杂逻辑中抽丝剥茧的耐心。对速度的病态追求,会让生命变成一场追逐多巴胺的赛跑,而无暇顾及真正的意义。
人类的灵魂,真的能外包给冰冷的代码吗?这正是我们需要在云栈社区这类开发者广场持续探讨的深刻命题——当人工智能以超乎想象的速度渗透进生活,开发者、产品设计者和所有技术相关者,都更需要一个能进行深度思考与碰撞的空间。
参考资料:
https://grok.com/share/bGVnYWN5_8013f7a3-f604-4351-8cd7-acecf3ef165b
https://x.com/elonmusk/status/2014501663776588200