找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4269

积分

0

好友

557

主题
发表于 2 小时前 | 查看: 4| 回复: 0

你测试大模型最常用的方法是什么?手撕红黑树?

这种小测试曾经很有效,但现在已经不够看了。

Andrej Karpathy 最近的一个实验,直接把大模型的能力边界往前推了一大步。他把《指环王》的第一段文字丢给了 Claude Opus(由 Anthropic 于 2025 年发布的新模型),给了它大约 100 万 token 的预算(成本大概 10 美元),然后只说了一句话:

“用 Three.js 把这段故事渲染出来。”

结果,模型自己跑了将近 2 个小时,写出了 5500 行代码

这些代码不是简单的静态页面,而是用程序化的方式,把霍比特人的故事场景在三维空间里一点点搭起来——摆放多边形资产、设置坐标、写动画逻辑……最后真的跑出了一个能动的 3D 场景。

虽然效果还有点粗糙(Karpathy 自己也说 janky),但已经足够让人愣住了。

Karpathy 真正想说的,其实不止是模型变强了这么简单。他指出了一个很关键的变化:过去,很多高度定制化、一次性的复杂工作,正常人根本不会去做——太费时间、太不划算。但大模型有近乎无限的耐力和耐心。对它来说,写 5500 行代码、反复调整坐标和动画,不过是花点算力的事。

于是,很多以前没人会去做的事情,现在变成了:“反正差不多免费,为什么不试试?”

这背后,藏着一种新的创作逻辑。Karpathy 明确说,他更期待的是这种能力带来的下一步可能——按需生成的、高度定制的虚拟世界

想象一下:你可以直接把人扔进《指环王》的故事里,当旁观者、NPC,甚至某个角色。就像一个随时生成、用完即走的主题版 GTA。这种短暂、个性化、几乎零门槛的交互体验,在过去几乎不可想象。现在,随着 AIGC 技术的演进,它开始变得现实。

当然,Karpathy 并没有只讲优点。他特别指出,游戏和 3D 世界这个领域,反而把大模型目前的一个明显弱点暴露了出来:模型还不能真正看懂自己生成的视频,也不能高效地在游戏里自己玩一遍来检查问题。这次 Opus 5 只能非常缓慢地截图自查,结果中间出了不少错误,最终画面也就有了各种卡顿和瑕疵。

换句话说,生成能力已经跑得很快,但理解和审计自己作品的能力,还明显跟不上。 多模态感知和实时交互,仍然是短板。

Karpathy 这条推文,表面上是在晒一个有趣的实验,真正想传递的却是两件事:

  • 一是大模型正在改变“什么事情值得做”的经济账——很多过去因为太麻烦而被放弃的定制化创作,现在开始变得可行。
  • 二是能力越强,短板也越清晰。生成可以很猛,但真正理解、验证、迭代自己的成果,依然是下一道必须跨过去的坎。

你觉得,这种AI 自己吭哧吭哧写几千行代码生成世界的方式,未来会先在哪些领域真正落地?




上一篇:RAG系统性能提升高阶技巧:索引优化、查询转换与微调全指南
下一篇:Coldcard硬件钱包PRNG漏洞致7000万美元被盗,受影响版本与修复指南
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-8-3 06:24 , Processed in 0.928472 second(s), 41 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表