找回密码
立即注册
搜索
发回帖 发新帖

4855

积分

0

好友

625

主题
发表于 半小时前 | 查看: 5| 回复: 0

哈佛物理学家Matthew Schwartz

全世界拿 AI 搞科研的姿势,可能从一开始就用错了。

哈佛物理学家、量子场论教材作者 Matthew Schwartz 找到的正确姿势,恰恰是别把 Claude 当科学家。

他把 Claude 够不着的深层问题留给自己,只挑它最擅长的题交给它。

结果,他花了好几周、逐行写代码才完成的计算,Claude 只跑了 20 分钟就复现了,连他自己都没想到。

他又多追问了一句,Claude 在接下来几周里算出 15 个费曼积分,这些积分此前从来没有人算出来过。

三个月后,Schwartz 手里多了 36 篇论文初稿,从对撞机里的粒子做到了巴拿马雨林里的树,横跨 18 个学科。

Anthropic关于Claude形状科学的推文截图

10 月 1 日,Anthropic 将这篇长文发到官方科学博客,标题叫「Claude 形状的科学」。

他在文中给出的理由是,今天的大模型很擅长做科学,但还算不上科学家。硬把它当成人类科学家去使唤,它的本事反而发挥不出来。

想让 AI 变强,有两条路。一条是等巨头在实验室里堆出下一代模型,另一条就是拿到模型的人,自己找到对的用法。这条路怎么走,云栈社区里不少开发者已经在摸索。

哈佛教授挖出了 Claude 最强的一面

去年 12 月,Schwartz 让 Claude Opus 4.5 给自己当科研助手。用他的话说,Claude 像一个能干的研究生,干活快 20 倍,论文最后写出来了,过程却很磨人。

很多科学家都有类似的体会。新闻里 AI 一会儿解开数学难题,一会儿刷新纪录,自己上手一用,却总觉得隔着一层。

这种落差,在他看来有迹可循。AI 科研的新闻头条大多出在数学里,那是唯一能把问题完整写下来、答案能被绝对验证的学科,可大部分科学并不长这样。

他借了物理学里的一个词,叫「阻抗不匹配」——两个系统各自运转良好,接在一起却配不上。放到 AI 科研上,一头是科学家想要的,另一头是 AI 最擅长的。

于是他按 Claude 实际的样子来用它。Claude 眼下帮不了他想深层的概念问题,可它几乎什么领域都懂,写代码是强项,读论文和数据也是机器的速度。

他要做的,就是专挑正好落在这些长处上的题。这类题,他叫作「Claude 形状的问题」。

Claude形状的问题示意图

科学家想做的事和 AI 能做的事只在两小块地方重叠,那里就是「Claude 形状的问题」。

追问一句,算出 15 个新积分

第一个 Claude 形状的问题,他从老本行里挑,叫散射振幅。

物理学家要靠它从对撞机的碎片里认出新粒子。可它的核心是费曼图背后的多维积分,难一点的,算出一个就够写一篇博士论文。

为了绕开这些难算的积分,过去 20 年,物理学家发展出一条捷径,叫 S 矩阵 bootstrap。它不硬算积分,靠物理约束一层层排除。

比如,知道振幅在哪些地方会变成无穷大,候选就缩到 2 万个,再加一个对称性,剩下 500 个,就这样一步步缩到 1 个。约束不够用的时候,再在几个点上把振幅算到极高的精度,把剩下的系数钉死。

S矩阵bootstrap筛选流程示意图

在 Schwartz 看来,这道题天生适合 AI。一来,它要的数学、物理和计算机知识没人能全部掌握;二来,答案能被验证,跑两个脚本就能对到任意位数,Claude 想糊弄也糊弄不了。

他交给 Claude Fable 5 的第一件事,是把散落在各种代码和论文里的方法搬进同一个框架。结果,Claude 很快复现了他的旧结果,还指出他有个算法写慢了。

突破出在后面。他让 Claude 去找还没人算过的振幅,发现它一直把自己限制在最简单的对数函数里,于是追问了一句:更难的椭圆函数能不能也这么做?

费曼积分几何复杂度演变示意图

这一问问到了难处。人类完整算出的椭圆费曼积分只有寥寥几个,还没有一个完全靠 bootstrap 算出来,因为所需的知识散在许多人身上,从来没人试过。

Claude 却没有这个障碍,它把整套工具扩展到了椭圆函数上,大部分新软件由它自己写,剩下的借自数学界。

几周后,30 个积分被从头到尾算完,一半是复现已知结果,另外 15 个此前从来没人算出来过。

回头看这几周,Fable 5 的能力是底子,决定结果的是两次选题。一次是挑中这道能验证、知识又分散的题,一次是看出 Claude 在给自己设限,追问了一句。

其中第二次更关键,那批前人从没算出来的积分,全出在追问之后。

这套越用越全的工具,Schwartz 起名叫 BootLoops。它是套在大模型外面的一层工具和流程,已经开源,换哪家的模型都能驱动。

其中两个积分引擎的算法,出自北京大学马滟青团队。

BootLoops工具包官网首页截图

门槛有多低,我们自己试了一下。在一台 Mac 上装好 BootLoops 后,我们只用一句话给 Claude Code 交代任务。

它自己翻文档、找工具,20 分钟出头、花了约 1.5 美元,就把官网上一个新算出的积分系数重算了一遍,还找出了闭式,和数值对上 157 位。

一套积分,打穿 18 个学科

本来,Schwartz 打算就这批积分写篇文章收工。可科学里有个巧合,同样的方程总会在不同学科里反复出现,这批工具的用处远不止物理。

Claude 告诉他,这些积分还能对应到群体遗传学里的贝叶斯证据积分。

系统发育学用 DNA 给物种排家谱树时要算的积分,和 BootLoops 当初为费曼图打造的积分也是同一类。

BootLoops跨学科应用思维导图

BootLoops 为费曼图造的积分工具,在物种家谱、群体遗传和生态学里都能用。

为了让工具箱越用越全,他给 Claude 立了条规矩,老工具要用,新工具也要造。

这样一来,每个项目哪怕失败,都会留下新工具,Claude 越用越能干。用他的话说,就像《黑客帝国》里刚灌完功夫的尼奥。

也就是说,模型能做成多少事,不只取决于权重,也取决于手边的工具箱。下一代模型要等实验室发布,工具箱却每天都在扩充,和模型打交道的人自己就能改进它。

工具箱带进别的学科后,生态学最先出了成果。中性理论认为,森林里物种的兴衰也许全凭运气。

可这个理论的方程写出来 20 年,一直没人能在大尺度上解开。Claude 认出这是 BootLoops 形状的题,把它解了。

拿巴拿马运河巴罗科罗拉多岛的普查数据一对,树种组成的变化速度比中性理论允许的快了 4.5 倍,光靠运气解释不了。

于是,他和植物生物学家 James O'Dwyer 用 Claude 搭出新模型,把物种之间寿命、生长和繁殖的差异加了回来,正往全球的森林样地推广。

巴拿马雨林树种数量变化动画

其他学科也陆续出了结果。群体遗传学里,他们在 57 亿对相邻突变中找到了基因转换的证据。

经济学五大顶刊 4452 篇论文的复现包,被搬进开源代码逐个核对,语言学家也拿到了覆盖 6072 种语言的重音数据库。

数学家 Watson 在 1939 年开启的格点积分系列,最后一道难题也被解开了。

BootLoops三个月产出的36篇论文稿概览

这些成果加起来,就是那 36 篇论文稿。它们是 Schwartz 从约 400 个候选问题里筛出来做成的,目前都还没正式发表。

Schwartz 在文末披露,项目期间他在 Anthropic 担任访问研究员,BootLoops 由 Anthropic 资助,由他本人拥有和维护。

撑起这个产量的工作台并不复杂。每个项目一个 Claude Code 会话,一个总控会话负责协调和验收,计算交给后台子Agent。

还有一个会话专门扮演挑刺的审稿人,把结果翻来覆去地核查。

Schwartz的Claude工作台架构流程图

一个总控会话管着一群项目会话,计算交给后台子Agent,另有会话专门挑刺。

Claude 做成的这些题有一个共同点,答案都能被核对。

正因为算错了瞒不住,Schwartz 才敢放手让它去跑。所以说,能被验证的地方,AI 就能放开手往前推。

通往 ASI 的另一条路,谁都能走

Schwartz 这三个月,回答的是一个更大的问题:智能到底靠什么扩张。

外界衡量 AI 有多强,看的几乎全是模型本身,参数多了没有,跑分高了没有,下一代什么时候发。

Schwartz 看的却是另一件事——模型的上限由实验室决定,最后能发挥出多少,取决于挑题、搭工具、定验收标准的那个人。

至于 AI 该去哪儿,他用了一个数学概念来比喻,叫凸包,也就是把一个形状所有尖角连起来后,围出的最小凸形状。

人类知识就是这样一个参差不齐的形状,生物学往一个方向突出去,数学往另一个方向突出去。

一个实验室可能花 20 年,用一种方法把一组基因研究透,旁边的基因和别的方法却一直荒着。

那些人类够得着、但还没有哪个人去过的中间地带,最适合交给 AI。

BootLoops 做的,就是在这些尖刺之间连线,把凸包一点点填满。

人类知识的凸包示意图

人类知识像一颗参差不齐的星形,BootLoops 的工具包在尖刺之间连线,填补中间的空白。

AI 去填这些空白,人在科研里的位置也跟着变了。

局面变得太快,几乎没法提前规划。Schwartz 反问,一个 AI 可能一夜之间就算完的问题,为什么还要申请三年的经费去算?

连该怎么带研究生,他也说自己至今还没想清楚。

不过在他看来,只要找对问题,大部分技术活都能自动化,离不开人的是概念那一部分。

放到通往 ASI 这件事上,也是两条路。一条是等实验室训出更强的模型,另一条是把人类散落在几十个学科里的工具拼成一个工具箱,交给一个什么都懂一点的模型,再由人来挑题、追问、验收。

前一条路握在少数几家公司手里,后一条路不用等下一代模型,每个会用 AI 的人现在就能走。不管选择哪条路,稳定可靠的模型 API服务都能省下不少折腾。

参考资料:

https://www.anthropic.com/research/claude-shaped-science

https://x.com/anthropicai/status/2105733864152858919




上一篇:一条Fofa语法批量挖SRC:用友U8-OA SQL注入漏洞实战挖掘
下一篇:VA-Bench 评测揭示大模型空间智能的执行断层:看懂不等于做对
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-10-5 23:30 , Processed in 0.064813 second(s), 39 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表