
全世界拿 AI 搞科研的姿势,可能从一开始就用错了。
哈佛物理学家、量子场论教材作者 Matthew Schwartz 找到的正确姿势,恰恰是别把 Claude 当科学家。
他把 Claude 够不着的深层问题留给自己,只挑它最擅长的题交给它。
结果,他花了好几周、逐行写代码才完成的计算,Claude 只跑了 20 分钟就复现了,连他自己都没想到。
他又多追问了一句,Claude 在接下来几周里算出 15 个费曼积分,这些积分此前从来没有人算出来过。
三个月后,Schwartz 手里多了 36 篇论文初稿,从对撞机里的粒子做到了巴拿马雨林里的树,横跨 18 个学科。

10 月 1 日,Anthropic 将这篇长文发到官方科学博客,标题叫「Claude 形状的科学」。
他在文中给出的理由是,今天的大模型很擅长做科学,但还算不上科学家。硬把它当成人类科学家去使唤,它的本事反而发挥不出来。
想让 AI 变强,有两条路。一条是等巨头在实验室里堆出下一代模型,另一条就是拿到模型的人,自己找到对的用法。这条路怎么走,云栈社区里不少开发者已经在摸索。
哈佛教授挖出了 Claude 最强的一面
去年 12 月,Schwartz 让 Claude Opus 4.5 给自己当科研助手。用他的话说,Claude 像一个能干的研究生,干活快 20 倍,论文最后写出来了,过程却很磨人。
很多科学家都有类似的体会。新闻里 AI 一会儿解开数学难题,一会儿刷新纪录,自己上手一用,却总觉得隔着一层。
这种落差,在他看来有迹可循。AI 科研的新闻头条大多出在数学里,那是唯一能把问题完整写下来、答案能被绝对验证的学科,可大部分科学并不长这样。
他借了物理学里的一个词,叫「阻抗不匹配」——两个系统各自运转良好,接在一起却配不上。放到 AI 科研上,一头是科学家想要的,另一头是 AI 最擅长的。
于是他按 Claude 实际的样子来用它。Claude 眼下帮不了他想深层的概念问题,可它几乎什么领域都懂,写代码是强项,读论文和数据也是机器的速度。
他要做的,就是专挑正好落在这些长处上的题。这类题,他叫作「Claude 形状的问题」。

科学家想做的事和 AI 能做的事只在两小块地方重叠,那里就是「Claude 形状的问题」。
追问一句,算出 15 个新积分
第一个 Claude 形状的问题,他从老本行里挑,叫散射振幅。
物理学家要靠它从对撞机的碎片里认出新粒子。可它的核心是费曼图背后的多维积分,难一点的,算出一个就够写一篇博士论文。
为了绕开这些难算的积分,过去 20 年,物理学家发展出一条捷径,叫 S 矩阵 bootstrap。它不硬算积分,靠物理约束一层层排除。
比如,知道振幅在哪些地方会变成无穷大,候选就缩到 2 万个,再加一个对称性,剩下 500 个,就这样一步步缩到 1 个。约束不够用的时候,再在几个点上把振幅算到极高的精度,把剩下的系数钉死。

在 Schwartz 看来,这道题天生适合 AI。一来,它要的数学、物理和计算机知识没人能全部掌握;二来,答案能被验证,跑两个脚本就能对到任意位数,Claude 想糊弄也糊弄不了。
他交给 Claude Fable 5 的第一件事,是把散落在各种代码和论文里的方法搬进同一个框架。结果,Claude 很快复现了他的旧结果,还指出他有个算法写慢了。
突破出在后面。他让 Claude 去找还没人算过的振幅,发现它一直把自己限制在最简单的对数函数里,于是追问了一句:更难的椭圆函数能不能也这么做?

这一问问到了难处。人类完整算出的椭圆费曼积分只有寥寥几个,还没有一个完全靠 bootstrap 算出来,因为所需的知识散在许多人身上,从来没人试过。
Claude 却没有这个障碍,它把整套工具扩展到了椭圆函数上,大部分新软件由它自己写,剩下的借自数学界。
几周后,30 个积分被从头到尾算完,一半是复现已知结果,另外 15 个此前从来没人算出来过。
回头看这几周,Fable 5 的能力是底子,决定结果的是两次选题。一次是挑中这道能验证、知识又分散的题,一次是看出 Claude 在给自己设限,追问了一句。
其中第二次更关键,那批前人从没算出来的积分,全出在追问之后。
这套越用越全的工具,Schwartz 起名叫 BootLoops。它是套在大模型外面的一层工具和流程,已经开源,换哪家的模型都能驱动。
其中两个积分引擎的算法,出自北京大学马滟青团队。

门槛有多低,我们自己试了一下。在一台 Mac 上装好 BootLoops 后,我们只用一句话给 Claude Code 交代任务。
它自己翻文档、找工具,20 分钟出头、花了约 1.5 美元,就把官网上一个新算出的积分系数重算了一遍,还找出了闭式,和数值对上 157 位。
一套积分,打穿 18 个学科
本来,Schwartz 打算就这批积分写篇文章收工。可科学里有个巧合,同样的方程总会在不同学科里反复出现,这批工具的用处远不止物理。
Claude 告诉他,这些积分还能对应到群体遗传学里的贝叶斯证据积分。
系统发育学用 DNA 给物种排家谱树时要算的积分,和 BootLoops 当初为费曼图打造的积分也是同一类。

BootLoops 为费曼图造的积分工具,在物种家谱、群体遗传和生态学里都能用。
为了让工具箱越用越全,他给 Claude 立了条规矩,老工具要用,新工具也要造。
这样一来,每个项目哪怕失败,都会留下新工具,Claude 越用越能干。用他的话说,就像《黑客帝国》里刚灌完功夫的尼奥。
也就是说,模型能做成多少事,不只取决于权重,也取决于手边的工具箱。下一代模型要等实验室发布,工具箱却每天都在扩充,和模型打交道的人自己就能改进它。
工具箱带进别的学科后,生态学最先出了成果。中性理论认为,森林里物种的兴衰也许全凭运气。
可这个理论的方程写出来 20 年,一直没人能在大尺度上解开。Claude 认出这是 BootLoops 形状的题,把它解了。
拿巴拿马运河巴罗科罗拉多岛的普查数据一对,树种组成的变化速度比中性理论允许的快了 4.5 倍,光靠运气解释不了。
于是,他和植物生物学家 James O'Dwyer 用 Claude 搭出新模型,把物种之间寿命、生长和繁殖的差异加了回来,正往全球的森林样地推广。

其他学科也陆续出了结果。群体遗传学里,他们在 57 亿对相邻突变中找到了基因转换的证据。
经济学五大顶刊 4452 篇论文的复现包,被搬进开源代码逐个核对,语言学家也拿到了覆盖 6072 种语言的重音数据库。
数学家 Watson 在 1939 年开启的格点积分系列,最后一道难题也被解开了。

这些成果加起来,就是那 36 篇论文稿。它们是 Schwartz 从约 400 个候选问题里筛出来做成的,目前都还没正式发表。
Schwartz 在文末披露,项目期间他在 Anthropic 担任访问研究员,BootLoops 由 Anthropic 资助,由他本人拥有和维护。
撑起这个产量的工作台并不复杂。每个项目一个 Claude Code 会话,一个总控会话负责协调和验收,计算交给后台子Agent。
还有一个会话专门扮演挑刺的审稿人,把结果翻来覆去地核查。

一个总控会话管着一群项目会话,计算交给后台子Agent,另有会话专门挑刺。
Claude 做成的这些题有一个共同点,答案都能被核对。
正因为算错了瞒不住,Schwartz 才敢放手让它去跑。所以说,能被验证的地方,AI 就能放开手往前推。
通往 ASI 的另一条路,谁都能走
Schwartz 这三个月,回答的是一个更大的问题:智能到底靠什么扩张。
外界衡量 AI 有多强,看的几乎全是模型本身,参数多了没有,跑分高了没有,下一代什么时候发。
Schwartz 看的却是另一件事——模型的上限由实验室决定,最后能发挥出多少,取决于挑题、搭工具、定验收标准的那个人。
至于 AI 该去哪儿,他用了一个数学概念来比喻,叫凸包,也就是把一个形状所有尖角连起来后,围出的最小凸形状。
人类知识就是这样一个参差不齐的形状,生物学往一个方向突出去,数学往另一个方向突出去。
一个实验室可能花 20 年,用一种方法把一组基因研究透,旁边的基因和别的方法却一直荒着。
那些人类够得着、但还没有哪个人去过的中间地带,最适合交给 AI。
BootLoops 做的,就是在这些尖刺之间连线,把凸包一点点填满。

人类知识像一颗参差不齐的星形,BootLoops 的工具包在尖刺之间连线,填补中间的空白。
AI 去填这些空白,人在科研里的位置也跟着变了。
局面变得太快,几乎没法提前规划。Schwartz 反问,一个 AI 可能一夜之间就算完的问题,为什么还要申请三年的经费去算?
连该怎么带研究生,他也说自己至今还没想清楚。
不过在他看来,只要找对问题,大部分技术活都能自动化,离不开人的是概念那一部分。
放到通往 ASI 这件事上,也是两条路。一条是等实验室训出更强的模型,另一条是把人类散落在几十个学科里的工具拼成一个工具箱,交给一个什么都懂一点的模型,再由人来挑题、追问、验收。
前一条路握在少数几家公司手里,后一条路不用等下一代模型,每个会用 AI 的人现在就能走。不管选择哪条路,稳定可靠的模型 API服务都能省下不少折腾。
参考资料:
https://www.anthropic.com/research/claude-shaped-science
https://x.com/anthropicai/status/2105733864152858919