找回密码
立即注册
搜索
发回帖 发新帖

6431

积分

0

好友

778

主题
发表于 17 小时前 | 查看: 2| 回复: 0

OpenAI 刚刚发布了 300 多个数学问题的解决方案。其中包括:黎曼 Zeta 函数的无零带证明;CM 阿贝尔簇的 Hodge 猜想证明。

山姆·奥特曼发推说:我们现在正进入一个新的发现时代!

722 份手稿跨越 372 个类,而 OpenAI 只为其中一份附上了精简的工件。其余的没有任何可供 OpenAI 外部人员检查的版本。审计现在就是整个故事。纳维—斯托克斯声明已经处于争议状态,而该仓库仍在不断增长。

OpenAI 数学仓库一夜爆肝 722 篇

北京时间 2026 年 10 月 7 号晚上 6 点,美国旧金山的一间办公室里,几个 OpenAI 的工程师按下了一个按钮,没有红毯,没有发布会,没有香槟。他们只是往 GitHub 上推了一个仓库,名字叫 openai/math。

点开这个仓库,所有人都傻了。

里面躺着 722 篇数学手稿,不是草稿,不是摘要,是实打实的完整论文。这些论文被归成 372 个"结果族",什么意思呢,就是每篇论文解决的是一个数学问题,而相关的几个问题被打包成一个"家族"。17 个数学分支全覆盖了,从数论到几何,从理论计算机到统计力学,几乎把数学的半壁江山都扫了一遍。

OpenAI在GitHub发布的math数学证明仓库文件列表截图

更炸裂的是这些问题的难度。准黎曼猜想、Hilbert 第十问题、BSD 猜想、霍奇猜想、唯一游戏猜想……随便拎出来一个都是数学界挂了十几年甚至上百年的硬骨头。其中好几道直接跟千禧年大奖难题沾边。千禧年难题是什么概念?克莱数学研究所 2000 年公布的七大难题,解出一道奖 100 万美元。OpenAI 这次一口气碰了三四道。

但最让人后背发凉的不是问题难,而是完成这些"证明"的"人"。不是某个大学里的教授团队,不是某个天才少年的灵光一闪,是一个还没有公开发布的内部 AI 模型。对,就是你们天天用的那个聊天机器人背后的技术,现在跑去证明数学定理了。

平均每个结果消耗的算力,约等于 ChatGPT Pro 连续跑 3 个小时。整个评估阶段,这个模型被扔进去了大约 4000 个数学问题。4000 个。这是什么概念?相当于把整个数学评论网近三十年的未解问题条目翻了个底朝天,然后逐个尝试解题。

这就很奇怪了。以前我们觉得 AI 最厉害的地方是下围棋、画画、写代码。现在它跑去证明数学定理,而且看起来还真的很有一套。

但事情真的这么简单吗?

AI 破解的千禧难题到底有多硬核

先别急着欢呼。我们需要搞清楚,OpenAI 这次交出来的东西,到底牛在哪里。

先看最吸睛的"准黎曼猜想"。黎曼猜想是数学界最著名的未解问题之一,由德国数学家黎曼在 1859 年提出。简单来说,它研究的是素数分布的规律。素数就是你小学学的那种只能被 1 和自身整除的数:2、3、5、7、11……它们看起来随机出现,但背后其实藏着深刻的规律。黎曼猜想说的就是,这些规律可以用一个叫做"黎曼 zeta 函数"的数学工具来精确描述。

如果黎曼猜想成立,那整个数学大厦的很多地基就稳了。但 167 年来,没人能证明它。OpenAI 这次没有说"我证明了黎曼猜想",而是做了一个更温和但也很厉害的事情:它证明了 zeta 函数和所有狄利克雷 L 函数在实部大于 7/8 的区域里没有零点。

这是什么意思?打个比方,假设你在找一群藏在山洞里的人,你之前只知道他们肯定在某个大区域里,现在你证明了他们不可能在山洞的某个子区域里。虽然没找到所有人,但把搜索范围缩小了一大截。此前数学家能证明的无零点区域,离黎曼猜想要求的极限还差得很远。OpenAI 把这个边界往前推了一大截,而且给出了两份独立的证明,其中一份还额外排除了一种叫做"西格尔零点"的捣乱可能性。

再看 Hilbert 第十问题。这是另一位大数学家 Hilbert 在 1900 年巴黎国际数学家大会上提出的 23 个难题之一。它的有理数版本问的是:能不能写出一套通用算法,来判断任意一个整数系数的多项式方程有没有有理数解?整数版本在 1970 年被苏联数学家马季亚谢维奇解决了,但有理数版本悬了半个多世纪。OpenAI 说它证明了这样的通用算法不存在。注意,"不存在"在数学里是一个很强的结论,意味着你不需要再浪费时间去找了,因为根本找不到。

还有 BSD 猜想,全称伯奇和斯温纳顿-戴尔猜想,也是千禧年难题之一。它把椭圆曲线上的有理点个数,和一个相关的解析函数的性质联系起来了。OpenAI 对满足某些条件的椭圆曲线给出了完整的公式,而且按密度统计,能覆盖绝大多数有理椭圆曲线。

霍奇猜想方面,OpenAI 处理了具有特殊复乘结构的阿贝尔簇和 K3 曲面的乘积这两类对象。虽然还没有覆盖霍奇猜想的全部范围,但已经是朝着正确方向迈出了实质性的一步。

把这些成果放在一起看,你会发现一个模式:OpenAI 不是随机乱猜,而是系统地攻击一类又一类数学问题。它不是找到一个答案就停,而是把一个问题的证明方法推广到一大类对象上。这种"举一反三"的能力,过去一直被认为是人类数学家独有的天赋。

但这里有一个巨大的问号:这些证明,真的是"数学证明"吗?

Lean 验证给 AI 数学证明背书了吗

要回答这个问题,你得先了解一个叫 Lean 的东西。

Lean 不是一种编程语言,至少不完全是。它是一个由微软研究院开发的定理证明助手。你可以把它想象成一个超级严格的数学老师:你写的每一步推理它都要检查,只要有一个逻辑漏洞,它就给你打回重来。数学家们用 Lean 来形式化验证证明,就是把人类写的数学证明翻译成 Lean 能理解的代码,然后让计算机一步步检查逻辑是否正确。

OpenAI 在这批成果里附上了 235 份 Lean 形式化证明。这意味着什么?意味着这些证明的逻辑链条已经被计算机验证过了,从前提到结论,每一步推理都没有逻辑漏洞。在数学界,一个证明如果经过了形式化验证,那它的正确性就有极高的把握。

这听起来很厉害,对吧?但等一下,这里有一个微妙之处。

Lean 验证的是"逻辑正确性",不是"创新性"。换句话说,计算机可以确认你的证明没有犯逻辑错误,但它不能判断你这个证明是不是"有意思",是不是包含了真正新的数学思想。一个证明可以是逻辑正确的,但同时也可以是机械的、缺乏洞察力的。数学界评判一个证明的价值,不光看它对不对,还要看它新不新、深不深、能不能打开新的思路。

这就引出了一个更深层的问题:这些由 AI 生成的证明,到底是谁写的?

OpenAI 说,绝大多数结果都是由他们的内部模型独立获得的。模型先尝试解题,失败了就换策略,成功了就把推理过程记录下来。但这里有一个细节很多人忽略了:OpenAI 同时发布了 10 份"模型推理摘要"。这些摘要记录了模型在解题过程中经历了多少次失败、尝试了多少种思路、最终是怎么找到正确路径的。

这就像是给你看一个学生在考试时的草稿纸,上面写满了错误的尝试和涂改痕迹,最后才是正确答案。对数学家来说,这种"过程透明"其实比答案本身更重要。因为通过看过程,他们可以判断这个证明是真正的数学洞察,还是某种高级的模式匹配。

到目前为止,已经有一些顶尖数学家开始认真读这些手稿了。他们的初步反馈是混合的:一方面承认这些结果在技术上是正确的,另一方面对其中包含的"新思想"程度持谨慎态度。

有人会说,管它新不新,能证出来不就是厉害吗?但数学不是体育比赛,光看结果不看过程。一个用暴力穷举法证明的定理,和一个用巧妙思路证明的定理,在数学界的分量是完全不同的。前者像是用挖掘机挖宝,后者像是用钥匙开锁。

更棘手的是验证问题。数学界有个叫 Lean 的形式化证明工具,可以把数学证明写成代码,让计算机一步步检查逻辑有没有漏洞。OpenAI 仓库的 lean 文件夹里确实放了一些 Lean 证明文件,但问题在于,有些文件里只有问题的定义,证明部分还是 sorry——这是 Lean 里的占位符,意思是我知道这应该对,但还没写出来。

图论研究者 Jake Boggan 最有发言权。他花了二十四年研究 Barnette 猜想,去年夏天还觉得自己快要解决了。结果 OpenAI 的模型把这道题做了出来。他去仓库里翻那个 Lean 文件,发现里面只有 def MainStatement,证明部分空空如也。他只好自己啃论文,发现证明里用了一些来自理论物理的复杂技巧,比如复值指数和、Penrose 计数之类的东西。这些东西在图论里从来没人用过。

所以问题回到了原点:OpenAI 的 AI,到底是在"做数学",还是在"模拟做数学"?

对比一下 Anthropic 那边用 Claude 的做法,差异就更明显了。Claude 走的是"狙击手"路线,集中火力攻击一个具体问题,比如它协调 60 个子智能体花了一天半时间去推黎曼猜想相关的零点比例下界,从 41.6% 提升到了 67.2%。OpenAI 走的是"轰炸机"路线,722 篇手稿铺开来全面进攻。一个追求深度,一个追求广度,两种策略各有优劣,但到底哪种更能产生真正有价值的数学知识,目前还没有定论。

菲尔兹奖得主联名抵制 AI 数学

如果你以为数学家会为这种量产奇迹欢呼,那就太天真了。

事情要追溯到今年八月。OpenAI 当时召集了大约四十位数学家开会,议题是 AI 的数学能力正在超越人类,接下来怎么办。据与会者事后的说法,OpenAI 在会上暗示模型已经解决了数百个长期未解的问题,还给出过保证不会一次全部放出来。

数学家们的建议也很直接:走论文发表的路子,一篇一篇来,让数学界有时间慢慢消化。结果 OpenAI 发言人回应说公司不知道有过这样的保证。一边记得有承诺,一边说不知道有承诺。

十月六日,WIRED 杂志发了篇报道,标题毫不客气:OpenAI 又把一群数学家惹毛了。末尾那个 Again 格外扎眼。纽约大学访问数学教授 Nestor Guillen 直接说,数学家中间有一种感觉,觉得 AI 公司的行为就像黑帮。西北大学数学家 Bryna Kra 更直白,她说数学家们建议 OpenAI 别在博客或推文里发数学成果,要走正式论文,结果这些建议显然被忽略了。

但最让人意外的是陶哲轩的态度变化。几个月前他还是硅谷最推崇的 AI 课代表,今年三月公开喊话同行拥抱 AI,说数学正在经历一场哥白尼革命。半年后画风突变,他抛出一个概念叫 Proof Indigestion,翻译过来叫"证明消化不良"。他的意思是,一个证明的生命周期有五步:提出解答、机器验证、翻译成人话、同行消化、写进教科书。AI 在前两步狂飙,后三步进展几乎为零。

九月的时候,陶哲轩联合邓煜等二十五位菲尔兹奖得主发表公开声明,呼吁实验室不要在对专有模型测试高级数学问题。这个叫 AGMAI 的顾问团体由普林斯顿高等研究院支持,在声明里写得清清楚楚:不赞成在不可访问的专有模型上测试高级数学问题。但 OpenAI 的做法显然跟这个建议背道而驰。

AGMAI 在声明中强调,数学研究的未来不能仅仅局限于理解 AI 实验室的成果。数学家必须能够提出自己的问题,发展自己的研究方法,并探索那些尚未被选为 AI 系统能力示例的研究方向。

数学家弗朗切斯科·马吉刚刚质疑了 OpenAI 的 400 份证明发布

马吉发帖称,OpenAI 即将把大约 400 个 AI 生成的证明放到一个公共服务器上。他说,专家们仍在研究 OpenAI 的那个纳维—斯托克斯例子到底是怎么回事,而这可不是件容易的事。

那个例子要追溯到 2026 年 9 月 8 日。OpenAI 分享了一个 AI 生成的纳维—斯托克斯千禧年大奖难题的解答,附有一份书面说明和一份 Lean 形式化证明。马吉的意思是,在数学家们把它消化之前,它对数学的影响是有限的。他认为,成果必须被理解、被联系起来、被质疑、被复用。他的问题是:如果数学成果产生的速度超过了数学家吸收的速度,会发生什么?一次性放出 400 个证明到底有什么价值?

反驳很快就来了。

有人说这很正常,历史学家有没读完的文献,天文学家有没研究完的星系。还有人拿它跟 GitHub 比,说全世界已经摸索出了怎么使用质量参差不齐的代码。有一条回复说,AI 系统使用这些成果的速度可能比人类吸收的速度还快。

一位数学家估计,OpenAI 对这些解答的理解不超过 5%。

还有人指出,数学大约有 3000 个细分领域,所以 400 个证明平均下来每 1000 个专家也就分到 1 到 2 个。

补充

使用 H3 Max 为 openai 数学目录中的 300 多个结果制作了 15 秒的简短解释视频:https://gokayfem.github.io/openai-math-explained/

马库斯的观点

唱空派司令马库斯主要说了三件事:

  1. OpenAI 的数学成果是神经符号 AI 的胜利:系统除了 LLM,还用了 Lean 这类符号 AI 工具。这正好印证了他多年来的主张——纯神经网络不够,需要符号推理来补充。

  2. 但这不等于 AGI:这些数学成果没有广泛泛化能力,因为开放现实世界里没法用同样的符号验证和数据增强。所以"通用"(G)的问题还没解决。

  3. 他 2019 年的立场依然成立:神经符号 AI 是必要的,但不充分;世界模型也至关重要。

网友直接开怼:LEAN 不生成证明,LEAN 用来验证证明。你错了加里,承认你错了。

马库斯:它用 Lean 验证证明,这就是我在说的。我没错。如果你觉得我错了,指出来我哪句话说错了。

"神经网络自己解题"和"神经网络提出答案、独立符号系统验证"是有区别的!

双方其实在说不同的事:

  • 马库斯:系统用了符号 AI(Lean),所以是神经符号混合,这印证了我的路线。
  • 批评者:Lean 只是验证器,证明是 LLM 生成的。你把验证器的功劳算作符号 AI 的胜利,是在偷换概念、给自己贴金。

马库斯没有说"Lean 生成了证明",他说的是"系统使用了 Lean"。从字面上看他没错。但批评者的火气在于:他把一个验证工具的存在,包装成自己多年主张的胜利,而实际上核心突破仍然是 LLM 的能力。再加上他反复强调"我早就说过",在这种语境下就显得像是在抢功。

其他观点:

  • Lean 是 CI 流水线,不是工程师。它抓坏证明就像单元测试抓坏代码——证明还是 LLM 写的。把这算作符号 AI 的胜利,就像把拼写检查器算作小说的作者。
  • LLM 猜、Lean 查,这是最无聊的混合方式,但无聊正是证明需要的。



上一篇:Claude中文界面悄然上线,结账页能选中中国,支持地区却无中国大陆
下一篇:卡片笔记写作法:Ryan Holiday如何靠日常研究让内容自然长出来
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-10-8 20:29 , Processed in 0.068856 second(s), 41 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表