OpenAI公开722份AI数学手稿,3份因符号错误撤回
OpenAI于10月7日在GitHub公开一批由内部模型生成的数学结果:首版目录含722份手稿、归为372个“结果家族”,随后核对的目录降为719份,3份被撤回,其中一份撤回说明写明“证明存在符号错误”(The proof contains a sign error)。手稿覆盖17个领域,部分附有Lean形式化证明,OpenAI称绝大多数结果来自同一流程和同一个内部模型,每项结果平均算力约相当于ChatGPT Pro思考三小时。组合数学家Gil Kalai称这是“数学的一个惊人里程碑”,同时提醒仍需人类数学家核验;25位菲尔兹奖得主此前已联署声明,强调AI数学应服务于概念理解。
为什么重要:若这些主张经人类核验成立,将显示同一套模型可在多个数学领域产出可检验的结果;而撤回也提醒,预印本形态的AI数学成果仍需形式化与同行审查。
相关来源 36氪 人工智能 · AIbase AI新闻 · DoNews
一个负号,牵动了三份证明。
北京时间10月7日,OpenAI在GitHub公开了一批内部模型产生的数学结果。首版目录有722份手稿,归为372个结果家族。本文10月8日核对的目录中,在列手稿变成719份,家族数仍为372。
减少的这3份手稿,被撤回了。
其中,一份标注9月18日、讨论Weil类代数性的几何手稿,在撤回说明中写道:“The proof contains a sign error”。意思是“证明存在符号错误”。
这份证明需要把几何交点的正负计数补到零,才能调用后面的定理。原以为某种操作增加正数,实际却增加负数。用简化数值打比方:想做“−2+2=0”,却做成了“−2−2=−4”。定理的使用条件没有满足,两份借用该构造的手稿也失去支撑。
这批成果也收到了很高的评价。
10月7日,组合数学家吉尔·卡莱称这次发布为“数学的一个惊人里程碑”(an amazing milestone for mathematics)。紧接着,他提醒:证明仍需人类数学家核验、消化。
围绕AI数学研究的讨论,也早就开始了。
9月,Claude的临界渗流证明主张引发讨论;9月11日,陶哲轩等25位菲尔兹奖得主作为初始署名者发表声明,承认AI数学能力的进步,同时批评企业把解题作为评测竞赛、忽视理解与知识传承的做法。
一边是可能改变领域的重要结果,一边是已经发生的撤回。这些手稿究竟“突破”了什么?为什么AI能批量解开这些曾困住数学天才的难题?
1
AI向数学界交来了什么
这次,OpenAI一口气公开的数学材料,内容丰富。
打开GitHub上公开资料库,就能看到论文PDF和排版源文件,同行还可逐步检查论证。有部分手稿附有Lean证明材料——这是把数学命题和推理写成严格代码,交给程序检查。有意思的是,其中还有10份删节推理摘要,展示了部分探索过程,包括没有走通的尝试。
这些手稿也可称为“预印本”,一般是作者先公开研究文本,供别人阅读、讨论和检查。预印本中可以有重要成果,但不说明它经过了怎样的外部审查。
OpenAI称,绝大多数结果来自同一流程、同一个内部模型。如果其中的重要主张得到确认,就意味着同一套模型能力参与了多个数学领域的研究。
公告还把每项结果平均消耗的算力,折算成相当于ChatGPT Pro思考“大约三小时”(roughly three hours)。
2
722、719、372:三个数字,三种含义
722和719数的是手稿,372数的是把相关手稿归在一起的组。OpenAI把这样的组称为“结果家族”。
仓库说明使用的是“related papers”,即”相关论文”。
我们可以把一个家族想成一个研究资料夹。这个研究资料夹中,它们各司其职,有的文章证明主结论,有的补上其中一个关键步骤,有的把结论推广到其他条件。同时,它们各有一份手稿,在目录里则共用一个家族编号。
也就是说,一篇文章可以有多个结论,一个资料夹也可能回答不同问题。
3
最大的家族共有14篇,它们的关系是?
第034族有14份手稿,是当前最大的家族,属于代数与复几何。目录里既有一般论证,也有专门处理四维对象的版本。
要理解相关研究为何会分成多篇,可以先看只有两篇的第088族。两篇研究的是同一项几何指标,粗略说,与一个形状在各个方向投下的“影子”有关。
其中一篇研究,什么形状能让这项指标最小。另一篇给出反例,说明原先猜测的最大者并非最大。它们围绕同一个指标,却回答不同的问题,所以归在同一个家族里,又各自写成手稿。
这种成组现象很普遍。372族中,205族只有一篇,167族有多篇。多篇家族不到总数的一半,却包含514篇,占当前手稿的约71%。
4
跨17个领域,六成家族集中在七组
按OpenAI目录的领域分类逐项统计,372个家族分布在17个领域。最大的七组共227族,占约61%。理论计算机科学40族,组合数学37族,代数与复几何36族,排在前面。
那这些领域分别在研究什么?比如,理论计算机科学,他们研究的是算法需要多少计算。比如,组合数学,主要研究的是离散的东西怎样排列和计数。比如,代数与复几何,主要研究的是方程定义的形状有什么性质
这次公开的手稿中,理论计算机科学有40个家族、73份手稿,而概率与统计力学有29个家族、105份手稿。前者的家族更多,后者的手稿更多。如果只看论文篇数和按相关成果归组来看,会得到不同的数量。
5
“突破”至少有五种形态
这次OpenAI公布的722份手稿,其“突破”到底意味着什么?
我们依据抽读的手稿,可以分出五种贡献。这并非OpenAI给出的等级划分,一篇论文也可能兼具几种。
(1)给未知问题一个答案。比如,π可以被分数不断逼近。这里研究的是:误差相对于分母,能无穷多次下降得多快?新稿声称,衡量这种速度的“无理度”指标等于2。
(2)让结论适用于更多情况。研究粒子与电磁场时,已有多类结果要求起始状态足够小,或具有特殊对称。新稿主张,在论文规定的模型和其他初态条件下,可以去掉这两类限制,仍保证解长期平滑存在。
(3)越过一条被猜测无法突破的界线。比如,整数越长,乘法需要的计算步骤通常越多。新稿声称,在同一固定机器模型下,步骤数的增长可以比长期猜测的极限更慢。
(4)补上许多结论共同依赖的前提。比如,不少研究先假定唯一游戏猜想成立,再据此证明某些算法任务难以达到怎样的近似精度。新稿若成立,这些结论就不必继续把它列为未经证明的假设。
(5)给已知答案另一种证明。比如,一份几何反例稿先承认:“Their result already gives a negative answer”,也就是前人的结果已经给出否定答案,随后提出直接构造。这里新增的是证明路线,需要看它能否带来更清楚的解释或可供其他研究使用的方法。
6
七个亮点,先看它们改变了哪一句话
这次的公开,究竟“突破”了什么?
具体到一项成果,我们可以把三件事放在一起对比着看:前人已经证明到哪里,新稿声称推进到哪里,以及它还保留哪些条件。
下面七个案例,按这个顺序展开。
拿乘法来说,论文比较的是:随着整数位数不断增加,计算步骤增长得多快。而在新稿声称把这个增长速度压得更低。
它若成立,就推进了关于计算效率的理论研究,同时真实设备能否因此提速,还要看算法怎样实现,以及计算的整数有多长。
值得注意的是,表中的“准黎曼假设”和“CM霍奇”还需要看清范围。前者仍未达到完整黎曼假设,后者限定在CM阿贝尔簇。
7
撤回的是哪三份,影响了什么
撤回的三篇稿件,分别是《分裂阿贝尔八维簇上Weil类的代数性》《K3曲面Kuga–Satake对应的代数性》《K3曲面乘积的有理霍奇猜想》。
后两篇都涉及一类称为K3的曲面,也都用到了第一篇中那项出错构造的改写。
然而,撤回说明并没有宣布原命题为假:这条论证有缺口,不代表命题已经被推翻,也不排除存在另一条有效证明。
这撤回的三稿同属第032家族。撤回后,这一族从八篇变成五篇,其中关于CM阿贝尔簇的霍奇主稿仍保留。CM阿贝尔簇是一类具有特殊算术对称性的几何对象。这份留下的主稿,还连接着一项27年前的研究。
8
一个新结果,可能补上27年前的“如果”
数学家James Milne在1999年发表的一篇论文中,证明了一条联系:只要一个猜想成立,另一个猜想就能随之成立。当时还缺的,是前一个猜想本身的证明。
具体来说,就是前者是复数上所有CM阿贝尔簇的有理霍奇猜想,而后者是有限域上所有阿贝尔簇的泰特猜想。前一个问题限定了一类有特殊算术对称性的几何对象,后一个问题则进入只有有限个数的运算系统。
这次的手稿声称补上了前一个猜想的证明。如果它成立,就可以接上Milne论文中已经证明的联系,推出后一个猜想。新结果的影响因此会超出它直接研究的对象。
10月7日,Milne在自己的论文目录中加注,提到OpenAI的宣布,并用“it seems”,也就是“看来”描述这一后果。这表明他也注意到了新稿与旧定理的联系。
9
这些问题为什么可能适合AI
OpenAI表示,扩大数学研究测试的起点,是“评测趋于饱和”(evaluations saturated),也就是原有考题越来越难区分模型能力。OpenAI累计向模型提供约4000个研究问题,再筛选、归组输出。
这些它们的共通点是,即使问题尚无已知答案,研究任务也可以写得很明确。一份公开任务列出了研究对象、输入条件、需要证明的结论,以及什么样的反例足以推翻它。
而证明路线则要由模型寻找。
公开的删节推理摘要中,记录了一次设计测试的尝试。这项测试需要让符合要求的答案容易通过,同时挡住不符合要求的答案。然而,模型也发现,一种方案暴露了可被利用的结构,使不符合要求的答案也能蒙混过关。
加入更密集的随机扰动,可以阻止这种蒙混方式,却又降低了本该通过的答案通过测试的概率。模型于是继续寻找——怎样堵住漏洞,又不破坏另一项保证。
于是,“寻找证明”更加具象,而不是一个努力中的“形容词”。它们可以拆分为可多次重复的步骤:提出办法,检查它会在哪里失效,再调整路线,当然过程中还会调用前人已经证明的定理。
倒推来看,从这些材料可以看出几项有利条件:目标写得清楚,已有研究提供可调用的工具,部分结果还能接受形式化检查。
10
OpenAI承诺出资,让人类有时间理解这些证明
除了工具,研究者还需要时间理解这些证明:哪些步骤是关键,哪些方法可以讲给学生,哪些思路能够用于其他问题。
这种讨论和关注,早于这次公布。
9月11日,加州大学洛杉矶分校数学教授、2006年菲尔兹奖得主陶哲轩等25位得主,作为初始署名者发表联合声明。声明承认AI数学能力的进步,也强调解题应服务于“概念理解与洞见”(conceptual understanding and insight)。
9月11日,陶哲轩在个人博客发布联合声明。声明将理解数学思想、传播研究方法,列为解题之外仍需完成的工作。
10月6日,OpenAI宣布将资助“研讨班、会议和专项活动”,帮助人类理解AI产生的重要数学结果。
关于这类支持可以做什么,AGMAI此前在9月29日的建议中列出了工作组、暑期学校、学生或博士后资助,以及讲解文章和书籍。它还建议,由既有非营利机构按成熟流程决定资助哪些项目,让理解工作保持“由社区自然发展并主导”。
截止目前,这些安排仍是咨询组的建议。现阶段,OpenAI已经作出资助承诺,但10月6日公告尚未列出预算、受资助名单或实施日期,也未确认上述分配机制已经落实。
参考资料:
1.《Sharing AI progress in mathematics》,OpenAI
2.OpenAI数学成果公开仓库:项目说明、成果目录及修订记录,OpenAI,GitHub
3.《Algebraicity of Weil classes on split abelian eightfolds》撤回说明,OpenAI
4.《Algebraicity of Kuga–Satake Correspondences for K3 Surfaces》撤回说明,OpenAI
5.《The rational Hodge conjecture for products of K3 surfaces》撤回说明,OpenAI
6.《Updates: Sharing AI progress on mathematics (amazing!); and my lecture plans》,Gil Kalai,Combinatorics and more
7.《Amazing: There is no Percolation at the Critical Probability in all Dimensions》,Gil Kalai,Combinatorics and more
8.《A Severe Misalignment of AI in Mathematics》,陶哲轩等25位菲尔兹奖得主初始署名的联合声明,陶哲轩个人博客
9.Comparator项目文档,leanprover,GitHub
10.《The irrationality exponent of π is 2》,OpenAI
11.《Integer multiplication below n log n》,OpenAI
12.《The Unique Games Theorem》,OpenAI
13.《Quasipolynomial Bounds for Arithmetic Progressions》,OpenAI
14.《The Quasi-Riemann Hypothesis: A Zero-Free Half-Plane Re(s)>7/8》,OpenAI
15.《The rational Hodge conjecture for CM abelian varieties》,OpenAI
16.《Global classical solutions of the three-dimensional relativistic Vlasov–Maxwell system》,OpenAI
17.《A product counterexample to the simplex maximum for projection-body volume》,OpenAI
18.《On the Unique Games Conjecture》,Subhash Khot
19.《The Mathocalypse》及文后讨论,Scott Aaronson个人博客;含Dana Moshkovitz读稿经历及其评论
20.《Lefschetz Motives and the Tate Conjecture》,J. S. Milne,1999年
21.《Mathematical Articles (with abstracts)》及2026年10月7日更新,J. S. Milne个人网站
22.《Ordinary NP-Hardness at the Basic Semidefinite Threshold》删节推理摘要,OpenAI
23.数学与人工智能咨询组成员及独立性说明,AGMAI官网
24.《On OpenAI’s Release of Mathematical Results》,数学与人工智能咨询组(AGMAI),2026年10月6日
25.《Responsible Release of AI-Generated Mathematics》,数学与人工智能咨询组(AGMAI),2026年9月29日
本文来自微信公众号“盒饭财经”,作者:许有阳,36氪经授权发布。
前因后果
- 四模型各100美元造PDF编辑器,几乎全有bug开源中国 · OpenAI
- 纽约时报案文件曝光 微支付或成 AI 内容付费解方科技新报 · OpenAI
- OpenAI预计2026年底年化营收达700亿美元36氪快讯 · OpenAI
- Google Gemini agent 调度 Claude虎嗅 AI · OpenAI
- 新思科技拟与中国 AI 实验室合作加速芯片设计AIbase AI新闻 · OpenAI
- 加菲尔德演奥尔特曼后称不信任当前AIDoNews · OpenAI