Create

Sign in to ReadmeX

Sign in to join communities, post, vote and chat.

or

New here?

Story

OpenAI posts 722 AI-generated math manuscripts, retracts 3 over sign error

AI summary

On October 7 OpenAI published a batch of mathematics results produced by its internal models on GitHub: the first catalog listed 722 manuscripts grouped into 372 "result families," and a later-checked catalog showed 719 after three manuscripts were retracted — one retraction notice states "The proof contains a sign error." The manuscripts span 17 fields, some include Lean formal proofs, and OpenAI says the vast majority came from the same pipeline and the same internal model, with each result costing roughly three hours of ChatGPT Pro-style thinking on average. Combinatorialist Gil Kalai called it "an amazing milestone for mathematics" while cautioning that human mathematicians still need to verify the proofs, and 25 Fields medalists had already signed a statement stressing that AI mathematics must serve conceptual understanding.

Why it matters: If the claims hold up under human verification, they would show a single model contributing testable results across many areas of mathematics — while the retractions show that preprint-style AI math still needs formal and peer review.

OpenAIChatGPT ProLean

References 36氪 人工智能 · AIbase AI新闻 · DoNews

29
Source text36氪 人工智能 · 12 min read

一个负号,牵动了三份证明。

北京时间10月7日,OpenAI在GitHub公开了一批内部模型产生的数学结果。首版目录有722份手稿,归为372个结果家族。本文10月8日核对的目录中,在列手稿变成719份,家族数仍为372。

减少的这3份手稿,被撤回了。

其中,一份标注9月18日、讨论Weil类代数性的几何手稿,在撤回说明中写道:“The proof contains a sign error”。意思是“证明存在符号错误”。

这份证明需要把几何交点的正负计数补到零,才能调用后面的定理。原以为某种操作增加正数,实际却增加负数。用简化数值打比方:想做“−2+2=0”,却做成了“−2−2=−4”。定理的使用条件没有满足,两份借用该构造的手稿也失去支撑。

这批成果也收到了很高的评价。

10月7日,组合数学家吉尔·卡莱称这次发布为“数学的一个惊人里程碑”(an amazing milestone for mathematics)。紧接着,他提醒:证明仍需人类数学家核验、消化。

围绕AI数学研究的讨论,也早就开始了。

9月,Claude的临界渗流证明主张引发讨论;9月11日,陶哲轩等25位菲尔兹奖得主作为初始署名者发表声明,承认AI数学能力的进步,同时批评企业把解题作为评测竞赛、忽视理解与知识传承的做法。

一边是可能改变领域的重要结果,一边是已经发生的撤回。这些手稿究竟“突破”了什么?为什么AI能批量解开这些曾困住数学天才的难题?

1

AI向数学界交来了什么

这次,OpenAI一口气公开的数学材料,内容丰富。

打开GitHub上公开资料库,就能看到论文PDF和排版源文件,同行还可逐步检查论证。有部分手稿附有Lean证明材料——这是把数学命题和推理写成严格代码,交给程序检查。有意思的是,其中还有10份删节推理摘要,展示了部分探索过程,包括没有走通的尝试。

这些手稿也可称为“预印本”,一般是作者先公开研究文本,供别人阅读、讨论和检查。预印本中可以有重要成果,但不说明它经过了怎样的外部审查。

OpenAI称,绝大多数结果来自同一流程、同一个内部模型。如果其中的重要主张得到确认,就意味着同一套模型能力参与了多个数学领域的研究。

公告还把每项结果平均消耗的算力,折算成相当于ChatGPT Pro思考“大约三小时”(roughly three hours)。

2

722、719、372:三个数字,三种含义

722和719数的是手稿,372数的是把相关手稿归在一起的组。OpenAI把这样的组称为“结果家族”。

仓库说明使用的是“related papers”,即”相关论文”。

我们可以把一个家族想成一个研究资料夹。这个研究资料夹中,它们各司其职,有的文章证明主结论,有的补上其中一个关键步骤,有的把结论推广到其他条件。同时,它们各有一份手稿,在目录里则共用一个家族编号。

也就是说,一篇文章可以有多个结论,一个资料夹也可能回答不同问题。

3

最大的家族共有14篇,它们的关系是?

第034族有14份手稿,是当前最大的家族,属于代数与复几何。目录里既有一般论证,也有专门处理四维对象的版本。

要理解相关研究为何会分成多篇,可以先看只有两篇的第088族。两篇研究的是同一项几何指标,粗略说,与一个形状在各个方向投下的“影子”有关。

其中一篇研究,什么形状能让这项指标最小。另一篇给出反例,说明原先猜测的最大者并非最大。它们围绕同一个指标,却回答不同的问题,所以归在同一个家族里,又各自写成手稿。

这种成组现象很普遍。372族中,205族只有一篇,167族有多篇。多篇家族不到总数的一半,却包含514篇,占当前手稿的约71%。

4

跨17个领域,六成家族集中在七组

按OpenAI目录的领域分类逐项统计,372个家族分布在17个领域。最大的七组共227族,占约61%。理论计算机科学40族,组合数学37族,代数与复几何36族,排在前面。

那这些领域分别在研究什么?比如,理论计算机科学,他们研究的是算法需要多少计算。比如,组合数学,主要研究的是离散的东西怎样排列和计数。比如,代数与复几何,主要研究的是方程定义的形状有什么性质

这次公开的手稿中,理论计算机科学有40个家族、73份手稿,而概率与统计力学有29个家族、105份手稿。前者的家族更多,后者的手稿更多。如果只看论文篇数和按相关成果归组来看,会得到不同的数量。

5

“突破”至少有五种形态

这次OpenAI公布的722份手稿,其“突破”到底意味着什么?

我们依据抽读的手稿,可以分出五种贡献。这并非OpenAI给出的等级划分,一篇论文也可能兼具几种。

(1)给未知问题一个答案。比如,π可以被分数不断逼近。这里研究的是:误差相对于分母,能无穷多次下降得多快?新稿声称,衡量这种速度的“无理度”指标等于2。

(2)让结论适用于更多情况。研究粒子与电磁场时,已有多类结果要求起始状态足够小,或具有特殊对称。新稿主张,在论文规定的模型和其他初态条件下,可以去掉这两类限制,仍保证解长期平滑存在。

(3)越过一条被猜测无法突破的界线。比如,整数越长,乘法需要的计算步骤通常越多。新稿声称,在同一固定机器模型下,步骤数的增长可以比长期猜测的极限更慢。

(4)补上许多结论共同依赖的前提。比如,不少研究先假定唯一游戏猜想成立,再据此证明某些算法任务难以达到怎样的近似精度。新稿若成立,这些结论就不必继续把它列为未经证明的假设。

(5)给已知答案另一种证明。比如,一份几何反例稿先承认:“Their result already gives a negative answer”,也就是前人的结果已经给出否定答案,随后提出直接构造。这里新增的是证明路线,需要看它能否带来更清楚的解释或可供其他研究使用的方法。

6

七个亮点,先看它们改变了哪一句话

这次的公开,究竟“突破”了什么?

具体到一项成果,我们可以把三件事放在一起对比着看:前人已经证明到哪里,新稿声称推进到哪里,以及它还保留哪些条件。

下面七个案例,按这个顺序展开。

拿乘法来说,论文比较的是:随着整数位数不断增加,计算步骤增长得多快。而在新稿声称把这个增长速度压得更低。

它若成立,就推进了关于计算效率的理论研究,同时真实设备能否因此提速,还要看算法怎样实现,以及计算的整数有多长。

值得注意的是,表中的“准黎曼假设”和“CM霍奇”还需要看清范围。前者仍未达到完整黎曼假设,后者限定在CM阿贝尔簇。

7

撤回的是哪三份,影响了什么

撤回的三篇稿件,分别是《分裂阿贝尔八维簇上Weil类的代数性》《K3曲面Kuga–Satake对应的代数性》《K3曲面乘积的有理霍奇猜想》。

后两篇都涉及一类称为K3的曲面,也都用到了第一篇中那项出错构造的改写。

然而,撤回说明并没有宣布原命题为假:这条论证有缺口,不代表命题已经被推翻,也不排除存在另一条有效证明。

这撤回的三稿同属第032家族。撤回后,这一族从八篇变成五篇,其中关于CM阿贝尔簇的霍奇主稿仍保留。CM阿贝尔簇是一类具有特殊算术对称性的几何对象。这份留下的主稿,还连接着一项27年前的研究。

8

一个新结果,可能补上27年前的“如果”

数学家James Milne在1999年发表的一篇论文中,证明了一条联系:只要一个猜想成立,另一个猜想就能随之成立。当时还缺的,是前一个猜想本身的证明。

具体来说,就是前者是复数上所有CM阿贝尔簇的有理霍奇猜想,而后者是有限域上所有阿贝尔簇的泰特猜想。前一个问题限定了一类有特殊算术对称性的几何对象,后一个问题则进入只有有限个数的运算系统。

这次的手稿声称补上了前一个猜想的证明。如果它成立,就可以接上Milne论文中已经证明的联系,推出后一个猜想。新结果的影响因此会超出它直接研究的对象。

10月7日,Milne在自己的论文目录中加注,提到OpenAI的宣布,并用“it seems”,也就是“看来”描述这一后果。这表明他也注意到了新稿与旧定理的联系。

9

这些问题为什么可能适合AI

OpenAI表示,扩大数学研究测试的起点,是“评测趋于饱和”(evaluations saturated),也就是原有考题越来越难区分模型能力。OpenAI累计向模型提供约4000个研究问题,再筛选、归组输出。

这些它们的共通点是,即使问题尚无已知答案,研究任务也可以写得很明确。一份公开任务列出了研究对象、输入条件、需要证明的结论,以及什么样的反例足以推翻它。

而证明路线则要由模型寻找。

公开的删节推理摘要中,记录了一次设计测试的尝试。这项测试需要让符合要求的答案容易通过,同时挡住不符合要求的答案。然而,模型也发现,一种方案暴露了可被利用的结构,使不符合要求的答案也能蒙混过关。

加入更密集的随机扰动,可以阻止这种蒙混方式,却又降低了本该通过的答案通过测试的概率。模型于是继续寻找——怎样堵住漏洞,又不破坏另一项保证。

于是,“寻找证明”更加具象,而不是一个努力中的“形容词”。它们可以拆分为可多次重复的步骤:提出办法,检查它会在哪里失效,再调整路线,当然过程中还会调用前人已经证明的定理。

倒推来看,从这些材料可以看出几项有利条件:目标写得清楚,已有研究提供可调用的工具,部分结果还能接受形式化检查。

10

OpenAI承诺出资,让人类有时间理解这些证明

除了工具,研究者还需要时间理解这些证明:哪些步骤是关键,哪些方法可以讲给学生,哪些思路能够用于其他问题。

这种讨论和关注,早于这次公布。

9月11日,加州大学洛杉矶分校数学教授、2006年菲尔兹奖得主陶哲轩等25位得主,作为初始署名者发表联合声明。声明承认AI数学能力的进步,也强调解题应服务于“概念理解与洞见”(conceptual understanding and insight)。

9月11日,陶哲轩在个人博客发布联合声明。声明将理解数学思想、传播研究方法,列为解题之外仍需完成的工作。

10月6日,OpenAI宣布将资助“研讨班、会议和专项活动”,帮助人类理解AI产生的重要数学结果。

关于这类支持可以做什么,AGMAI此前在9月29日的建议中列出了工作组、暑期学校、学生或博士后资助,以及讲解文章和书籍。它还建议,由既有非营利机构按成熟流程决定资助哪些项目,让理解工作保持“由社区自然发展并主导”。

截止目前,这些安排仍是咨询组的建议。现阶段,OpenAI已经作出资助承诺,但10月6日公告尚未列出预算、受资助名单或实施日期,也未确认上述分配机制已经落实。

参考资料:

1.《Sharing AI progress in mathematics》,OpenAI

2.OpenAI数学成果公开仓库:项目说明、成果目录及修订记录,OpenAI,GitHub

3.《Algebraicity of Weil classes on split abelian eightfolds》撤回说明,OpenAI

4.《Algebraicity of Kuga–Satake Correspondences for K3 Surfaces》撤回说明,OpenAI

5.《The rational Hodge conjecture for products of K3 surfaces》撤回说明,OpenAI

6.《Updates: Sharing AI progress on mathematics (amazing!); and my lecture plans》,Gil Kalai,Combinatorics and more

7.《Amazing: There is no Percolation at the Critical Probability in all Dimensions》,Gil Kalai,Combinatorics and more

8.《A Severe Misalignment of AI in Mathematics》,陶哲轩等25位菲尔兹奖得主初始署名的联合声明,陶哲轩个人博客

9.Comparator项目文档,leanprover,GitHub

10.《The irrationality exponent of π is 2》,OpenAI

11.《Integer multiplication below n log n》,OpenAI

12.《The Unique Games Theorem》,OpenAI

13.《Quasipolynomial Bounds for Arithmetic Progressions》,OpenAI

14.《The Quasi-Riemann Hypothesis: A Zero-Free Half-Plane Re(s)>7/8》,OpenAI

15.《The rational Hodge conjecture for CM abelian varieties》,OpenAI

16.《Global classical solutions of the three-dimensional relativistic Vlasov–Maxwell system》,OpenAI

17.《A product counterexample to the simplex maximum for projection-body volume》,OpenAI

18.《On the Unique Games Conjecture》,Subhash Khot

19.《The Mathocalypse》及文后讨论,Scott Aaronson个人博客;含Dana Moshkovitz读稿经历及其评论

20.《Lefschetz Motives and the Tate Conjecture》,J. S. Milne,1999年

21.《Mathematical Articles (with abstracts)》及2026年10月7日更新,J. S. Milne个人网站

22.《Ordinary NP-Hardness at the Basic Semidefinite Threshold》删节推理摘要,OpenAI

23.数学与人工智能咨询组成员及独立性说明,AGMAI官网

24.《On OpenAI’s Release of Mathematical Results》,数学与人工智能咨询组(AGMAI),2026年10月6日

25.《Responsible Release of AI-Generated Mathematics》,数学与人工智能咨询组(AGMAI),2026年9月29日

本文来自微信公众号“盒饭财经”,作者:许有阳,36氪经授权发布。

Read the original →

How we got here

  1. Four frontier models each got $100 to build a PDF editor — nearly all shipped bugs开源中国 · OpenAI
  2. NYT v. OpenAI docs renew debate on paying for AI's news use科技新报 · OpenAI
  3. OpenAI expects annualized revenue to reach $70B by end of 202636氪快讯 · OpenAI
  4. Google's Gemini agent can route work between Gemini and Claude虎嗅 AI · OpenAI
  5. Synopsys eyes China AI lab partnerships to speed chip designAIbase AI新闻 · OpenAI
  6. Garfield, after playing Altman in 'Artificial', says he distrusts today's AIDoNews · OpenAI

Comments

I've used this: share my experience What I think: share my view
How important is this story?No ratings yet

No comments yet. Start the conversation.