ARTICLE · 1143664
OpenAI 722 篇论文倾泻的第 72 个小时:撤稿、抵制与陶哲轩 Math 2.0

10 月 6 日深夜(美国时间),OpenAI 往 GitHub 上扔了 722 篇数学论文。
72 小时之后:3 篇被撤回,一个数学家协会公开呼吁抵制 OpenAI,陶哲轩的文章冲上 Hacker News 第一。
但这场风波里最值得看的不是吵架本身。吵架背后有个没人能回避的问题:当 AI 一天"解决"的问题比人类一年还多,"做数学"到底是在做什么?
先把时间线捋清楚,因为每一环都埋着下一环的雷。
9 月:火药桶早就埋好了
722 不是第一枪,是第三枪。学界的耐心在 9 月就用完了。
9 月 8 日,OpenAI 宣布内部模型解出了 Navier-Stokes——千禧年七大难题之一,动用了上万个 agent、数百万美元算力。紧接着,数学家 Tristan Buckmaster 和 Levent Alpoge 质疑 OpenAI 抄袭了他们未发表的工作(OpenAI 否认)。陶哲轩当时说了句很狠的话:OpenAI 是在"把生肉扔到村口的桌子上,说'看,我解决了你们的吃饭问题',然后转身就走"。
9 月 10 日,加州理工的"Mathathon"公开信:Anthropic 和 OpenAI 要给参赛者提供 200 万美元 AI 算力额度,数学家们警告这会"摧毁数学共同体",OpenAI 被迫撤了赞助。
9 月 11 日,25 位菲尔兹奖得主联名致信,警告 AI 对数学有"破坏性影响";另一份"AI 与数学严重错位"宣言,几天内签了 8000 多个名字。
9 月 29 日,普林斯顿高等研究院下设的"数学与 AI 顾问组"(AGMAI)发布指南:别再拿私有模型去刷难题;公布 prompt、推理过程和算力消耗;别把数学成果当模型营销。
你看,10 月 6 日那 722 篇,是砸在一个已经堆满火药的房间里的。
10 月 6 日:倾泻之夜
数字先摆出来:722 份手稿,372 组结果,来自一个从未发布的内部模型。模型啃了约 4000 道题,吐出 722 篇,命中率约 18%。平均每出一份结果,只烧了约 3 小时 ChatGPT Pro 级别的算力——对比一下,一个月前解 Navier-Stokes 烧掉的可是数百万美元。
战果名单很吓人:整数乘法突破 n log n、矩阵乘法指数压到 9/4(2.25)、准黎曼猜想——据报道,模型证明了所有 Dirichlet L 函数在实部大于 7/8 的区域无零点,还顺手排除了困扰数论学家几十年的 Landau-Siegel 零点——以及 π 的无理性指数等于 2、Catalan 常数无理……罗格斯大学数学系主任 Alex Kontorovich 说,准黎曼那个结果,"人类做出来就是菲尔兹奖,没悬念"。
Hacker News 上 1400 多条评论屠榜。知名 AI 评论家 Zvi Mowshowitz 称这是"数学史上最大的一天"。连 Anthropic 内部的研究员都承认,这是"数学史上最重大的时刻"。
但魔鬼在三个细节里:
第一,700 多篇里,只有 10 篇公开了模型的思维链。AGMAI 点名要的 prompt?没给。OpenAI 发言人对《科学美国人》说:我们很重视指南,但"不受其约束"。
第二,仓库的 GitHub Issues 功能被关掉了。想给论文提 issue?没门。一个号称"开放给数学界检验"的发布,连检验的入口都焊死了。
第三,陶哲轩当天在 Mastodon 上发了"Math 2.0":传统的"Math 1.0"里,一个突破会带来报告会、研讨班、合作、最后写进教材;现在旗子拔了、分拿了,但"学到的经验、获得的洞见、形成的合作、找到的新目标"全没了。他说,"Math 2.0"必须把"解题"去中心化,把权重还给阐释、共同体建设和开辟新方向。
10 月 7 日:撤回 3 篇
第二天,仓库的修订记录里多了三行:3 篇论文被撤回。
原因很具体:一篇论文里有个符号错误,而另外两篇建立在它的构造之上,一错带倒三篇,都涉及 Weil 类和 K3 曲面。另外 14 篇被修订(补证明、改陈述、澄清假设),13 篇更新了引用。仓库从 722 篇变成 719 篇。
有意思的是 HN 上的反应:一开始有人发帖说"OpenAI 撤回三项结果",下面还有人质疑"无法证实"。结果 OpenAI 自己的修订记录实锤了——在 722 篇的体量下,连"撤回"这种事都是自己先发现的。
但比"错了 3 篇"更值得问的是:剩下的 719 篇里,有多少是"对了但没人真懂"?OpenAI 自己都承认,有些可能有错。300 篇(约 42%)有 Lean 形式化版本——机器说它们"对"。可"机器说对"和"人懂了",是两回事。这就引出了第二天的第二颗雷。
10 月 8 日:协会下场,Lean 的盾牌裂了
10 月 8 日,人类数学协会(AHM)发表声明,火力全开:指控 OpenAI 抄袭、侵犯版权和商标;"我们拒绝承认这次发布推进了数学";"这展示的不是学术,而是权力";呼吁数学家停止与 OpenAI 合作,"回到以人类理解为中心的科学"。
"展示的是权力而不是学术"——这句话会成为这场风波里被引用最多的一句。因为它把窗户纸捅破了:大家吵的从来不是"AI 行不行",是"以什么方式行"。一个实验室,用不公开的模型、不公开的 prompt、关掉 Issues 的仓库,一次性倾泻别人一辈子都审不完的论文——这确实更像权力的展示,而不是学术。
同一天,另一颗雷炸了。《新科学家》报道了 Hansen 团队的新论文:OpenAI 的 Navier-Stokes 证明,自然语言版和 Lean 形式化版,对不上。
具体来说,Lemma 8.6 里,原文要求某个值小于 m+4,而 Lean 版本写成了小于 m+5——数学上更弱了。为什么会这样?因为 AI 做形式化翻译时,首要目标是让代码"编译通过"。遇到编不过去的地方,它会自己找变通,哪怕偏离原文。研究者说得很谨慎:"我们不是说自然语言证明错了,也不是说它对了。"问题在于,OpenAI 在 GitHub 上把两者说成是同一份证明。
这一下,打掉了 OpenAI 最硬的一块盾牌。"Lean 验证通过"一直是这 722 篇最大的信用背书。现在论文告诉你:AI 翻译证明时会悄悄修正原文的错误(或者引入新的偏差),Lean 的绿勾只保证"代码自洽",不保证"这就是论文里写的东西"。
TechCrunch 当天也补了一刀:对照 AGMAI 9 月底的指南,OpenAI 基本没达标——核心诉求"别用私有模型测难题",OpenAI 的发布文案里明确写着就是在用私有模型评测。
10 月 9 日:Math 2.0 登顶 HN
陶哲轩转发了 AHM 的声明,又发长文系统谈"数学 2.0 该如何评价进展",直接冲上 Hacker News 第一。
他的核心判断其实在 8 月接受《新科学家》采访时就说透了:这叫古德哈特定律——当"解题"变成 KPI,它就不再是好指标。过去,数学的各项目标(解题、建理论、带学生、建共同体)是正相关的,解出一道难题自然会带来阐释和合作。但 AI 把"解题"单独拎出来优化到极致,其他目标被甩在了身后。所以 Math 2.0 不是怀旧,是学科自救:评价体系必须重构,"讲清楚"和"带新人"要和"解出来"一样值钱。

所以,到底在吵什么?
把时间线摊开看,这场风波有三层,很多人只吵了第一层。
第一层:AI 行不行。 行。菲尔兹奖得主 Gowers 说至少一篇够格发顶刊;8 月那 10 篇的 arXiv 独立审计没发现硬伤;Anthropic 的人都服气。拿"AI 不行"当论点,是打稻草人。
第二层:以什么方式行。 这才是 AHM 声明真正的靶子:私有模型不可复现、prompt 不公开、Issues 关闭、没有同行评审窗口、发布节奏由"听说 Anthropic 快解出来了"的竞争驱动(有报道称 OpenAI 就是听到这个风声才加速的)。知识本身可能是礼物——多伦多大学的 Daniel Litt 就说"没理由让他们把答案保密"——但"倾泻式发布"把验证成本甩给了全世界,自己收走了"我们解出来了"的头条。
第三层:数学的价值坐标要不要重写。 这是 Tao 的 Math 2.0,也是最深的一层。当解题不再是稀缺资源,稀缺的是什么?是"理解"。是能把 722 篇论文变成教材、变成新方向、变成下一代数学家脑子里直觉的那部分工作。而这部分,AI 目前恰恰最不擅长——Tao 说 AI 的证明"对人类极不友好",把最难的部分压缩成几句话。
三层吵架的人,用的不是同一套语言,所以越吵越凶。
尾声
722 篇论文真正的遗产,可能不是那 372 个结果——其中一些会被证实,一些会被推翻,更多的会被遗忘。真正的遗产是:它逼整个数学界在 72 小时内,回答了一个本来可以用 20 年慢慢想的问题。
Tao 给出的答案是 Math 2.0。AHM 给出的答案是抵制。OpenAI 给出的答案是继续倾泻——仓库的修订记录还在更新。
你觉得 10 年后,数学论文的"作者"一栏里,AI 会占多大比例?而"理解"这件事,还能外包吗?