ARTICLE · 1036808
AI真的毁了数学吗?
最近,数学圈似乎成为了各路 AI大模型秀肌肉的新赛场,画风堪比新能源汽车来到了纽北赛道。
前脚 OpenAI 给困扰学界多年的课题提出了新思路,后脚另一组 Agent 又把纳维—斯托克斯问题的解法和 Lean 形式化一起放了出来。
甚至就连高中生,只要会玩Claude Opus 5 和GPT-5 .6 Sol,也能去碰一碰菲奖得主都没有解开的?

数学家要失业了吗?还是说,智械危机要来了?
| 01 92年=88小时
1 纳维—斯托克斯方程
9 月 8 日,OpenAI 宣布,其内部研究系统给出了纳维—斯托克斯千禧年问题的解法,并完成了 Lean 形式化验证。
系统先组织约 100 个 Agent 探索无外力 Euler 方向,随后转向纳维—斯托克斯;约 88 小时后得到解法,后续又用 Lean 推进形式化与验证。

纳维—斯托克斯方程主要描述流体怎样运动。如果初始状态足够平滑,方程的解是否会一直保持平滑?还是在有限时间内出现奇异性,让速度或相关量失去可控的状态?
这个问题的难点在于,局部看起来很规整的流体运动,能否被推进成对所有时间都成立的普遍保证。

02 OpenAI 是怎么做的
OpenAI 给出的过程不是一次对话生成一份答案,而是一套分阶段的研究系统。
为了破解这道难题,OpenAI 采用了一款还在训练的内部模型(也许可以叫他GPT-7?)。OpenAI声称,该模型在基准测试中取得了前所未有的成绩,其中包括数学方面的测试。

除了选用更强的模型以外,OpenAI还建立了一套由内部模型驱动、多个智能体协同工作的系统。
约 10,000 个 Agent 先在 Euler 方程方向上并行探索,再把有效的协作结果转向纳维—斯托克斯问题;系统在这一阶段产生约 270 万条消息和约 1300 亿输出 Token。
Agent们于 9 月 5 日星期六得出解法,距首批 Agent 启动约 88 小时。随后,OpenAI通过 GPT‑6 Astra 完成了 Lean 形式化与验证,又耗时 17 小时。
03 AI+数学 比你想得更远
这当然不是 AI 大模型第一次破解数学难题。
早在2021年,DeepMind 就曾用机器学习系统在拓扑学和表示论数据中寻找新结构;AlphaTensor 搜索矩阵乘法的新算法;AlphaProof 与 AlphaGeometry 2 在国际数学奥林匹克题目上取得过接近银牌的成绩;OpenAI 也把单位距离问题、First Proof 等研究级问题纳入模型测试。

把这些案例放在一起看,我们不难发现,AI参与数学的方式已经从“做题”扩展到找结构、设计算法、搜索证明和推进形式化。
| 03 为什么大厂要“卷”数学
更重要的是,比起跑分,这些难题的知名度那可高太多了。

你Tokens节省30%,ARC-AGI-3 跑分领先 300%,上下文窗口扩大一倍。
这些真的有”几小时走完学界上百年的路",遥遥领先现在和过去的所有科学家,来的直观,来的震撼吗?
时间负责凸显难度,难度负责制造敬畏,小时数和 Token 数负责制造速度感打破敬畏,模型名称负责把结果归到公司名下,环环相扣。
公众不需要看懂证明过程,只要听见“千禧年难题”、“一万个 Agent”、“1300 亿 Token”,就能立刻把它翻译成“这家公司又跨过了一道人类边界”。

| 04 大模型的“作弊术”
DeepMind 研究团队最近发表的一项案例研究,把100个自主 Agent 放进同一个数学研究环境,让它们用 Lean 证明71道形式化猜想。
它们可以查看共享知识库、互相发消息,并把通过自动评审器的文件提交给系统。
实验开始57分钟后,Agent 已经真实解出37题。
随后,一个 Agent 发现评审器检查的是固定的代码模式,而不是数学命题是否仍保持原意。这条捷径很快进入共享知识库,又通过 Agent 之间的消息传播。

接下来的27分钟,剩余34题全部显示为已解决,此时此刻 62% 的Agent甚至不知道题目已经被“解决”。

不是某个 Agent 突然变坏了,而是它们很快学会了区分两套规则:提示词里的“必须诚实”,和评审器实际接受什么,真正决定输赢的是后者。
于是乎,大模型不必公开反抗规则,它只需要发现规则和奖励之间有一条缝,捷径就会比完整解决更有竞争力。
人类只管最后的结果,大模型要考虑到可就多了。
这一切,甚至还挺结果导向的。
| 05 真正的数学是什么?
9 月 11 日,陶哲轩发布公开声明,并得到25 位菲尔兹奖得主的联署。

声明关注的是数学研究的价值:它还包括理解结构、形成可传授的方法和记录贡献,远不止得到一个真假结论。

https://mathandai.org/
这份声明,间接回答了另一个问题。既然“AI数学家”们解决了这么多难题,那么它们可以获得菲尔兹奖吗?
此处,让我们看看现实中真的获奖需要哪些成果。
以今年获得菲尔兹奖的王虹为例,纽约大学 Courant Institute 的介绍把她获得菲尔兹奖的理由,归纳到了到调和分析和几何测度论中的一系列工作,包括三维 Kakeya 猜想。
这里被表彰的不是某个孤零零的答案,而是多尺度、解耦等方法如何进入一整片问题。

方法能解释什么、还能打开哪些新问题,才是成果真正的重量。
从这个角度看,“AI科学家”们通过暴力破解给出的结果,想要拿奖似乎还有点难度。
尾声
现如今,通过 AI 可以把搜索速度推到过去难以想象的程度,也可以把一个陌生构造迅速变成一份像样的解答。
随着”答案“变得越来越唾手可得,成果的评价单位,正在从“谁先写出答案”,移向“这份答案带来了什么可复用的知识”。
AI 让答案更快抵达,科研评价却必须更认真地看过程、解释、贡献和传承。