夜雨聆风学习资料网

ARTICLE · 1047912

震撼硅谷!奥特曼断言AI已超越最强数学家,GPT-6首次攻克十年未解难题

震撼硅谷!奥特曼断言AI已超越最强数学家,GPT-6首次攻克十年未解难题

人类数学大厦的屋顶,正在被人工智能以肉眼可见的速度掀翻。

就在几天前,旧金山 Dreamforce 大会现场,OpenAI 首席执行官 Sam Altman 抛出了一枚震撼弹。

坐在扶手椅上的奥特曼神色平静,说出的话却让全场倒吸一口凉气:

“三个夏天前,我们的模型连小学二年级的应用题都费劲;两个夏天前,它能打高中有难度的数学竞赛;一个夏天前,它拿到了国际数学奥林匹克(IMO)的金牌;而就在这个夏天,我们手里的模型已经证明了七大数学世纪难题之一。”

紧接着,他更是语出惊人:GPT-5.5 相当于普通数学教授,GPT-5.6 相当于顶尖前 1% 的数学教授,刚发布的 GPT-6 Astra 还要更强一些。而在 Astra 之后,OpenAI 内部还有一个尚未公开的神秘模型,它能做到的事情,“连全世界最顶尖的数学家都做不到”。

▲ Sam Altman在Dreamforce现场勾勒出令人心惊的AI数学能力跃迁线

这到底是一场硅谷顶级的商业吹嘘,还是真实降临的科技奇点?

仅仅 48 小时后,一份挂在 arXiv 上的论文和权威数学评测机构的公告,把无可辩驳的证据直接砸在了所有人脸上。

零的突破:全球顶级数学题库亮起第一盏红灯

全球顶尖 AI 评估机构 Epoch AI 维护着一个让无数数学家和 AI 望而却步的严苛题库:FrontierMath: Open Problems

这里不收录有标准答案的考试题,只收集“职业数学家全力以赴过、但至今仍未解决”的人类未解难题

题库按难度和学术影响力分为四档:中等有趣(Moderately Interesting)、坚实结果(Solid Result)、重大进展(Major Advance),以及最高殿堂的突破性进展(Breakthrough)

在过去很长一段时间里,“重大进展”和“突破性进展”两栏后面的数字,是一片令人绝望的 0

然而,就在 2026 年 9 月中旬,历史被改写了。

▲ FrontierMath题板上,Major Advance档位首次由 0/6 变为 1/6

一道自 2017 年悬赏至今、折磨了学术界近十年的数学开放难题,被正式攻破。

题板上的状态被狠狠打上了一个历史性的标签:Solved(human + AI)

这是全人类历史上,AI 首次参与并作为核心主力攻克“重大进展”级别的未解数学问题!

▲ 学界与科技圈热议:Astra不仅证明了定理,更创造了全新的数学工具

随论文一同公开的致谢辞迅速引发学界震动。来自欧洲顶尖学府的三位数学家 Patrick Becker、Matthias Greger 和 Dominik Peters 明确表示:

证明该定理的核心想法(Primary Idea)和完整证明链条,全部由 GPT-6 Astra 提出;如果没有 AI,人类研究团队大概率根本找不到这个证明。

▲ 论文致谢与说明栏中明确写道:本证明在 GPT-6 Astra 协助下获得

消息一出,整个数学界和计算机界瞬间炸开了锅。

什么是“委员会选举的核心”?它为什么困扰人类十年?

为了理解这次突破的震撼程度,我们完全不需要看懂复杂的公式,只需要设想一个高中的生活场景:

假设你们班要选一个 5 人的“班级外卖管委会”,负责决定每天给大家订什么奶茶和小吃。全班 50 个同学,每个人可以在候选名单上勾选自己支持的人(这叫审批式投票)。

最终选出的 5 人管委会,必须做到绝对的公平与稳定

什么叫绝对稳定?

就是不能出现任何一个抱团的“反对派联盟”。 比如,全班如果有五分之二(20人)的同学突然跳出来抗议:“凭什么你们选这 5 个人?我们这 20 个人完全可以自己组团,选出另外 2 个人,而且保证我们这 20 个人每个人都比现在更满意!”

如果在任何投票规则下,都能选出一个让任何人都无法抱团推翻的完美管委会,数学家就把这种完美解法称为“核心(Core)”

▲ FrontierMath上关于审批式选举“核心(Core)”存在性问题的详细定义

从 2017 年开始,全球顶尖的算法博弈论和社会选择学者们就提出了一个世纪拷问:

在所有的投票可能中,是否存在某种极端恶心、极其刁钻的投票情况,导致“核心”彻底为空?也就是说,无论你怎么选管委会,都一定会有人掀桌子?

过去将近十年里,数学家们发疯一样地写程序、画网络、算矩阵,试图寻找一个哪怕极其复杂的反例

人类找了将近十年,一无所获

而当三位数学家带着 GPT-6 Astra 介入这道题时,AI 给出了一个让所有人意想不到的降维打击策略:

它没有去傻傻地继续搜寻反例,而是直接在理论上彻底焊死了大门,它证明了反例在宇宙中绝对不可能存在!在任何情况下,绝对稳定的“核心”永远非空!

不仅如此,Astra 还创造性地发明了一种被命名为“调和熵(Harmonic Entropy)”的全新数学目标函数与投票规则,顺手证明了这个完美解法在多项式时间内完全可计算。

它不仅解决了理论上的“有没有”,还给现实世界造出了一把能落地的“尺子”。

告别盲目下指令:一场惊心动魄的“人机接力”

很多人可能会好奇:这是否意味着数学家只要输入一行“请帮我证明这个猜想”,翘着二郎腿喝咖啡就行了?

恰恰相反

论文的致谢部分,堪称人类历史上最详实的一份“人机深度协同研究纪要”。整个破题过程,像极了一场高智商的智力拉力赛:

  1. 起步碰壁
    :数学家最初的目标只是退而求其次,想找一个近似解。他们引导 Astra 从经典的经济学均衡理论出发,Astra 几分钟内就算出了一个约 2.065 的近似因子。
  2. 人类掌舵
    :人类数学家不满足于这个数字,他们敏锐地察觉到还有更深层的几何结构,于是要求 Astra:“放弃传统势函数,去利用 KKT 极值条件,寻找全新的能量约束。”
  3. AI 灵光乍现
    :在反复的交互与算力燃烧中,Astra 突然跳出了人类过去的文献思维框架,提出了一套优化选民连续支付系统的全新熵架构
  4. 人类拔高目标
    :看到这个精妙的数学结构,人类研究者心跳加速,果断发出指令:“不要只证明弱核心,直接用这个工具冲击最强的 core+!”
  5. AI 完成绝杀
    :Astra 沿着这套人类从未见过的路径,层层推演,最终完成了无懈可击的全局构造性证明。

▲ 论文作者 Dominik Peters 发文感慨:整套论证极其优美,且该技术很有希望推广到其他模型

随后,人类数学家把 Astra 吐出的密集逻辑整理成了人类可读的手稿,并用当今数学界最严密的计算机形式化语言 Lean 进行了逐行代码验证,确保每一个逻辑符号都坚如磐石。

主导该研究的数学家 Dominik Peters 激动地表示:

“这个论证非常漂亮!它完全跳出了机械硬算与繁琐分类讨论的泥潭,具备极高的数学审美,相关方法更很有希望推广到其他模型。”

历史回响与质疑:AI 真的拥有“数学洞见”了吗?

每当计算机在数学界攻城拔寨,怀疑与审视就从未缺席。

认知科学家 Gary Marcus 迅速在社交平台上泼下冷水。他直言不讳地指出:Altman 的言论充满水分。现阶段的系统依然高度依赖符号验证工具,这并不等同于人类那种能够颠覆范式的“原创数学洞见(Conceptual Insight)”

▲ 认知科学家 Gary Marcus 对“AI产生深层数学洞见”提出尖锐质疑

这种争论让人不禁想起 1976 年的四色定理证明,以及后来的开普勒猜想。当时,计算机穷举了数十亿种着色构型,引发了全球数学家的剧烈哲学危机:“如果一个人穷尽一生都无法肉眼看懂一个证明,这还算数学理解吗?”

半个世纪过去了,今天 Astra 带来的冲击,比当年的四色定理更进一步。

因为这一次,它不仅仅是在执行穷举,它在“发明概念”,它提出了人类文献库里原本没有的调和熵规则,串联起了原本风马牛不相及的分析工具。

著名菲尔兹奖得主陶哲轩(Terence Tao)曾对 AI 参与数学研究给出一个极具穿透力的论断:

数学的核心价值,往往深植于向终点跋涉时孕育出的全新语言与世界观,远超终点处那个冰冷的常数或孤立定理。AI 最先接管的,或许是人类无暇顾及的漫长技术死角;但当它开始向人类反哺思维模型时,整个学科的分工将被彻底重塑。

为了检验 AI 是否真的掌握了通用的数学推理,Epoch AI 不久前联合数学家 Thomas Bloom 推出了 FrontierMath Erdős 题库,将 68 道著名的埃尔德什(Erdős)悬赏难题写成形式化命题。

▲ 面对全面开放的 Erdős 难题库,即便是顶尖模型也依然步履蹒跚

在这项没有任何人类引导、全靠模型自主推理的残酷测试中,绝大部分前沿模型斩获了零分,Astra 预发布版也仅仅攻克了其中的 2 道(约 3%)。

这揭示了一个至关重要的现实:在充满已知技巧的基准题库里,AI 已经接近满分;但在无人涉足的蛮荒数学无人区,自主突破依然是极其罕见的“极光事件”。

时代的断层:数学家正在变成“交响乐指挥家”

把所有拼图拼在一起,一幅属于未来的清晰图景已经浮出水面:

  1. 未公开的后 Astra 内部模型
    ,正在 OpenAI 的超级计算机集群深处,以极其陡峭的斜率向千年数学难题发起冲锋;
  2. 已经发布的现网 Astra
    ,正在成为顶尖学者手里前所未有的“超级加速器”。

正如奥特曼在 Dreamforce 上所强调的,数学能力的超高速起飞(Fast Takeoff),比任何领域都更加凶猛。

因为数学拥有世界上最纯粹的反馈环境:对就是对,错就是错,没有含糊其辞的中间地带。 一旦模型跨过了逻辑自洽的临界点,它的进化速度就将把人类远远甩在身后。

未来的数学研究所,可能不再是几个人在一块黑板前枯坐数年、为某一个引理的展开式抓耳挠腮。

数学家的新角色,正在迅速演变为一名“交响乐总指挥”。

人类负责提供最顶层的审美标准、指出极具野心的探索方向、在关键分岔路口凭借哲学直觉做出抉择;而 AI 则负责在千万条可能的分支中开疆拓土,把人类直觉构想的草图,浇筑成无懈可击的严密真理。

正如一位学者在讨论区留下的感慨:

“人类数学家并未迎来黄昏,这门古老学科反而装配上了前所未有的曲率引擎。”

这场由人类指路、AI 执笔的理性风暴,才刚刚吹响第一声号角。

相关学习资料