乐于分享
好东西不私藏

OpenAI花2000美元解决十大数学难题,然而全人类几乎没人看得懂

OpenAI花2000美元解决十大数学难题,然而全人类几乎没人看得懂

数学家沉默了三个小时,最后只说了四个字。

2026年8月1日,OpenAI上线了一篇看似平静的技术公告:下一代模型Astra的内部版本,一口气给出了十个长期悬而未决的数学与理论计算机科学开放问题的解覆盖高维球堆积、非sofic群构造、Connes刚性猜想反驳、量子复杂度、格密码学、极值组合……每一个名字,都足以让对应子领域的教授心跳加速。

而找到这十个解的推理token成本,大约是2000美元。

这个数字荒诞到令人发笑,一个博士生的五年青春、一位教授的半生心血,被折算成了一张高端酒店的周末房费。

更深的不安随之而来:地球上几乎没有人能看懂这些突破到底在说什么。

一场没有记分牌的胜利

先快速回顾发生了什么

OpenAI研究者Sébastien Bubeck在X上只写了一句:"yes, nonsofic groups exist",是的,非sofic群存在。然后他列出了十项证明的清单:Lean形式化证书、思维链讲解、从冯·诺依曼代数到高维球堆积再到多色Ramsey数,范围之广、难度之高,像是一个人同时在十张棋盘上将了军。

▲ OpenAI研究者Noam Brown同步宣布这批数学成果

Noam Brown转发并附上示意图,Lijie Chen提到了permanent计算的新电路下界。消息在学术推特上以分钟级速度扩散。

然后,一件微妙的事情发生了

沃顿商学院教授Ethan Mollick,这位长期跟踪AI应用、以冷静著称的观察者,没有去解释任何一条定理。他说的是:"对地球上几乎每一个人来说,这些结果不仅超出了我们的能力,更超出了我们的理解范围。"

▲ Mollick的核心判断:我们只能信任数学专家来告诉我们"这是否令人印象深刻",而这种情形正在越来越多的领域出现

他用了一个英文词组"beyond our ken",超出了我们的认知边界我们甚至不知道自己不知道什么能力在跃迁,但人们越来越难"感受到"这种跃迁

这就是整件事最诡异的地方

柏拉图的洞穴,2026版

《大西洋月刊》的Derek Thompson接过Mollick的话头,搬出了两千多年前柏拉图的洞穴寓言:

囚徒被锁在洞穴深处,身后是火光,面前是石壁。他们一辈子只能看见物体投在墙上的影子,于是把影子当成了全部的真实。

Thompson说:超人类智能时代,我们都是洞穴里的囚徒。

量子复杂度的突破长什么样?高维球堆积的更优界限意味着什么?Connes刚性猜想被反驳,对人类知识版图的影响有多大?多数人不知道,也没有能力知道我们能接触到的,只是专家的转述、记者的解读、社交媒体上的惊叹号。而这些"解释"本身,也可能是误导的、不完整的、甚至是错误的

我们看到的只是影子的影子

一位叫Ryan Kramer的用户把这个困境说得更锋利:"国际象棋有记分牌,所以深蓝赢了卡斯帕罗夫,全世界都能感受到那一刻。证明没有记分牌"

▲ "鸿沟在于验证速度:专家共识以月计,模型迭代以周计"

1997年,电视机前的观众无须理解搜索树和评估函数,只要看到棋盘上的将杀就够了。那是一种全民可观测的胜负数学证明的世界里,胜负只藏在一份249页的技术文稿、一堆Lean代码,以及少数专家眉头紧锁后缓缓点头的瞬间。

最冷静的数学家,只给出四个词

所有人都在等一个人开口

Daniel Litt,一位以冷静和严谨著称的数学教授。在AI领域的营销话术与怀疑论的交火之间,数学共同体更信任这样的声音。

他的回应只有四个英文单词:

"It's a big deal."

▲ 四个词,让等待判断的人松了一口气

Mollick立刻引用了这条:"我一直在等最冷静的、同时也最了解AI的数学教授的裁决。"这句话本身就是一个绝佳的注脚:在一个普通人无法验证的领域,信任链成了认知基础设施。人们只能判断谁有资格判断定理

▲ 当你看不懂突破本身,你只能选择信任谁

一位数学博士生在回复中坦承:"即便是做数学的人,对自己专业之外的结果也常常完全同感。" 非sofic群恰好落在他的领域,他说感觉"非常impressive",但同时强调这些结果"严重依赖更深层的人类工作",所以"还没觉得自己完全没用"。

▲ 圈内人的真实体感:兴奋与焦虑并存

这句话同时承认了两件事:突破可以是真实的、巨大的;而人的工作与理解力,暂时还没有被整体取消。

蒸汽机刚发明的时候,也没人觉得GDP会变

Thompson在他的长帖末尾抛出了一个让人坐立不安的问题:

"AI越来越强大,但现实生活看起来仍然大体正常。"

这像极了经济学家索洛那句著名的毒舌:"计算机时代无处不在,唯独在生产率统计里看不见。" 1980年代的IT生产力悖论,现在换了一身AI的外衣重新上演。

有人用蒸汽机做类比:发明后头几年,经济影响几乎可以忽略不计,你能因此说蒸汽机不重要吗?

▲ "这就像在蒸汽机发明几年后说它对经济的影响可以忽略不计"

也有人不买账Stefan Schubert直截了当:"缺乏现实影响,很大程度上是因为它们在很多任务上并没有那么智能。" 数学定理上的胜利与通用"智能"之间,隔着一道峡谷。

▲ 冷水一瓢:在许多日常任务上,模型仍然不够聪明

一位临床研究背景的评论者Bruce Lambert则搬出了医学概念,替代终点血压降低、肿瘤缩小,这些中间指标容易测量、见效快,但不等于患者活得更久、过得更好AI的基准分数、排行榜名次、甚至开放问题的解决数量,会不会也是这样的"替代终点"?他呼吁建立一份普通人可感知的AI福利清单:结核和疟疾的治愈率、作物固氮效率、海水淡化成本、预期寿命、住房负担指数……

当你不知道突破长什么样的时候,至少应该知道突破最终应该让什么变好。

洞穴墙壁上的影子,越来越密、越来越快

MathOverflow上,一个标题为"数学研究公平性的严峻挑战"的帖子悄然升温。提问者一边为非sofic群和Connes刚性反例的到来而兴奋,一边忧心忡忡:如果前沿模型的访问权限只掌握在少数机构和付费用户手中,数学研究是否正在从"人脑加纸笔"的廉价科学,滑向粒子对撞机式的昂贵设备科学?

▲ 数学共同体担忧前沿模型的访问门槛

Kevin Lin提出了一个更诡异的意象:反向柏拉图洞穴传统洞穴里,囚徒看不见真实;而现在,人们借助AI触摸到了数学现实,你可以用它生成证明、构造反例,却对自己触摸到的东西毫无理解,像是沐浴在光中却依然失明

这幅2026年8月的图景让人脊背发凉:

两年前,AI连基础数学题都做不稳现在,它用2000美元的成本,解决了人类数十年未攻克的难题。249页文稿、Lean形式化证书、推理思维链,一切都摆在桌上。

但能读懂这张桌子的人,可能全世界不超过几百个。

而模型的迭代速度以计,专家的共识形成速度以计。下一波影子投上洞穴墙壁时,上一波的轮廓还没来得及被辨认。

超级智能也许已经到来了只是我们看不见

我们不知道自己正在看见的,究竟是什么。