夜雨聆风学习资料网

ARTICLE · 1057528

OpenAI神秘模型24天攻破100+世界级数学难题

OpenAI 神秘模型 24 天攻破 100+ 世界级数学难题

文凯AI 观察 | AI 行业前沿观察 · 数据洞察

  

北京时间 9 月 21 日,OpenAI 在官网发布一则公告,宣布成立"数学与人工智能顾问组"(Advisory Group on Mathematics and Artificial Intelligence)。九位数学家、常设于普林斯顿高等研究院、独立于公司运作、成员不领薪水。单看这件事,它的分量并不算大。真正让人心头一紧的,是公告里顺手写下的另一句话:一个 8 月 28 日开始训练的内部模型,已经解决了数学多个领域中 100 多个长期悬而未决的开放问题。从开始训练到攻破 100 多道难题,中间只隔了 24 天。

这不是一篇论文,也不是一次发布会,而是一家公司第一次公开承认:它自己也没跟上自家模型的脚步。公告原文写道,这个模型在数学上的进展速度令 OpenAI 内部的数学家感到惊讶,公司内部正在讨论,要以何种方式告知学界。

一、24 天,100 多道题:发生了什么?

公告给出的时间线很紧:8 月 28 日开始训练,到 9 月 21 日公告发布,仅 24 天。这 24 天里,它解开的不只是一道题。OpenAI 说,它解决了横跨数学大多数领域的 100 多个开放问题,其中包括此前已经公布过的纳维-斯托克斯存在性与光滑性问题——克莱数学研究所 2000 年提出的七个千禧年奖难题之一,困扰数学界约 90 年。

纳维-斯托克斯方程描述流体如何运动,飞机设计、天气预报、血液流动都依赖它。核心问题是:一个初始平滑的流体,会不会在有限时间内发展出"奇点",也就是流速无限增长。OpenAI 的解法很具体:设计一个向内旋转、不断拉长的涡流,像一根越拧越紧的意面,中心区域缩小、转速加快,但能量始终保持在物理定律允许的有限范围内。证明同时给出了 Lean 语言的形式化验证,而完成这项验证的,是另一款模型 GPT-6 Astra,用了大约 17 个小时。

而证明最后由另一个模型来验,这一点更微妙。自己出题、自己解题、自己判分,这个闭环一旦形成,人类数学家在中间的位置就被压得极窄。

二、一万个智能体,88 小时,两千多万美元

这些题是怎么打下来的?OpenAI 披露的方法,比结果更能说明行业走向。他们让大约 1 万个 AI 智能体协作,用约 88 小时生成了纳维-斯托克斯的证明。智能体被分成多个小组,组内可以互相通信,每个问题都有不同小组用不同版本的题目表述去攻。智能体手里有工具:可以读一个缓存的互联网副本,也可以运行代码。

据估算,这次的计算成本可能高达 1500 万至 2250 万美元,折合人民币约 1.01 亿至 1.51 亿元。而克莱研究所为千禧年难题准备的奖金是 100 万美元,OpenAI 表示不打算申领。花一亿多人民币去拿一百万美元的奖金,这笔账显然不是按奖金算的。它买的不是那道题的答案,而是"AI 能解决最难问题"这个结论本身,以及随之而来的定价权和话语权。

更值得注意的是并发规模。一万个智能体同时工作、互相通信、分工试错,这意味着"解题"第一次具备了流水线的形态:不是等待某个天才的灵光一现,而是用足够多的并发和足够长的运行时间,把不可能变成概率问题。算力在这里不再只是燃料,而是组织方式本身。

关键洞察:1 万个智能体 × 88 小时 × 2250 万美元 = AI 首次以"流水线"方式攻克人类顶尖智力难题。数学证明的成本曲线,可能从此永久改变。

三、数学界的"复仇者联盟":25 位菲尔兹奖得主的愤怒

OpenAI 宣布纳维-斯托克斯突破的三天后,数学界直接"炸"了。27 位菲尔兹奖得主联合签署公开信《AI 在数学领域的严重错位》,签名的大佬横跨了 48 年的菲尔兹奖历史,包括陶哲轩、邓煜、彼得·舒尔茨、皮埃尔·德利涅、吴宝珠、马丁·海雷尔等。

他们的愤怒不是针对 AI 本身。公开信开篇明确承认,AI 有加速真正数学研究的巨大潜力。真正让数学大佬无法接受的,是公布的方式。他们批评道,各大 AI 巨头把人类几百年沉淀下来的公开数学难题,当成跑分刷榜的 benchmark。解题这项指标,与数学研究所追求的理解,可能发生偏离。而且,巨头仓促公布之后,根本没有时间对思路进行梳理,以及新方法的充分撰写。这种功利化、黑箱化的暴力破解,看似风光,实则给数学界留下一地鸡毛。

公开信警告:如果 AI 能解决最困难的问题却不需要人类深度参与,人类对数学的理解可能被削弱。数学家真正质疑的,是 AI 跳过的那部分,恰恰是数学研究价值的核心所在。

     

24 天攻克时间线:从训练启动到成果发布

四、九人顾问组:有发言权,没有刹车权

为了平息众怒,OpenAI 请来了 9 位全球顶尖数学家,正式成立一个独立的数学顾问组。名单堪称"数学界复仇者联盟":菲尔兹奖得主 Timothy Gowers、Martin Hairer,理论物理和数学界大神 Edward Witten(爱因斯坦后继者、首位获得菲尔兹奖的物理学家),还有偏微分方程与流体力学世界级权威 Camillo De Lellis。

OpenAI 给这支队伍的任务,主要有三件:帮忙判断新数学成果到底有多重要;讨论这些结果该怎么发布、什么时候发布;确保 AI 时代的数学研究,依然遵守学术和职业规范。还有一个很有意思的设计,这 9 个人不拿 OpenAI 一分钱。他们可以公开批评 OpenAI,可以提出公司未要求的建议,可以自行决定成员变更。

但有一个关键限制:顾问组不负责建议 OpenAI 如何控制内部数学研究的进度。9 位学术泰斗有公开发言权,但没有"刹车权"。这就像一个熟悉的结构:投资人给你董事会席位,却保留了对 CEO 的任免权。顾问组是 OpenAI 递向数学界的一座桥,同时也是它给自己留下的一条边界。

人类 vs AI:数学证明成本对比

数年

人类数学家证明周期

24天

AI 攻克 100+ 难题

效率提升约 100 倍

数据来源:OpenAI 官网、公开报道

五、Lean 验证:绕开同行评议

OpenAI 同时给出分析证明和 Lean 形式化验证。Lean 是一种可以把证明逐行翻译成机器可检验代码的语言。当 OpenAI 同时给出分析证明和 Lean 形式化,它实际上绕开了"同行评议"这道最慢的关卡——把争议从"对不对"压缩成了"代码能不能跑通"。

形式化验证的出现,把数学从一门靠声誉运转的学问,推向了一门靠算力运转的学问。这里有个容易被忽略的对比。Anthropic 上个月宣布其内部模型在黎曼猜想上取得进展,把临界线上零点比例的下界从 41.6% 提高到了 67.2%;谷歌的 AlphaProof Nexus 攻破了 2 道悬置 56 年的难题;OpenAI 此前还宣布 AI 推翻了具有 80 年历史的几何猜想。

数学这条最古老的赛道上,几家顶级实验室已经进入"季度级报喜"的节奏。这不是单点突破,而是一个领域的整体提速。当一个模型能在 24 天里横跨多个领域解题,说明它掌握的不再是某种技巧,而是方法本身——这才是最需要被认真对待的变化。

六、冷思考:AI 能解题,但能理解数学吗?

纽约大学数学教授 Tristan Buckmaster 和 Anthropic 研究员 Levent Alpöge 曾质疑 OpenAI 是在听闻他们的进展后,才把资源转向"外力驱动"方法。争议点在于:AI 公司为了商业竞争,正在把神圣的名变成能力排行榜的垫脚石。

数学家陶哲轩把这类难题比作吸引科学家前往的"灯塔",同时警告:如果 AI 能解决最困难的问题却不需要人类深度参与,人类对数学的理解可能被削弱。曾在 OpenAI 对齐团队担任访问研究员的德州大学教授 Scott Aaronson 讲了个让人心头一紧的地狱笑话:他 13 岁的女儿开玩笑说:"如果我想当数学家,看来大概只剩两周了。"

菲尔兹奖得主 Figalli 预测,数学家的角色,正在从"解题的人"被迫变成"判断哪些题值得解的人"。如今,OpenAI 毫不掩饰地确立了新世界的潜规则:发现归机器,验收和解释归人类。物理、化学、生物迟早也会走到这一步,每一门学科都会有这么一天。数学,只是先到了而已。

七、AI 成果评审:一个新的创业赛道?

这次事件里最有意思的一幕,不是证明本身,而是争议催生的制度需求。历史上,当一项技术跑得比制度快时,制度总会以"先请专业共同体入场"的方式补位。核能如此,基因编辑如此,生成式 AI 的版权规则也是如此。数学界的这次入场,不过是同一剧本的重演。

它传递的信号很明确:AI 公司越强,越需要一套外部权威来替它的成果盖章。对创业者而言,这一天真正该记住的不是 100 道题,也不是那两千多万美元的账单,而是一个转折:AI 已经从"被验证的工具",变成了"需要被验证的结论生产者"。

当模型开始产出原创发现,谁来定义什么算发现、什么算可信、什么算署名,都还是空白。空白处,就是新公司出生的地方。闸门刚刚装上,钥匙还没配好。能力侧在狂奔,规则侧在追赶。而规则侧每一次补位,都会催生一批新岗位、新工具、新公司。

文凯AI 观察

AI 行业前沿观察 · 数据洞察

关注公众号,不错过每一次改变行业的财报与技术信号

持续更新优质内容

相关学习资料