2000美元、十道悬置数十年的数学难题、249页证明手稿、全部附带机器可检验证书。 这是OpenAI在2026年8月1日扔向数学界的一颗核弹。
然后,不到24小时,核弹被人拆了一半。
Anthropic研究员Levent Alpöge随后在X上写道:"24小时后,我用Fable拿到了其中一半。"
完全自主通用提示词不联网甚至刻意屏蔽了OpenAI发布的所有解答,防止任何信息泄漏。
按照Alpöge的说法,一天之内,一个已经上线、人人可用的模型,在一台笔记本前,由一个人,复现了五项。
这到底意味着什么?
十道题,十声惊雷
先说OpenAI到底做了什么

▲ OpenAI官网发布《Ten advances in mathematics and theoretical computer science》
8月1日,OpenAI在官网发布文章Ten advances in mathematics and theoretical computer science。他们宣称,尚未公开发布的下一代模型家族Astra的一个内部版本,独立解决了数学与理论计算机科学中的十项长期开放问题。
这些题是数学家们悬挂在黑板上几十年、反复碰壁、无人能解的硬骨头,远超奥数竞赛或大学期末考试的范围。
non-sofic群的存在性,一个群论中心问题,追溯到Gromov等人1999年前后的工作;Connes刚性猜想的反驳,牵涉von Neumann代数的深层结构;permanent的电路下界,理论计算机科学中衡量计算本质难度的经典战场;高维球体填充的上界改进,号称自1978年以来的首次量级突破;三个Erdős问题的解决,涵盖多色Ramsey数的超指数下界和极值图论……

▲ GitHub仓库 openai/ten-proofs,可见各项证明的Lean 4文件
每一项都附带Lean 4机器可检验证书,可在形式化定义的框架内检查编码后的推导链。249页手稿,推理过程走查,代码仓库,全部公开。
而最让人咋舌的那个数字是:生成这一切的token成本,合计约2000美元。

▲ Noam Brown称十项突破合计生成成本低于2000美元
OpenAI研究员Noam Brown在X上补充说明:他们也尝试了其他重大问题,"遗憾的是还没有千禧年大奖问题(暂时)",并且"每个问题上也没花很多,测试时算力还可以再往上推"。
这句话的潜台词令人不寒而栗,还没到极限。
"24小时,一半"
接下来出现的消息,又把关注点转向了复现速度。

▲ Alpöge宣布:24小时内用Fable复现了一半
8月2日,距OpenAI发布不到24小时,Anthropic研究员Levent Alpöge,就是一个月前用Fable找到1939年Jacobian猜想反例、震惊数学界的那位,引用了OpenAI数学负责人Sébastien Bubeck的帖子,写道:
"so after 24h i have half of them with fable"
然后他列出实验设定:完全自主,通用提示,不联网,外加额外的防泄漏措施。 他特意强调,这套操作流程和此前单位距离猜想、Jacobian猜想的实验"类似",表明这套流程此前已经使用过。

▲ Alpöge补充:复现的是问题4-8,仅Ehrhart一题论证基本相同
在跟帖中他进一步明确:复现的是OpenAI十项清单中的第4到第8题,Connes刚性猜想、permanent电路下界、量子并行重复、最近向量问题(CVP)硬度、Ehrhart体积猜想。他认为只有Ehrhart这一题,两边找到了"基本完全相同"的论证路径;其余四项,Fable走的是不同的路,殊途同归。
按他的判断,其中四项来自不同的证明路径。
24小时这个数字
评论区迅速抓住了要害一位名叫Kaan Can Guven的用户写道:

▲ 评论者关注24小时的复现周期
24小时格外惊人
一家公司花了不知多久的研发周期,用尚未发布的最新模型,精心挑选、生成、检验、整理了十项数学成果,以249页论文加持隆重发布。一天之内,竞争对手的研究员声称用已经在线的旧模型,以通用提示词盲跑,复现了一半。
这里的焦点落在复现周期:数学发现的"独占窗口",可能已经缩短到以小时计。
一位评论者提出另一种猜测:Astra是OpenAI尚未发布的"下一代模型",但它可能仍非OpenAI内部最强的那个。

▲ 评论者猜测Astra并非内部最强模型
当发现速度超过评议速度
如果把镜头往回拉两个月,这一切就更清晰了。
5月,OpenAI公布了对Erdős单位距离猜想的AI反例,Fields奖得主Tim Gowers公开评价其可发表性,引发后续研究浪潮。6月,《莱顿宣言》发布,获国际数学联盟背书,措辞严厉:重大结果应进入可审稿渠道,而非仅靠新闻稿;不应把AI生成的证明署名为人类原创;不要用数学成果给商业模型做公关

▲ 莱顿宣言:AI与数学治理的框架性文件
7月,Alpöge用Fable找到了Jacobian猜想的反例,一个悬置87年的经典问题。《财富》杂志以“数学家面对AI带来的急速变化”为题报道此事。
8月1日,OpenAI放出十发齐射。8月2日,Alpöge在24小时内还击五枪。
时间线持续加速从"数十年悬而未决"到"24小时声称复现",两个AI系统在相近的时间窗口内,撞击同一批"成熟到可被搜索"的开放问题。
这正是莱顿宣言最担忧的场景:发现的速度,已经超过了评议的速度。
2000美元能买什么?
让我们诚实地谈谈那个"2000美元"。
Hacker News上的讨论聚焦实验透明度。Lean编译通过说明编码后的推导在形式定义下成立;而2000美元到底在算什么,仍有许多疑问:是只算成功路径的token?还是包含了所有失败尝试?总共试了多少题?放弃阈值是什么?每题跑了几次?选题本身又消耗了多少专家智力?

▲ Hacker News讨论帖,高分评论质疑实验透明度
这些问题非常重要因为"2000美元解十道世纪难题"和"2000美元是十次成功run的token费,但背后可能有成百上千次失败",讲述的是完全不同的故事。前者暗示一种颠覆性的成本革命,一个博士生读五年还未必碰得到的问题,模型花一杯咖啡的钱就解决了;后者则更接近现实中的科学探索,大量试错中筛选出少量成果,人类的品味、选题和判断仍然在幕后起关键作用。
Gary Marcus的批评也精准地戳到了另一个痛点:OpenAI没有对照组。

▲ Gary Marcus质疑无对照组与公关口径
而FrontierMath相关研究者Elliot Glazer在Alpöge帖下的提问则揭示了一个尴尬的使用鸿沟:普通人把同样的难题丢给Fable,为什么常常只得到一条无尽思维链,直到上下文窗口崩溃? "能出结果"和"可复现的研究工作流"之间,仍隔着一道名叫Levent Alpöge的鸿沟。
品味、理解与最后的护城河
Lean证书能证明推导链条在形式定义下没有逻辑洞。但它不能证明:定义是否被悄悄弱化了?选题是否经过精心挑选?自然语言论文中的叙述是否忠实对应了形式化声明?数学社区是否接受这种归因方式?
更深的焦虑来自职业层面当模型能在一天内复现刚发布的研究级成果,训练"证明技巧"的边际价值正在下降。但选择问题、解释意义、连接不同领域、设计定义与形式化策略,这些被数学家称为"品味"的东西,机器仍然拙于模仿。正如Kevin Buzzard所强调的:以数学家名字命名的,往往是提出问题的人。
人类最后的护城河,或许将更多落在提问上。
尾声:一场刚刚开始的竞赛
截至发稿,Alpöge承诺的完整PDF仍在上传中;OpenAI侧的论文、推理走查与Lean仓库已全部公开;十项结果的领域专家评议仍在进行
我们目前能确认的事实边界是清晰的:OpenAI公开了一组附形式化证书的主张;Alpöge公开声称Fable在严格受限设定下于约一天内得到其中五项,并给出了题号与论证重合的初步判断。
至于"谁更强""数学是否终结""2000美元能否买到任意开放问题",这些说法都远远超出了目前的证据。
但有一件事已经无法否认:
我们正站在一个新纪元的门口 在这个纪元里,多个AI系统会在几乎相同的时间窗口内,沿着不同路径,撞向同一个真理。发现的周期从"年"压缩到"天",从"天"可能还将压缩到"小时"。
而数学界、科技界、甚至整个人类社会,还远远没有准备好迎接这个速度。
夜雨聆风