ARTICLE · 1136443
OpenAI一次公开722篇数学手稿:真正值得关注的,不只是AI又会做题了
OpenAI一次公开722篇数学手稿:真正值得关注的,不只是AI又会做题了OpenAI 这次没有发布一个新的聊天产品,也没有公布新的 API。 它做的是另一件更值得科研圈关注的事:把内部前沿模型产生的一批数学研究结果,直接放到了公开仓库里。 根据 OpenAI 10 月 6 日公布的信息,目前这批材料包括722 篇数学手稿,归入 372 个结果家族。这些成果主要来自一个尚未公开的内部前沿模型。 真正值得关注的,不只是“AI又解出了多少题”,而是 OpenAI 开始尝试把结果、证明材料、模型推理摘要和计算成本一起公开。 首先,是数学研究结果本身。 OpenAI 表示,在模型开发过程中,它一直让模型尝试解决开放研究问题。随着传统数学评测逐渐无法区分模型能力,公司扩大了这类研究测试。 整个评估过程中,模型大约被提交了4,000 个问题,最终整理出目前这 722 篇手稿和 372 个结果家族。 但这里需要注意: 722 篇手稿并不等于 722 个完全独立的新数学突破。 一个“结果家族”可能同时包括主要结果、补充论证、推论或不同证明方式,因此更准确的统计单位是这 372 个结果家族。 这次公开内容中,一个很重要的部分是Lean formalization。 Lean 是一种可以让计算机检查数学证明逻辑是否成立的形式化语言。 OpenAI 已经为许多结果提供了 Lean 版本,并表示还会继续补充。 但它同时明确提醒:并不是所有论文都已经完成形式化验证,一些尚未形式化的结果仍可能存在问题。 这句话其实非常重要。 它意味着 OpenAI 并没有把这 722 篇材料包装成“已经全部证明正确”的最终答案,而是把它们作为一批仍需要数学社区继续验证的研究成果公开。 这次 OpenAI 还公开了10 份模型推理摘要。 它们涉及从数论、复杂性理论到数学物理等不同方向,包括 π 的无理数指数、Mahler 猜想、Kaplansky 直接有限性猜想以及量子 Heisenberg 铁磁体等问题。 除此之外,OpenAI 还给出了一个很少见的数据: 平均每个结果所消耗的计算量,大约相当于这个内部模型使用 ChatGPT Pro thinking 运行三小时。 这并不是说研究人员真的打开 ChatGPT Pro 连续聊了三个小时,而是 OpenAI 用 Pro thinking 的计算量作为一个方便理解的换算单位。 这让外界第一次能更具体地估算:让前沿模型做真正的数学研究,大概需要多少推理计算。 过去我们看到很多 AI 数学新闻时,往往只能看到一个结果: 模型答对了。 但科研真正关心的问题是: 这个结果能不能被别人检查? 证明有没有漏洞? 过程是否可以重复? 如果发现错误,之后怎样修订? 这次 OpenAI 的 GitHub 仓库专门设计了论文版本和引用机制。后续修正会保留历史版本,而不是直接覆盖原来的文件。 这已经开始接近真正科研基础设施的逻辑,而不只是一次模型能力演示。 这里还有一个很值得注意的背景。 OpenAI 表示,在设计这次发布方式时,它咨询了Institute for Advanced Study(普林斯顿高等研究院)的 Advisory Group on Mathematics and Artificial Intelligence,并参考了这个独立顾问组关于 AI 数学成果发布方式的建议。 OpenAI 还表示,未来会继续探索由数学社区托管、符合相关指导原则的发布平台。 这说明 AI 实验室现在面对的已经不只是: 而是另一个问题: 这可能才是今天这条新闻最重要的地方。 短期内,其实没有一个新的 API 可以马上调用。 OpenAI 目前没有公布这个内部模型的正式名称,也没有给出 API 价格、开放时间或下载方式。 所以它暂时还不是一个“今天就能接入产品”的新闻。 但是 OpenAI 已经明确表示,它正在研究如何负责任地发布产生这些成果的模型。 一旦这种能力真正开放,受影响的可能就不仅是数学家。 定理证明、科研助手、算法验证、芯片设计、形式化验证,甚至部分工程研发流程,都可能出现新的工具链。 未来最值得关注的不是“OpenAI又宣布解决了几个问题”,而是三件事: 第一,数学社区能否独立验证这些结果。 第二,越来越多论文能否完成 Lean 等形式化验证。 第三,产生这些成果的前沿模型最终是否会开放,以及会以研究访问、ChatGPT 功能还是 API 的形式出现。 目前 OpenAI 自己已经承认,这批材料处在不同的验证阶段,一些未形式化结果仍可能有问题。 所以现在下结论说“AI已经攻克数百个重大数学难题”,仍然太早。 但可以确认的是: AI科研正在从展示答案,进入公开证明、开放检查和建立研究规范的阶段。 如果这个方向继续发展,那么未来衡量一个科研 AI 的标准,可能不再只是: 它能不能给出答案。 而是: 它能不能给出一个全世界都可以检查的答案。 Pixel Phoenix AI Research Lab 2026年10月7日 分类:AI News #OpenAI#AI科研#数学#Lean#FrontierModel#ScientificAI#AIMath
这次到底公开了什么?
第二个变化:开始让计算机检查证明
第三个变化:连模型怎么得出结果,也开始公开一部分
为什么这件事比“AI做对了一道难题”更重要?
OpenAI为什么现在要这样做?
“模型到底聪不聪明?”
当 AI 开始生产真正的科学成果以后,这些成果应该怎样进入人类科研体系?