夜雨聆风学习资料网

ARTICLE · 1137000

AI写出722篇数学手稿,谁来给它判卷?

AI写出722篇数学手稿,谁来给它判卷?

一篇数学论文,读懂它往往就要花不少功夫。现在,OpenAI把722篇由内部模型生成的数学手稿放到了网上。

看到这个数字,很多人可能会问:AI已经厉害到这一步了?接着,一个更具体的问题就来了:这些答案,谁来判卷?

10月6日,OpenAI宣布公开新一批AI数学研究结果,并提供部分证明的计算机核验材料。这批成果来自尚未公开发布的内部模型。[1]

截至本文核对时,官方目录列有722篇手稿,分为372组相关成果。一组里可能包含主要结果、配套论证、推论或不同证明,因此,不能把篇数直接换算成已经解决的世界难题数量。[2]

先看清它交了什么

在学校做题,题目和评分标准通常已经准备好了。前沿研究多了几层难处:问题有没有问准确,证明有没有跳步,结论与已有研究是什么关系,都需要检查。

这批手稿也有明确的核验边界。官方项目说明:成果处于不同验证阶段,并非每篇都有Lean形式化证明,部分尚未形式化的结果可能存在问题。[2]

这里的Lean,可以先理解为一种让数学推理接受计算机严格检查的工具。研究者把命题和证明写成系统能够检查的形式,再检查推理是否符合规则。[1]

对普通读者来说,有一点很关键:看到“数学手稿”和看到“经充分检验、被学界理解的成果”,意味着不同的证据状态。判断这条新闻,得把每份材料的状态看清楚。

这也解释了为什么我愿意关注这次公开。读者终于有了可追踪的材料:能查看手稿、核验进度以及后续修订。科技新闻里那些漂亮的数字,开始有机会被逐项追问。

写出来以后,还得有人读懂

接下来这件事,与722这个数字同样值得关注。

9月29日,数学与人工智能独立顾问组发布了一份关于AI数学成果公开的建议。文件强调,人类理解数学仍然至关重要;对于发布大量尚未被人充分理解的成果的实验室,应承担支持后续理解工作的责任。[3]

这个要求很容易让人联想到一间课堂。假如有人交来一份答案,推导铺了几十页,读的人却说不清关键一步为什么成立,那么,课堂上的讨论显然还要继续。这个比喻只为说明“理解”的意义,实际数学核验远比课堂判卷复杂。

OpenAI在这次公告中也表示,将资助围绕AI数学成果的研讨会、会议和专题项目,并继续改进论文的引用与表述。[1]

于是,这条新闻里同时摆着两项工作:一项是模型继续探索问题,另一项是人们检查、理解这些探索留下的结果。两项工作怎样衔接,会影响这些材料最终能为数学带来多少价值。

它也关乎我们怎样使用AI

数学离日常工作似乎很远,“答案来得太快,核对跟不上”的场景却很熟悉。

让AI整理一份资料,它很快就能给出完整段落;请它分析一件事,几条理由也能排得整整齐齐。文字顺畅,会让人容易生出一种感觉:这件事已经弄明白了。

真要把这些内容用于汇报、写作或判断,仍有几件具体事要做。

先打开出处,看看原文说了什么。再核对时间、研究对象和适用条件。最后把事实与推测分开:哪些事情已经发生,哪些是作者的解释,哪些还只是可能性。

这几步当然需要时间。它们也让使用AI的人保有判断的依据。你可以同意一个结论,也可以找到足够具体的理由修改它。

我对这批数学手稿抱有兴趣,原因也在这里:如果其中的成果经得住检验,新的研究道路就可能由此展开;发现漏洞、修正表述,同样会帮助我们摸清模型的能力边界。后续的公开核验,值得继续看下去。

下一次再看到“AI取得重大突破”的标题,可以多问半句:它公开了什么证据,谁在核验,核验走到了哪一步?

这半句,会让一次点击多一点收获。

资料来源

[1] OpenAI:Sharing AI progress in mathematics,2026年10月6日https://openai.com/index/sharing-ai-progress-in-mathematics/

[2] OpenAI官方数学成果库:README,2026年10月7日核对https://github.com/openai/math

[3] 数学与人工智能独立顾问组:Responsible Release of AI-Generated Mathematics,2026年9月29日https://agmai.org/general-sep29/

相关学习资料