夜雨聆风学习资料网

ARTICLE · 1152941

四年前连小学数学都算不对,如今AI开始挑战百年数学难题

四年前连小学数学都算不对,如今AI开始挑战百年数学难题
四年前,ChatGPT连一道小学数学题都可能算错。
你让它解一道应用题,它能写出一大段看似合理的推导,最后却给出错误答案。你指出问题,它还可能非常礼貌地道歉,然后自信满满地再错一次。
谁能想到,短短四年后,当年那个被嘲笑数学不好的AI,已经开始挑战困扰人类数学家数十年甚至更久的研究难题。
2026年10月6日,OpenAI公布了一批由内部前沿模型生成的数学研究成果:722份研究手稿、372组相关成果,涉及约4000道评估问题,其中不少涉及尚未解决的数学研究课题。部分证明还提供了可供计算机检查的Lean形式化版本。
这些成果尚不等于数百个数学难题已被正式攻克,但它们已经足够说明:AI的数学能力,正在经历一场惊人的进化。
1.2022年,ChatGPT能写文章,却经常算错数学题
2022年11月,ChatGPT正式发布。凭借流畅的对话能力,它迅速成为全球关注的焦点,但数学也成为早期大语言模型最容易翻车的领域之一。
当时的ChatGPT可以解释微积分、线性代数,却可能在多步骤的基础应用题上出错。原因在于,早期大语言模型主要依靠预测文本规律生成答案,虽然能够模仿数学推导,但并不能保证每一步计算和逻辑都正确。
这也暴露了当时AI的一个核心问题:会解释数学,不代表真正擅长数学推理。
2.2024年:推理模型登场,数学正确率大幅提升
2024年9月,OpenAI发布o1系列推理模型,成为AI数学能力进化的重要转折点。
o1开始在回答问题前投入更多计算资源进行多步推理,能够尝试不同解法、检查错误并调整推导过程。这种变化很快体现在数学测试成绩上。
根据OpenAI公布的2024年AIME(美国数学邀请赛)评估数据:
GPT-4o:平均正确率约12%
o1:单次作答平均正确率74%
o1:通过64次采样共识,正确率提升至83%
o1:通过更多候选答案和评分筛选,正确率可达93%
从约12%到83%,相同测试下的正确率提升超过70个百分点。
OpenAI o1在AIME 2024数学测试中的表现
这说明AI数学能力的进步,已经不只是依靠更大规模的训练数据,而是开始通过更充分的推理来解决复杂问题。
3.2025年:AI数学奥赛达到金牌水平
2025年7月,AI在国际数学奥林匹克竞赛(IMO)上迎来标志性突破。
Google DeepMind的Gemini Deep Think在6道IMO题目中完整解决5道,获得35分(满分42分),达到金牌水平,成绩还获得了IMO官方协调员的认证。
更值得关注的是,2024年Google的AlphaProof与AlphaGeometry 2系统只达到银牌水平,拿到28分,而且需要人工将题目转化为形式化语言,部分计算耗时2—3天。
2024年Google DeepMind数学推理系统在IMO题目测试中达到银牌水平
仅仅一年后,Gemini就能直接阅读自然语言题目,在4.5小时的竞赛时间限制内完成证明,并获得金牌水平成绩。
同年,OpenAI也公布了其模型在IMO题目测试中达到金牌水平的结果。
2025年Gemini Deep Think以35/42分达到国际数学奥林匹克金牌水平
从2024年的银牌水平到2025年的金牌水平,AI已经开始在世界顶尖数学竞赛中展现强大的复杂推理能力。
4.2026年:AI开始参与真正的数学研究
如果说此前AI还在解决人类设计好的竞赛题,那么2026年,它已经开始尝试解决数学界尚未解决的开放问题。
10月6日,OpenAI公开了内部前沿模型生成的大规模数学研究成果。据披露,这次研究涉及约4000道问题,最终公开722份手稿,归为372组相关成果。
OpenAI公开的AI数学研究成果仓库
OpenAI还分享了部分研究过程及Lean形式化证明。部分成果平均消耗的计算资源,相当于内部模型使用ChatGPT Pro进行约3小时的思考。
这意味着AI已经不满足于在数学考试中拿高分,而是开始尝试提出研究级证明,参与前沿数学探索。
不过,目前仍需理性看待这些数据。722份手稿不等于解决了722道数学难题,能够通过形式化验证的部分证明,也不代表所有成果都已经获得数学界认可。 证明的正确性、原创性和研究价值,仍需要独立验证。
5.从会做题到参与科研,AI的下一步是什么?
回顾这四年的变化,AI数学能力的进化路线已经相当清晰:
2022年,ChatGPT能够解释数学知识,但经常在基础推理中出错。
2024年,o1通过更充分的推理,将AIME测试正确率从GPT-4o的约12%提升至最高93%。
2025年,AI在IMO题目上获得35/42分,达到国际数学奥赛金牌水平。
2026年,OpenAI开始公开AI生成的大规模数学研究手稿,尝试推动真实数学问题的解决。
为什么数学会成为AI能力突破的重要领域?一个关键原因在于,数学证明拥有相对明确的验证标准。相比写文章、做设计等主观性较强的任务,数学可以利用严格规则和形式化工具检查推理是否成立,这让它成为训练和衡量复杂推理能力的重要场景。
而这种能力未来也可能延伸到代码验证、芯片设计、物理研究等领域,让AI从知识检索和内容生成工具,逐渐变成真正参与科研工作的助手。
当然,AI距离独立开展可靠的数学研究还有很长的路要走。但仅仅四年,它就已经从一个经常算错应用题的聊天机器人,发展到能够尝试挑战数学研究的前沿。
从解答已知问题,到探索未知答案,AI正在跨过一条更重要的边界。
下一次突破,或许就不只是数学考试的满分成绩了。我们拭目以待。

相关学习资料