谷歌DeepMind拿下2025 IMO金牌
这一结果得到了IMO组委会官方认证。
他们的解法在诸多方面都堪称惊艳。IMO的评委认为,这些解法思路清晰、表述精确,且大部分内容都简单易懂。
——IMO主席Gregor Dolinar教授
值得注意的是,Gemini仅用纯自然语言——英语完成了解题。
2024年,AlphaProof和AlphaGeometry 2破解了6题中的4题,获得28分,达到了银牌水平。进步速度令人惊叹!
自然语言解题,端到端推理
2024年的IMO,AlphaProof和AlphaGeometry 2在解题前,需要专家将问题翻译为「形式语言」,如Lean,在形式化语言中进行证明。需要两到三天的计算时间。
2025年的IMO,Gemini Deep Think以自然语言端到端运行,从官方问题描述中生成严谨的数学证明,并在4.5小时的比赛时间限制内完成。

Deep Think模式
团队使用了Gemini Deep Think的高级版本——一种针对复杂问题的增强推理模式。
结合并行思考技术,允许模型同时探索多种解题路径,最终整合出最优答案。这种多线程推理方式,突破了传统单一线性思考的局限。
谷歌对Gemini进行了新颖的强化学习训练,让其利用更多步推理、问题解决和定理证明数据。
此外,谷歌研究团队还通过以下方式,进一步升级了Gemini版本:
更多思考时间。
获取过往问题的一系列高质量解决方案集。
提供解决IMO问题的通用提示与技巧。
这种「训练+知识库+策略」的组合,让Gemini在IMO的舞台上大放异彩。
团队介绍
Thang Luong
官博称,Gemini Deep Think整体技术方向由Thang Luong带队,他于2016年获得斯坦福大学计算机科学博士学位,在读博期间开创了深度学习在机器翻译领域的应用先河。
在Google DeepMind工作期间,Thang Luong构建了多个语言(QANet、ELECTRA)和视觉(UDA、NoisyStudent)领域的尖端模型。
2020年,他推出全球最强聊天机器人Meena项目,该项目后续发展为Google LaMDA、Bard及现Gemini系列,也是经典注意力机制「LuongAttention」的发明者。
自2022年起,Thang Luong共同领导Bard多模态功能的开发,并担任能解决IMO级别几何题的AlphaGeometry项目负责人。
2024年,作为AlphaGeometry 2开发负责人之一,Geimini摘得2024年IMO银牌。
AI+数学未来
AI为数学做出贡献的潜力才进一步展现,能够解决更复杂的数学问题。
将流畅的自然语言能力与严谨的推理能力(包括形式化语言中的可验证推理)相结合的AI智能体,将成为数学家、科学家、工程师和研究人员不可或缺的工具。
OpenAI的参赛
谷歌DeepMind早在7月19日周五下午就拿下了金牌,之后在等内部验证流程才未对外公布。OpenAI赶在周六凌晨抢发,并未经过任何IMO官方的独立验证和评分。
IMO组委会还特地明确要求,希望各个大模型公司在闭幕式一周后再公布成绩,不要抢走孩子们的风头。但OpenAI的Naom Brown却表示,他们的确尊重了IMO的要求,是等闭幕式之后才发布的。
评注
关于形式化和自然语言谁才是数学的未来,当时难以下定论。我认为形式化语言Lean,大概会成为AIMath的通用语言。
2026年5月21日,OpenAI创造性的推翻了平面单位距离猜想,可见OpenAI在数学上的能力很强。2025年的IMO,OpenAI虽没有得到官方确认,但基本可以推测那时它的大模型确实达到了金牌的水平。
前沿的大模型,应该不会参加2026年的IMO,它们把目光投向了更有意义、更有难度的大规模自动形式化和开放问题的研究。就像AlphaGo Zero,围棋是它的一个试验场,IMO是大模型的试验场,它们急速驶来,又急速转向别的方向。
这一事件,让人们更加坚信AIMath的未来。
夜雨聆风