

2026年7月30日早晨,康奈尔大学应用数学家亚历克斯·汤森(Alex Townsend)像往常一样坐到电脑前。
过去整整一年,他无数次向人工智能抛出同一个折磨了数学界22年的世界级猜想。在此之前,模型的回答要么是漏洞百出的胡说八道,要么卡在同一个死胡同里原地打转。
但这天早晨,GPT-5.6吐出了一行全新的回答,末尾赫然附着一篇刚刚上传三天的预印本文档链接。
论文标题极其干脆:《数值域是一个2-谱集》(The Numerical Range Is a 2-Spectral Set)。

▲ 康奈尔大学数学家Steven Strogatz转发并惊呼:“数学与AI前沿最新的疯狂故事!”
汤森带着极大的怀疑点开论文
当他扫到作者一栏时,整个人彻底愣住了:
作者没有任职于普林斯顿、牛津或其他数学研究所。他的工作单位,是北京协和医院;身份,是一名神经外科住院医师
这位医生根本没有受过专业的高等纯数学训练。他在医院值班、开颅做手术的空档,给AI下达了一套精密严苛的指令,随后关上电脑去上班。
AI在完全断网的设定下,自主推演、自我博弈了整整16个小时。
当医生结束临床工作后,一份声称跨过这道二十多年难关、等待更广泛核验的证明已经出现在屏幕上。
困扰人类22年的“魔咒”:那个卡在2.414与2之间的叹息之壁
要理解这件事有多震撼,不妨用几分钟看看:这个让全世界数学家挠头22年的 Crouzeix猜想(克鲁泽猜想),到底在争什么?
即便你只有高中数学基础,也完全能听懂。
在现代工程、航天、量子物理和医学成像里,最底层的数学骨架就是矩阵(你可以把它想象成一张巨大的数字表格)。
要研究一个矩阵的性质,数学家通常会去找它的特征值。特征值就像一个人的“骨架身形”,能告诉你这个系统在某些特定方向上的伸缩比例。
但特征值常常会“说谎”
在现实世界里,绝大多数矩阵都是“非正规矩阵”。这种矩阵极其诡异:它的特征值看起来可能很小、很温顺,但系统在运转过程中,局部能量却会突然像海啸一样暴涨,直接把物理系统干崩溃。
为了看清矩阵可能造成的实际影响,数学家发明了一个更丰满、更诚实的工具,数值域(Numerical Range)。

▲ 维基百科上的Crouzeix猜想页面:一个连接几何与算子范数的宏大命题
如果说特征值只是矩阵的几个孤立“骨骼点”,那么数值域就是矩阵在所有方向上疯狂晃动时,扫出来的全方位能量包络圈(复平面上的一块紧凸区域)。
2004年,法国著名数学家米歇尔·克鲁泽(Michel Crouzeix)提出了一个极其漂亮的猜想:
把任何一个多项式函数套进矩阵里,矩阵最终爆发出来的最大算子能量,绝不会超过这个函数在“数值域”里最大标量值的,整整 2 倍!
公式写出来极其精炼对称:$$|p(A)| \le 2 \max_{z \in W(A)} |p(z)|$$
这个“常数2”如果被证实,人类就能把复杂的矩阵函数计算、超级计算机算法的误差分析,稳稳地锁在一个极小、极确定的几何边界内。
然而,为了证明这个小小的“2”,人类顶尖数学家苦战了20多年:
- 2004年
:猜想提出。 - 2007年
:克鲁泽本人拼尽全力,证明了这个常数不会超过 11.08。 - 2017年
:克鲁泽与合作者利用极其精巧的对称性技巧,把常数死死压到了 $1+\sqrt{2} \approx 2.414$。
全世界最好的专家用尽了分析学工具箱里的所有武器,最终在 2.414 面前撞得头破血流。
从2.414到2,看似只差0.414,却成了一道不可逾越的叹息之壁。
谁是金山木?拿手术刀的医生,为什么撞上了纯数学圣杯?
提交这份候选证明的人,名叫金山木(Shanmu Jin)。

▲ 论文作者金山木(Shanmu Jin),北京协和医院神经外科博士后、住院医师
看一眼他的履历,你会被这种纯粹的跨界硬核震撼:
本科毕业于北京大学地质学专业; 随后通过协和医学院严苛的“4+4”医学培养通道,跨界拿到临床医学博士; 如今是北京协和医院临床医学博士后,兼任神经外科住院医师。
他研究这个猜想,源头是治病救人的现实需求。
在神经外科领域,金山木从事经颅超声的前沿研究,医生试图用超声波精准穿透极其复杂的人体颅骨结构,去探测和治疗脑部病变。
超声波在颅骨骨缝、脑组织之间的折射与衰减,在数学模型里映射出的正是极其凶险复杂的非正规矩阵算子!
为了把颅脑超声的计算精度推向极致,金山木白天在手术台旁争分夺秒,晚上自学矩阵分析和算子理论。
在自学的漫漫长夜里,他遇到了那个闪闪发光、却悬置了22年的 Crouzeix 猜想。
“除了大学理工科必修的高数基础,”金山木在给美国学者的邮件里平静地写道,“其余的一切数学知识,全部都是自学的。”
揭秘神级Prompt:16小时“AI角斗场”,究竟是怎么搭出来的?
很多人以为,用AI解数学题就是随手打一句“请帮我证明克鲁泽猜想”。
如果这么简单,全世界的数学家早就集体失业了。
金山木之所以能创造奇迹,是因为他构建了一套极其硬核的任务约束契约。他借鉴了顶级实验室关于复杂图论证明的方法论,并针对数学公理体系做了深度的工程改造:

▲ 金山木在GitHub开源的完整论证、提示词与Lean 4代码库
这套让GPT-5.6狂奔16小时的工作流,核心包含了四条不可逾越的“铁律”:
- 绝对断网与底层推导
:明确封锁任何网页检索和现成文献引用,强制模型必须从纯粹的数学公理和底层逻辑出发做原创推理,彻底杜绝大模型在半成品上抄袭拼凑。 - 多智能体思维隔离(禁止跟风)
:启动多个平行的子智能体(Sub-agents),强制每个分支去尝试截然不同的数学流派。严禁子智能体过早趋同于同一个看起来诱人但残缺的思路。 - 残酷的对抗性审计(互殴验假)
:多个子智能体必须互为死敌,疯狂给对方的推导挑刺。规则规定:除非能掏出具体的反例彻底砸碎对方,否则不准随意否定某种路径;在严密无瑕的完整证明诞生前,绝对不准停机。 - 堵死所有“偷懒借口”
:把“完整证明必然存在”设为铁设前提;严禁将问题降维转化成另一个未证命题;严禁拿特定数字的计算验证来冒充一般性证明。
设置好全部参数后,金山木离开电脑,转身处理临床工作。
在无人的16个小时里,GPT-5.6的推理内核在静默中掀起了狂暴的算力海啸:无数个子智能体在数千个抽象维度里厮杀、碰壁、反驳、推倒重来。
传统人类数学家在攻克常数2时,总是执着于更暴力的“硬估计”;
而AI在经历无数次推演后,极其冷酷地绕开了这条死路,它通过一套极其精妙的采样策略,把整个庞大猜想直接化约成了一个极其简洁、优美的正性条件!
等金山木完成临床工作后,屏幕上静静躺着一份完整的候选证明。
猜想提出者参与核验:三位专家认为证明正确
当康奈尔大学的汤森教授和华盛顿大学的格林鲍姆(Anne Greenbaum)读完这份来自中国医生的预印本时,内心的震撼无以复加。
他们立刻联系了猜想的提出者,年逾古稀的法国数学宗师米歇尔·克鲁泽(Michel Crouzeix)。

▲ 金山木在Preprints.org发布的预印本文档
三位数值分析专家对手稿进行了细致审读。
结论一致:他们相信这份证明是正确的。 但它仍是预印本,正式同行评议尚未完成。
为了方便外界核查,金山木在 GitHub 上公开了手稿、提示词、Lean 4 形式化与公理审计等材料。
然而,更具科幻色彩的“神级巧合”还在后面。
就在金山木论文公布仅仅 8天之后,荷兰与德国的两位数学家埃米尔·洛里斯特(Emiel Lorist)和费利克斯·施温宁格(Felix Schwenninger)在预印本网站 arXiv 上也扔出了一篇论文:他们用完全不同的算子扰动理论,同样独立攻克了克鲁泽猜想!

▲ 8天后,两位欧洲数学家在arXiv发布的第二篇独立证明
在论文末尾的AI使用声明中,两位数学家坦诚写道:他们同样在7月下旬深度使用了 GPT-5.6 Sol Pro 探索证明策略,而且在看到金山木的手稿之前,他们就已经完成了人机交互推导。
22年未解的难题,在相隔约八天的两份预印本中出现了两条不同的证明路径;两组作者都披露使用过同一款AI模型。
毒辣洞察:当AI撬开象牙塔,人类科研的规则被彻底重写
这个发生在2026年夏天的故事,注定会载入人类科学史。
它带给我们的绝不仅仅是一个“医生业余做数学题”的传奇八卦,而是两记直击灵魂的时代重锤:
1. 象牙塔的“灵感垄断”正在被彻底砸碎
在过去,想要触碰算子理论、代数几何这种人类纯智力的“名题圣杯”,一个人必须在顶级数学圈子里浸润十几甚至几十年,掌握汗牛充栋的专业行话和圈内隐性知识。
但今天,一个带着临床真实计算痛点的神经外科医生,凭借强烈的自学意愿和顶级的提示词工程架构,跨界击穿了专业圈子的天花板。
发现的权力,正在从少数顶尖同质化的学术作坊,扩散到每一个拥有硬核问题意识的跨界者手中。
2. 人类科学家的核心壁垒,从“苦思冥想”变成了“设计约束与判断真伪”
过去,大科学家往往比拼的是谁的脑力能支撑几百步复杂的代数推演。
但在拥有长程推理能力的多智能体系统面前,AI可以在一晚上穷尽人类几辈子才能试完的弯路。
在这场人机协作中,人的决定性力量体现在哪里?
是金山木在经颅超声中提炼出真问题的敏锐洞察; 是他编写提示词时,给AI套上的“防偷懒、反跟风、强制对抗”的严苛契约; 是克鲁泽和汤森等老牌学者一眼看出这篇论文是“真黄金”还是“假巧合”的深厚终审功底。
正如康奈尔教授汤森在文章末尾写下的那句意味深长的感叹:
“仅仅几年前,我们还很难想象人工智能能在重大数学猜想的证明中贡献决定性的原创想法。
而今天,这一切就真真切切地发生在我们的眼前。”
属于少数天才冥想的古典科研时代正在落幕。
一个由人类提问、AI狂奔、跨界者破局的全新科学大航海时代,已经轰然撞开了大门。

夜雨聆风