所有写在纸上的题,都将变得不值一提。 埃隆·马斯克站在自家Grok 4发布会上,对整个AI评估体系下了一纸判决书。
2025年7月9日,xAI正式发布Grok 4。二十万块GPU组成的Colossus集群轰鸣作响,强化学习被拉到与预训练同量级的规模,一个号称"最智能"的模型横空出世。发布会上最受关注的是马斯克的这段话:
"我们实际上正在耗尽能问AI的测试题。即便对人类来说荒谬地难、甚至几乎不可能的纸面问题,对AI也正迅速变得trivial。但有一件事是极好的裁判:现实。物理是法则,其他一切都只是建议。对AI的终极推理测试就是现实,造一辆车,造一枚火箭,创造一种新药。它行不行?现实是最终裁判。"


▲ Grok 4发布会次日,这段视频剪辑在X平台获得211.5万次观看
当博士试卷变成小学作业
要理解这段话的分量,得先看一组让人不安的事实。
MMLU,曾经的AI能力温度计,死了。 这个覆盖57个学科的选择题基准,几年前还被视为衡量语言模型"博学程度"的金标准。2023年GPT-4刚发布时,86%的得分率让整个行业为之震动。而到2025年中,前沿模型在上面的得分已经挤在95%以上的狭窄区间,分数不再能区分"很好"和"顶尖",温度计到顶了,液柱纹丝不动。
斯坦福HAI等研究机构给这个现象取了个冷峻的名字:benchmark saturation(基准饱和)。
GSM8K、HumanEval、GPQA……一张又一张试卷被做穿。行业像一台永不停歇的出题机器,疯狂地制造更难的考试,试图找到那条"模型还不行"的分界线。而分界线一次次后退,后退的速度越来越快。
于是,有人试图出一张"终极试卷"

▲ 维基百科"Humanity's Last Exam"条目,名字本身就透着一股绝望
"人类最后一场考试":一个因马斯克而诞生的项目
Humanity's Last Exam(HLE,人类最后一场考试),光是这个名字,就能感受到出题者的悲壮。
它的诞生故事极富戏剧性:AI安全中心(CAIS)主任Dan Hendrycks公开表示,灵感直接来自与马斯克的一次对话。马斯克告诉他:MMLU太容易了 于是Hendrycks联合Scale AI,从全球学科专家众包题目,再用领先模型过滤掉"已经会做的",最终筛出约2500道题,数学占大头,另有物理、生物、医学、人文社科、工程、化学等。

▲ HLE项目门户:agi.safe.ai,标题赫然写着"人类最后一场考试"
刚发布时,前沿模型的准确率低得令人振奋,只有个位数百分比。终于,人类找到了一把还能量出差距的尺子。
但问题是:这把尺子还能撑多久?
HLE论文自己都写得很审慎:以过往基准被迅速刷满的历史看,HLE也可能在不长时间内被推高。他们不得不设计滚动更新机制(HLE-Rolling),把"终极考试"变成一场永远在出新题的马拉松。
马斯克在Grok 4发布会上的那段话,正是这条曲线的终点外推: 如果任何写在纸上的固定卷终将被做穿,那"出更难的题"这条路本身就有尽头。你不能无限加难度,总有一天,最难的纸面题对模型而言也不过是trivial。
物理是法则,其他一切都只是建议
这里有一个精妙的工程逻辑需要拆解。
现代推理模型为什么进步这么快?因为强化学习需要"对错信号"数学证明对了,奖励代码跑通了,奖励答案匹配了,奖励这种干净利落的"做对了/做错了"反馈,是训练引擎的燃料。
但当人类能出的、可自动判分的难题越来越少,燃料就枯竭了。 瓶颈落在"什么算做对了":可用的判断标准已经不够。强化学习撞上了奖励稀疏的墙
马斯克给出的答案是:把裁判权交给物理世界。
火箭入轨了吗?入了就是对了 车安全行驶了吗?开了就是对了 候选药物在体内起效了吗?有效就是对了 你无法通过刷题技巧、通过memorize训练集、通过任何纸面上的投机取巧来欺骗重力、欺骗空气动力学、欺骗人体生化反应。
"物理是法则,其他一切都只是建议,你无法打破物理。"

▲ xAI官方页面强调"Scaling Up Reinforcement Learning",以现实结果为奖励的RL闭环,正是技术路线图的核心
这套技术哲学指向一条完整路径:当文本世界的奖励信号被耗尽,就去物理世界获取不可伪造的奖励。马斯克把它称为"围绕现实的强化学习闭环",模型提出假设,物理世界给出判决,模型根据判决更新。循环往复,让智能体逐步从描述世界走向理解世界。
快反馈与慢反馈:为什么代码飞速进步,造药依然艰难
这里有一个值得玩味的不对称
在软件领域,"现实考试"已经存在了 编译器、单元测试、持续集成,秒级反馈,可无限重置,零边际成本。AI编程助手之所以进步神速,正是因为代码世界天然就是一个"快速现实":写完就能跑,跑完就知道对不对。
但马斯克点名的三样东西,车、火箭、药,恰恰是反馈最慢、代价最高的领域。
合成一个候选分子要清洗仪器、等待反应;测一次碰撞要毁一台车;发一枚火箭的成本以亿计现实反馈慢、贵、不可任意重置 这既是挑战,也是护城河,谁能最先打通从模型到物理的闭环,谁就占据了AI竞赛中最不可商品化的高地。

▲ AI制药已是进行时:从靶点筛选到分子生成再到临床试验,周期正在被压缩
事实上,"造药"这个考场已经有人在交卷了。 AlphaFold把蛋白质结构预测推进到可支撑药物设计的精度;Insilico Medicine宣称AI设计的候选分子在约18个月内推进到临床试验,传统路径可能需要数年。但请注意:进了临床不等于上市,I期成功不等于III期通过。 从"计算命中"到"患者获益",中间仍是漫长而昂贵的现实闭环。马斯克把问题追到了临床终点:它真的治好了病吗?
社区回应:赞同与质疑
Grok 4发布次日,特斯拉车主社区、马斯克语录账号和科技评论频道纷纷转发同一段一分钟剪辑。一年之后,2026年8月,仍有账号用几乎相同的文案和画面再次推送。

▲ "Elon很会问对问题,基准数字之外还有更重要的东西"

▲ "关键在问题本身,也许这才是AGI的试金石"
评论区也有质疑:即便接入了现实反馈,模型仍然缺乏人类直觉。 当训练数据枯竭、只能靠模型生成数据来喂模型时,"越喂垃圾判断越差"的恶性循环怎么打破?

▲ "数据枯竭后怎么办?连接现实就够了吗?"
谁先把仿真做成现实
马斯克在发布会上还透露了一个关键细节:当前AI能用的"工具"仍然极为原始。 浏览器搜索、代码解释器,这些和特斯拉、SpaceX日常使用的有限元分析、计算流体力学、碰撞仿真相比,完全不在一个层级。
他描述了一个更长远的图景:让模型通过人形机器人与物理世界直接互动。提出假设,动手验证,获取反馈,更新认知。模型要把车造出来开一开,也要把推导出的分子合成出来试一试。
这才是那句"现实是裁判"的完整技术含义: 从纯文本智能到具身智能(embodied intelligence)的跃迁。从"在考卷上表演聪明"到"在物理世界里证明有用"的范式切换。
而马斯克恰好同时掌握着特斯拉的自动驾驶数据、SpaceX的发射迭代经验、以及xAI的模型能力,这些资源让他更有条件率先闭合这个环。
纸面考试的区分度正在衰减,物理世界也随之成为新的训练场。谁最先在这个训练场里跑通闭环,谁就掌握了下一个时代的入场券。
夜雨聆风