七月的夜晚,硅谷的直播间里,埃隆·马斯克说了一句让整个AI圈集体失语的话,"我们快没有考题可以拿来考AI了。"
他的语气平静得像在念物理定律紧接着是那段后来被剪成七十秒短视频、在X上反复出现的完整表述:"一切都变得轻而易举。AI的终极推理考试将是现实本身它能不能造出一辆车、一枚火箭,或一种新药?管用吗?现实才是最终的裁判"
这番话出自xAI发布Grok 4的现场。马斯克把通用人工智能的评价标准从"会不会答题"拨向"能不能在物理世界里交付结果"。


▲ 2025年7月10日,账号@AutismCapital发出的带警报符号短视频帖,成为这段金句首次大规模爆发的载体,获得百万级浏览
那一夜到底发生了什么
时间倒回2025年7月9日,太平洋时间晚上8点。xAI的Grok 4发布直播开场,马斯克与团队成员并排坐在深色背景前,屏幕上打着硕大的"Grok"字样。

▲ Teslarati预告报道,确认直播时间与现场构图
发布会上,马斯克先给了一组让人倒吸冷气的定位:Grok 4在学术问题上,"每个科目都达到甚至超过博士水平,没有例外"。然后话锋一转,他主动承认了边界,"有时它可能缺乏常识,也还没有发明新技术或发现新物理,但那只是时间问题。"
然后,他把逻辑链条拉到了终点
"物理定律才是法律,其他一切都只是建议"
网络上流传最广的是那段七十秒字幕版。账号@ElonClipsX还保存了完整转录:
即便对人类来说难到近乎不可能、写在纸上的问题,对AI来说也正在迅速变得trivial。现实是优秀的裁判,因为物理定律才是法律,其他一切都只是建议,你无法打破物理。
所谓终极测试,是你发明一项新技术:改进汽车或火箭的设计,或创造一种新药,它管用吗?火箭能否入轨?汽车能否开起来?药物是否有效?无论哪种情况,现实都是最终裁判。因此,这将是一个围绕现实闭合的强化学习回路。


▲ @ElonClipsX的完整转录卡片,末尾明确标注来源:"Grok 4 presentation by xAI, July 9, 2025"
三层意思叠加在一起,构成一套完整的宣言:第一,纸面基准正在饱和;第二,物理与工程结果不可伪造;第三,未来AI训练的奖励信号,要从"标准答案"切换为"现实是否成功"。
最后那句"围绕现实闭合的强化学习回路"尤其关键。马斯克由此描述了一种训练范式的迁移。
考题,真的快用完了吗?
整个AI评测工业都在经历基准饱和的阵痛。
还记得MMLU吗?那套覆盖57个学科的选择题大杂烩,一度是衡量大模型"通识能力"的金标准。2024年前后,前沿模型的准确率纷纷突破90%,分数拉不开了,考试失灵了。
于是更难的卷子被造出来Humanity's Last Exam(HLE,人类最后一场考试)应运而生:约2500道由顶尖专家出题的闭卷难题,覆盖数学、物理、生物医学、人文社科,要求答案无歧义且不可搜索引擎秒查。这个名字已经表明了它的野心,这是人类打算出的最后一份卷子。

▲ 英文维基百科"Humanity's Last Exam"条目,定义其为2500题专家级基准

▲ Nature于2026年初正式发表HLE论文,标题直译:"一套用于评估AI能力的专家级学术问题基准"
有趣的是,HLE的创建灵感之一,恰恰来自马斯克本人,主要推动者Dan Hendrycks曾公开表示,创建动机部分源于与马斯克的对话,后者认为MMLU等基准太简单了。
而Grok 4在HLE上的表现呢?TechCrunch报道给出了数字:无工具约25.4%,带工具的Grok 4 Heavy约44.4%。

▲ TechCrunch即时报道:"Elon Musk's xAI launches Grok 4 alongside a $300 monthly subscription"
这与"没题可考"矛盾吗?不矛盾HLE的存在本身就是对基准饱和的制度性回应,评测共同体承认旧卷子失灵,于是人为堆出更难的考场。但趋势已经写在墙上:闭卷学术题作为长期标尺的寿命,正在倒计时。马斯克在同一个夜晚既展示HLE分数,又宣布"终极考试是现实",等于同时给出了短期答案和长期判决。
"新药"已经走进现实
马斯克举出的车、火箭、药,都有清晰的工程语境。
造车? 特斯拉的Full Self-Driving(FSD)训练体系,本质上就是一个以真实世界驾驶数据为奖励信号的强化学习闭环。车在路上开,数据回流,模型迭代开不好就是开不好,没有标准答案可以背。
造火箭? SpaceX的星舰迭代逻辑更加冷酷。能否入轨、能否回收,结果一目了然物理定律不接受PPT汇报
造新药? 这个例子在产业里已经有了真实的第一批考生。

▲ Insilico Medicine官方博客:"First Generative AI Drug Begins Phase II Trials with Patients"
Insilico Medicine,一家AI制药公司,用生成式AI从靶点发现到分子设计,端到端地"设计"出了候选药物INS018_055(针对特发性肺纤维化),并已进入II期临床试验,开始面向患者给药。
AI设计的分子,正在接受人体的裁判。安全性、药代动力学和疗效终点,都要由患者身体给出反馈。火箭是否入轨,药物是否有效,遵循着同构的验收逻辑。
一年后仍在反复刷屏
这段话很快进入各类剪辑账号的时间线。
2025年7月10日,发布会次日,剪辑号密集上线。@AutismCapital的短视频帖获得百万级浏览与上万点赞,成为金句最早的爆发载体。@teslaownersSV、@ElonClipsX等账号同步跟进,不同长度、不同剪辑、不同字幕版本铺满时间线。
一年之后它还在出现2026年8月,@PrimeUniverseHQ、@saylordocs等账号再次搬出同款剪辑,评论区依旧活跃。内容没有新信息增量,属于金句的周期性复活。


▲ 2026年8月的转述帖,内容与一年前几乎一致
这段话能被反复剪辑、跨年出现,通常意味着它击中了某种集体直觉。人们隐约感到考试时代正在终结,却难以描绘下一关的样子。马斯克给出了他的答案
争议:知道很多,不等于有判断
也有人并不买账

▲ 另一类怀疑:AI与现实交互时仍可能失败,数据质量下降会让判断更糟,且缺乏人类直觉
还有人调侃,"它连星露谷物语里喷头怎么排布最优都答不好,你跟我说它要造火箭?"用日常小任务的拉胯,反衬宏大愿景的荒诞感。
这些质疑并非没有道理马斯克自己也在发布会上承认了一个关键缺口:模型可能缺乏常识。而常识,恰恰是现实世界最基础的通行证。能解微分方程、却不理解"湿滑路面要减速",这种错位在自动驾驶史上已经反复上演。
从"会考试的学生"到"会交付的工程师"
但如果我们把视角拉远,马斯克那晚的话指向的其实是一个范式跃迁:
| 4 | 科学与工程创造 | 提出可检验假设、设计可制造系统、经受实验与市场反馈 |
Grok 4发布夜展示的证据,仍主要停留在第2-3层。马斯克用第4层定义"终极考试",是在公开设定下一阶段的目标函数。
这像一个教练在运动员刚跑进10秒大关时,突然把下一项比赛改成飞行。

▲ 支持者将马斯克表述连接到Tesla FSD的实时物理反馈:"结论在现实中是否成立,是最好的真伪检验"

▲ 一条跨语言的精炼解读:当AI做出人类做不到的东西,"是否AGI"就不再重要,竞争焦点随之转向现实创造力
为什么偏偏是"车、火箭、药"
这三个领域共享一种残酷的评价结构:中间步骤可以争论,最终结果几乎无法粉饰。
汽车要在真实道路与量产约束下运行。火箭要对抗轨道力学与再入热环境药物要在人体上证明风险收益比它们都是长周期、高资本、强安全约束的系统工程,恰好是纯语言模型最难"口头通关"的地带。
而马斯克同时执掌电动车与航天企业,使他在举例时几乎是在用自己公司已经接受的验收标准,反向要求通用AI。他用自己的产业经验给AI的下一关出了卷子。
与此对照:编程竞赛、法律多选、医学执照模拟考,都是封闭世界,答案空间事先给定,评分可以自动化。现实创造则是开放世界:设计空间巨大,失败模式不可穷举,成功往往只能事后确认。
HLE试图在封闭世界里把难度推到专家极限。马斯克则说,即便那一关也终将过去,下一关不在考场里。
尾声:当考试终结,什么开始?
AI史上反复出现"出卷,刷分,换卷"的循环。ImageNet被刷爆之后换赛道,GLUE/SuperGLUE被刷满之后出更难的推理测试,MMLU饱和之后有了HLE。每一次,社区都觉得这次的考试够难了。每一次,模型都用速度证明了出题者的天真。
马斯克那晚的表述之所以击穿圈层、跨年出现,是因为他把下一次"换卷"直接推到了最大的考场,宇宙本身的物理约束与生物约束。工程与科学的结果由此取代了新的选择题集。
但问题仍然悬而未决:谁来定义"work"? 汽车"能开"与"在开放道路上足够安全",药物"有效"与"获批并长期改善患者终点",这之间的鸿沟,可能比任何一道HLE难题都要深。
现实是最终的裁判但裁判的判决书,往往要等很久才能读完。
夜雨聆风