所有人类能写出来的考题,都正在变成废纸。 2025年7月9日深夜,xAI的Grok 4发布会上,埃隆·马斯克说出了一句让整个AI评测圈脊背发凉的话,"我们快没有考题可以拿来考AI了。" 紧接着他把话锋一转,指向了一个任何模型都无法作弊的考场:现实本身。
他给出的判据落在火箭入轨、汽车行驶和药物疗效上。
物理定律才是法律其他一切,都只是建议


▲ @ElonClipsX发布的完整转录帖,包含"physics is the law, everything else is a recommendation"原话及出处
那一夜,他同时亮出了成绩单和死刑判决书
故事要从那场发布会的分裂感说起
一边,xAI团队骄傲地展示Grok 4的基准测试分数:在"人类最后一场考试"(Humanity's Last Exam)上拿下约25.4%的无工具成绩,带工具的Grok 4 Heavy更是飙到44.4%,与Gemini 2.5 Pro、OpenAI o3正面对标。马斯克本人甚至说出了那句极具冲击力的定性,"在学术问题上,每个学科都优于博士水平,无一例外。"
另一边,话音未落,他就亲手宣布了这些分数的死刑。
"即便对人类来说难到近乎不可能的、写在纸上的问题,对AI来说也正在迅速变得trivial。"
Trivial轻而易举不值一提
这番判断指向正在发生的变化

▲ TechCrunch以"$300月费订阅"为切口记录了那一夜:Grok 4的能力画像与SuperGrok Heavy产品同步亮相
这种自我矛盾构成了整场发布会最强烈的戏剧张力。马斯克刚亮出一张"博士级"成绩单,随即把考卷扔进垃圾桶;同一个产品既赢下考试,也暴露了考试的局限。
"车、火箭、药",用自家命根子立军令状
仔细看他给出的三个"终极考场":造一辆车,造一枚火箭,造一种新药。
等等,这不就是特斯拉、SpaceX,外加他长期关注的生物科技方向吗?
这三个例子正好落在马斯克商业版图与长期关注的方向上。他在用自己商业帝国最核心的验收标准来定义AI的下一阶段目标。特斯拉FSD每天在真实道路上接受物理世界的暴力测试,SpaceX的星舰由飞行结果定成败,药物则由临床数据裁决。
这三个领域共享一种残酷的评价结构:中间步骤可以争论,最终结果无法粉饰。
引力不会被prompt engineering骗过,患者的生物标记物也不会因few-shot凭空变好;碰撞测试更不接受模型的"幻觉"


▲ 另一段马斯克口播的核心表述:"考试全对之后,它甚至会告诉你题目哪里有问题,到那时,人类考试将不再有意义"
科普插播:什么叫"考题耗尽"?这事儿是真的
如果你觉得"没题可考"听起来像营销话术,那让我们看看数据。
MMLU(大规模多任务语言理解)曾经是衡量模型"有没有文化"的黄金标准。覆盖57个学科,从抽象代数到世界宗教。2023年它还能拉开差距;2024年,前沿模型纷纷突破90%区分度归零卷子废了
于是评测圈紧急造出更难的卷子Humanity's Last Exam(HLE) 应运而生,2500道专家级超难题,号称"Google-proof",涵盖数学、物理、生物医学、工程、人文社科,要求每道题有明确可验证答案,又不能靠搜索引擎秒查。

▲ HLE官方站点:名字本身就暗示了一种终局感,"人类最后一场考试"
还有一个鲜少被提及的细节:HLE的主要推动者之一Dan Hendrycks曾公开表示,灵感来自与马斯克的一次对话。马斯克跟他说,MMLU太简单了
也就是说,这套"最后的考试"本身,就是马斯克嫌旧卷子太容易而催生出的产物。 而现在他又站出来说,即便这张卷子,寿命也有限。

▲ 2026年1月Nature正式发表HLE论文:AI评测共同体用学术期刊的庄重形式,为"闭卷考试的黄昏"盖了一个章
AI评测史反复上演同一个循环:出卷→刷分→饱和→换卷。ImageNet刷爆换检测,GLUE刷满换SuperGLUE,MMLU见顶换HLE。每一次"换卷"都在承认上一张卷子的失败。马斯克的激进之处在于:他不打算再换卷了,他要换考场,从纸面跳到物理世界。
"强化学习闭环围绕现实",短视频略去的技术核心
流行的短视频通常只保留金句,却略去了一段技术判断:
"So it's going to be a reinforcement learning closing loop around reality."
这段话的分量远超口号过去,模型对着标准答案学习,以考试分数优化正确率;他设想的训练方式会让模型提出设计或假设,再到仿真或现实中执行,并用成败信号反向更新策略。
自动驾驶的真实路测数据、火箭回收的飞行遥测和药物的临床终点指标,都是"现实打分器"的不同化身。此时,考官换成了宇宙 宇宙不会因为结果"接近正确"就给出部分分。
这也是为什么马斯克选了那句几乎像哲学宣言的前缀:Physics is the law, everything else is a recommendation. 物理定律不受谈判、游说或公关左右。它是唯一一个不会因为模型足够聪明就被hack掉的评分系统。
网络反应:有人封神,有人泼冷水
这段口播被压缩成70秒字幕短视频,在X上迅速走红。2025年7月10日,@AutismCapital 的剪辑帖斩获百万级浏览、上万点赞,成为早期最受关注的版本之一。


▲ 2025年7月10日爆发帖:警报符号开头,配以发布会现场口播画面,互动量级远超普通科技帖
质疑也随之出现马斯克自己在同一场发布会上承认,"它有时可能缺乏常识,尚未发明新技术或发现新物理。" 纸面高分与现实创造之间,他本人明确留出了距离。
还有人用一种近乎调侃的方式提出质疑:AI连"星露谷物语里喷头怎么排最优"都未必答好,用这种日常琐事的失败,来对冲"造火箭"的宏大目标。这种质疑虽然不严谨,却代表了相当一部分普通用户的真实体感。
现实已经在打分:AI设计的药物走进了人体
马斯克口中的"new medication"已有现实对应物。
Insilico Medicine的候选药物INS018_055,一个由生成式AI从靶点发现到分子设计端到端完成的化合物,已经进入II期临床试验,正在真实患者身上给药。适应症是特发性肺纤维化,一种选择有限、进展不可逆的疾病。

▲ "First Generative AI Drug Begins Phase II Trials with Patients",AI设计药物首次在人体上接受"现实裁判"的打分
这就是马斯克所说的闭环正在发生的地方:AI提出分子→合成→动物实验→人体试验→现实给出判决。最终结果由药代动力学曲线和安全性数据决定。
一年后还在刷屏:金句的"周期性复活"
这句话没有随着2025年7月那个新闻周期的结束而消亡。2026年8月,同样的字幕视频再次回流,获得十万级浏览。


▲ 一年后,同一段话以几乎相同的形式再次获得大量关注,经典金句拥有自己的"复活周期"
这说明什么?它击中了一种持续存在的焦虑 每当新模型发布、新基准被刷爆、又一轮"XX模型超越人类"的标题出现,这句"现实才是终极考场"就会被重新拿出来,既是对分数狂欢的降温,也是对"然后呢?"这个问题的一种回答
最深处的问题:谁来定义"管用"?
马斯克画了一个极其清晰、极其诱人的图景。但在这个图景的边缘,有几个他没回答的问题:
汽车"能开"和"足够安全"之间,隔着多少条人命的数据? 药物"有效"和"获批上市"之间,隔着多少年的监管流程?火箭入轨是个二值判断,但"值得入轨的载荷"是一个社会经济问题。
仿真里过关,算不算"现实裁判"? 绝大多数工程迭代发生在数字孪生中,真实世界只承接其中一部分验证。如果模型在仿真中过拟合,那个"现实闭环"是真闭环还是假闭环?
这些问题不会让马斯克的判断失效,但会让它变得远比口号复杂。从"考试正在失效"到"现实给出答案"之间,存在着巨大的工程灰色地带,其中的细节决策仍离不开人类判断力。
一场考试文明的落幕
如果把视野拉远,马斯克那晚说的话,本质上是在宣告一种评价文明的终结。
从科举到高考,从MMLU到HLE,人类社会运转了上千年的核心假设之一是:你可以通过出题来衡量能力。 如今,一个坐拥电动车工厂和火箭发射台的人把能力的终极证明推向车间、发射台与病床前。
这个判断也触及我们如何定义"聪明"
当AI把所有人类写得出的题目都变成trivial,剩下的问题只有一个:
它造出来的东西,能不能在这个宇宙里站住?
夜雨聆风