七月的夜晚,硅谷一间黑色背景的直播间里,马斯克说出了一句让整个AI圈反复咀嚼了一整年的话,"我们快没有题目可以拿来考AI了。"
这句判断毫无缓冲他接着说:一切都变得轻而易举 那么AI的终极推理考试是什么?答案落在现实本身能不能造一辆车?能不能设计一枚火箭?能不能发明一种新药?管用吗?火箭入轨了吗?药有效吗?
"Reality is the ultimate judge.",现实,才是最终的裁判。
这段口播此后被切成七十秒的字幕短视频,在X平台不断被剪辑、翻译、引用和争论。2026年8月,它又一次出现在信息流里。


▲ @PrimeUniverseHQ 的转述帖,发布于2026年8月9日
一场发布会,一个时代判决
时间回到2025年7月9日,xAI的Grok 4发布直播。
马斯克坐在团队成员中间,穿着深色外套,侧身交谈的画面后来成了无数剪辑的封面模板。他在那晚抛出了一连串判断:Grok 4在学术问题上,每一个科目都已达到甚至超过博士水平,无一例外。 它有时缺常识,还没发明新技术、没发现新物理,"但那只是时间问题"。
然后话锋一转,进入了那段被全网复读的核心表述。


▲ @ElonClipsX 提供的长版转录,包含完整逻辑链与出处标注
更完整的口播是这样的:即便对人类来说难到近乎不可能的纸面题,对AI来说也在迅速变得trivial。现实才是合格的裁判,因为物理定律才是法律,其他一切都只是建议。你无法打破物理终极测试是你发明一项新技术:改进汽车设计,改进火箭方案,创造一种新药,它管用吗?
最后一句尤其关键,却在大多数剪辑中被省略了:"这将是一个围绕现实闭合的强化学习回路。"
翻译成人话:未来训练AI时,可以把标准答案评分换成真实世界的成败信号。自动驾驶的每一次路测、火箭回收的每一帧飞行数据、药物的每一期临床试验,都可以成为"现实打分器"。
发布会后的剪辑潮
发布会结束不到24小时,剪辑号蜂拥而至。
2025年7月10日,账号@AutismCapital放出一条带警报符号的短视频帖,正文沿用了那段字幕。


▲ @AutismCapital 的剪辑帖,发布于Grok 4亮相次日
同一天,Tesla Owners Silicon Valley、ELON CLIPS等账号同步放出不同长度的剪辑版本。有的只保留"终极推理考试是现实",有的则留下了"物理定律是法律"和"强化学习闭环"的完整逻辑。
这些剪辑能反复出现一年,因为它们刚好踩中了行业最深的焦虑。
"考题耗尽"正在成为现实
过去几年,衡量大模型强弱的方式很简单:做题。 MMLU覆盖57个学科的选择题,一度被当作"通识能力标尺",直到前沿模型把准确率推过90%,区分度急剧坍塌。GPQA想拉高难度,也在被迅速追平。
于是评测社区做了一件事:造了一套号称是最后的考试。

▲ 英文维基百科"Humanity's Last Exam"条目:约2500道专家级题目
Humanity's Last Exam(人类最后一场考试),简称HLE。约2500道由各领域专家出题的闭卷问答,覆盖数学、物理、生物医学、人文社科、计算机。每道题都要求有明确可验证的答案,又不能靠搜索引擎秒查。Nature在2026年初正式发表了相关论文。

▲ Nature正式发表HLE论文,标题直译:一套评估AI能力的专家级学术问题基准
有趣的是,HLE的创建动机之一,恰恰来自马斯克。其主要推动者Dan Hendrycks曾表示,灵感源于与马斯克的对话,马斯克认为现有基准太简单了。
而在Grok 4发布会上,xAI同时展示了HLE分数:无工具约25.4%,带工具的Grok 4 Heavy约44.4%。数字还远未"考满分"但马斯克当晚的意思很明确:短期还得用更难的卷子区分模型,长期则要把裁判权交给物理与工程结果。
他在同一个夜晚给了两种答案,一只手递交成绩单,另一只手宣判考试制度的死刑。
"新药"已经走到临床
马斯克举的车、火箭、药三个例子,显然与他的产业经验有关。
车和火箭是他自己的生意,这不用解释。但"新药"这个例子,在产业里已经有了真实对应物。

▲ Insilico Medicine官方博客:首个生成式AI药物进入II期临床试验
Insilico Medicine的候选药INS018_055,由生成式AI从靶点发现到分子设计的端到端产物,已经进入II期临床试验,面向真实患者给药。适应症是特发性肺纤维化,一种患者选择极有限、疾病进展不可逆的重症。
药物是否"work",最终只能由安全性、药代动力学、疗效终点与监管路径回答。模型在生物医学选择题上的得分给不了这个答案。 AI可以把早期发现的周期从四五年压缩到几个月,但临床现实仍然是冷酷的打分器。
这恰恰与"火箭是否入轨"同构:中间步骤可以争论,最终结果几乎无法粉饰。
一年后的争论:赞同者与怀疑者
围绕这段口播的讨论持续了一年
赞同者把它接到了已知工程经验上有用户指出,特斯拉FSD的训练本质就是一个"现实闭环":真实道路上的驾驶反馈,每天数百万英里的数据回流,"结论在现实里是否成立"是最好的真伪检验。

▲ 有评论将马斯克表述连接到Tesla FSD的物理世界反馈机制
怀疑者另有疑问:知道很多,不等于有判断。

▲ "即便AI与现实交互,它仍缺乏人类直觉;数据垃圾化会恶化判断"
一位用户写道:我们已经在很多领域看到了这个问题,数据喂得越多越杂,AI的判断反而在变差。即便让它跟现实交互,它也缺乏人类直觉。还有人以游戏里"喷头怎么排布最省水"的琐碎规划问题调侃,连星露谷物语都未必能优化好,就要造火箭了?
而一条来自日本的评论提供了一个精炼的收束:AI是否是AGI,这个问题本身将变得不重要。 一旦它做出了人类做不到的东西,那就是能力证明。争论定义毫无意义

▲ 日本用户:行业正从基准竞争进入现实世界的创造力竞争
从"会考试的学生"到"会交付的工程师"
把时间线拉长,AI能力的发展可以粗略分成四层:
第一层:语言流畅,聊天不崩第二层:知识检索与考试,通过律师、医生、程序员类测验。第三层:工具使用与代理,调用浏览器、代码执行器、多代理协作。第四层:科学与工程创造,提出可检验假设、设计可制造系统、经受实验与市场反馈。
Grok 4发布会的证据主要停留在1–3层。马斯克用第四层定义"终极考试",是在公开设定下一阶段的目标函数。
AI史反复出现"出卷,刷分,换卷"的循环:ImageNet分类精度见顶,社区转向检测和分割;GLUE/SuperGLUE被刷满,出现更难的对抗评测;MMLU饱和,HLE登场每一次基准被刷爆,都意味着旧标尺失灵、新考场开辟。
马斯克把下一次"换卷"直接推到了最大的考场,宇宙本身的物理约束与生物约束。 这套评价哲学要求结果导向,成败说话,现实打分。
悬而未决的问题
金句漂亮,但裂缝也肉眼可见
谁来定义"work"? 汽车"能开"和"在开放道路上足够安全"是两回事。药物"有效"和"获批并改善患者结局"也是两回事。标准差一层,答案差十万八千里
模拟过关算不算"现实裁判"? 大量工程先在仿真中通过验证仿真过拟合,看起来在虚拟世界里完美运行,扔到真实环境却崩溃,这种失败模式并未被那句口号覆盖。
常识缺口怎么办? 发布会同时承认模型"可能缺乏常识"而常识恰恰是现实世界最基础的操作系统。强化学习闭环能自动补上常识吗?没有人知道

▲ TechCrunch报道:Grok 4伴随300美元/月的SuperGrok Heavy订阅一同发布
口号之外
这段口播反复出现了一年,也触碰到一种技术讨论之外的集体情绪。
那情绪是什么?是整个行业隐隐感觉到:刷榜时代的尽头已经可以看见了。 分数还会涨,排行榜还会换,但这套游戏的信息量正在迅速衰减。行业正在寻找新的坐标系
马斯克给出了他的版本:物理定律是法律,其他一切都只是建议。现实是唯一不可贿赂、不可游说、不可公关的裁判。
至于这个裁判何时入场,火箭是否因AI设计而更快入轨,药物是否因AI发现而更早救人,只能交给时间回答。
夜雨聆风