2025年7月9日深夜,硅谷 当所有人都在等马斯克公布Grok 4的跑分表格时,他把整张桌子掀了。
现场看不到PPT和柱状图,那句"我们又在XX基准上SOTA了"也没有出现。他坐在深色背景前,用一种几乎冷淡的语气抛出一个判断,
"We're running out of test questions to ask AI. Everything has become trivial."
我们已经没有题可以考AI了一切都变得太简单了
然后他给出了自己的答案:"终极推理考试,是现实。"
能不能造出一辆车?一枚火箭?一种新药?火箭入轨了吗?车能开吗?药有效吗?
"Reality is the ultimate judge." ,现实,才是最终的判官。


▲ ELON CLIPS发布的长引语视频,字幕显示"We actually are running out…",画面中马斯克身旁坐着xAI团队成员
一场发布会,把AI评测体系送进了ICU
把镜头倒回发布会开始的那一刻
xAI跳过了所有人预期的小版本迭代,直接从Grok 3蹦到了Grok 4。同步推出的还有多代理版本Grok 4 Heavy,以及一个让钱包颤抖的新订阅:SuperGrok Heavy,月费300美元。
马斯克先给了甜头:Grok 4在学术问题上,达到或超过了博士水平,所有科目,无一例外。 数学物理卷子几乎不会再错,除非题目本身是恶意对抗性的。它甚至能反过来修正题干中的错误和歧义。
这原本像是又一个刷榜故事马斯克紧接着把刀转向了自己,
"它可能缺乏常识它尚未发明新技术或发现新物理"
这项限定,给整场发布会猛踩了一脚刹车。 他在宣布模型考试满分的同一口气里,亲手把"满分"贬值为零:考卷通往AGI的效力已经过期。

▲ 马斯克本人发帖:Grok 4是他第一次见到AI能解出"互联网与书本上都找不到答案"的工程问题
"物理是法律,其他一切只是建议"
发布会完整录像里还保留着一段关于物理定律的话,ELON CLIPS等账号后来截取了这段内容:
"Physics is the law. Everything else is a recommendation."
物理是法律,其他一切只是建议你无法违背物理
工程师会把这句话视为圣经
马斯克接着描绘了他设想的下一代训练范式,"围绕现实的强化学习闭环"(a reinforcement learning closing loop around reality)。翻译成人话就是:AI不能只在文本的海洋里自我陶醉,它必须走出去,设计一个东西、造出来、测试、失败、改进、再测试,直到物理世界给出"通过"的裁决。
这个逻辑其实一点都不新鲜特斯拉FSD(全自动驾驶)干的就是这件事:真实道路上的每一公里都构成考题,接管意味着失分,安全抵达则得到一次小小的满分。 评分者换成了物理世界
网友@StarSun2在回复中精准地把这条线串了起来:"特斯拉FSD完全建立在实时物理世界反馈上。Grok似乎也在用同样的方式构建,终极测试是:它的结论在现实世界是否管用。"
Epic创始人的五个字:这感觉像AGI
如果只是马斯克一个人在说,你可以怀疑是"老板夸自家产品"。但发布后不到12小时,一个重量级的外部声音加入了,
Tim Sweeney,Epic Games创始人,虚幻引擎的缔造者,一个以技术洁癖和毒舌著称的人,写下了这么一条:
"Grok 4 feels like Artificial General Intelligence to me."

▲ 马斯克引用Sweeney的推文,并回复称自己在材料科学领域问"书本和网上都没有"的问题时有同感
注意Sweeney的措辞:"It is clearly not just constructing statistically likely connections"。他认为Grok 4已经超出了统计关联和文字接龙的范畴,展现出某种洞察力。
马斯克接过话茬,透露了一个细节:他在材料科学领域问了一些任何书本和互联网上都找不到答案的问题,Grok 4给出了让他"有同感"的回答。
材料科学 背题很难覆盖这类问题:答案未被写入公开数据集,Reddit上也找不到现成讨论。模型需要理解晶格结构、相变行为和微观力学,才可能给出有意义的推断。
一道正在消失的护城河:当"更难的卷子"也不够难
马斯克的判断并非空穴来风整个AI评测界在过去一年都在经历同一种焦虑。
Scale AI创始人Alexandr Wang与Center for AI Safety联手推出了Humanity's Last Exam(HLE),字面意思,"人类最后的考试"。约2500道题,覆盖上百个学科,需要研究生级别甚至极窄领域的专业知识。题目先让前沿模型试答,模型答不好的才有资格入库。

▲ Humanity's Last Exam官方站点,可见AI准确率曲线上Grok 4等模型的点位
设计者的初衷很明确:如果模型能通过这套题,"基本上就有AGI了"。 但现实比想象更残酷,Grok 4发布时,这套"人类最后的考试"的分数已经被推到了让人不安的高度。
更难的卷子被造出来,又被更强的模型碾过去。 这是一场军备竞赛,而马斯克说:别赛了,换赛道。

▲ 英文维基百科"Humanity's Last Exam"条目,记录了创建背景与基准饱和的讨论
"会答题"vs"会造物":一个残酷的类比
让我用一个中国读者秒懂的比喻来说明马斯克在讲什么,
高考状元不一定能开好公司 考场上的满分王和商场上的创业者,用的是完全不同的肌肉。前者在已知规则下做最优选择,后者在未知环境里做生死决策。
AI现在的处境,就像一个考遍天下无敌手的高考状元,被问:"那你来设计一款可以量产的芯片试试?"
有人在社交网络上提出了一个更毒辣的对比:AI能轻松通杀研究生级考试,却出不好一份能区分概念理解的本科试卷。 它知道什么是好答案,却搞不清什么是好问题。

▲ 有网友指出:AI会答题却不会出题,答题能力过剩,命题与价值判断不足
这个洞察和马斯克的"running out of test questions"形成了一组完美的镜像:
- 答题端
:人类出的题不够用了; - 命题端
:模型尚不会承担出题者的责任。
如果未来的AGI要做科学发现和工程创造,它必须学会提问、设实验、选指标,而不仅仅是填空。
药、车、火箭:三张"现实答卷"交到哪了?
马斯克点名的三个领域,恰好代表了三种不同的"物理验收难度"。
新药是最残酷的Insilico Medicine已经用生成式AI将候选药推进到临床试验阶段,号称成本压缩至传统路径的十分之一、时间缩短至三分之一。但药学的现实判官极其严苛:毒性、药代动力学、对照试验、终点事件,任何一步都可以否决一个"纸面完美"的分子。

▲ NVIDIA博客记录Insilico Medicine用生成式AI加速药物发现的进展
汽车是马斯克最熟悉的战场特斯拉FSD从数十万行手写规则走向端到端神经网络,用海量真实驾驶视频训练,碰撞风险和接管率会直接暴露错误。
火箭则是验收最干脆的:入轨就是入轨,爆炸就是爆炸。仿真再完美,也要靠飞行证明 这是航天文化里最古老的信条,也是马斯克私人词库里最重的那个词。
发布一年后,这段话仍被反复提起
2026年8月,距离那场发布会已经过去一年多,PrimeUniverse等账号仍在重新剪辑和发布同一段话。


▲ 2026年8月的二次发布帖,信息增量有限,但话题依然没有过期
原因很简单:这个矛盾没有被解决
考试在继续饱和,模型在继续刷分,"现实验收"仍然遥远。我们手里有了"博士水平"的AI,距离AI独立设计并成功入轨的火箭、独立发明并通过三期临床的新药却还有很长的路。
马斯克把那句话变成了一根标尺,插在了所有人面前:
你可以继续刷榜,继续发论文,继续宣布"又一个SOTA",但最终,火箭入轨了吗?车能开吗?药有效吗?
这三个问题,没有一个能靠语言模型的自洽来回答。
尾声:最终的考官不会打分,只会判生死
在AI发展史上,我们见过太多次"旧尺子变短"的戏码。ImageNet饱和了换检测,棋类饱和了换实时策略,代码题饱和了换仓库级任务。每一次,社区都在寻找"下一张更难的卷子"。
马斯克则把终点推向物理世界:最终的尺度就在那里。
这项主张仍在等待验证他自己也说了:Grok 4尚未发明新技术,尚未发现新物理,"只是时间问题。"
时间会证明他是对的,还是过于乐观AI的考试时代已经走到转折处 新的较量会看谁能造出点什么
现实不打分现实只判生死
夜雨聆风