ARTICLE · 1120744
清华满分论文震动全球AI圈:撕碎o1神话,强化学习根本没教出新智商!
过去两年,大模型的世界彻底陷入了一场集体狂欢。
从OpenAI的o1,到横空出世的DeepSeek-R1,再到Kimi-1.5,所有人都被一种近乎神迹的现象震撼了:给大模型加上可验证奖励的强化学习(RLVR),只要用答对给1分、答错给0分的简单信号去逼它,模型就会自己嘟囔着长考,甚至爆发出类似人类顿悟的“啊哈时刻”!

▲ 论文曝光后,海外技术圈爆发的剧烈震动:“强化学习的庆功宴开得太早了”
无数信徒激动地宣布:AlphaGo在围棋里突破人类思维的奇迹,终于在大语言模型上重演了!AI正在通过左右互搏,自主进化出人类从未教过的高维推理能力。
然而,就在所有人为AGI的倒计时欢呼时,清华大学的一支团队却悄无声息地递上了一把冰冷的手术刀。
这篇由清华大学自动化系LeapLab与上海交通大学联合发表的重磅论文,直接拿下了顶级AI盛会NeurIPS 2025的唯一满分评价,并最终斩获最佳论文亚军(Best Paper Runner-up),这是NeurIPS设立该奖项以来,首篇完全由中国本土学者独立完成的获奖成果。
他们做了一个极其严谨但残忍的对照实验,把整个AI圈的狂热遮羞布一把扯了下来:
大模型并没有学会任何新逻辑这场备受瞩目的自我进化,实则是一场昂贵而精巧的“存量压缩”。
01.幻觉破灭:单发命中90分,成百上千次却被基座“暴打”
为了把问题看透,清华团队设计了一场堪称“显微镜级”的残酷对决。
在评估AI解题时,业内通常看一个指标叫 pass@1:给模型同一道题,只让它做一次,答对就算过。这就像考试里的“第一反应”
但清华团队把采样次数放大了几百倍甚至上千倍,去测量 pass@k(比如pass@256、pass@1024):如果允许模型反复做1024次,只要其中有一次能蒙对,就算这道题在它的“能力覆盖边界”内。
这就构成了全篇最震撼的一组前后对照:

▲ 论文Figure 1:左侧显示RL训练后解题树被修剪、有效解题空间收窄;右侧显示大采样量下基座模型pass@k反超RL模型
在数学基准AIME和MATH上,经过强化学习训练的模型,在小采样量($k=1$)时的表现简直惊艳,单发命中率碾压原始的基座模型。各大厂商正是拿着这个数据,向全世界宣传“AI逻辑能力暴增”。
然而,诡异的事情在采样次数增加时发生了。
随着采样次数 $k$ 不断拉大,基座模型的准确率曲线开始疯狂攀升,以肉眼可见的速度逼近、追平,最终在成百上千次采样时,全面反超了经过强化学习训练的“学霸模型”!
很多时候,交叉反超点甚至在个位数的 $k$ 就早早出现了。
为何会出现这种反常现象?
打个通俗的比方:未经强化学习的基座模型,就像一个天马行空、思路杂乱但底子极厚的偏才。虽然他第一枪经常打偏,但如果给他1000颗子弹,他的子弹能覆盖整片靶场,总有一发能正中那个刁钻的靶心。
而强化学习训练后的模型,被教成了一个只背标准答案的做题机器。他打第一枪极准,但如果你让他开1000枪,你会绝望地发现,他打出来的所有弹孔都挤在同一个狭窄的小坑里。
那些稍微偏门、但原本基座模型完全能做出来的解法,被他自己亲手废掉了。
02.显微镜下的残酷真相:你解出来的,只是基座的“严格子集”
为了探究深层机制,清华团队把模型的内部工作机理层层剖开,给出了三项极具说服力的实证证据:
1. 严格子集定理:AI没有探索新大陆
研究团队将题目分成了四大类:两者都能解的、两者都不能解的、仅基座能解的、以及“仅RL能解”的。
统计结果显示:在MATH500题库里,经过RL训练后表面上才能解出的题目,占比不到1%,一共只有约5道题。
而当团队把基座模型的采样次数放宽到1024次时,奇迹消失了,基座模型对这5道题实现了100%命中。
这证明了一个冷酷的数学事实:当前强化学习模型能解决的全部问题,在统计学上几乎完全是基座模型潜在解题集合的“严格子集”(Strict Subset)!
它从来没有走出过基座模型画好的圆圈。
2. 困惑度追踪:它在背基座早就写好的草稿
大模型输出中那些“自我纠错”、“等一下我再想想”的惊艳反思,难道全凭强化学习自主领悟?
团队拿出了衡量语言模型序列概率的核心工具,困惑度(Perplexity)。如果强化学习真的发现了全新的逻辑链条,基座模型在阅读这条思维链时,困惑度应该极高,感到陌生和突兀。

▲ 清华团队第一作者乐洋公开解读:强化学习生成的解题轨迹,在基座模型看来完全属于“轻车熟路”
然而,测量结果让人大跌眼镜:RL模型引以为傲的思维链,基座模型读起来不仅毫不陌生,反而处于困惑度最低的超高概率区间。随着强化学习一轮轮推进,基座模型对这些轨迹的困惑度还在单调下降!
真相大白了:所谓的反思与顿悟,种子早就埋在海量预训练数据的基座里。强化学习没有创造出哪怕一丝新的认知原语,它只是像猎犬一样,把基座里原本就存在的高频解法给叼了出来。
3. 解题空间锐化:零分题目不减反增
如果把每道题的做对概率画一张直方图,对比更是触目惊心:
强化学习把大部分题目的命中率强行推到了0.8至1.0的高频区;但代价是,准确率为0(彻底丧失解题可能)的题目数量,在强化学习之后居然激增了!
为了奖励那些显而易见的正确路径,算法把那些低概率但蕴含潜力的微弱通路切断。这种机制牺牲了探索深度,宛如一场为了应试而进行的大脑额叶切除手术。
甚至,团队尝试调高生成温度,强行让RL模型的输出熵恢复到跟基座一样的水平。结果呢?曲线依然全面落后于基座这表明,这种思维多样性的塌缩,已经被焊死在了权重突触里,调参数根本救不回来。
03.终极激辩:稳定答对95%的专家,算不算更聪明?
论文的结论如同一记重锤,砸碎了无数AI信徒的狂热幻想。
在社交媒体上,悲观情绪瞬间蔓延有人尖锐地写道:“我们狂欢了半天,原来只是在给硅基鹦鹉做应试集训,把一道道奥数题当成了智慧的证明,这简直是全球最昂贵的一次曲线拟合演示!”
但也有技术大牛提出了极具深度的反思与交锋:
“如果一个专家做预测,95%的时候都是对的;而一个普通人胡言乱语,五花八门的答案碰巧蒙全了100%的可能性,我们能说后者比前者更聪明吗?”

▲ 技术学者在讨论中提出反思:用牺牲边缘可能性换取高可靠性,究竟算不算更聪明?
这个反问直击产品与商业的命门
对于现实应用来说,谁能在实际业务里给你采1024次样?谁能忍受大模型胡说八道几百次只为了那一次灵光乍现?从工程落地看,用牺牲边缘可能性为代价,换取单次回答的高可靠性,这正是工业界最迫切需要的能力。
然而,这也恰恰是这项研究最具价值的警示:我们要分清什么是“工程上的高效采样”,什么是“科学上的智力跃迁”。
你可以赞美强化学习是一个极其出色的“漏斗”,把预训练海洋里的智慧精华以最高效率提纯出来;但你不能指鹿为马,把一个更锋利的漏斗,吹嘘成了能自主喷涌智慧泉水的源头。
更有趣的一组对照来自模型蒸馏
清华团队在对比实验中发现,当用更强大的大模型思维链去蒸馏一个小模型时,小模型在小 $k$ 和大 $k$ 上的表现是同步抬升的!
这带来了一个颇具黑色幽默的结论:当前的自我强化学习只能把老底掏空;而向更优秀的教师模型学习(蒸馏),才能切实注入全新的认知模式。
04.拨开迷雾:大模型离自主进化究竟还有多远?
面对网络上的过度解读,论文第一作者乐洋多次公开发文澄清:“我们从未否定强化学习,我自己依然是强化学习的坚定信徒。”

▲ 作者公开说明:当前的局限旨在呼唤全新且更具探索性的范式
清华团队的这项工作,旨在用扎实的科学事实把行业从盲目的狂热中拉回地面。
当前的RLVR之所以画地为牢,是因为它的设定太局限了:它面对的是死板固定的题库,依赖的是简单的0/1对错结果,模型只能在封闭的答题纸上自言自语。在这样的环境里,模型唯一能学会的生存策略就是“投机”,抱紧最稳妥的旧套路,剪掉一切冒险的新尝试。
这与当年AlphaGo在围棋复杂对局中自如博弈、自主发现“第37手”的壮举,存在本质差异。
要让大模型孕育出全新的认知能力,未来的强化学习需要打破现有束缚:
- 更密集的进程奖励
:跳出单一终局对错评判,在思维推导的每一步建立即时反馈; - 真实环境的多轮交互
:让AI像智能体一样去操作代码、调用工具、在物理世界的反馈中探索,摆脱在封闭提示词里的原地打转; - 更激进的探索机制
:从算法底层重赏那些未曾遇见的逻辑路径,摆脱一味奖励单发命中的平庸取向。
大模型没有魔法,它依然严格遵循着信息论与统计学的铁律。
清华这篇拿下 NeurIPS 亚军的硬核论文,给狂奔了整整两年的AI世界送上了一剂最好的清醒剂:别再沉迷于用最昂贵的算力教模型“背闪卡”了。更深远的探索,才刚刚拉开序幕