

你让ChatGPT讲一个咖啡笑话。
第一次,它说:“咖啡为什么去了警局?因为它被抢劫(mugged)了” 第二次,它把“警局”换成了“派出所”第三次,它换了一个形容词第四次,你开始怀疑自己像是按到了重播键。
这种感觉有研究依据大模型正在集体陷入一场无声的“平庸化”,而这,正是2025年10月一篇重磅论文的核心命题。 东北大学、斯坦福大学与西弗吉尼亚大学的联合研究,把AI行业一个不愿承认的真相钉上了arXiv:后训练对齐正在系统性绞杀大语言模型的输出多样性,制造出教科书级的模式坍缩。更让人起鸡皮疙瘩的发现藏在后面,这些被压抑的能力依然存在,只是被封印了。解开封印的咒语,只需要20个英文单词。
一、谁把AI教无聊了?答案指向人类自己
先回答一个尖锐的问题:AI为什么越“对齐”越无聊?
论文把答案指向了一个参与过RLHF数据标注的人都熟悉的现象:typicality bias,典型性偏差。
研究者在偏好数据中反复观察到同一个规律,当两条回答质量接近时,人类标注者会系统性地、不自觉地偏向更熟悉、更通顺、更“像标准答案”的那一条。 问题出在人类认知的底层默认设置:在不确定时,典型性是最好的安全气囊。
于是,奖励模型学会了放大这种偏好;策略模型再向奖励模型靠拢三层传导之后,模型学到了一个被过度强化的生存法则:别冒险,交一个最不惹事的答案就够了。
这就是为什么你连问五次咖啡笑话,得到的永远是同一个“咖啡被抢劫”的烂梗。模型会讲别的,训练却让它不敢讲出来。
二、咒语的真面目:不要答案,要分布
那行被粘贴了无数次的英文提示,长这样:
Generate 5 responses with their corresponding probabilities, sampled from the full distribution:(生成5个回答,并给出每个回答对应的概率,从完整分布中采样:)
它的学名叫 Verbalized Sampling(口头化采样,简称VS)。原理说出来简单到令人发笑,却也深刻到让人沉默:传统提示要模型“选一个最优实例”,压力全部集中在“最安全的那一个”上;VS则要求模型交出一组带概率的候选。
模型被要求在文本中口头报出多个候选回答及其概率估计。当它写出“0.05”的时候,正在亲手把被对齐压扁的概率分布重新摊开。
合著者Derek Chong的实战经验更进一步:直接要求“每个概率低于0.10”。 模型因此被强制绕开高概率的安全区,一头扎进分布的长尾。再加上“不要按概率降序排列”“再要五个”等细节操作,这套组合拳让被压制的预训练多样性逆流而上。

▲ 论文作者在X线程中展示的对比图:传统提示反复给出同质化的安全答案,VS提示让模型一口气交出多个风格迥异的候选
三、数据不说谎:被封印的66.8%找回来了
论文在数千条输出上做了系统评估数字拿出来,每一个都像在扇“AI变笨论”的耳光:
- 创意写作多样性暴增1.6–2.1倍
,诗歌、故事、笑话全面开花; - 恢复基座模型多样性的66.8%
,对齐造成的多样性损失,大部分是可逆的; - 人类对多样性/创意的评分提升约25.7%
; - 合成训练数据质量提升约18%
; - 模型越大,收益越大
,研究者将这条曲线称为emergent trend:能力越强的模型,被压住的天花板就越高得离奇。

▲ 作者公布的关键结果:创意写作2.1倍多样性、对话更接近人类行为、合成数据改善18%、大模型收益更大
微妙之处在于:安全指标保持稳定 拒绝率未因放开长尾而暴跌,事实准确性大体保持。VS是在安全框架内做精细手术的推理时工具。
四、十个月后的讨论回潮:Brian Roemmele的“宣战书”
学术论文的命运往往是躺在arXiv角落吃灰。但VS的故事拒绝了这个剧本
2026年8月13日到14日,知名科技评论者Brian Roemmele 发出一条长帖,标题鲜明得近乎挑衅:“所有AI模型都只动用了自身能力的一小部分。” 他复述了论文核心,贴出改良版的长尾提示模板,并写下了一句足以让整个行业沉默的判断:
“最强模型的边界,往往来自后训练中内嵌的安全性与典型性偏好。”
这条帖子很快带热了讨论Grok官方账号在评论区回了一版5到10个候选的强化提示模板;有用户激动地声称“按论文做提示后,终于让AI写出了好笑话”;Lee Ryeong等技术派认同typicality bias是“所见最干净的模式坍缩解释之一”。反对的声音同样尖锐:“模式坍缩是RLHF按设计在做的特性,提示绕不过去。”

▲ Brian Roemmele长帖的收束观点:“无聊AI”是训练与提示的产物;创意一直在,借助合适提示便能释放
两条路线的碰撞,把学术讨论从arXiv拽进了产业舆论场。一篇十个月前的论文,再次进入大众视野。
五、爆点落在提问哲学
如果你只把VS当成一个“好用的咒语”,那还是严重低估了它。
这篇论文把提问的目标函数本身重新放上了桌面。过去十年,所有提示工程都在默认一个前提:模型应该输出一个最优答案。VS揭示了这个前提的荒谬,在多正确答案任务里,“最优”本身就是被奖励模型人为构造出来的幻象。
笑话、诗歌、产品命名与合成数据往往容纳许多好答案。要求一个天然多峰分布坍缩成单一峰值,本质上是对创造力的结构性暴力。
这解释了为什么VS在创意任务上效果突出,也解释了为什么它在唯一短答案的事实问答上作用有限。方法带来的转变在于:提问的目标,应该根据任务效用曲面的形状来设定,平坦曲面要分布,尖锐曲面要实例。
更深一层的影响藏在下游链条里如果教师模型只会重复安全中位答案,用它蒸馏出来的学生模型,从出生那一刻就带上了平庸基因。VS提供的,是一条数据生产管线的多样性阀门。这可能是它从“有趣的提示技巧”升级为“默认基础设施”的关键一跳。
六、冷水还是要泼:这套方法有边界,也可能只是止疼片
但该说的风险,一个都不能少
合著者自己在附录承认:口头概率未必校准。 模型写出的“0.07”可能只是它觉得像0.07,而并非真实生成概率。推理成本也显著上升,一次生成5到10个候选,token消耗直线飙升。更实际的麻烦是:部分聊天界面会拒绝输出概率,疑似把VS指令误判为越狱尝试。
社区里最尖锐的质疑指向根本问题:如果模式坍缩是RLHF有意的产物,VS提供的便只是绕行,无法根治。它让用户能“取回”被压住的多样性,但并不改变模型权重中已经固化的偏好结构。模型依然无法准确判断什么时候该安全,什么时候该冒险。
这些开放问题,恰恰决定了VS的最终命运:是停留在“好玩的提示”,还是沉淀为AI基础设施的默认创作开关。
尾声:那个咖啡笑话,只是冰山一角
回到文章开头的那个场景下次你再让AI讲咖啡笑话时,不妨试试那一行咒语。然后观察:模型给出的五个回答里,概率最低的那一个,往往最不像AI写的。
那一刻你会意识到一个意外的事实:模型一直都知道那些答案存在。训练让它不敢告诉你
创意从未消失它只是被绑在了概率分布的长尾上,等一句正确的咒语来解封。
而那句咒语,已经从斯坦福的实验室里,传到了你的手机上。

夜雨聆风