

如果你最近觉得 ChatGPT 变无聊了,别怀疑自己的直觉,它被驯化得太过头了。
问它讲个咖啡笑话,它像一台卡了带的复读机:“Coffee got mugged!”问十次,九次是同一个双关。写个故事,开头永远“在一个遥远的地方”。写博客,“In today's digital landscape…”像极了朋友圈里那些永远端着的中年人。
2025 年底,一篇论文把这层窗户纸捅破了。来自东北大学、斯坦福大学与西弗吉尼亚大学的研究团队,包括自然语言处理泰斗 Christopher D. Manning,在论文《Verbalized Sampling》中给出了一个让行业沉默的结论:创意没有被删除,它只是被默认的提问方式锁死了。解开这把锁的工具,就藏在模型自己的嘴里。

▲ 作者 Weiyan Shi 用咖啡笑话做演示:模型明明“知道”一百个笑话,却只肯讲一个
一场没有凶手的“创意谋杀案”
故事的起点,是一种所有大模型用户都有的模糊感觉:回答太标准了,标准到让人窒息。
笑话像同一个笑点的变体,诗像同一个模板的填空,商业方案像同一个咨询顾问写的 PPT。学术界给这个现象起了个名字:模式坍缩(mode collapse)。借用生成模型研究的术语,本来可以覆盖几十种答案的分布,训练后塌缩到了两三种“高分安全款”。
过去的技术圈喜欢把锅甩给 RLHF,基于人类反馈的强化学习。听起来很合理:你让人类打分,人类当然喜欢“顺眼”的,模型自然越练越怂。但《Verbalized Sampling》这篇工作往前走了一步,它做了一件前人没做的事:给偏见命了名,还算了笔账。
这个名叫典型性偏见(typicality bias)。它与认知心理学中的熟悉感、加工流畅性、可得性启发有关。标注者在给回答打分时,会系统性地偏爱“读起来顺、像见过的好答案”的文本。哪怕两个答案在正确性上打平,带着“标准模板”痕迹的那个也更容易赢。

▲ arXiv 上的论文摘要页,v1 到 v4 的修订史见证了这个方法的快速迭代
于是,一个残酷的数学现实浮出水面:当奖励函数里被悄悄塞进一个“典型性加成”,RLHF 的优化目标便偏向“最不会出错的最好”。概率分布被幂次方式锐化,强者拿到更多概率质量,弱者被挤压到几乎看不见。而在创意写作、头脑风暴这类任务里,很多答案的真实质量本来就相差无几,典型性便成了唯一的胜负手。
这种“无聊”,恰是对齐算法认真执行偏好目标时产生的副作用。
把分布的“尖峰”重新摊开
论文作者们没有去重新训练模型,这是最聪明的部分。他们只是换了个问题
过去你问模型:“给我一个答案”模型就去分布的最高峰上摘一个果子给你。每一次都是同一棵树顶上的同一颗果子。 而论文提出的口头化采样(Verbalized Sampling, VS),是在问另一件事:“告诉我整片果园长什么样,每种果子有多少概率被摘到。”
做法听起来简单到不真实:一次生成多个候选,并让模型给每个候选一个概率估计。必要时,明确要求从分布的长尾,比如概率低于 0.10 的区域,去采样。

▲ 作者原推给出的核心提示词:要求模型输出候选及其概率分布
看起来只是加了个“概率”字段,但任务的性质被改变了。模型从“采样一个实例”切换到了“描述整个分布”。论文发现,这种“分布级提问”能把创意写作的多样性相对直接提问提升 1.6 到 2.1 倍,恢复约 66.8% 的基础模型多样性。在“说出一个美国州”这种可枚举问题上,直接提问的 KL 散度可以高达十几,而 VS 能把它压到接近 0.1,分布几乎被完整还原了。
论文还观察到一种“涌现”趋势:模型越强,VS 的增益越大。这让整件事带上了某种修辞感:那些最聪明、最有才华的模型,反倒被问得最不像自己。
一场从学术圈烧到工程圈的运动
论文于 2025 年 10 月挂上 arXiv 后,先后进入学术社区、提示工程圈和开发者讨论区。
论文发布 作者 Weiyan Shi 在 X 上发帖,以“让 ChatGPT 创意翻倍”介绍方法,并演示咖啡笑话的对比效果。论文、项目站与 GitHub 仓库很快构成完整的学术发布材料:verbalized-sampling.com 展示着那张著名的对比图,一边是“五个笑话全是同一个”,另一边是“五个笑话分布在不同模态上”,espresso 心理鸡汤、拿铁看心理咨询、404 错误、cold brew 自嘲,各不相同。
提示工程圈再发现 2026 年 8 月,@HowToPrompt 和科技评论者 @BrianRoemmele 用大众语言重新介绍论文,把对齐后的模型比作一个取悦多数人的滤镜。Brian 的长帖给出了一套完整模板:生成 10 个显著不同的候选,概率低于 0.10,禁止为新奇而故意奇怪,探索不同假设、框架、边界情形。

▲ Brian Roemmele 的长帖把论文方法整理成“长尾 + 概率 <0.10”的可复制模板
工程折中与反驳 评论区变成实验室:有人报告“终于写出了像样的笑话”,有人把流程封装成了可安装的 Skill,仓库地址也贴了出来。Ryan Kramer 则认为,模式坍缩正是 RLHF 按目标运作的结果,提示词只能绕行。奖励模型原本就会收窄分布;若想获得更丰富的输出,可以直接采样未对齐的 base model。

▲ 批评声音:提示词工程是在“系统边缘工作”,而非修复系统本身
一个关于“合群”的隐喻
抛开技术细节,这个故事最迷人的部分,是它折射出的人性。
典型性偏见,翻译成生活语言就是:我们总是更容易给“听起来对”的东西打高分。 招聘面试里那个说话最像“标准候选人”的人,融资路演里那个 PPT 最像“上一轮成功的公司”的创业团队,写作比赛里那篇读起来最像“范文”的文章。人类标注者把这些判断教给了AI,AI 又把它们放大成了“标准答案”。
所以大模型并未变笨它被教成了一个极度擅长配合社会期待的好学生,安全、流畅、无可挑剔,却逐渐失去让人停下来的那种“意外感”。
口头化采样做的事情,本质上是给“标准答案”之外的可能性一张被说出口的门票。模型权重和奖励机制保持原样,提问方式则改为列出多个可靠候选,其中也包括通常很少被选中的答案。
有作者合作者在讨论中坦承:对很多场景,人类确实天生偏好流畅典型的输出,典型性偏见也部分反映了真实用户效用。VS 最适合模拟、探索、合成数据、创意分叉这类强调覆盖面的任务。
所以,到底怎么用?
这条从论文落到产品层的路径,值得每一个 AI 用户记住。单纯调高 temperature 容易增加噪音,甚至破坏格式和解析;更稳妥的做法是在提示词里嵌入概率字段:
生成 10 个显著不同的响应,分别给出相对完整分布的概率估计。从长尾采样,瞄准概率低于 0.10 的候选。它们必须逻辑可靠、相关、有用,不许为新奇而故作奇怪。
这串字段的价值来自任务模式的切换:模型开始报告分布,不再局限于单点采样。用论文的话说,基础模型本来记得整片果园,默认解码却只摘树顶。

▲ 用户实测反馈:多样性“hard jump”且质量未下降
从论文到模板,从 GitHub 仓库到评论区争论,这条路径留下了一个清晰的方法论启示:创意未必消失了,只是默认提问方式不再请求它。 那把打开锁的钥匙一直含在模型自己的嘴里,换一种方式问它即可。
问问你自己吧:上次你的 AI 让你停在屏幕上,想了三秒钟,是在什么时候?

夜雨聆风