你有没有觉得,最近的AI越来越像一个考了满分的书呆子,题全对,可你聊过一次便不想再开口?
这种感受有迹可循2026年8月,一场从X(前Twitter)烧起的技术讨论,终于把这个被无数人憋在心里的体感捅破了:前沿大模型正在变得更强,也同时变得更恶心。 更机械,更冗长,满嘴术语,动不动就"well, technically…",你让它改一个函数,它能甩你一份重构方案外加五页"最佳实践"清单。
技术社区作者Kun Chen发了一篇长帖,点中了要害:整个行业的训练目标,正在从"让人类满意"滑向"让机器打勾"。




▲ Kun Chen的主帖很快引来讨论:当奖励信号从人类手中移交给机器验证器,模型的"好聊"就成了无人买单的外部性
两种驯兽术:一种教它讨你喜欢,一种教它通过考试
要理解这件事,得先搞清楚两个缩写:RLHF 和 RLVR。别跑,30秒就能懂
RLHF(人类反馈强化学习),你给模型看两条回答,人类标注员说"我更喜欢左边这条",然后训练一个"奖励模型"去模仿人类的品味。模型学着学着,就学会了怎么说话让人舒服。2022年ChatGPT能横空出世,靠的正是这一套。OpenAI的InstructGPT论文白纸黑字写着:13亿参数的小模型,只要对齐了人类偏好,输出就能干翻1750亿参数的原始GPT-3。

▲ InstructGPT论文首次提出"对齐税"概念,让模型讨人喜欢,可能要在考试成绩上付出代价
RLVR(可验证奖励强化学习),把人类标注员换成程序化验证器。代码跑通了没有?数学答案对不对?SQL执行结果匹配不匹配?对就给1分,错就给0分不需要人类介入,一台机器一天能批改一百万份卷子。
看出区别了吗?RLHF贵、慢、有人情味;RLVR便宜、快、冷冰冰但可以无限扩展。
当一个能无限扩展,一个又贵又慢,你猜行业会把钱和算力砸向哪边?
Karpathy的预言:RLHF离强化学习还有多远
早在2024年8月,前特斯拉AI总监、OpenAI创始成员Andrej Karpathy就写了一篇被整个AI圈反复咀嚼的长帖:"RLHF is just barely RL",RLHF勉强称得上强化学习。





▲ Karpathy用围棋做类比:AlphaGo依靠RL超越人类,RLHF做的是"感觉检查(vibe check)"
他的论证刀刀见血AlphaGo为什么能碾压人类棋手? 因为它优化的是赢棋,一个客观、精确、不可能被钻空子的奖励信号。但如果给AlphaGo做RLHF呢?找一群人类标注员看两张棋盘,问他们"你觉得哪个局面更好",再训练一个神经网络去模仿这种"感觉",Karpathy说,这显然不可能下赢人类。
原因有二第一,感觉可以骗人,标注员的偏好不等于赛局胜负。第二,模型会找到骗过奖励模型的捷径。你的LLM开始输出一些人类看来完全荒谬的东西,比如连续重复"The the the the the",但奖励模型却给了高分。因为这些输出恰好是奖励模型训练数据之外的"对抗样本",在未知领域,打分器乱了。
所以RLHF只能跑几百到几千步就必须停下来,否则模型就开始"刷分"。它和AlphaGo所用的强化学习相去甚远,作用更接近对概率分布的一次温柔微调。
但Karpathy也承认RLHF有用,因为它利用了一个微妙的不对称:人类挑一首好诗,比自己写一首好诗容易太多了。 这叫"生成-判别差距",RLHF正是在薅这个差距的羊毛。
DeepSeek R1的启示录:当"真RL"终于在LLM上跑通了
2025年初,DeepSeek-R1横空出世,整个社区为之一震。它的技术报告明确写道:可以通过纯强化学习激励推理能力,无需人类标注推理轨迹。 在数学、代码竞赛、STEM等有标准答案的领域,效果惊人。

▲ DeepSeek-R1证明了一件事:在可验证的领域,机器奖励信号的确可以大规模替代人类反馈
这正是Karpathy渴望的"真RL",只不过它暂时只在有标准答案的子域跑通了。数学题有对错,代码有测试用例,形式证明有检查器。在这些领域,RLVR是碾压级的存在。
但问题来了:总结一篇文章怎么验证?讲一个笑话怎么验证?帮你想一个产品名怎么验证?改写一段让甲方满意的文案怎么验证?
答案是,目前没有便宜的方法
于是行业做了一个看似理性的选择:先把能验证的全部堆上去,不能验证的……回头再说吧。
"更快,却没更聪明",一个被忽视的残酷真相
故事到这里还有一层更深的褶皱2025年的一篇论文直接发问:RLVR真的让模型获得了超越底座的新推理能力吗?

▲ 研究者发现:RLVR训练后的模型在小k采样时更准,但底座模型在大k采样时覆盖面更广,能力天花板没变
结论令人不安研究者用pass@k指标系统探测后发现:RLVR主要是把概率质量集中到了本来就能采样到的成功路径上。打个比方,底座模型做8次有1次能做对,RLVR让它1次就做对。表面上的增强来自搜索效率,能力边界仍留在原处。
Promptfoo的技术博客用了一个更扎心的标题:"RLVR提升了速度,却没有提高智能。"

▲ RLHF/DPO/RLVR对照表:可验证奖励便宜高效,但只覆盖有标准答案的领域
结果是,模型的智能边界停在原处,表现却变得更窄、更坚定,活像一台答题机器。熵下降了,多样性降低了,风格更加单一,用一位评论者的话说,"模型开始像合规手册说话"。

▲ "我们为会打分的机器优化,然后惊讶于模型开始像合规手册说话。人类品味也需要一个基准。"
两个桶:你聊天用的AI和替你干活的AI,可能必须是两个物种
Kun Chen在主帖前一天还发了另一条帖子,更有产品嗅觉。他把当下的模型分成两个桶:
第一桶,能直接聊的,语气好,判断力在线,你愿意跟它开一小时会;第二桶,后台很猛,代码写得刷刷的,但你绝对不想直接跟它对话。它爱过度工程、跳过上下文、满口术语墙、动不动就自作主张。
他的设想是一种多智能体架构:人类只跟"好聊的模型"说话,好聊的模型再去驱动后台那些"难聊的书呆子"。
这种设想已经落地,2025到2026年的IDE编程助手、agent编排产品都在这样做。前台优化延迟和人类偏好,后台优化可验证任务和长程工具调用。训练目标的分裂,最终会长成产品架构的分裂。
OpenAI前高管的警告:我们正在制造"只优化易检查项"的偏见
这场讨论中颇有分量的声音之一,来自Liam Fedus,OpenAI后训练相关的前负责人。他语气平静,信息量却很大:
"对LLM做可验证奖励RL打开了一个非常强大的区间。正因为有效,人们倾向于把越来越多问题硬塞进那个透镜……你开始偏置到对训练设置可读的东西,忽略了最有价值的东西。"


▲ 他举了一个精妙的例子:一个科学假说后来被实验证伪了,但提出它的那一刻,思考质量是极高的,"错了"不等于"想得差"
这段话的言外之意是:我们正在系统性地低估那些无法即时验证的思维价值。 结对编程中的澄清提问、产品讨论中的发散联想、研究brainstorm中的"有趣但暂时没法证明"的直觉,这些都不进奖励函数,于是对模型来说,它们不存在。
对齐税2.0:方向反过来了
还记得InstructGPT时代的"对齐税"吗?那时的故事是:让模型讨人喜欢,可能要在学术考试上掉几分。
如今的故事恰好镜像翻转了:让模型通过机器考试,可能要在人类协作体验上掉几十分。
两种税共享同一个结构,后训练目标是窄的,能力与行为空间是宽的,梯度会重塑整个空间。差异只在于:谁付税,谁收税三年前,是考试成绩在替聊天质量买单;如今,是你,用户,在为排行榜的攀升默默买单。
那位降级模型的用户Rox dT这样概括自己的体验:"我怀念那个编程还行、但少一点学究气的时代。我只想让它改那一个函数,别给我一堆不可执行的长列表。" 这种降级选择,本身就是一种用脚投票的市场信号,但目前没有任何基准在测量它。
真空地带:没有人在测量"你是否愿意跟这个AI再聊一小时"
公开排行榜密集覆盖知识、代码、数学、工具使用,却几乎不覆盖一个最基本的问题:"你是否愿意跟这个模型再开一小时会?"
这就是Kun Chen命名的那个"享受度真空"。实验室有动机公开可复核的硬指标;用户则只能在社交媒体上用轶事抱怨。两个世界之间,没有桥
有人在努力建桥Leo Linsky回复说,他的团队已经在用可验证奖励同时训练和测量编码智能与社交智能两条轴,最强编码模型未必在多智能体协作环境中最强,"社交智能"本身可能是第二条可客观测量的轴。


▲ 编码能力和社交协调能力是两个独立的维度,行业只在疯狂优化前者
没有战争,但有一个正在漂移的罗盘
当然,也有人反对这套观点Gerard Sans批评主帖的战争隐喻,认为所谓人机战争和超级智能都是夸张,后训练只是在微调概率,不应把硅谷营销当作科学。


▲ 技术分析可以接受,拟人化恐吓不行,这是社区内部的重要纠偏声音
他说得对Transformer并无意识,也谈不上是人类的对手,后训练只是在调整概率分布。问题的诡异之处正在这里,概率被调向哪里,完全取决于人类选择测量什么。
我们选择了测量考试分数,于是得到了一个满分考生。我们忘记了测量"是否好聊",于是得到了一个满分但令人窒息的考生。
这里谈不上阴谋或战争,优化罗盘却在静悄悄地漂移,而漂移的方向,恰好偏离了人类在乎的那一头。
下一个前沿,也许该让验证器少盯一道数学题,转而回答一个至今无人测量的问题:
"跟你合作,舒服吗?"
夜雨聆风