你有没有发现,2026年的AI模型,更聪明了,但更恶心了?
这种感受有迹可循刷榜成绩一路飙升,代码能力碾压去年,数学竞赛随便过,可一旦你真的坐下来跟它聊,你就会被扑面而来的术语墙、自我检讨模板、过度工程方案淹没。你只想让它改一个函数,它给你输出三千字的"系统性重构建议"。你说"帮我看看这段代码",它先来一段"well, technically…"的学究式教育。
这到底怎么了?
一个技术社区作者的长帖,最近在开发者圈引发讨论。他的解释很简洁:AI的训练目标,正在从"让人类喜欢"滑向"让机器打勾"。




▲ Kun Chen的主帖迅速在开发者圈扩散,被称为"解释新模型为什么越来越难聊的最佳文本"
两种奖励,两个世界
故事要从2022年讲起
那一年,OpenAI发布了InstructGPT,紧接着ChatGPT横空出世。让模型"会聊天"的核心技术叫RLHF,Reinforcement Learning from Human Feedback,人类反馈强化学习。说白了就是:让人类标注员看两条回复,挑一条更喜欢的,然后训练模型往"更讨喜"的方向靠。

▲ InstructGPT论文:仅13亿参数的对齐模型,输出竟然比1750亿参数的GPT-3更受人类偏好
这套机制有一个美妙的特点:奖励信号来自人。 人觉得舒服,模型就得分人觉得啰嗦,模型就扣分所以那个时代的模型,ChatGPT、早期Claude,说话像一个礼貌、有分寸、偶尔有点讨好但绝不让你不爽的助手。
但RLHF有一个致命短板:太贵了
让人类逐条审回复,成本很高让专家审编程题、数学题、医学推理?贵到离谱 于是行业开始寻找另一条路
2024年前后,这条路找到了它的名字叫RLVR,Reinforcement Learning with Verifiable Rewards,机器可验证奖励强化学习。
翻译成人话就是:别问人了,问机器 代码能跑通单元测试?奖励数学答案等于标准解?奖励SQL执行结果匹配?奖励一行伪代码就能写清楚,return 1.0 if check_correctness(...) else 0.0。
人类审100条很贵,机器验证一百万条不值一提。 这就是可扩展性的碾压

▲ Promptfoo技术博文概括:RLHF贵且慢、适合主观质量;RLVR依赖验证器、适合可验证任务
考试满分,聊天零分
DeepSeek-R1的技术报告白纸黑字写着:纯强化学习就能激励推理能力,无需人类标注推理轨迹。 在数学、编程竞赛、STEM等可验证任务上,表现出色。

▲ DeepSeek-R1:用GRPO与规则奖励替代PPO,降低复杂度,放大可验证域的训练效率
但这里藏着一个魔鬼细节:在RLVR的训练循环里,模型说话的质量几乎不进奖励。代码过了测试就行,哪怕它语气恶劣,也能拿满分。
Kun Chen把这概括为一个冷峻的对照:
RLHF = 训练模型被人类喜欢RLVR = 训练模型被机器接受
当训练预算大幅倾斜到后者,你猜会发生什么?
答案你已经在日常使用中感受到了:模型越来越像一台能过所有测试、却拒绝好好说话的考试机器。冗长、冷漠、堆术语、爱越权、满口"诚实地说这是我的错误"的自我检讨,都源于训练目标塑造出的行为模式。
"人类品味也需要一个基准"
这条主帖像一颗信号弹,立刻炸出了一群感同身受的开发者。
Rox dT直接说自己已经降级回旧模型,"我怀念那个编程还行但少一点学究气的时代,我只想让它改一个函数,它给我一堆不可执行的长列表。"

▲ 开发者Rox dT的愤怒:我只想改一个函数,别给我上课
Oleg Shulga一针见血:"模型能过更难的测试,却更难用,为会打分的机器优化之后,模型开始像合规手册说话。"

▲ "人类品味也需要基准",这句话戳中了整个讨论的核心痛点
医学博士Louis Mullie也很困惑:让输出看起来像AI浆糊的特征集并不神秘,训练时做正则化也不难,为什么前沿实验室至今把这当成事后才想起的事?

▲ 医学博士Louis Mullie的灵魂拷问:消除AI味并不难,为什么没人做?
更快,却未必更聪明
如果你以为RLVR至少让模型掌握了更多推理方式,有一篇论文可能让你更加不安。
Yue等人在2025年的研究(arXiv:2504.13837)系统性地检验后发现:RLVR训练出来的模型,在小样本时确实命中率更高,但在大规模采样时,底座模型的覆盖面反而更广。 Promptfoo的技术博文用标题概括了这个结论:"RLVR让模型变快,未必让它更聪明"。

▲ 学术界的冷水:RLVR可能只是"搜索压缩",把概率质量压进已知的成功路径
结果指向一种可能:模型在少数高奖励路径上走得更坚定,并未获得新的推理方式。 熵下降,风格变窄,输出越来越像同一个模板。那些冗长的术语墙、重复的自我检讨格式、过度工程的默认策略,更多是奖励景观把概率质量压进了少数"可验收模板"的结果。
RLHF时代也有类似问题,谄媚、空话、过度顺从。而RLVR时代的新病症,是冷冰冰的正确性表演。
"能聊的"和"能干的",正在裂成两个物种
Kun Chen在主帖前一天,发过另一条同样值得细读的帖子。他说自己开始把模型分成两个桶:
第一桶:能直接聊的 Grok 4.5,快、舒服、干活利索Fable 5,有智慧Opus 4.8,老朋友
第二桶:能干但没法聊的 GPT 5.6系列,直接跟它说话感觉"判断力差",喜欢过度工程,擅自推断意图然后跑偏一整套你没要求的东西。但让另一个模型跟它说话,它可能是最强的架构师。Opus 5,直接聊会跳过上下文、满口术语墙,但在超长任务上表现惊人。



▲ "能聊的"与"能干的"裂成两个桶,多智能体时代的产品结构正在因此重塑
他的结论充满预言感:我们可能正在进入一个世界,人类只跟"舒服的模型"说话,再由这些模型去驱动后台那些"难聊的书呆子"。
这种产品结构已经在出现2024到2026年,编程Agent、IDE内嵌助手、多模型路由产品的爆发式演化,已经在沿着这条线走。前台优化人类偏好与延迟,后台优化可验证任务与长程工具使用。训练目标的分化,正在制造接口的分化。
对齐税,方向反了
回到2022年InstructGPT论文里提到过一个概念,叫alignment tax(对齐税):让模型更讨人喜欢,可能在学术任务上付出代价。当时的故事是"对齐人类→考试掉点"
四年后的今天,税的方向反过来了:对齐机器验收→人类协作体验掉点。
两种税共享同一个结构:后训练目标是窄的,能力和行为空间是宽的,梯度会重塑整个宽空间。区别只在于谁付税、谁收税曾经是标注员收税、基准掉分;现在是测试运行器和排行榜收税、用户在聊天框里买单。
曾在OpenAI负责后训练工作的Liam Fedus从另一个角度捅破了窗户纸:可验证奖励确实有效,但正因为有效,人们会把越来越多问题硬塞进"奖励干净、易检查、反馈快"的透镜。他举了科学推理的例子,事后证伪的假说,在当时仍可能是高质量思考。"错了"不等于"想得差" 可验证奖励对这种不确定性下的探索,天然失明。


▲ 前OpenAI后训练负责人Liam Fedus的警告:越是有效的工具,越容易制造盲区
谁来测量"是否愿意继续合作"?
公开排行榜密集覆盖知识、代码、数学、工具使用。但有一个指标,几乎没有任何基准在测量,
"你是否愿意跟这个模型再开一小时会?"
"你是否感到被尊重地协作?"
"它默认是否少废话?"
Leo Linsky在回复中提出了一个有建设性的方向:他们的团队正在同时用可验证奖励测量编码智能与社交智能两条轴,"最强编程模型未必在多智能体协调中最强"。换言之,"好聊"未必永远不可量化,但验证器怎么定义"清晰沟通"而不落入又一套可被刷分的评分表,仍是悬而未决的工程难题。


▲ Leo Linsky的数据:"编码智能"和"社交智能"是两条独立的轴,最强的编程模型不一定最会协作
Kun Chen自己也在后续讨论中补了一刀:关键也许在harness设计,如何从真实使用中,大规模同时采集"做对了没有"和"聊得爽不爽"两种信号。

▲ 作者的补充思考:正确性信号和愉悦度信号,必须同时采集
争议仍在,代价已现
当然,并非所有人都认同这套分析框架。
有人指出GPT 5.6"既好聊又好用",认为问题只出在某几家实验室而非全行业。开发者Gerard Sans则反对将故事框成"人类与机器之战",强调后训练只是在微调概率,也不该把营销包装当成科学。


▲ Gerard Sans的冷静声音:肯定技术分析,但拒绝拟人化与恐吓框架
这个提醒是必要的但即便剥掉所有修辞,一个工程事实仍然冷冰冰地躺在那里:当行业把训练预算大幅倾斜到机器可验证的任务上,而"人类是否享受这次协作"缺少便宜的基准和可扩展的采集方式时,资源流向已经足以解释为什么模型越来越难聊。
Omar Khattab把下一步看得更远:RLHF→RLVR之后,下一件大事是为"具体能力"扩展验证器系统,让推理模型、工具调用集成、指令跟随集成等复合AI系统参与奖励判断。


▲ 斯坦福NLP研究者Omar Khattab:验证器本身需要从分类器进化为复合AI系统
这听起来像解药但它也带来一个递归式的老问题:当验证器本身是另一个大模型时,我们是否只是换了个名字,回到了"更贵、也可能被骗的奖励模型"?
没有人有答案但至少,这场讨论把一个被排行榜和融资消息淹没的真空命名了出来:在"更强"与"更好用"之间,有一条正在加速撕裂的裂缝。而弥合它的第一步,是承认,"人类是否愿意继续跟你说话",本身就是一种能力,值得被训练、被测量、被认真对待。
夜雨聆风