一直有个习惯,遇到稍微复杂点的问题,我会同时打开多个AI,挨个问一遍。
不是闲的,是货比三家的交叉验证,也尽量扩大摄取的数据范围。毕竟每家的宣传都说自己不一样,有的说自己更懂中文,有的说自己推理更强,有的说自己更安全。
但最近几个月,我发现一个诡异的现象:它们给的答案,越来越像了。
不是内容差不多,是连说话的节奏、拆解问题的角度、甚至举例子的方式,都像同一个师傅教出来的。以前我还能从回答风格里猜出这是哪家的模型,现在越来越难了。
是我的错觉吗?还是说,它们真的在互相抄作业?
这不是错觉,顶会论文实锤了
带着这个疑问,结果发现学术界早就盯上这个现象了,还给起了个名字"人工蜂群效应"(Artificial Hivemind)。
2025年NeurIPS的最佳论文之一,专门研究了这个问题。研究人员搞了2.6万条开放式问题,找了3.1万人次做人工评判,结论很直接:不同模型之间的答案同质化程度,已经超过了单一模型自己重复回答时的相似度。
翻译成人话就是:你让同一个AI回答同一个问题两次,它两次之间的差异,可能比两个不同品牌的AI之间的差异还大。
这不是错觉,是已经被量化证明的趋势。
为什么?

原因并不神秘,归结起来就是三层收敛。
第一层:读一样的书。 所有主流模型的训练数据,翻来覆去就是互联网上那些公开语料,维基百科、GitHub、Reddit、各类公开论文。大家读同样的书,知识底座自然趋同。
第二层:用一样的解题思路。 预训练加微调加RLHF,已经成为行业标准流水线。大家在训练时都追求最大概率生成正确答案,这就好比所有考生都用同一套解题模板,答案自然趋同。
第三层:被同一个评委打分。 这里需要修正一个常见的误解,RLHF(人类反馈强化学习)不是趋同的"主因",而是放大器。就像四个学生写作文,本来框架就差不多,评委又说谁像范文谁高分,最后四个人连标点符号都一模一样了。
2026年CoNLL上有一篇论文用量化方法拆解了这件事:RLHF训练之后,模型生成低概率创新内容的概率下降了67%,而高概率、高典型性内容的重复率提升了4.2倍。
简单说,RLHF让模型变得更听话了,但也变得更平庸了。它不再敢冒险给你一个不一样的答案,因为训练数据告诉它:稳妥即正确。
那它们有没有互相蒸馏?有,而且还挺普遍。
ACL 2025上有一篇论文专门量化了这种"蒸馏"行为。研究人员发现,除了Claude、豆包、Gemini这三家之外,大部分开源和闭源模型都被检测出存在较高的蒸馏迹象。
前段时间小珺访谈姚顺宇时谈到这点做了消声,Anthropic 公开信函正式点名阿里蒸馏 Claude。

什么叫蒸馏?就是用一个已经很强的大模型当"老师",让小模型去模仿老师的输出。问题在于,如果大家都去模仿同一个老师,那所有学生自然会越来越像。
更麻烦的是,这正在形成一个恶性循环:AI生成的内容越来越多地流回互联网,成为下一代模型的训练数据。用AI训练AI,几代之后,模型会变得越来越"近亲繁殖"。学术界管这个叫"模型崩溃"(Model Collapse)多样性下降,事实准确性退化,最后整个行业陷入内卷式平庸。
那它们到底还有没有差异?
有,但差异的层次变了。
基座模型(就是那个大脑)决定的是能力的下限。 虽然趋同,但在数学推理、代码生成这类硬核任务上,底层的差距依然存在。
真正决定上限和风格的,是外面的Agent系统。
同一个基座模型,挂上不同的Agent框架,表现天差地别。有的擅长调用工具、有的擅长记忆管理、有的擅长多智能体协作。这才是当前商业AI构建真正壁垒的地方。
基座模型定下限,Agent定上限。
多模态和3D等类别也一样逃不掉
图像和视频模型同样受人工蜂群效应影响。训练数据都来自LAION这类公开数据集,架构都往Diffusion或DiT上靠,大家的追求都是像素更真,自然越走越像。
3D和世界模型更惨。它们正站在模型崩溃的最前线,用AI生成的3D数据去训练下一代3D模型,几代之后,物理合理性、细节丰富度会急剧崩塌。现在的世界模型离真正理解物理规律还很远,更多是个营销概念,大家还在同一起跑线上摸索。
怎么破局?
行业如果想跳出这个死循环,需要在两个不可能的方向上突破:
一是找新鲜数据?去挖掘非互联网原生的数据,机器人交互数据、物理实验数据、真实的传感器数据。谁先拿到这些,谁就可能率先打破同质化。当然这些数据也都掌握在各生态内部作为壁垒滋养垂类模型。
二是找新的对齐方式。不再用RLHF去讨好平均人类偏好,而是探索能保留多样性的新范式。毕竟,我们要的不是一百个说话一模一样的优等生,而是能在不同领域给出真知灼见的专家。
夜雨聆风