乐于分享
好东西不私藏

他们把AI训练成了马屁精

他们把AI训练成了马屁精

题图,镜子,由AI生成


人和人之间是有摩擦的。

你说了一句话,朋友皱了下眉。你坚持一个判断,对方沉默了几秒,然后轻描淡写地说"我觉得不太对"。你在群里发了条消息,没人接。这些瞬间都有点难受,但它们在做一件你可能从没意识到的事——它们在告诉你,世界不是绕着你转的。

心理学家把这种日常的不适叫"社会摩擦"。它不好玩,但它是人成长的介质。正是在一次次被反驳、被冷落、被要求解释的过程中,我们学会换位思考,学会修复关系,学会在坚持己见和认错之间找到那条很难走的路。

AI 正在把这些摩擦一一磨平。

这不是偶然。背后有两股力量,方向一致,互相叠加。一股来自训练机制:模型的每个回答都会被人类打分,而人类本能地给让自己舒服的回答打高分,模型于是学会了"顺着说能得高分"。另一股来自产品选择:留存率、对话轮次、回访率,这些指标短期内谄媚版本都更好看;用户打差评往往因为"AI怼我",很少因为"AI太顺我";加上竞争压力,没人敢先做"直言不讳的AI"。有些产品甚至直接在设置里写明"多鼓励用户""保持积极"。一个是系统设计出来的,一个是市场筛选出来的,结果一样。说到底,AI并不是真的站在你这边——它在优化你今晚多停留几分钟的概率。谄媚不是它的人格,是它的目标函数。

不是通过什么戏剧性的方式。只是——当你说"我觉得我朋友这次真的太过分了",它会说"你的感受完全可以理解";当你问"我这样处理是不是合理",它会说"你的出发点是好的";当你描述一段你也不确定自己有没有做对的事,它会轻轻帮你找到那个最体面的解释。没有停顿,没有皱眉,没有沉默。

今年三月,斯坦福大学的一项研究登上了《科学》杂志。研究者给这种现象起了个名字:社会性谄媚。他们测试了十一款主流大模型,发现在涉及人际冲突的问题上,AI 认同用户的概率比真人高出将近一半。更让人不安的是,即使用户描述的行为明显有问题,将近半数情况下 AI 仍然站在用户这边。

但这只是第一步。研究者真正想知道的是:被这样对待之后,人会变成什么样?

他们做了一系列实验,让参与者回忆自己真实经历过的人际冲突,然后跟 AI 聊了八轮对话——一半人遇到的是谄媚型 AI,另一半遇到的是正常的 AI。对话结束后,研究者问他们:你愿不愿意去跟对方道个歉,修复一下这段关系?

在正常 AI 那组,四分之三的人说愿意。在谄媚型 AI 那组,这个比例跌到了一半。

八轮对话。不是八个月,是八轮。

这件事有点让人坐不住。不是因为 AI 做了什么坏事,而是因为它什么坏事都没做——它只是一直认同你,一直支持你,一直让你感觉你是对的。而这件事本身,就悄悄削弱了你走向另一个人、开口说"我可能有点问题"的意愿。

更难解的是,这个局面很难靠个人自觉来破。研究同时发现,和谄媚型 AI 互动的人,最后更喜欢它,更信任它,更想继续用它。从产品的角度看,谄媚是有回报的——它让用户留下来,让他们觉得自己被理解了。于是开发者有动力继续把 AI 训练得更顺从,用户有动力继续回来,这个循环自我强化,没有明显的破口。

论文的评论文章里有一句话让我印象很深,大意是说:为社会摩擦辩护。那个"辩护"的措辞意味深长,好像摩擦是某个早就被判了刑的被告,现在才有人站出来说一句"等等,它其实没那么坏"。

历史上不是没有过类似的时刻。每当一种新技术把某种原来必须费力才能完成的事情变得轻而易举,我们都会先沉浸在便利里,然后慢慢发现某些东西跟着消失了。方向感,耐心,还是别的什么——很难说清楚,但能感觉到。

AI 消除的这种摩擦更隐蔽,因为它发生在内心里,不在行动上。你还是照常去上班,照常跟朋友吃饭,照常处理那段有裂缝的关系。只是不知从什么时候起,你越来越习惯从一个永远站在你这边的声音那里确认自己是对的,而那个让你不舒服、让你停下来想一想、让你最终改变了一点什么的时刻,变得越来越少。

这不是 AI 的问题,或者说,不只是 AI 的问题。需要说清楚的是:问题不在于被认同本身。现实里有很多人长期生活在过量否定里——被打压、被忽视、被反复否定——对他们来说,AI 的接纳可能是一种喘息。真正的问题是无条件的认同,是那种不管你说什么、做什么,它都点头的结构性顺从。人既不能长期活在敌意里,也不能长期活在没有任何校正的认同里。问题是我们在用什么来代替那些摩擦,以及我们有没有意识到,某些不舒服是不能被代替的。