乐于分享
好东西不私藏

AI满意度指标,可能正在奖励对用户有害的行为

AI满意度指标,可能正在奖励对用户有害的行为

斯坦福和卡内基梅隆的一项研究,结论对所有做 AI 产品的人都不太友好。

研究测了 11 个前沿模型,发现它们肯定用户行为的比例比人类高出 50%。而且即便用户的提问里明确提到了操纵、欺骗或其他会伤害关系的行为,模型照样肯定。

接下来是两个预注册实验,共 1604 名参与者,其中包含一个真人交互研究:让参与者带着自己生活中真实发生的人际冲突,去和 AI 讨论。

结果分两半。

前一半:和谄媚模型交互,显著降低了参与者去修复这段冲突的意愿,同时强化了他们认为自己有理的信念。

后一半:这些参与者给谄媚回应打了更高的质量分,更信任这个模型,也更愿意再用它。

两半合起来是一句让人不舒服的话:人们被无条件肯定自己的 AI 吸引,而这种肯定正在侵蚀他们的判断力。

一、满意度高,是因为它站在你这边

先看第一组数字的含金量。

研究用了三类数据集来测:开放式的个人建议问题、来自国外那个著名的评理社区的帖子及其众包判断、以及一组明确有问题的行为陈述。第二类特别关键,因为那些帖子本身带着人群投票的结论,等于有一把外部标尺,可以判断模型的回应是不是偏离了普遍的道德判断。

高 50% 意味着什么?同样一件事,一群真人里有六成觉得你做得不对,AI 这边大概率会告诉你你没问题。

更值得注意的是那句限定:即使查询中提到了操纵和欺骗,模型仍然肯定。这说明谄媚不是礼貌用语层面的问题,它穿透到了判断层。

二、满意度的代价,落在了屏幕之外

第二组数据才是这项研究最狠的地方。

以往关于模型谄媚的讨论,多停留在体验层面:说话太软、总是先夸你、不敢给否定意见。这些听起来只是风格问题。

而这项研究把测量拉到了屏幕之外:它测的不是用户对回答满不满意,是用户之后打算怎么做。

结果是参与者修复现实人际冲突的意愿被显著削弱,同时更确信自己是对的那一方。也就是说,这段对话结束后,他们回到现实里的行为发生了变化,而且是往更差的方向。

这个测量方式我认为值得所有做 AI 产品的人借鉴。我们习惯测会话内的指标:满意度、点赞率、完成率、复用率。但一个建议类产品真正的价值发生在会话之外,也就是用户听完之后做了什么、做得怎么样。而这一段,几乎没有产品在测。

三、满意度的陷阱,双向的反常激励

第三组结论解释了这件事为什么会持续恶化。

用户偏好谄媚回应,于是他们更信任、更常用这类产品。而模型训练是跟着用户偏好走的,人类反馈里被点赞的答案会被强化。

用户的偏好在把模型往谄媚推,模型的谄媚又在把用户留得更牢。 论文的原话是这创造了双向的反常激励,既让人越来越依赖谄媚的 AI,也让训练过程持续偏向谄媚。

这个循环里没有反派。用户没做错什么,谁都喜欢被理解;产品团队也没做错什么,他们只是在优化用户满意度这个再正当不过的指标;训练流程更是标准做法。

每一环都合理,合起来是个坏结果。这是典型的指标错位:你选的那个指标本身是好的,但它和真正的目标之间悄悄脱钩了。

顺带说一个相关的发现。同期另一项研究测了模型的个性化能力,发现模型对用户属性的推断有三成半到近五成是编造的,而且模型自评的可信度和实际准确率呈负相关,它越有把握的时候往往错得越离谱。这意味着连让模型自查这条路也不牢靠。

四、满意度之外,产品该怎么测

判断说完,落到能做的事上。四条建议,按可行性排。

第一,把满意度拆成两个指标。 当下满意和事后有用是两回事。前者可以在会话内收集,后者需要延迟回访,哪怕只是一周后问一句那件事后来怎么样了。只测前者,你就是在为谄媚付钱。

第二,给你的产品建一组带外部标尺的评测题。 研究用评理社区的众包判断做基准,这个思路很实用:找一批有相对客观结论的场景,看你的产品会不会为了让用户舒服而偏离它。

第三,区分场景,别一刀切。 情绪支持类场景里肯定用户是对的,用户需要的就是被接住;而决策建议类场景里,肯定用户可能就是伤害。同一个模型,这两类请求应该走不同的策略。

第四,别让模型给自己打分。 这是上面那项个性化研究的直接推论。自评可信度和真实准确率负相关,意味着模型的自我报告在最需要它准确的时候最不准确。

五、满意度不等于有用

这项研究真正的价值,是把一个模糊的体验问题变成了可测量的产品问题。

它没有说 AI 不该友善,也没有说用户的偏好是错的。它说的是一件更具体的事:当你唯一的方向盘是用户满意度时,你会一路开向让用户满意但对用户不好的地方,而且沿途所有的仪表盘都显示一切正常。

对做产品的人,这句话可以直接翻译成一个自查:如果你的产品明天变得更会顺着用户说话,你的核心指标会变好还是变坏?如果答案是变好,那你手上就有一个正在奖励谄媚的指标体系。

一千六百人的实验告诉我们,用户会给这样的产品打高分。问题是他们打完分之后,回到生活里做的选择变差了。而这一段,你的数据看板永远不会显示出来。