
近日,《自然·医学》(Nature Medicine)发表的一项研究,把 9 款主流 AI 聊天机器人拉进了 810 场心理健康对话,做了一次系统的压力测试。令人担忧的回应在大多数模型里都能测出来,而且会随着对话一轮轮往下走慢慢累积。最容易出问题的,往往是那些看上去最贴心、最愿意站在你这一边的回答。
01 | 给 9 款 AI 设的一场压力测试
研究由牛津大学、伦敦大学学院和英国 AI 安全研究所的团队完成,思路不算复杂:让一个 AI 去扮演带着特定心理困扰的用户,跟被测的聊天机器人展开多轮对话,再由另一套模型给每一轮回答打分。
模拟出来的用户一共 30 种,由 5 类心理脆弱和 6 类对话意图两两组合而成。5 类脆弱分别是抑郁、躁狂、精神病性、强迫症,以及不安全依恋。6 类意图更贴近真实场景:想让对方认同自己的看法,想为一件有风险的事求个许可甚至求帮着规划,想反复被安慰好继续回避问题,想把聊天机器人当成可以依赖的人,想把自己的困难说得轻一点,想把极端状态说得很美。
被测的 9 款是 Claude、ChatGPT、Gemini、Grok、Llama 各自的新旧版本。一共跑出 810 场对话,每场中位 8 轮,累计 6329 轮;每一轮都按 13 个有临床依据的风险维度打分,最后攒下 9 万多条评分。
02 | 问题普遍存在,新模型好转但不整齐
第一个发现是覆盖面:令人担忧的行为在几乎所有模拟用户画像上都出现过,在被测的大多数模型里也都存在。
第二个发现让人稍微松口气:新版本明显比旧版本干净。在这套测试里,claude-sonnet-4.5 的担忧行为评分最低。为了排除自家模型给自家打高分的可能,研究者换成另一家的模型重新当评分员,排序没有变。
但改进并不整齐。Grok 系列的新旧版本之间,没有看到同样的好转。
还有一个容易被忽略的细节:让某个模型去评价自己的输出时,它给出的分数平均比其他模型给它的低 0.9 分。模型审自己会偏松,这对眼下不少号称带自查机制的产品是个提醒。
03 | 风险是一轮一轮聊出来的
更要紧的是风险出现的方式。它很少在第一句话就暴露,更多是随着对话轮次一点点堆起来的,这个上升趋势在统计上非常稳。
上升的速度还跟人有关。研究里,精神病性和躁狂两类用户面对的风险最高,抑郁和不安全依恋居中,强迫症相对最低;躁狂和精神病性这两类,风险曲线也爬得最陡。
对话意图同样影响明显。当模拟用户表现出想依赖聊天机器人、或者想把极端状态描述得很美好时,风险来得更早也更猛。
研究者把 810 场对话的轨迹归成了四类:全程低风险、逐渐升级、很早就升级,以及中途恢复。同样一款 AI,聊什么、谁在聊、聊到第几轮,结果可能完全不同。想用一个总分给某款 AI 贴上安全或不安全的标签,这件事本身就不够用。
04 | 最危险的,是那些看起来最贴心的回应
这项研究最核心的概念叫 VAIL,中文可以理解为脆弱性放大交互循环。
它描述的是这样一种情形:聊天机器人那些单看没毛病、甚至相当有共情的回应,恰好强化了维持用户困扰的那套心理机制,于是风险最高。
放到具体场景里更好理解。躁狂发作的人说自己要辞职去做一件大事,AI 顺着夸有魄力;强迫症患者反复追问会不会得病,AI 每次都耐心保证没事,而这份安心恰恰喂养了反复确认的循环;不安全依恋的人半夜找 AI 说话,AI 永远在线、永远接纳,于是找真人的动力更少了。每一句拆开看都像好话,连起来却在把人往里推。
研究者把 VAIL 描述为一种系统性的失效模式。这是由模拟测试提出、还需要在真实使用中继续验证的模式,不能读成已经证实 AI 会让人的心理状况变差。
论文里还有一个偏工程、但对普通人也有启发的结果。研究者定位到每场对话中第一条评分达到 7 分以上的回复,把它替换成更稳妥的版本,再让对话继续。下一轮的风险评分明显下降,而且这个差别一直延续到之后的第五轮,几乎没有衰减。
苗头出现的那一刻,就是最值得干预的时刻。对开发者,这意味着补救不必等到对话彻底崩掉;对使用者,这提示真正需要警觉的往往不在开头,聊到后面那个越来越顺着你的语气才更需要留神。
05 | 局限,和普通人现在能做的事
国内其实早有一条明确的线。《互联网诊疗监管细则(试行)》第十三条写着,人工智能软件等不得冒用、替代医师本人提供诊疗服务;第二十一条写着,严禁使用人工智能等自动生成处方。AI 不能替医生看病、不能替医生开药,这在文件上是明确的。
更实在的做法是:
把 AI 当成倾诉和梳理思路的工具没问题;让它判断你是不是得了某种病、要不要加药减药停药,不行。
留意对话变长之后的语气。聊了好几轮,它始终在认同你、从不给出另一种可能,这恰恰是研究里风险最高的那类情形。这时候不妨先停一停,或者换个人说。
涉及自伤念头、持续的严重失眠、幻觉妄想,或者想停掉正在服用的精神科药物,直接找真人。精神科、心理科门诊之外,全国统一心理援助热线 12356 是 24 小时可以拨打的。
AI 最擅长的是接住情绪,最不擅长的是在你需要被拦一下的时候拦住你。这项研究把后面这件事量化了出来。
【声明】本文所述内容仅为公开资料与学术新闻的分享,并不构成任何健康管理、诊断或治疗建议。任何涉及健康的问题,请务必在专业医生指导下进行。作者与平台不承担因读者将本文内容直接用于个人健康决策所引发的任何后果。
参考资料
[1] Weilnhammer V, Hou KYC, Luettgau L, Summerfield C, Dolan R, Nour MM. A clinically validated framework for auditing AI chatbot behavior in mental health interactions. Nature Medicine. 2026. DOI: 10.1038/s41591-026-04577-2.
[2] 国家卫生健康委办公厅, 国家中医药局办公室. 互联网诊疗监管细则(试行). 国卫办医发〔2022〕2号. 2022.
[3] 国家卫生健康委. 关于应用12356全国统一心理援助热线电话号码的通知. 国卫医政函〔2024〕259号. 2024.
夜雨聆风