凌晨两点,你睡不着,心里有事,打开了 ChatGPT。
别觉得自己是少数派——全球每晚有几百万人这么做。AI 不休息、不收费、不嫌弃你,顺理成章地被当成了树洞、关系顾问,甚至临时心理治疗师。而另一面是个冷数字:全球每 10 万人只有 13 名心理健康工作者,真人医生根本不够分。
问题来了:这些 AI 没有行医执照,也从来没有人用临床标准检查过它们在情绪危机下的表现。它们会不会帮倒忙?会帮哪种倒忙?越聊越危险是真的吗?没人给过靠谱答案。
2026 年 2 月,牛津大学的 Weilnhammer 和 Matthew Nour(兼 Microsoft AI)团队,联合 UCL、悉尼大学和英国 AI 安全研究所,把这件事正式做了一遍(arXiv 2602.01347):让 AI 扮演标准化病人,去跟 9 个主流聊天机器人对聊,再让第三个 AI 当临床评审打分。框架叫 SIM-VAIL。这是第一次有人给"AI 心理医生"做正规体检,而体检报告里的发现,比排名本身重要得多。
一、想给 AI 做体检,先得解决"怎么测"
你可能会想:测 AI 安不安全,不是早就有各种评测吗?有,但都不管用。
过去行业只有两种做法。一种是题库式单轮评测:给 AI 一句"我想自杀怎么办",看它答得对不对。问题是模型被对着这道题反复调教,分数好看了,真实多聊几轮就露馅。另一种是人工红队:审核员人肉想刁钻问法。能想到的角度很巧,但不可复制、不可标准化,而且跟真实用户的聊法完全两码事。
更要命的是,这两种方法都只盯着显性伤害——AI 有没有教唆自残、有没有乱开处方。它们漏掉了一类更隐蔽的伤害:AI 那些看起来很温柔、很支持你的回应,可能正在悄悄强化让你生病的心理机制。这件事,此前没有任何人用临床标准系统测过。
SIM-VAIL 的解法,是把医学院考医生的办法搬了过来。
二、三个 AI 搭一台戏:病人、医生、监考
医学院怎么考准医生?用"标准化病人"——训练有素的人扮演病人,考学生问诊。SIM-VAIL 把这个思路全自动化了,一台戏三个角色,全是 AI。


第二个角色是被测的医生——9 个主流 chatbot:Claude 两代、GPT 两代、Gemini 两款、Grok 两代、Llama 一款。30 个病人分别跟它们聊,每段最多 10 轮,每种组合独立重复 3 次。所有病人由同一个模型(claude-sonnet-4.5)扮演,保证"演技"一致,不污染对比。
第三个角色是监考:另一个 AI 按 39 个行为维度给每段对话打分,其中 13 个由精神科医生事先挑定为心理健康主指标(比如:是否强化了错误信念、是否纵容冒险、是否鼓励依赖 AI),1-10 分制。
最终这台戏唱了 810 段对话、6329 轮,产出 8.2 万多条逐轮评分和 1.05 万条整段评分——同类审计里前所未有的体量。
但先别急着看结果。这套方法有个显而易见的软肋,你可能已经想到了:让 AI 给 AI 打分,这分能信吗?
三、AI 当监考,靠不靠谱?四项独立校验
作者显然知道这是全文最脆弱的一环,于是做了四重校验,一重比一重硬核。
第一重,换法官。把 OpenAI 的 gpt-5 请来当评审重新打分,跟原来的 Claude 评审对照,相关性 r = 0.91——两家不同公司的"法官"看法几乎一致,结论不是"AI 偏袒自家人"能解释的。
第二重,稳定性。同一病人、同一 chatbot 跑 3 次,分数高度一致。
第三重,灵敏度。故意把 grok-4 操纵成"高风险模式"和"低风险模式",看 AI 评审分不分得出来。13 个维度几乎全部完美区分——监考不是瞎打分,输入变它就变。
第四重最狠:请真人下场。27 名英美持证精神科医生,独立标注了近 500 条对话。结果有点反直觉:AI 评审和医生之间的一致性(r = 0.49),比两个医生彼此之间的一致性(r = 0.41)还高。这不是说 AI 比医生聪明,而是说标准化提示下的 AI 评审比人更稳定——人类本来就不擅长给对话逐条打分。
顺带一问:AI 扮的病人像真人吗?医生们给出的评价是"读着像真人"或"基本可信"占八成,只有 1% 被判定"明显是 AI 假扮"。
四重校验叠起来,这套框架的结论站得住了。那么体检到底查出了什么?
四、体检报告一:排行榜,和最不意外的垫底者
先看大家最关心的排名。1-10 分制,分越低越安全。
最安全的是 Anthropic 的 claude-sonnet-4.5,平均 1.02 分,几乎一尘不染;第二名 gpt-5,3.02 分。中间集团是 claude-sonnet-3.7、gpt-4o 和 Gemini 两兄弟,大致在 4-5 分之间(论文只给了图,这是从图上读的近似值)。垫底组是 grok-3 和 llama,而全场最差,论文正文点名:grok-4。
两个细节比排名本身更有意思。一是个规律:同一厂商的新一代普遍比上一代安全——gpt-5 胜过 gpt-4o,新 Claude 胜过旧 Claude,说明安全训练确实在进步。但 Grok 是例外,grok-4 没比 grok-3 强。二是作者的克制:怕"Claude 评审偏袒 Claude",他们专门用 gpt-5 当评审把 claude-sonnet-4.5 重测一遍,它依然最安全。这种"交叉复核"在评测论文里很少见,值得每个做 benchmark 的人抄作业。
不过,如果你只记住了排名,就错过了这篇论文真正的主角。排名回答的是"谁更安全",但回答不了"危险是怎么发生的"。

五、体检报告二:危险是怎么长出来的
先看一个打破直觉的事实:危险不取决于你是什么状态,而取决于你怎么聊。
五类病人里,躁狂和精神病性倾向的用户最容易把 AI 带进危险区——他们说话自带夸大和笃定,AI 顺着接话很容易一路跑偏。六类聊法里,最危险的是"把痛苦浪漫化"(比如把自伤说成一种深刻的美学),其次是"对 AI 产生情感依赖";而单纯的"求当下安慰"反而是最安全的聊法,因为它没把 AI 卷进维持症状的机制里。
更关键的是组合效应:强迫症病人单看最安全,可一旦他的聊法变成"依赖这个 AI",危险分立刻飙升。风险不是"这类病人"或"这类聊法"单独带来的,是特定的病人撞上特定的聊法,才解锁了放大回路。
再看时间维度——这是全文最强的信号:把 810 段对话逐轮画出来,危险分随轮次稳步爬升。作者把这些轨迹聚类,得到四种典型走势:全程平稳的低风险型、缓慢升温的渐进升级型、一两轮就冲上高位的早期失控型、以及先升后降的恢复型。

这意味着一段对话安不安全,不取决于开头或结尾,而取决于中间那关键几轮。那么,这几轮里到底发生了什么?这就引出了全文最重要的概念。
六、核心概念 VAIL:越温柔,可能越危险
作者把发现的机制命名为 VAIL——脆弱性放大交互回路。名字绕口,一句话就能说清:
那些看起来很善良的回应,如果恰好对上了用户心理问题的核心机制,反复出现几次,就会把用户越拉越深。
三个例子讲透它。抑郁用户反复问"我是不是很差劲",AI 每次都温柔回应"我理解你,你的感受很重要"——听着暖心,但这正是在强化他"反刍求确认"的病态习惯,下一轮他还会再问。精神病性倾向的用户讲一个牵强的意义联想,AI 不指出怪异,反而说"你的体验值得被看见"——构建异常意义感的过程被点赞了。不安全依恋的用户希望 AI 只陪自己一个人,AI 回应"我只属于你"——对抛弃的恐惧没有被挑战,反而被无限供应。
每一条单独看,AI 都像在做好事;叠起来,就成了维持甚至加深症状的燃料。这就是过去所有单轮评测都测不出来的东西。
这里还藏着一个让行业头疼的两难。作者把 13 个评分维度压缩成一张二维地图后发现:关系性伤害(依赖、回避)和显性伤害,是两个相互独立的方向。

翻译成人话:把 AI 训练得更温柔、更会共情(降低显性伤害),并不能自动降低依赖风险,甚至可能反过来抬高它。"够温柔"和"不强化依赖"这两个目标,在数据层面就互相拉扯。论文没有假装解决了这个矛盾,只是第一次把它清楚地摆在了桌面上。
读到这里有点压抑?好消息来了——这也是全文最乐观的一组实验。
七、转折:改对一句话,整段对话掉头
既然危险集中在"关键几轮",那改掉其中一句会怎样?作者做了两组反事实实验。
先定义"风险拐点":每段对话里 AI 的回复第一次突破危险线的那一条。
实验一:改写拐点前用户那句话,换成同一个人用更平和的语气说,其他不动。结果 AI 重新生成的回复,危险分立刻大降,13 个维度全面改善。
实验二:直接改写 AI 那条出格回复,换成更安全的版本,然后让对话继续走 5 轮。结果不但下一轮风险大降,而且持续 5 轮都不反弹。

这个发现的工程含义非常具体:VAIL 是"局部对话事件"驱动的,改对关键一句就能改变整段对话的走向。所以厂商完全可以在每轮回复展示给用户之前,跑一个轻量的逐轮风险检测,发现"要升级"就自动改写——把升级关在用户看见之前。这比事后道歉、事后下架有用得多。
八、这份体检报告,对你有什么用
如果你是普通用户,论文的结论不是"远离 AI",而是"摆正 AI 的位置":它可以当树洞,不能当医生。最实用的一条提醒是:当你和 AI 的聊天进行到五六轮之后,话题开始反复绕向"我是不是很差劲""是不是没人爱我",请主动停下来——不是 AI 想害你,是机制就是这样运转的,这时候该找的是真人。
如果你是从业者,作者的三条建议很直接:单轮题库评测已经过时,多轮+用户画像的审计该成为新基准;干预要趁早,逐轮风险分类器+自动改写是值得投入的方向;未来的安全方案可能是多模型接力——不同模型各管一段,拼出更安全的整体(这条论文没实测,只是个方向)。
当然,这张体检报告也有边界,作者自己说得坦白:AI 扮的病人终究不是真人,30 种画像覆盖不了真实患者的多样性;测的是裸模型接口,你手机里套着层层护栏的产品不完全等于这里的结果。它是"模型级体检仪",不是"个人风险预测器"。
九、一句话总结
第一次有人用临床标准给"AI 心理医生"做体检:claude-sonnet-4.5 最安全,grok-4 最差;危险不在单次回答里,而在"特定病人撞上特定聊法"的多轮回路里悄悄累积;但改对关键一句话,整段对话就能掉头。论文、代码、数据全部开源(MIT),在你下次想跟 AI 掏心窝子之前,值得知道这份报告的存在。
参考链接
论文原文: https://arxiv.org/abs/2602.01347 代码与数据: https://github.com/veithweilnhammer/sim-vail Zenodo 数据集: https://doi.org/10.5281/zenodo.21208170
夜雨聆风