67%。
放在手机跑分里,这叫翻车;放在医院里的 AI 数字助手身上,这三个数字就不是“体验波动”了,而是足够让整个行业坐直的一脚急刹。
先说清楚,眼下最关键的一层边界不能丢:这些内容来自美国明尼苏达联邦法院收到的诉状,法院还没有认定事实。但也正因为还只是指控,这件事才更值得看——如果连梅奥诊所这种全球最顶级的医疗机构,都被前 AI 合规负责人告上法庭,问题就已经不只是某个工具准不准,而是坏消息能不能穿过会议室的门。

这次起诉梅奥的是前研究运营总监、AI 合规负责人 Traci Tamiko Eto。公开报道里,最扎眼的是两条:一是梅奥内部 AI 数字助手 MAYA 被指错误率高达 67%;二是她在提出合规和研究流程问题后,经历了被边缘化、降职,最后在病假期间收到裁员通知。梅奥方面的公开回应很标准,核心意思是研究和临床创新都遵守适用法律法规,并强调患者信任和隐私。话说得很稳,但对“67%”“删除不利结果”“10份内部警报”这些最刺眼的点,目前没有逐条展开。

这里最值得大家盯住的,不只是 67% 本身,而是这个 67% 到底怎么算出来的。
因为医疗 AI 不是手机参数,数字不能裸看。它可能是答案错误率,也可能是字段缺失、检索失败、摘要偏差,甚至是某个特定测试集上的问题比例。分母是什么,样本多大,验证窗口多长,公开信息都还不完整。所以现在谁要直接把它翻译成“每三次诊疗错两次”,那也是过度延伸。
但反过来说,这也正是问题严重的地方。数字口径没讲清,已经够紧张;如果诉状里提到的“删除不利结果、歪曲研究结局”最后被坐实,那就不是模型性能问题了,而是研究诚信和机构治理问题。这一点很关键。

说白了,MAYA 这类工具的风险,不在那块屏幕上,而在它会不会顺着工作流一路往前走。它被定位为数字助手,听着像信息检索、流程辅助,但只要输出进入病历、研究文档,甚至医生判断链条,错误就会穿上白大褂继续流转。医疗行业最怕的,从来不是 AI 偶尔答错一句,而是错误被系统化吸收,还没人敢按暂停键。
而且这事并不是孤例语境里的“吓人新闻”。今年公开研究里,电子病历 AI 摘要工具已经暴露出一个很现实的共性:遗漏往往比幻觉更麻烦。一个 2026 年研究里,10 名医生对 147 份 AI 摘要做反馈,记录到了 46 次信息遗漏、20 次内容混乱、5 次幻觉。你看,最常见的不是胡编,而是漏掉关键细节。医疗场景里,少一句有时比错一句还危险。

这也是我个人特别想强调的一点:医疗 AI 真正的门槛,从来不是“能不能生成”,而是“能不能被追责、被复核、被及时叫停”。行业这些年最热衷讲效率、降本、临床赋能,这些都没错,我也一直看好 AI 进入严肃专业场景。但越是这种场景,越不能用互联网产品那套“先上线再优化”的节奏硬冲。因为这里的 bug,不是闪退,不是卡顿,是患者数据、知情同意、审查流程,甚至直接碰到临床安全。
从这个角度看,梅奥这起案子哪怕最后有些细节被修正,它留下的行业冲击也已经足够大:真正决定医疗 AI 成色的,未必是模型名字多响、参数多大,而是机构有没有保留坏结果的勇气,有没有让合规负责人说真话的位置,有没有在项目速度前面留一脚刹车。

所以这篇我最后的态度很明确:别急着被“67%”带节奏,但更别把它当成一条普通风波看过去。医疗 AI 可以继续往前冲,但问责机制必须先跟上。能把坏消息听进去的医院,才配把 AI 放进临床。
短句收尾:医疗这条赛道,快从来不是第一位,可靠才是。
⚠️ 文中信息整理自网络公开渠道,参数与细节可能仍有出入,最终请以官方表述和实际情况为准。
夜雨聆风