乐于分享
好东西不私藏

AI辅助诊断:80%的病例过不了初诊关

AI辅助诊断:80%的病例过不了初诊关
美国波士顿大众布莱根医疗网络(Mass General Brigham)一项发表于《JAMA网络开放版》的研究给AI医疗热潮泼了一盆冷水。研究人员测试了21款主流大型语言模型(LLM),包括Claude、DeepSeek、Gemini、GPT和Grok的最新版本,结论令人失望:超过80%的病例中,这些模型无法给出合格的鉴别诊断(differential diagnosis)。
鉴别诊断是临床医学的核心思维工具:面对一组症状,医生需要列出所有可能的疾病,并逐步排查、缩小范围。在信息不完整、充满不确定性的条件下做判断,是医学思维的"开局"阶段。
研究人员在AI辅助诊断的研究中专门设计了模拟真实临床场景,分阶段披露信息——先只给年龄、性别、主诉,再陆续加入体检和化验结果。使用PrIME-LLM评估工具,测试各个AI模型在每个阶段的诊断能力。
01
AI辅助诊断的弱点
* 当信息有限、情况开放时,AI表现很差——这恰恰是临床最需要判断力的时刻
* 当完整信息都给出后,模型往往能给出正确的最终诊断(成功率因模型而异,在60%到90%以上之间)
* 简言之:AI在"收尾“工作上表现尚可,在"开局"上几乎是毫无头绪。
综合表现排在前列的有:Grok 4、GPT-5、GPT-4.5、Claude 4.5 Opus、Gemini 3.0 Flash 和 Gemini 3.0 Pro。
02
AI不是没用,但还不能独立工作
目前有大量应用宣传AI"可以辅助诊断"。研究人员表示:
"这些模型在医疗场景中仍然需要人在决策链中保持存在,需要非常严格的监督。"
真正的问题不在于AI是否能在有足够信息时猜对答案,而在于它能否在信息残缺、情况模糊时保持谨慎、不给出误导性结论。这项研究的结论是:目前做不到,也不该让AI去单独作业。
为此,医学专家建议公众谨慎使用AI技术,如有任何健康问题,请务必咨询医疗专业人士。

欢迎访问

德国热线网站

https://

www.dolc.de

扫码查看更多内容