夜雨聆风学习资料网

ARTICLE · 1029947

AI诊断九成准,医院只敢交出一半的病例

AI诊断九成准,医院只敢交出一半的病例
九成准确率在医疗AI的新闻稿里已经不算亮点。真正稀缺的能力是承认自己不确定,并且把不确定的那一半推回给人。
2026年夏,Nature Medicine 上线了一项来自德累斯顿工业大学的研究。研究者搭了一套完全离线的临床智能体:医生智能体负责多轮问诊、开检查、读影像报告、下医嘱,病人智能体只负责回答,中间还会遇到工具调用失败并自行重试。整个过程不连任何外部接口。研究真正想回答的不是"AI能不能诊断",而是另一个更贵的问题——哪些病例可以不看。

一、本地化不掉分,代价只写在部署单上

论文做了一件工程上很重、新闻稿里很轻的事:把一整套双智能体系统放进本地机房,再让它去考试。
性能没有明显损失。在MIRA-v2 的七类疾病上,四个开源权重模型里Qwen-3.5 拿到90.0%,GLM-5 是89.7%,作为对照的云端GPT-5.2 是90.7%,差距0.7个百分点。在四分类的 CDM 基准上,Qwen-3.5达到83.8%,而此前该榜单开权重模型的最好成绩是70.5%。
意义不在高低,而在位置。过去两年医院的采购逻辑里有一个隐含交换:想满足"数据不出院",就得接受模型弱一档。这份研究把交换项划掉了。
中国侧的部署已经起量。《医疗机构人工智能应用与治理专家共识(2026版)》披露,国内已有覆盖三级医院到基层的400余家机构完成本地化部署。大模型一体机2025年出货约15万台,预计2026年升至39万台,医疗是敏感数据行业里招标最活跃的领域之一,宝鸡市中心医院一个医疗大模型一体机项目中标246.27万元。
但一体机的价格里装的是硬件。论文里真正难的那部分,不在任何一份招标清单上。

二、模型最自信的时候,最不该信

这项工作最锋利的一组实验是抽掉证据。研究者让病人智能体不再提供初始病史,还可能给出不可靠的陈述。整体诊断准确率从90.6%掉到70.2%,整整20.3个百分点。配对检验显示,123对病例变差,只有11对变好。
如果置信度是一个安全阀,它应该随准确率一起掉。它没有。内部生成概率几乎没有下移,语言上的谨慎程度也稳住了。肺炎这一类上,准确率在降,这两个指标反而上升,都停在0.90以上。
翻译成临床语言:一个不知道自己在猜的模型,会以高置信度把猜测讲完。这在技术上叫校准失败,在商业上叫风险定价失败。
中国司法已经给过定调。2025年6月,一位用户用生成式AI查询高校报考信息,AI给出错误信息,在被指出后坚称正确,还回答"如果生成内容有误,我将赔偿您10万元"。该案2026年1月经杭州互联网法院一审判决,驳回原告诉请,适用一般过错责任原则。判决里另一句话分量更重:在医疗、金融等关乎人身财产安全的专业领域,服务提供者的注意义务标准应据风险情景相应予以提高。
幻觉本身不必然构成过错。但在医院里,判断过错的门槛会被抬高。

三、术语堆得越满的推理,越可能是错的

研究者把可靠性拆成三层:模型内部的生成概率、语言上表达的犹豫程度、重复运行中结论是否稳定。每一层同时作用于最终诊断和推理链,共八个指标。
区分正确与错误的能力写在曲线下面积上。最终诊断层面,行为一致性是0.860,内部概率是0.747;推理链层面,语言犹豫度0.792,略高于一致性。
有一个指标是反向的。推理链里的临床概念密度只有0.426,低于随机水平。推理写得越术语密集,越不倾向于答对。作者认为这些术语可能和检查项目数相关,但一个判断不变:它作为置信信号不成立。
他们还试了一个被寄予厚望的方案:加一个鉴别诊断评审智能体,让第二个模型审第一个模型。加了是87.1%,不加是88.4%。
国内的对照片段是华山医院2026年3月上线的临床辅助决策智能体:接入5000万份文献、指南与真实病例,覆盖32个科室,三个月试点覆盖120名医生、超过8万次诊疗,医生认可比例是95.2%。
认可率是接受度指标,不是可靠性指标。模型表现得专业,和它答对了,是两件事。评审智能体那一组结果指向同一面:更严谨的流程,不必然更准。

四、最笨的办法最管用,同一道题问五遍

一致性指标的做法并不复杂:同一份病例,让系统独立跑五次,比较五次给出的诊断在语义上是否一致。
跑得越多越稳。阈值定在0.90时,跑三次保留集的准确率是97.5%,五次98.9%,十次99.6%。
按这个阈值做分诊:551例中保留272例交给系统自主处理,占49.4%,这部分准确率98.9%,只有3例误判;剩下279例转人工复核,49个错误集中在这里。作者的表述很克制——这套机制不消除不确定性,只是把它重新分配。
换成用内部概率做门槛,效果立刻打折。阈值提到0.98时,保留率只剩22.5%。
代价写在算力单上。五次重复运行使医生智能体的token消耗增加到约五倍,GPU占用同步上升,串行时延也拉长。作者的结论是,这是一个有用但昂贵的决策时信号,部署价值必须和基础设施约束一起算。
这是一条容易被忽略的线索:让AI更可信的办法,不是给它更聪明的大脑,而是让它把同一件事多做几遍,然后为这几遍付钱。

六、阈值不能跨院搬运,也不能单独收费

0.90这个数字,不能直接写进任何一家医院的招标文件。
作者用一整节做敏感性分析:换一个句向量编码器,同样0.85阈值下,保留率从62.6%变成73.9%,保留集的准确率却没有相应优势。温度设置、重复次数、模型选择都会挪动这条曲线。作者的原话是,绝对阈值不是普适的,必须按部署配置校准。
对商业模式的杀伤力比看起来大:交付物不是一个能复制的盒子,而是一次必须重做的本地标定。那个98.9%,属于特定模型、特定编码器、特定运行次数、特定数据生态。
支付端的规则写得更清楚。江苏在放射、超声、康复类立项指南中设立了51项"人工智能辅助"扩展项;但AI辅助执行与主项目相同的价格,不额外向患者收费。苏州落地的X线摄影成像—人工智能辅助诊断(扩展)定价40元每部位或体位,医保支付类别为甲类、自付比例为零。
能力可以进院,收入进不来。AI在医院里是一门成本,不是一项收费。校准谁做、五倍算力谁出、那279例人工复核谁买单,成了这套技术能否规模化的唯一问题。

七、老年患者更容易被推给AI,这笔账没人算过

整份报告里有一段不像技术分析的话:在MIRA-v2 和 CDM 上,老年组的诊断准确率都低于年轻成人组,性别差异则较小。作者没有把它写成结论,只说是"重要的部署考量,需要专门的偏见审计",因为回顾性分析无法区分这来自数据构成、病例复杂度、病历记录质量,还是模型偏差。
但用一致性阈值做分诊时,这个梯度会直接变成分配问题:准确率更低的那一群人,会以更高比例进入自主处理还是转人工,目前没有答案。
其他限制同样坦率。两个主要基准都来自MIMIC-IV,是单一机构的数据生态;评测只覆盖文本推理,影像不在内;全部为回顾性模拟,没有前瞻验证。
这些限制指向同一个空缺。论文证明的是不确定性可以被计算,没有证明它可以被结算。把AI关进机房,数据的去向解决了;让AI说"我不确定",可信的边界有了;但重复五次比单次贵五倍,转人工的279例仍然要医生看,而立项指南不允许AI单独计价。
技术已经把选择权交出来了。今天可以少看某一道题,可以只看一半的病例。接住这个选择权的成本,还挂在医院的运营账上,没人替它结算。

相关学习资料

返回首页浏览学习资料