ARTICLE · 1029947
AI诊断九成准,医院只敢交出一半的病例
AI诊断九成准,医院只敢交出一半的病例九成准确率在医疗AI的新闻稿里已经不算亮点。真正稀缺的能力是承认自己不确定,并且把不确定的那一半推回给人。 2026年夏,Nature Medicine 上线了一项来自德累斯顿工业大学的研究。研究者搭了一套完全离线的临床智能体:医生智能体负责多轮问诊、开检查、读影像报告、下医嘱,病人智能体只负责回答,中间还会遇到工具调用失败并自行重试。整个过程不连任何外部接口。研究真正想回答的不是"AI能不能诊断",而是另一个更贵的问题——哪些病例可以不看。 论文做了一件工程上很重、新闻稿里很轻的事:把一整套双智能体系统放进本地机房,再让它去考试。 性能没有明显损失。在MIRA-v2 的七类疾病上,四个开源权重模型里Qwen-3.5 拿到90.0%,GLM-5 是89.7%,作为对照的云端GPT-5.2 是90.7%,差距0.7个百分点。在四分类的 CDM 基准上,Qwen-3.5达到83.8%,而此前该榜单开权重模型的最好成绩是70.5%。 意义不在高低,而在位置。过去两年医院的采购逻辑里有一个隐含交换:想满足"数据不出院",就得接受模型弱一档。这份研究把交换项划掉了。 中国侧的部署已经起量。《医疗机构人工智能应用与治理专家共识(2026版)》披露,国内已有覆盖三级医院到基层的400余家机构完成本地化部署。大模型一体机2025年出货约15万台,预计2026年升至39万台,医疗是敏感数据行业里招标最活跃的领域之一,宝鸡市中心医院一个医疗大模型一体机项目中标246.27万元。 但一体机的价格里装的是硬件。论文里真正难的那部分,不在任何一份招标清单上。 这项工作最锋利的一组实验是抽掉证据。研究者让病人智能体不再提供初始病史,还可能给出不可靠的陈述。整体诊断准确率从90.6%掉到70.2%,整整20.3个百分点。配对检验显示,123对病例变差,只有11对变好。 如果置信度是一个安全阀,它应该随准确率一起掉。它没有。内部生成概率几乎没有下移,语言上的谨慎程度也稳住了。肺炎这一类上,准确率在降,这两个指标反而上升,都停在0.90以上。 翻译成临床语言:一个不知道自己在猜的模型,会以高置信度把猜测讲完。这在技术上叫校准失败,在商业上叫风险定价失败。 中国司法已经给过定调。2025年6月,一位用户用生成式AI查询高校报考信息,AI给出错误信息,在被指出后坚称正确,还回答"如果生成内容有误,我将赔偿您10万元"。该案2026年1月经杭州互联网法院一审判决,驳回原告诉请,适用一般过错责任原则。判决里另一句话分量更重:在医疗、金融等关乎人身财产安全的专业领域,服务提供者的注意义务标准应据风险情景相应予以提高。 幻觉本身不必然构成过错。但在医院里,判断过错的门槛会被抬高。 研究者把可靠性拆成三层:模型内部的生成概率、语言上表达的犹豫程度、重复运行中结论是否稳定。每一层同时作用于最终诊断和推理链,共八个指标。 区分正确与错误的能力写在曲线下面积上。最终诊断层面,行为一致性是0.860,内部概率是0.747;推理链层面,语言犹豫度0.792,略高于一致性。 有一个指标是反向的。推理链里的临床概念密度只有0.426,低于随机水平。推理写得越术语密集,越不倾向于答对。作者认为这些术语可能和检查项目数相关,但一个判断不变:它作为置信信号不成立。 他们还试了一个被寄予厚望的方案:加一个鉴别诊断评审智能体,让第二个模型审第一个模型。加了是87.1%,不加是88.4%。 国内的对照片段是华山医院2026年3月上线的临床辅助决策智能体:接入5000万份文献、指南与真实病例,覆盖32个科室,三个月试点覆盖120名医生、超过8万次诊疗,医生认可比例是95.2%。 认可率是接受度指标,不是可靠性指标。模型表现得专业,和它答对了,是两件事。评审智能体那一组结果指向同一面:更严谨的流程,不必然更准。 一致性指标的做法并不复杂:同一份病例,让系统独立跑五次,比较五次给出的诊断在语义上是否一致。 跑得越多越稳。阈值定在0.90时,跑三次保留集的准确率是97.5%,五次98.9%,十次99.6%。 按这个阈值做分诊:551例中保留272例交给系统自主处理,占49.4%,这部分准确率98.9%,只有3例误判;剩下279例转人工复核,49个错误集中在这里。作者的表述很克制——这套机制不消除不确定性,只是把它重新分配。 换成用内部概率做门槛,效果立刻打折。阈值提到0.98时,保留率只剩22.5%。 代价写在算力单上。五次重复运行使医生智能体的token消耗增加到约五倍,GPU占用同步上升,串行时延也拉长。作者的结论是,这是一个有用但昂贵的决策时信号,部署价值必须和基础设施约束一起算。 这是一条容易被忽略的线索:让AI更可信的办法,不是给它更聪明的大脑,而是让它把同一件事多做几遍,然后为这几遍付钱。 0.90这个数字,不能直接写进任何一家医院的招标文件。 作者用一整节做敏感性分析:换一个句向量编码器,同样0.85阈值下,保留率从62.6%变成73.9%,保留集的准确率却没有相应优势。温度设置、重复次数、模型选择都会挪动这条曲线。作者的原话是,绝对阈值不是普适的,必须按部署配置校准。 对商业模式的杀伤力比看起来大:交付物不是一个能复制的盒子,而是一次必须重做的本地标定。那个98.9%,属于特定模型、特定编码器、特定运行次数、特定数据生态。 支付端的规则写得更清楚。江苏在放射、超声、康复类立项指南中设立了51项"人工智能辅助"扩展项;但AI辅助执行与主项目相同的价格,不额外向患者收费。苏州落地的X线摄影成像—人工智能辅助诊断(扩展)定价40元每部位或体位,医保支付类别为甲类、自付比例为零。 能力可以进院,收入进不来。AI在医院里是一门成本,不是一项收费。校准谁做、五倍算力谁出、那279例人工复核谁买单,成了这套技术能否规模化的唯一问题。 整份报告里有一段不像技术分析的话:在MIRA-v2 和 CDM 上,老年组的诊断准确率都低于年轻成人组,性别差异则较小。作者没有把它写成结论,只说是"重要的部署考量,需要专门的偏见审计",因为回顾性分析无法区分这来自数据构成、病例复杂度、病历记录质量,还是模型偏差。 但用一致性阈值做分诊时,这个梯度会直接变成分配问题:准确率更低的那一群人,会以更高比例进入自主处理还是转人工,目前没有答案。 其他限制同样坦率。两个主要基准都来自MIMIC-IV,是单一机构的数据生态;评测只覆盖文本推理,影像不在内;全部为回顾性模拟,没有前瞻验证。 这些限制指向同一个空缺。论文证明的是不确定性可以被计算,没有证明它可以被结算。把AI关进机房,数据的去向解决了;让AI说"我不确定",可信的边界有了;但重复五次比单次贵五倍,转人工的279例仍然要医生看,而立项指南不允许AI单独计价。 技术已经把选择权交出来了。今天可以少看某一道题,可以只看一半的病例。接住这个选择权的成本,还挂在医院的运营账上,没人替它结算。