夜雨聆风学习资料网

ARTICLE · 1078067

AI会不会取代影像科/放射科医生?——这篇Science研究给了最诚实的回答

AI会不会取代影像科/放射科医生?——这篇Science研究给了最诚实的回答
增强腹部CT是众多疾病诊断评估中常用的影像学手段,同时也是最难评估的检查之一;
这既因为腹部解剖结构众多,也因为具有临床意义的征象常表现为容易被漏诊的细微异常。以往开发人工智能(AI)方案的尝试依赖监督学习和人工标注,导致训练极其耗费人力。
浙江大学医学院附属第一医院梁廷波教授、肖文波教授和章琦教授,阿里巴巴达摩院张灵等人开发了一种名为RADAR 的通用视觉-语言模型;该模型在无需人工标注的情况下即展现出强劲性能,即使面对训练中未曾遇到的异常也是如此,并且能够有效提升人类放射科医师的诊断成功率。
浙江大学医学院附属第一医院联合阿里巴巴达摩院,用 42万例增强腹部CT的"图像+报告"数据,训练出一个叫 RADAR(Rapid Abdominal Diagnosis with AI and Radiology) 的AI模型。
它能诊断 18个解剖结构、146种病变,不需要人工标注一个像素,也不需要为每种病重新训练——内部AUC 0.913,8家外部医院 0.874–0.912。
在一项26位放射科医师参与的读者研究中,它的辅助让医师敏感度提升10.0%、阅片时间缩短30.7%。
当然,故事没那么完美。往下看。

一、为什么腹部CT,是影像AI最难啃的骨头

在放射科,能不能读懂腹部CT,常被拿来衡量一名医师的基本功。它难在哪里,做这行的人心里有数。原因很实在:

·器官太多。肝、胆、胰、脾、双肾、肾上腺、胃肠、血管、骨骼……一个横断面扫过去,几十个结构同时入镜。

·病变太杂。从胆囊结石到肝细胞癌,从阑尾炎到肠套叠,上百种可能。

·对比度太低。病灶和正常组织的密度差,有时小到肉眼要"盯"很久才能分辨。

·形态变异太大。同一个器官,在不同人身上位置、形状、大小都不同。

这也是为什么,过去十年里AI在肺结节、乳腺、眼底这些领域先跑出来,而腹部CT一直进展缓慢。

更根本的问题在于训练方式。此前的医学影像AI大多走监督学习路线——需要医生逐张图、逐个病灶地打标签。一个病种动辄几万张大标注,成本高、扩展慢,而且一旦换到新医院、新设备、新的病种,模型往往就水土不服。

一句话概括旧路线的困境:标注多少,才能学会多少。而临床的需求是开放的——你永远不知道下一个病人得的是什么病。

二、RADAR的思路:不教它「答案」,教它「读报告」

RADAR 走的是另一条路——视觉-语言学习。

逻辑不复杂:医院里每天都产生海量的CT图像和对应的诊断报告。报告是医生写的,本身就包含了"这个器官有没有问题、是什么问题"的专业判断。既然这样,为什么不让AI直接从"图像—报告"的对应关系里学?

这样就不需要额外人工标注了。数据有多少,就能学多少。

但直接把"整卷CT"和"整份报告"配对,效果很差。原因在于——腹部CT的诊断信号极度稀疏:一份报告可能提到五六个器官,但真正有问题的可能只有一个,而那个病灶在整个3D体数据里可能只占极小的比例。整卷对齐,等于让"肝上有病灶"这句话被其他正常器官的描述淹没。

RADAR 的解法是:把CT按解剖拆开,让每个器官的影像,去对应报告里描述这个器官的那一段话。

RAD-CT 训练数据集(浙大一院,2010–2023)

三、它做对了三件事

① 把粗粒度的「整卷对齐」,拆成细粒度的「器官对齐」

前面说的"信号稀疏"问题,就是靠这个解决的。让"肝的影像"去和"肝的描述"对齐,而不是让"全腹的影像"去和"全腹的报告"对齐。这一个改动,是后面所有性能的基础。

② 把「器官定位」能力,内化进模型自己

要按器官对齐,首先得知道器官在哪。团队之前的工作(fVLM)依赖一个外部的分割模型先跑一遍;RADAR 则把定位能力做进了端到端训练里——模型自己学会找准器官,不需要外部再喂一张"器官地图"。同时,分割和诊断两个目标互相促进。

③ 让「相似的东西」不要互相排斥

这一条最技术,但也最妙。

对比学习的基本原则是:同一患者的图文要靠近,不同患者的要推开。但这里有个漏洞——两个不同患者的肝脏都正常,或者都长了肝细胞癌,它们本该是"相似"的,却被当成"不相似"硬推开。

RADAR 引入了"自适应对比建模":对正常器官,不同患者的表征互为正样本;对异常器官,用语义相似度做软对齐。简单说——它允许"同样正常"和"同样有病"互相靠近。

从内部到跨人群

模型在 146 种影像征象和疾病上评估,覆盖 18 个解剖结构。研究把评估分成了几个层次,逐层加难。

内部队列的表现最完整。146 种征象的平均 AUC 为 0.913(95% CI 0.911–0.915),次优的 fVLM 为 0.776。
按 18 个解剖结构分开看,AUC 范围是 0.838–0.982;按实质器官与空腔器官分,分别是 0.918 和 0.907;按良性与恶性分,是 0.910 和 0.929。低频征象上的表现尤其值得留意——两种监督学习基线(ViT 平均 0.787、nnU-Net+ 平均 0.868)在罕见征象上掉得明显,RADAR 没有出现同样的塌陷。这一点在模型离开训练环境后更突出:外部队列中 RADAR 的 AUC 下降 0.018,而 ViT 和 nnU-Net+ 分别下降 0.032 和 0.050。
外部验证有四个场景,设计思路各不相同。8 家医院覆盖了县级医院、体检、门诊与急诊,设备与扫描方案不统一,单中心 AUC 落在 0.874–0.912 之间。急诊那一组的数据在训练阶段被明确排除,等于一次没有见过的考题,结果 0.904。病理确诊的两家中心用手术或活检结果作为标签,四种癌症的 AUC 在 0.891–0.984。最后一个场景跨了人群:在美国斯坦福公开的 Merlin 数据集上,模型完全没有经过微调,21 种可对应的征象取得 0.883。
最后两组数据是延伸实验,不属于主结果。推理时把多条文本提示做集成,内部 AUC 从 0.913 升到 0.928;再做一轮监督微调,内部升到 0.940、外部升到 0.927。
这两项说明提示构造方式与微调策略都还有余量,但也意味着模型的最佳表现并非完全「零训练」——需要区分「不做任务微调就能用」和「做了微调会更好」这两件事。

四、最强的证据:不是AUC,是26位医生读片实验

对临床医生来说,AUC 再漂亮也只是统计量。真正要看的是:这东西上了临床,到底帮不帮得上忙?

这项研究做了一个两阶段读者研究:26位来自14家机构的放射科医师,按经验(>10年 / ≤10年)和医院等级(三甲 / 其他)分成4组,先独立读片,间隔至少1个月"洗脱期"后,再在RADAR辅助下重读同一批病例。

读者研究实验结果(300例患者 · 61种征象 · 26位医师)

更值得注意的是"跨层级追赶"效应:

·三甲医院里,RADAR辅助下的初级医师,表现已经和无辅助的高级医师相当;

·其他医院里,初级医师在辅助下敏感度提升10.1%,反超同院无辅助的高级医师7.0%。

这意味着什么?AI不能替代经验,但它可能填平一部分经验鸿沟。对基层医院、对年轻医师、对急诊值班,这一点的价值远大于AUC上那零点零几的提升。

五、它的泛化能力,被单独考了三次

一项模型能不能用,关键看它离开训练环境后还灵不灵。这篇研究设计了三个"刁钻"的考场:

RADAR 的外部验证

特别是第二行那个"急诊留出"设计——训练时刻意不给急诊数据,然后专门拿27,267例急诊病例来考,还能拿到0.904。

这比一般的"多中心验证"更有说服力:它证明模型不是在背答案。

六、这四个问题它还没解决

① 金标准问题,只是被绕过,没有被解决

模型用CT报告训练,评估时大部分用的也是"从报告里抽出来的标签"(146种征象里只有4种癌症有病理验证)。

报告是人写的,人也会漏诊——所以模型学到的,本质上是"报告里的判断",而不是"病理真相"。 0.891–0.984 的病理AUC很漂亮,但只覆盖4种癌症,剩下142种征象仍无金标准。

② 「平均AUC」是一个被平滑过的数字

论文报告内部AUC范围是 0.838–0.982,均值0.913。但作为临床医生,我更想知道的是:那些最要命的征象(小胰腺癌、早期腹膜转移、血管侵犯),单项表现到底如何?

论文正文没有给出。平均分很高,不代表每一项都好。

③ 「跨人群零样本」其实有落差

这一条容易被忽略:RADAR 在美国斯坦福数据上的零样本AUC是0.883,低于它内部队列的0.913、外部8家中心的0.895。

跨种族、跨设备、跨扫描协议的稳健性,仍然是通用模型最大的软肋,论文对此讨论偏轻。

④ 「可解释」目前还只是「看起来对」

RADAR 会给出注意力热图(Grad-CAM),高亮它认为重要的区域。但在读者研究中,这部分只有"减少了误诊"的间接证据,缺乏定量的空间正确性评估——热图高亮的区域,究竟是不是真的病灶?没有量化验证。

此外论文也未涉及模型何时会出错(金属伪影?术后改变?罕见变异?),没有不确定性量化,也没有前瞻性临床验证。

七、所以,这对我们意味着什么?

抛开细节,这篇文章真正值得记住的,是三个判断:

1."标注瓶颈"正在被语言监督绕开。如果你的研究受困于标注量不足,一个可考虑的方向是:用报告文本做弱监督预训练,再用少量精细标注做微调。这条路在2026年已经被Science级别的工作验证过。

2.通用模型不一定输给专科模型。这是一个反直觉但重要的结论——RADAR在病理确诊队列上的表现(AUC 0.891–0.984),和最好的单病种专科模型在同一水平线上,甚至更好。

3."平均AUC"是陷阱。无论写论文还是审稿,都应关注低频、高危征象的单项性能,而不是被一个漂亮的均值掩盖了短板。

最后说一句实话

这篇文章质量高于典型的AI影像论文——公平重实现基线、急诊留出测试、病理金标准验证、跨种族零样本、配对读者研究,这套评估组合拳非常扎实。模型和代码也已开源(Zenodo 公开可访问),这一点对临床转化极其关键。

(开源地址:https://github.com/alibaba-damo-academy/damo-radar)

但它距离真正的临床落地,还隔着三道门:病理金标准的全面验证、不确定性量化与失败模式分析、以及前瞻性临床部署证据。

对做影像AI研究的人来说,它最大的价值不是"又一个高分模型",而是提供了一套「不靠标注也能做通用诊断」的方法论模板——这才是能直接拿来用的部分。
END

申明

本公众号所有内容仅供医学专业同道学术交流,不代表任何治疗建议和治疗选择!不代表任何单位的意见和建议!

参考资料

Q. Zhang et al.An expert-level generalist AI for abdominal CT diagnosis, Science 393, eaec6129 (2026).                  

相关学习资料