ARTICLE · 1020639
四种数据喂给AI,赢的却是九个临床指标
四种数据喂给AI,赢的却是九个临床指标免疫治疗界花了十几年、几百亿美元找预测标志物,结果一项2396人的真实世界实验发现,最能打的还是医生每天都在看的九个常规指标。而真正让医生判断变准的,不是更复杂的模型,是AI肯把理由讲出来。 2026年9月13日,《自然·医学》发表I3LUNG研究:意大利国家肿瘤研究所牵头,欧洲地平线计划支持,六个国家六个中心,2396名晚期非小细胞肺癌患者,横跨2012至2023年的真实诊疗记录。团队把临床血液数据、CT影像、数字病理切片、基因测序四种模态全部喂进模型,回答一个悬了十年的问题:AI到底能不能比PD-L1更准地预测谁该用免疫治疗。 多模态AI的理想很完整,现实很骨感。2396人都有临床血液数据,但基因测序只覆盖1723人,CT是1705人,病理切片只有936人,四种模态凑齐的只剩339人。技术并不缺:病理侧用了微软的GigaPath基础模型,CT侧同时上了放射组学和基础模型两条管线,特征提取动辄数千维。可再强的模型也填不平数据的缺口:四模态模型必须用完整病例训练,完整病例又天然偏向检查齐全、资源充足的中心,模型学到的既可能是肿瘤生物学,也可能是检查路径本身。此前公开的多模态研究,Vanguri团队247例,Captier团队317例,完整模态的患者都只有80人左右。I3LUNG已经是这个赛道迄今最大规模,背后是16家机构合作五年,交集依然只有三百多人。真实世界的第一个真相在此:数据完不完整,不由技术决定,由医院流程、检查路径和患者处境决定。模型的天花板,在建库那天就画好了。 交叉验证里,多模态确实漂亮。一线患者24个月生存预测的AUC从0.68拉到0.88,只用免疫单药的亚组冲到0.91,P值小于0.0001,论文里的星号堆了四颗。然后是检验时刻:独立测试集上增益没有重现,美国芝加哥大学251人的外部验证队列同样没能复制。反倒是最朴素的临床数据模型,生存模型的C-index在交叉验证、测试集、外部验证三个环节稳稳停在0.64到0.66之间。深度学习融合路线更尴尬,这套架构专门设计了处理模态缺失的机制,可模态加得再多,性能纹丝不动。作者的归因很克制:问题大概率不在架构,在数据本身。回顾性、异质性、模态缺失不随机,15%的CT还不是基线扫描。外部验证那批芝加哥患者的画像也完全不同,中位生存22.2个月,是训练人群12.4个月的近两倍,女性占近六成,人群一换,AUC从0.74掉到0.60。交叉验证的显著性只能证明训练流程里有信号,证明不了换一批人、换一个国家还有同样的信号。 全文最硬的结果藏在这里。只用九个常规临床特征:体能状态评分、吸烟史、PD-L1表达、骨肝脑转移部位、中性粒淋巴细胞比值、乳酸脱氢酶这些查房桌上就有的数据,机器学习模型在独立测试集的24个月生存预测AUC做到0.74,PD-L1单打独斗只有0.53,差了21个百分点;体能评分0.62,乳酸脱氢酶0.58,全部被显著甩开。风险分层更直观:模型划出的低风险组中位生存25.1个月,高风险组4.7个月,相差五倍多;现行LIPI评分的C-index只有0.55,模型是0.65。这个结论并不孤独。2025年SCORPIO用9745例、21个癌种证明常规血检加临床数据就能压过TMB和PD-L1;泛癌模型LORIS的AUC最高0.83。I3LUNG还补了一刀反证:同一个模型放到EGFR突变吃靶向药的队列和纯化疗队列里,缓解预测的AUC跌到0.50到0.58,说明它学到的是免疫治疗特有的获益模式,不是笼统的病情轻重。规律摆在眼前:最贵的数据未必最耐用,最便宜的往往最抗造。 临床可用性研究是这篇论文真正的杀招,也是同类研究里第一次这么干。20名医生,10名肺癌专家,10名非专家,100个真实病例,合计200次评估:第一轮凭自己的本事判断,第二轮再给模型的预测,外加SHAP解释,每个特征往哪个方向推了结果都列得明明白白。疾病控制率预测的敏感度从0.72升到0.87,准确率从0.57升到0.65。专家敏感度从0.68到0.83,非专家从0.77到0.90。生存期判断的正确概率整体提高36%,其中非专家提高61%,专家只有14%;判断与真实生存区间吻合的比例从16.5%升到22.5%。更微妙的是一致性:两批医生独立判断时κ值只有0.11,近乎各说各话;看过同一段AI解释,升到0.48。让AI把理由讲清楚,是医疗AI落地绕不开的一步,这一步在这里第一次被完整量化。对缺乏胸部肿瘤专科的基层医院,这种增益的想象空间更大:AI补的不是医生的判断力,是经验浓度。 医生在74.5%的时候采纳了正确的AI建议,但另一组数字扎眼:专家采纳错误建议的比例72.2%,非专家63.6%。资历越深越自信,越容易被一个讲得头头是道的模型带偏。这在人机协作研究里有个名字,叫自动化偏倚,反复出现却总被当作别人的问题。医疗AI的产品设计必须回答一道题:当模型给出自信满满的预测,系统拿什么提醒医生去怀疑它?I3LUNG团队已经启动可用性研究2.0,要把不确定性提示做进界面。方向对了,但怎么在不吓退使用者的前提下泼这盆冷水,全行业都还没有现成答案。AI辅助的天平上,加法容易,减法才是护城河。 论文作者自己估计,距离临床部署还要两到三年。眼下正在推进的是2000多例前瞻性验证,模型在后台静默运行,不干预处方,先看它在异质真实环境里稳不稳。公平性审计已经提示了麻烦:不同中心之间预测敏感度差异显著,最高0.96,最低0.63,换一家医院就是另一副面孔。对中国市场,这件事有另一层分量:NMPA已批准11款PD-1/PD-L1单抗的肺癌适应症,2024年国产PD-(L)1销售额约113亿元,2030年晚期一线免疫用药市场预计75亿元。谁来筛病人、凭什么筛,是真金白银的问题。而PD-L1检测本身在国内就欠账不少:病理医生紧缺,抗体克隆和判分标准不统一,不同平台结果对不上,AI辅助PD-L1评分刚起步。一个不依赖昂贵检测、九个指标就能跑的模型,对基层医院反而是最现实的路。I3LUNG给行业的启示不复杂:别急着堆模态,先把常规数据、可解释性、外部验证三件苦活干扎实。AI进诊室的门槛从来不是跑分,是让医生放心。