ARTICLE · 1110747
食管癌AI|Frontiers in Immunology山东省肿瘤医院&华西医院等:术前CT深度学习预测NICT后复发风险,高风险患者或更能从术后放疗获益

局部晚期食管鳞癌这几年治疗变化很快。
过去大家更熟悉的是新辅助放化疗。后来免疫治疗进入围手术期,新辅助免疫联合化疗,也就是NICT,逐渐变成很多中心会选择的方案。
问题也随之来了。
同样是局部晚期食管鳞癌,同样接受NICT,有些患者术后很长时间不复发,有些患者很快出现局部复发或远处转移。
更现实的问题是:
术后到底要不要继续加放疗?
如果所有人都加,低风险患者可能只是多承担放疗毒性。
如果都不加,高风险患者又可能错过控制复发的机会。
这篇发表在 Frontiers in Immunology 的研究,想解决的就是这个问题。

文章题目是:
Deep learning models based on CT predict prognosis in patients with locally advanced esophageal squamous cell carcinoma who received neoadjuvant immunotherapy and chemotherapy
研究来自山东省肿瘤医院、山东第一医科大学、四川大学华西医院等团队。
作者纳入了 655例局部晚期食管鳞癌患者,这些患者均接受了NICT,并且都有治疗前CT影像。研究建立了一套基于CT的深度学习框架:先用VISTA3D结合point-prompt完成肿瘤自动分割,再用ResNet18和attention-based MIL提取空间影像特征,最后预测患者的DFS风险,并进一步分析不同风险人群是否能从术后辅助放疗中获益。
这篇文章比较值得看的一点是:
它不是只预测pCR。
它直接把问题放到了临床更关心的地方:
谁术后更容易复发?
谁可能需要加术后放疗?
谁可以尽量避免不必要的放疗?
清璟AI——清北医工交叉团队,擅长AI智能体、大模型、深度学习、机器学习、多模态与多组学等,能够为医学研究者和临床医生提供全方位的支持与创新解决方案。我们拥有顶级科研资源,欢迎咨询!共同探索AI与医学的无限可能,一起发顶刊!

为什么不只看pCR?
现在很多食管癌AI研究喜欢做一个任务:
预测患者治疗后能不能达到pCR。
这个方向当然有意义。pCR和预后有关,也容易作为模型终点。
但临床上,pCR并不能完全替代长期结局。
有些患者没有pCR,但后面也控制得不错;有些患者虽然病灶明显缩小,但仍然可能复发。
尤其是在NICT之后,真正让医生纠结的不是单纯“病理反应好不好”,而是:
术后还需不需要追加治疗?
食管鳞癌的术后辅助治疗一直有争议。
对一些高危患者,比如术后分期较高、切缘问题、淋巴结阳性等,术后放疗可能有价值。
但对于已经接受过NICT并完成手术的患者,谁应该继续放疗,目前还缺少非常明确的大规模证据。
这篇研究的出发点就比较实际:
能不能在治疗前,通过CT影像提前识别患者的复发风险,并辅助术后放疗决策?
图1|研究整体设计和分析流程
图注:研究纳入两个中心共655例接受NICT的局部晚期食管鳞癌患者。整体流程包括患者纳入、VISTA3D自动分割、ResNet18特征提取、attention-based MIL预后建模、模型性能评估,以及基于风险分层建立术后辅助放疗决策路径。
655例患者,两个中心验证
这项研究是回顾性研究。
患者来自两个中心,时间范围是2022年1月至2024年12月。
总共纳入:
655例局部晚期食管鳞癌患者
其中:
训练集:374例
内部验证集:94例
外部验证集:187例
训练集和内部验证集来自中心A,外部验证集来自中心B。
所有患者都接受了NICT,并且在治疗前有CT影像。研究的主要终点是DFS,也就是无病生存期;次要终点是OS,也就是总生存期。
到随访结束时,全队列中:
273例患者发生疾病进展
157例患者死亡
pCR比例在三个队列中大致接近,训练集为24.60%,内部验证集为28.72%,外部验证集为25.13%。
也就是说,这不是一个单纯做图像分类的小样本探索,而是围绕真实治疗路径做的多中心预后研究。
第一步:先解决肿瘤分割的问题
做CT影像AI,最麻烦的一步往往不是建模,而是勾画肿瘤。
传统影像组学通常要先手工画ROI。
这件事在论文里可以做,但到了真实临床就很难推广。
食管癌本身形态不规则,和食管壁、周围脂肪、纵隔结构关系密切。不同医生勾画出来的边界也可能不完全一样。
这篇文章用了一个相对新的思路:
VISTA3D + point-prompt。
VISTA3D是一个3D医学图像分割框架。它可以做自动分割,也可以结合点提示进行交互式修正。
研究比较了三种方式:
单纯自动分割
单纯point-prompt分割
自动分割 + point-prompt联合分割
最后作者选择第三种方式,因为它在保持效率的同时,分割质量更好。
在内部验证集中,联合分割方法的Dice系数为:
0.84 ± 0.15
在外部验证集中,Dice系数为:
0.87 ± 0.18
相比单纯自动分割和单纯point-prompt,都有一定提升。
这个结果说明,模型不是完全依赖人工逐层勾画,而是把自动分割和少量交互结合起来,尽量让流程更接近临床可用。
不过也要注意:
这里并不是完全“零人工”。
point-prompt本身仍然需要人工交互,只是比完整手工勾画成本低很多。
图2|VISTA3D自动分割和肿瘤habitat分析
图注:VISTA3D包含自动分割分支和point-prompt交互分割分支。研究在肿瘤区域基础上构建3mm瘤周环,并通过K-means聚类将肿瘤及瘤周区域划分为不同habitat,用于描述肿瘤内部及周围微环境异质性。
第二步:不只看肿瘤本身,还看3mm瘤周区域
这篇文章没有只盯着肿瘤主体。
作者在肿瘤轮廓外扩了一个 3mm瘤周环,把肿瘤本身和瘤周区域一起纳入分析。
这个设计有一定道理。
食管鳞癌的预后,不只是肿瘤中心长什么样。
肿瘤是否向外侵犯;
周围脂肪间隙有没有改变;
邻近纵隔结构是否受累;
区域淋巴引流区域是否可疑;
这些都可能反映更高的复发风险。
研究进一步使用无监督聚类,把肿瘤内部划分成不同的影像“habitat”。
这里的habitat可以理解成:
肿瘤里影像表现不同的亚区域。
有的区域可能代表坏死,有的可能代表强化不均,有的可能对应更复杂的间质或免疫微环境状态。
作者测试了不同K值,最后选择 K=3。原因是K=3在肘部法、轮廓系数以及后续预后模型表现中相对最好。用K=3构建的模型,在内部验证队列中C-index达到0.87,高于K=2、4、5、10、20等方案。
这个部分的核心意思是:
模型不是只看肿瘤大小,而是在试图读取肿瘤内部和瘤周空间异质性。
这也和免疫治疗场景比较契合。
免疫治疗效果本身就和肿瘤微环境、免疫浸润、缺氧、坏死、间质组成等因素有关,而这些信息在单点活检里很难完整反映。
CT当然不能直接看到免疫细胞,但它有可能捕捉到一些与微环境状态相关的宏观影像表型。
第三步:ResNet18 + Attention-MIL预测DFS风险
完成分割和habitat构建后,作者用ResNet18作为特征提取骨干,再通过attention-based multi-instance learning做患者级预测。
可以简单理解为:
CT里有很多切片,不是每一层都同样重要。
模型要学会从这些切片和区域中,找到对预后最有贡献的部分。
研究使用Cox比例风险损失函数训练模型,主要评价指标是C-index。
模型在内部验证集中表现为:
C-index 0.87
ACC 0.81
NPV 0.84
PPV 0.77
Sensitivity 0.74
Specificity 0.81
在外部验证集中表现为:
C-index 0.85
ACC 0.81
NPV 0.86
PPV 0.81
Sensitivity 0.77
Specificity 0.82
对于预后模型来说,外部验证C-index达到0.85,说明模型对患者复发风险排序具有较强区分能力。
更重要的是,外部验证表现没有明显崩塌。
这说明模型不只是记住了单中心数据的一些特征,而是在另一个中心仍然保留了一定泛化能力。
图3|模型分割性能、预测性能和可解释性分析
图注:研究比较了不同分割方法在内部和外部验证集中的表现;随后展示深度学习模型在内部验证集和外部验证集中的预测性能。图中还包括校准曲线、低风险和高风险患者DL评分分布、SHAP特征重要性,以及Cox回归分析结果。
高低风险分层:低风险患者DFS和OS都更好
作者根据DL模型输出的风险分数,把患者分成高风险和低风险。
全队列中:
高风险:452例
低风险:203例
结果很明显。
低风险患者的DFS明显优于高风险患者:
HR 0.21
P < 0.001
低风险患者的OS也明显更好:
HR 0.40
P < 0.001
换句话说,模型不仅能输出一个数字,还能把患者分成预后差异非常明显的两组。
这部分结果和临床决策关系很大。
因为术后辅助治疗最需要解决的就是:
哪些人复发风险高,值得进一步治疗;
哪些人预后已经相对好,继续加治疗可能收益有限。
模型到底看哪里?高风险看瘤周,低风险看瘤内
如果只是给出一个风险分数,临床医生未必敢用。
所以作者做了Grad-CAM和SHAP解释。
比较有意思的是,高低风险患者的热图关注区域不一样。
在高风险患者中,模型重点关注的区域主要集中在:
肿瘤周围食管壁
瘤周3–5mm区域
周围脂肪组织
邻近气管膜部区域
主动脉弓旁区域
纵隔淋巴引流区域
这些区域和肿瘤外侵、局部浸润、淋巴结相关风险比较接近。
在低风险患者中,模型关注更多集中在:
肿瘤核心内部
作者认为,这可能与肿瘤内部异质性、坏死程度、强化均匀性、对新辅助治疗敏感性等有关。
为了进一步验证这种观察,作者还做了批量统计。
在内部+外部验证队列共281例中:
高风险患者有189例,其中152例,也就是 80.4%,表现为以瘤周/远处区域为主的注意力模式。
低风险患者有92例,其中71例,也就是 77.2%,表现为以瘤内区域为主的注意力模式。
高低风险患者之间瘤周/远处关注模式差异显著。
这个结果值得关注。
它提示模型不是随便盯着某个地方做判断,而是可能抓住了与临床病理逻辑相符的空间信息:
高风险患者更像是“向外扩散型”影像模式;
低风险患者更多体现肿瘤内部结构特征。
当然,Grad-CAM不能等同于机制证明,但至少提高了模型解释性。
图4|高风险和低风险患者的Grad-CAM可解释性结果
图注:模型将患者A、B判断为高风险,将患者C、D判断为低风险。Grad-CAM显示,高风险患者的模型关注区域更多集中在肿瘤边缘及周围侵犯相关区域;低风险患者的关注区域更多集中在肿瘤内部结构。
真正关键的问题:谁能从术后放疗获益?
这篇文章最值得写的地方,其实是放疗获益分析。
作者不是停留在“模型能预测DFS”。
他们进一步问:
模型分出来的高低风险患者,术后放疗获益一样吗?
答案是不一样。
在高风险组452例患者中:
96例接受术后辅助放疗
356例未接受术后辅助放疗
高风险患者中,接受放疗者DFS明显更好:
HR 0.52
P < 0.001
OS也有改善:
HR 0.82
P = 0.008
也就是说,对于模型判断为高风险的患者,术后辅助放疗可能带来实际生存获益。
但低风险组结果不同。
低风险组203例患者中:
54例接受术后辅助放疗
149例未接受术后辅助放疗
低风险患者接受放疗后,DFS没有显著获益:
HR 0.86
P = 0.054
OS也没有显著改善:
HR 0.91
P = 0.951
这部分结果非常有临床意义。
因为它不是简单说“高风险预后差”。
而是进一步指出:
高风险患者可能更值得考虑术后放疗;
低风险患者可能未必需要常规追加放疗。
如果后续前瞻性研究能验证这个结论,那么这类模型的用途就不仅是预测复发,而是直接参与治疗策略选择。
图5|高低风险患者的DFS、OS差异及亚组分析
图注:Kaplan–Meier曲线显示,低风险患者的DFS和OS明显优于高风险患者。亚组分析显示,这种风险分层在多个临床亚组中保持一致,提示模型具有较稳定的预后区分能力。
图6|不同风险患者是否接受术后放疗的生存差异和决策路径
图注:高风险患者接受术后辅助放疗后,DFS和OS均有所改善;低风险患者接受放疗后未观察到显著获益。研究据此提出临床决策路径:模型判定为高风险的患者可考虑术后辅助放疗,低风险患者则应谨慎评估是否需要放疗,以避免过度治疗。
这篇文章对做医学AI有什么启发?
第一,终点选得更接近临床。
很多AI研究喜欢做pCR预测,因为终点清楚、相对容易。
但医生真正需要的是治疗决策。
这篇文章直接预测DFS,并进一步分析放疗获益,比单纯pCR预测更接近临床问题。
第二,AI不一定只做“预测谁复发”。
更有价值的问题是:
预测以后怎么改变治疗?
如果一个模型只能说某人高危,但不能指导下一步管理,它的临床价值会有限。
这篇文章把模型输出和术后放疗选择联系起来,研究设计上更进一步。
第三,自动分割是影像AI落地的关键环节。
如果一个模型必须依赖医生手工勾画肿瘤,临床推广会很难。
VISTA3D + point-prompt这种半自动流程,虽然还不是完全无人工,但已经比逐层手工勾画更接近实际可用。
第四,瘤周区域不能忽略。
很多肿瘤影像AI只关注肿瘤内部。
但这篇文章的Grad-CAM结果提示,高风险患者的关键信息可能更多来自瘤周和纵隔邻近区域。
这对食管癌、肺癌、直肠癌这类局部浸润和淋巴引流很重要的肿瘤,都有参考意义。
但这篇研究也不能过度解读
首先,它是回顾性研究。
虽然有外部验证,但仍然不能直接改变临床治疗策略。术后放疗是否真正应该由模型决定,还需要前瞻性试验验证。
第二,样本量还有限。
全队列655例,其中真正接受术后辅助放疗的患者数量并不算大。尤其是分到高低风险后再做放疗亚组分析,统计稳定性还需要更多数据支持。
第三,风险分层cutoff是用整个队列确定的。
文章也承认,0.53这个阈值还没有在完全独立外部数据中单独验证。它目前更适合作为探索性分层工具,而不是临床可直接使用的固定阈值。
第四,模型只用了治疗前CT。
但真实预后可能还和治疗过程中肿瘤缩小情况、术后病理、免疫指标、炎症指标、基因组信息等有关。未来如果加入动态影像、血液指标或病理信息,模型可能会更完整。
第五,外部验证只有一个中心。
多中心研究听起来比较完整,但严格说,训练和内部验证来自一个中心,外部验证来自另一个中心。要真正证明泛化能力,还需要更多中心、更长时间和更复杂扫描条件下的验证。
写在最后
这篇文章真正有意思的地方,不是“CT深度学习又做了一个预后模型”。
而是它把问题往临床决策上推了一步。
局部晚期食管鳞癌接受NICT后,患者之间差异很大。
有些人术后风险仍然高,可能需要进一步加强治疗;
有些人预后相对好,再加放疗未必有明显收益,还可能增加毒性。
这时候,治疗前CT里有没有信息可以提前提示这些差异?
这篇研究给出了一个方向:
通过自动分割、瘤内和瘤周habitat分析、深度学习预后建模,可以把患者分成高低风险组。
更进一步,高风险患者可能从术后辅助放疗中获益,而低风险患者没有观察到显著获益。
当然,这还不是临床指南,也不是可以直接照搬的治疗路径。
但它很适合给做肿瘤AI的团队一个提醒:
模型不要只停留在“预测准确率”;
更应该回答“预测结果能不能改变临床管理”。
对于食管癌、胃癌、肺癌、直肠癌这些围手术期治疗策略复杂的肿瘤,AI真正值得做的,不只是预测pCR,而是进一步帮助判断:
谁需要加强治疗;
谁可以减少治疗;
谁需要密切随访;
谁可能避免不必要的毒性。
这类问题,才更容易和临床价值接上。
清璟AI目前持续关注肿瘤影像AI、免疫治疗疗效预测、围手术期治疗决策、预后建模及SCI科研合作。对于已经积累CT影像、治疗方案、术后病理和随访数据的团队,课题设计时不建议只停留在“模型AUC多少”,而应该把风险分层、治疗获益分析、外部验证和临床决策路径一起设计进去。
文献信息
Zhao J, Yuan Z, Shi H, Li Y, Li C, Zhang R, Liu C.
Deep learning models based on CT predict prognosis in patients with locally advanced esophageal squamous cell carcinoma who received neoadjuvant immunotherapy and chemotherapy
Frontiers in Immunology. 2026;17:1900089.
DOI: 10.3389/fimmu.2026.1900089
关于我们
清璟AI由国内TOP2高校医工交叉博士联合创立,专注于医疗大模型科研、影像组学、病理组学、深度学习、AI智能体、生信分析、多组学、多模态和各类人工智能算法。致力打造一站式Al+医学科研生态圈,提供专业的AI智能体、高端科研资源及一对一定制化服务。我们的服务涵盖从科研方案设计、数据处理到AI模型训练及系统开发等各个领域,旨在为医学研究者和临床医生提供全方位的支持与创新解决方案。携手清璟AI,让科研更智能,让医学更精准。

科研合作请联系
长按二维码加微信
