夜雨聆风学习资料网

ARTICLE · 1028033

人工智能影像软件用于肺癌预测的临床应用

人工智能影像软件用于肺癌预测的临床应用

Clinical Application of Artificial Intelligence Imaging Software for Prediction of Lung Cancer

Daniel Miller, MD¹;John Kuckelman, DO²;Mikenzie Sturdevant, DO³;Trent Swanson, PA¹;Melissa Shafer, PA¹;Stephanie Hayes, BS⁴

1 佐治亚医学院胸外科(美国佐治亚州奥古斯塔);2 马迪根陆军医疗中心胸外科(美国华盛顿州塔科马);3 佐治亚医学院普外科(美国佐治亚州奥古斯塔);4 佐治亚医学院(美国佐治亚州奥古斯塔)

原载于 JTCVS Open(2026),doi: 10.1016/j.xjon.2026.102099

中心图 右肺上叶(RUL)不确定肺结节(IPN)的人工智能肺癌预测(LCP)评分为10分(癌症风险93%)。图中显示CT扫描上的病灶及LCP评分表。该右肺上叶IPN最终证实为IA期(T1bN0M0)腺癌。

中心信息

AI LCP评分高(>8)准确性高,可减少肺癌根治性手术治疗前不必要的影像学检查与诊断性操作。

观点陈述

AI软件生成的肺癌预测(LCP)评分可准确地对不确定肺结节进行风险分层。在1~10分的量表中,90%的恶性结节LCP评分≥8,优于术前活检数据(后者仅识别出31.4%的恶性结节)。应用该AI软件可减少肺癌根治性治疗的延误。

摘要

目的:低剂量CT(LDCT)已革新肺癌筛查,但不确定肺结节(IPN)的判读仍具挑战性。能够预测恶性风险的人工智能(AI)软件有望提高诊断精度。我们评估了一款AI肺癌预测(LCP)评分系统在IPN中的临床应用。

方法:前瞻性纳入直径<3 cm且当前无癌症的IPN患者,采用本机构获许可的专有AI软件生成LCP评分,评分范围从1(癌症风险0.2%)至10(风险93%)。将患者结局与传统危险因素、Lung-RADS及最终病理进行相关性分析。

结果:2023年至2025年间共纳入187例患者,其中136例(72.7%)患者的169个结节接受了LCP评分。39例患者(28.6%)确诊为恶性。近90%的恶性结节LCP评分≥8。在此阈值下,模型灵敏度为81%、特异度为93%、阳性预测值为84%、阴性预测值为93%、总体准确率为90%。LCP评分与恶性(R=0.69,p<0.001)及临床决策(R=0.66,p<0.001)均呈强相关,而Lung-RADS仅呈中等相关(R=0.34,p<0.01)。值得注意的是,术前非手术活检仅31.4%为恶性,而90%的恶性病例(包括5例假阴性活检)通过LCP评分≥8被正确识别。

结论:AI LCP评分高(>8)准确性高,可减少早期肺癌根治性手术治疗前不必要的影像学检查与诊断性操作。

引言

肺癌仍是全球癌症相关死亡的主要原因之一,这在很大程度上归因于其常被晚期诊断。早期发现对提高生存率至关重要,然而现有筛查方法(如低剂量计算机断层扫描,CT)在准确性和判读方面仍面临挑战。近年来,人工智能(AI)的进展在增强影像学诊断能力方面显示出前景,尤其在胸外科领域。为分析不确定肺结节(IPN)的CT图像并预测肺癌风险而设计的AI辅助放射学软件,有望通过提高肺癌检测的灵敏度和特异度带来范式转变,从而促进更早的诊断干预、更微创的治疗,并使早期发现的肺癌有可能获得治愈。

AI辅助放射学软件是一种先进的软件,通过分析CT扫描评估IPN的恶性风险,以辅助肺癌的早期发现。临床研究已证实,与传统放射科医师判读相比,其可提高诊断准确性。AI平台利用庞大的肺部影像数据集,并采用机器学习算法识别与肺癌相关的细微模式,从而实现对IPN的风险分层。在近期试验中,它通过准确识别可能为良性的肺结节,同时改善恶性肿块的早期发现,显示出减少不必要活检和手术的潜力。该工具正越来越多地整合进临床工作流程,但人们对AI与传统肺结节评估方法(如肺部CT筛查报告与数据系统Lung-RADS评分和/或危险因素)相比表现如何,仍了解有限。Lung-RADS由美国放射学委员会于2014年创建,旨在规范筛查发现的肺结节的报告与管理。Lung-RADS评分综合考虑结节位置、形态、结节数量以及结节在重复影像上的持续存在情况,将结节从0(不确定过程)分类至4b(高度怀疑恶性,建议转诊进一步临床评估)。

本研究回顾了本机构于2022年获得许可的AI软件在三级胸外科临床实践中,对IPN的CT图像为期两年的真实世界整合应用。主要终点包括预测肺癌的灵敏度与准确性。次要终点包括对其诊断性能的评估,以及与传统方法的比较和实际应用。通过临床洞见与技术创新的结合,我们假设:整合能够生成IPN肺癌诊断预测风险评分的AI软件,将可基于AI生成的评分为肺结节的临床管理提供准确指导。

患者与方法

机构审查委员会(IRB)批准豁免全面IRB审查(IRB–775161-24)并豁免知情同意。接受AI软件评估的患者来自本医疗系统内的三类人群:通过自动化放射学标记系统发现的偶然性肺结节患者、接受监测影像检查的既有胸外科患者,以及在LDCT筛查项目中随访的已知结节患者。这种三管齐下的方法实现了对机构内几乎所有符合条件患者的近乎完整覆盖,而非仅选择性地纳入转诊的高危亚组。IPN患者被转诊至由普通胸外科医师和介入肺脏病专科医师组成的肺结节门诊。

选择仅受以下因素限制:患者拒绝入组;因结节大小小于5 mm或大于30 mm而排除;或患者在转诊前两年内有既往实体瘤癌症诊断。入组后,患者被录入一款专有AI软件(Optellum Inc,TMC Innovation Institute,休斯顿,得克萨斯州)程序。该AI软件基于大型数据集,采用卷积神经网络并聚焦于先进深度学习技术来分析和分类图像。它利用多模态数据,拥有世界上最大的影像数据集之一,包含数百万个数据点用于训练和优化该AI软件。该软件程序可向保险公司和Medicare计费,是同类中唯一获FDA批准的平台。患者在整个后续IPN临床过程中被前瞻性地赋予肺癌预测(LCP)评分。所收集数据及LCP评分的完整清单见表1。这些数据包括结节特征,如结节大小、位置、结节数量、Lung-RADS,以及接受非手术活检或VATS楔形切除者的最终病理。AI生成的LCP评分基于该软件所使用的专有算法,其中纳入患者年龄、性别、包年数和吸烟状态。吸烟状态定义为当前吸烟者、既往吸烟者或从不吸烟者。如有吸烟史,则纳入包年数以及戒烟后的年数。任何既往胸部CT扫描也与所关注的胸部IPN CT图像一并上传至软件。胸部CT图像的层厚必须≤5 mm方可由AI软件分析以生成LCP评分。评分采用1至10的量表,每个分值对应相应的百分比预测值(图1)。预测癌症的LCP评分从1(0.2%)到10(93%)。这些评分对临床医师和患者均未设盲,用于指导IPN的共同临床决策管理。

临床干预决策由多学科团队在每周会议上酌情决定。在针对IPN诊断和/或治疗的临床决策干预分层中,LCP评分≥5者依据侵入性程度进行统计分析分层,涵盖6个干预类别(表2),从侵入性最小的12个月后复查CT,到支气管镜活检或手术楔形切除(见流程图)。对于低分层评分(1~3)的结节,分别视其分层评分行12个月、6个月或3个月随访影像检查。推荐的CT影像随访中位时间为6个月;若随访影像出现可疑表现,IPN管理将升级为组织学诊断或PET扫描。接受切除且组织学诊断为良性病变的患者,其CT影像随访为筛查人群标准的1年LDCT(若患者仍符合其人口学条件)。切除时诊断为恶性的患者,术后每6个月行胸部CT扫描、持续2年,之后每年1次再持续3年。分层评分>5的患者接受IPN非手术组织活检,方式为机器人导航支气管镜联合支气管内超声(若IPN为癌症阳性则完成分期)、中央型结节的经支气管针吸活检,或周围型结节的介入放射学引导活检。所有手术均经VATS入路完成。对未知IPN采用楔形切除并术中冰冻切片以明确组织学诊断。NSCLC的根治性肿瘤手术切除:<20 mm者行局限性切除(楔形切除或肺段切除),20~30 mm者行肺叶切除加淋巴结清扫。

统计分析采用标准描述性统计对纳入队列进行分析,并确定恶性患病率。在发现恶性与未发现恶性的患者之间进行比较分析。连续变量采用Student t检验比较,分类变量采用Fisher精确检验和卡方检验评估。计算灵敏度、特异度、阳性预测值(PPV)、阴性预测值(NPV)和准确率等诊断性能指标。随后采用相关性统计分析,以刻画LCP评分在临床决策中的应用价值,以及其对接受活检或手术切除患者最终病理恶性预测的能力,并与预测IPN为恶性的传统方法进行比较。相关系数(R)>+0.5(+0.5~1.0)视为强相关,所有p值显著性设定为<0.05。分析采用SPSS v.29(IBM,Armonk,纽约)完成。

结果

2023年至2025年间,187例患者入组基于AI的肺癌预测评分项目。其中136例(72.7%)患者共169个不确定肺结节符合纳入标准并接受了LCP评分。患者人口学资料和结节特征总结见表1。吸烟队列在年龄、性别和种族方面与国家肺癌筛查人群高度一致;入组的136例患者中,110例(80.9%)来自我们的LDCT筛查项目。39例患者(28.6%)确诊为恶性,涉及52个结节;97例(71.4%)为非恶性病变。所有癌症均为原发性非小细胞肺癌。

患者与结节特征

中位年龄为67岁(范围44~85岁),恶性与非恶性结节患者之间无差异(p=0.88)。两组在性别、种族、吸烟状态、包年数或既往CT扫描次数方面均无统计学显著差异(表1)。

结节特征在恶性组与非恶性组之间差异显著。整个队列的平均结节大小为14.2 mm。恶性结节显著大于良性结节(16.5 mm vs 13.2 mm,p=0.008)。恶性结节的Lung-RADS分类也更高(中位4[范围3~4]vs 3[范围2~4],p<0.01)。患者通常有一个优势结节,每例患者的结节数量在两组间无差异(p=0.29)。结节位置(侧别或具体肺段)与恶性无显著相关。

LCP评分表现

恶性结节的LCP评分显著高于良性结节(中位9[范围8~10]vs 5[范围1~10],p<0.001)。约90%的恶性结节LCP评分≥8。基于该分布,选择LCP阈值8进行诊断性能分析。所有评分≥8的患者均接受了IPN诊断性楔形切除手术。以LCP评分≥8计算,诊断性能显示灵敏度为81%、特异度为93%、阳性预测值为84%、阴性预测值为93%,总体诊断准确率为90%(图3)。

活检产出与临床管理

按最终病理分层的干预模式见表2。一部分患者接受了术前机器人支气管镜、经支气管针吸活检或介入放射学(IR)CT引导经皮活检。在接受术前活检的患者中,仅31.4%获得恶性诊断。相比之下,90%的恶性结节通过LCP评分≥8被正确识别,包括所有(5例)活检假阴性病例。大多数LCP评分高于诊断阈值的患者直接接受VATS楔形切除以明确诊断,而未进行额外的侵入性诊断检查。99例接受LCP评分的患者避免了非手术和手术IPN诊断;其中43例(43.4%)符合LCP评分≥5的分层评级条件,并按其评级以设定间隔进行影像随访。56例低评分患者(LCP评分<5)无需额外随访,除非其因高危人口学特征符合年度低剂量胸部CT扫描条件。此外,25例分层评级为6的患者直接接受VATS楔形切除,其中19例(76%)在最终手术病理中证实为恶性,从而避免了术前非手术活检。所有入组患者的中位随访时间为11个月(范围6~24个月)。

相关性分析

进行相关性分析以评估LCP评分的临床适用性。LCP评分与最终恶性诊断呈强相关(R=0.69,p<0.001),与临床决策和干预分层也呈强相关(R=0.66,p<0.001)。LCP评分与吸烟状态(R=0.09)、结节大小(R=0.34)或结节数量(R=0.50)无有意义的关联。Lung-RADS分类与LCP评分呈中等相关(R=0.34,p<0.01)。

讨论

用于预测肺癌的放射学AI软件(包括本研究所用模型)建立在肺癌筛查的若干关键进展之上。2021年针对美国预防服务工作组(USPSTF)开展的一项系统评价强调,低剂量计算机断层扫描(LDCT)用于肺癌检测的灵敏度(59%~100%)和特异度(26.4%~99.7%)范围很广,各研究的阳性预测值从3.3%到43.5%不等。这些发现与我们的结果一致:我们的AI驱动LCP评分显示出显著更高的诊断准确性,总体阳性预测值为84%,准确率为90%,尤其在高危(评分≥8)患者中。此外,我们的AI系统在该组中达到81%的灵敏度和93%的特异度,支持其提高恶性结节识别能力的潜力。这凸显了AI工具优化临床决策的能力,可将患者分层至适当的随访或干预,从常规监测到更具侵入性的操作。尽管这些发现与文献相呼应,我们的结果表明,基于AI的风险分层可减轻放射科医师的负担,同时提供更精准的临床洞见。

基于至少需要一次间隔CT扫描的标准监测范式,我们估计在低危患者中至少避免了56次CT扫描,若考虑典型的连续影像检查方案,实际数量很可能更多。此外,25例高危患者直接接受VATS诊断性楔形切除,很可能每人至少避免了一次间隔CT扫描。既往研究表明,不确定结节常因结果无法诊断而接受多次影像学检查和/或重复非手术活检,导致根治性治疗延误。在我们的队列中,AI引导的分层通过避免低危患者的监测影像、并使高危患者(包括活检假阴性病例)得以早期根治性管理,缩短了这一反复的诊断路径。

应用AI LCP评分软件最重要的是向患者宣教这一评估IPN的新诊断手段。是否进行支气管镜活检、手术楔形切除活检或进一步影像检查的最终决定权在于患者。增加一个客观数据点可能加速早期肺癌的诊断和治疗,减少不必要的放射学检查和侵入性操作,并减轻患者因不知IPN组织学性质而产生的焦虑。

我们发现基于AI的肺癌预测评分在本机构优于非手术组织活检,这需要审慎解读,但得到了越来越多文献的支持——这些文献显示非手术活检技术的诊断准确性在不同机构间存在显著差异。机器人导航支气管镜的报告灵敏度差异很大,约为60%至90%以上,诊断率受操作者经验、机构操作量、病灶大小、支气管征的存在以及径向EBUS或锥形束CT等辅助技术应用的强烈影响。同样,CT引导经皮肺活检——在理想条件下常被认为高度敏感——在不同中心之间也表现出明显差异,假阴性率报告为10%至30%,尤其对于较小、亚实性或技术上具有挑战性的病灶,以及活检并发症。在真实世界临床实践中,无法诊断或假阴性的活检结果常延误根治性治疗,并导致重复操作或长期影像监测。相比之下,我们队列中AI衍生的LCP评分表现出持续的高诊断准确性,不依赖操作或操作者相关因素,正确识别了90%的恶性结节,包括既往非手术活检假阴性的病例。这些发现提示,基于AI的风险分层可作为可靠、不受机构差异影响的辅助手段,补充传统诊断路径,尤其在活检性能不稳定或资源密集的环境中。重要的是,我们的结果并不提示应取代组织学诊断,而是支持利用AI更好地识别可安全直接接受根治性手术管理的患者,从而减少诊断延误和不必要的侵入性检查。在本研究进行时,我们的介入肺脏病团队正处于过渡阶段,机器人导航支气管镜和经支气管针吸活检的操作量较低。若非手术肺结节活检(机器人支气管镜和EBUS)阳性即为癌症,则无论是否联合锥形束CT,目前均已成为行业标准;但对于AI LCP评分≥8者,可能并不需要。

然而,我们的发现也与一些既往模拟风险预测模型在肺癌筛查中获益的研究形成对比。例如,Jonas等人认为此类模型可减少筛查可预防的死亡人数和假阳性。但其结论主要来自事后分析和试验数据建模,证据强度有限。我们的AI系统使用真实世界临床数据,为肺癌筛查患者和偶然发现肺结节的患者提供了更稳健、更实用的风险降低实证。

一些研究对我们的发现提出了质疑,尤其是提示风险预测模型可改善筛查结局。例如,建模研究估计此类模型可降低预防一例肺癌死亡所需的筛查人数,同时降低假阳性率。该方法可能优于传统的基于危险因素的筛查方法,尤其是在假设类似NLST的癌症检出率和死亡率时。然而,这些发现受限于证据强度较低,因为它们主要来自试验数据的事后应用和理论建模,而非真实世界临床场景。

尽管本研究样本量相对较小且来自单一学术机构,但跨越三类IPN人群的入组证明了其与更广泛国家肺癌人群的相关性。它可能也不完全适用于无法获得学术中心先进筛查技术的患者群体。在我们所在的地理区域,有相当比例(>50%)的患者胸部CT上发现的IPN与肉芽肿性疾病(组织胞浆菌病)和结节病有关。在我们学术中心利用AI协助预测IPN的肺癌,将通过减少不必要的影像和操作来降低成本,同时加速LCP评分>8、癌症高风险IPN的诊断与治疗,从而通过早期诊断改善长期生存。未来研究可扩展至覆盖美国更广泛的地区,或开展多中心、全国性研究。这将增强我们发现的有效性,并让更多机构能够比较其使用AI LCP评分的诊断结局。后续研究还应探索将Lung-RADS纳入AI的学习过程,以确保既有放射学标准与AI癌症预测更为契合。最重要的是,AI LCP评分是一种诊断工具,而Lung-RADS是IPN管理指南。将AI用于癌症预测开辟了诸多可能,未来应致力于纳入更大的CT扫描与结局数据集,以不断完善和提高AI算法的准确性和精确度。本研究的目的在于展示这一已获验证的技术在患者IPN真实世界日常管理中的临床应用。

您可以在补充材料中收听与本文相关的报告和讨论的录音。

表格

表1 患者人口学资料与结节特征

项目

非恶性(97例/117个结节)

恶性(39例/52个结节)

合计(136例/169个结节)

P值

年龄(岁)

67(44–85)

67(60–77)

67(44–85)

0.88

性别

0.19

 女性

44(45%)

25(64%)

69(51%)

 男性

53(55%)

14(36%)

67(49%)

种族

0.76

 非裔美国人

26(27%)

10(26%)

36(26%)

 拉丁裔美国人

2(2%)

0(0%)

2(1%)

 白人

69(71%)

29(74%)

98(73%)

吸烟状态

0.29

 当前吸烟

47(48%)

18(46%)

65(48%)

 既往吸烟

36(37%)

19(49%)

55(40%)

 从不吸烟

14(15%)

2(5%)

16(12%)

包年数

38(0–110)

42(0–110)

39(0–110)

0.44

既往CT扫描次数

2(1–6)

1(1–5)

2(1–6)

0.49

结节特征

 大小(mm)

13.2(4–45)

16.5(6–30)

14.2(4–45)

0.008

 位置

0.28

  右上叶(RUL)

45(38%)

34(65%)

79(47%)

  左上叶(LUL)

27(23%)

3(6%)

30(18%)

  右下叶(RLL)

25(21%)

10(19%)

35(21%)

  左下叶(LLL)

16(14%)

5(10%)

21(12%)

  右中叶(RML)

4(3%)

0(0%)

4(2%)

 每例结节数

1(1–5)

1(1–2)

1(1–5)

0.29

 Lung-RADS

4(2–4)

4(3–4)

4(2–4)

<0.01

 LCP评分

5(1–10)

9(8–10)

6(1–10)

<0.001

数据表示为中位数(范围)或例数(百分比)。LCP:肺癌预测;Lung-RADS:肺部CT筛查报告与数据系统;RUL/LUL/RLL/LLL/RML:右肺上叶/左肺上叶/右肺下叶/左肺下叶/右肺中叶。

表2 按干预严重程度与最终病理分层的临床管理

干预措施

分层评级

非恶性

恶性

合计

12个月后复查CT

1

1

0

1

6个月后复查CT

2

23

0

23

3个月后复查CT

3

15

0

15

PET-CT

4

4

0

4

非手术活检

5

5

7

12

手术楔形切除

6

6

19

25

合计

54

26

80

数值为患者例数。分层评级反映诊断与治疗强度的递增。

图1 右肺上叶(RUL)IPN中LCP评分为10的示例。病灶被圈出,评分在扫描图像和LCP评分表中均以高亮显示。

图2 图形摘要(Graphical Abstract)。

图3 人工智能统计数据。上方为模型诊断性能指标(灵敏度81%、特异度93%、阳性预测值84%、阴性预测值93%);下方为以最终病理为金标准的2×2四格表(真阳性30例、假阳性19例、假阴性7例、真阴性79例,合计135例)。

流程图 按干预严重程度与最终病理分层的临床管理。

*按照肺癌筛查指南,年龄50~80岁、吸烟史≥20包年且未在近15年内戒烟的患者。**活检通过术前机器人支气管镜、经支气管针吸活检或CT引导经皮活检获得。

流程图中文化对照

流程环节

例数

初始纳入IPN<3 cm的患者

187例

因CT层厚>5 mm排除

51例

纳入并接受LCP评分

136例(169个IPN)

LCP评分<5:无需额外随访或继续年度LDCT*

56例

LCP评分≥5,进入分层评级

80例

 评级1 → 12个月后复查CT

1例

 评级2 → 6个月后复查CT

23例

 评级3 → 3个月后复查CT

15例

 评级4 → PET-CT

4例

 评级5 → 活检**

12例

 评级6 → 手术切除

25例

相关学习资料

返回首页浏览学习资料