研究先开展回顾性研究,纳入英国 5 家筛查中心 115973 张乳腺钼靶影像、39 个月随访数据,对比谷歌 AI 系统与人类首阅、二阅及共识阅片的诊断效能,再推进前瞻性非干预可行性部署,覆盖 12 个筛查中心 9266 例病例,同步评估亚群公平性、工作流影响与技术适配性;结果显示 AI 灵敏度显著优于人类首阅、特异性非劣,癌症检出率提升,尤其在初筛与浸润性癌中表现突出,可识别 25% 间期癌,替代二阅能缩短 32% 阅片时间,无系统性人口学差异,前瞻性验证技术可行但需校准阈值;综上,AI 可提升乳腺筛查精准性与效率,保障公平性,落地需动态校准与持续监测。
注:该文章发表于《Nature Cancer》,该期刊最新影响因子为 28.5,属于 JCR Q1 区及《新锐期刊分区表》医学大类 1 区期刊。
超大规模多中心验证,回顾性 11 万 + 影像、前瞻性 9 千 + 病例;AI 灵敏度超人类、特异性非劣,提升检出率且识别 25% 间期癌;初筛优势显著、无系统性人群差异;替代二阅降 32% 阅片时间;前瞻性证实可行性,明确落地需动态校准与监测。
研究分回顾性、前瞻性两阶段开展,均聚焦谷歌乳腺钼靶 AI 系统(1.2 版)。回顾性研究:纳入英国 5 家 NHS 筛查中心、2015-2016 年 115973 名 50-70 岁女性影像,以 39 个月随访数据为金标准,对比 AI 与人类首阅、二阅、共识阅片的灵敏度、特异性,分析癌症检出率、召回率,开展年龄、种族、乳腺密度等亚群公平性评估,模拟 AI 替代二阅的工作流影响。前瞻性研究:伦敦 2 家筛查中心、12 个站点,纳入 9266 例病例,非干预式部署 AI,监测阅片耗时、召回率,验证技术集成可行性,针对数据分布偏移迭代校准 AI 阈值,全程评估数据质量、设备差异对性能的影响,严格遵循伦理审批与数据合规要求。
回顾性阶段,AI 灵敏度 0.541(高于人类首阅 0.437,P<0.001)、特异性 0.943(非劣于人类首阅 0.952,P<0.001);癌症检出率从 7.54 升至 9.33 / 千人,识别 25.0% 间期癌;初筛人群召回率降 39.3%、检出率升 8.8%,浸润性癌检测优势显著;无系统性人口学差异,仅少数小样本亚群临界不劣效。模拟替代二阅,阅片时间降 32%、检出率升 17.7%,总人力需求降 46.4%。前瞻性阶段,AI 阅片耗时 17.7 分钟(远快于人类 2.08 天),初始阈值敏感度过高致召回率偏高,校准后性能稳定;设备差异引发数据偏移,校准后可适配,全程无公平性问题,技术集成可行。

图 1:研究整体设计与实施框架
这张图从研究阶段、评估维度和落地场景三个层面,清晰勾勒了 AI 乳腺筛查研究的完整流程。左侧回顾性研究部分,明确选取英国 5 家不同筛查机构、3 种差异化阅片流程,覆盖 12.5 万名女性样本,用于全面验证 AI 性能;中间部分聚焦公平性与安全性评估,从病例、乳腺、病灶、感兴趣区域等多维度,结合临床、社会、人口学因素做细分分析,同时针对不同机构校准模型操作阈值并监测数据漂移;右侧前瞻性可行性研究,在 12 个筛查站点开展静默部署,不干预临床决策,仅让 AI 同步分析病例,验证技术落地的实操性,整体串联起从大规模回顾验证、公平性校验到真实场景前瞻测试的全链条研究逻辑。

图 2:AI 与人类阅片者的性能核心对比
该图集中呈现了回顾性研究中 AI 系统与人类阅片者在乳腺癌筛查上的关键性能差异,核心凸显 AI 的优势与适配场景。图 a 和 b 从病例、乳腺、病灶三个层级,直观对比了 AI、第一阅片者、第二阅片者及共识决策的灵敏度和特异度,明确 AI 在灵敏度上显著优于人类首阅者,特异度达到非劣效标准;图 c 展示 5 家不同筛查机构中,AI 性能均保持稳定,不受机构间样本和筛查流程差异影响;图 d 重点区分首次筛查和后续复查场景,揭示 AI 在首次筛查中优势尤为突出,能大幅降低召回率、提升癌症检出率,而后续复查中虽检出率更高但召回率也同步上升,精准体现 AI 在不同筛查阶段的适配价值。

图 3:AI 在不同人群与临床特征亚组中的性能表现
这张图拆解了年龄、社会经济状况、种族、乳腺密度、病灶大小、癌症风险等级等关键亚组,全面分析 AI 在不同群体中的筛查性能与公平性。整体来看,AI 性能在绝大多数亚组中无系统性差异,不存在针对特定人群的显著偏差,仅少数样本量极小的亚组(如特定贫困等级、混合种族)灵敏度未达非劣效标准,属于统计波动而非系统性缺陷;在年龄维度,AI 对 65 岁以上女性灵敏度优势更明显;针对癌症类型,AI 对高风险浸润性癌症灵敏度远超人类,对低风险原位癌也保持非劣效;在设备适配、乳腺密度等技术和生理特征亚组中,AI 性能稳定,证实其筛查公平性和场景普适性。

图 4:前瞻性部署中 AI 的真实世界性能与动态变化
该图呈现了 12 个筛查站点前瞻性静默部署阶段,AI 系统在真实临床场景的性能表现、动态调整过程及数据分布偏移影响。图 a 对比回顾性数据、部署初期阈值和调整后阈值三个阶段,发现真实场景中 AI 初始阈值过于敏感,召回率偏高,调整阈值后性能回归稳定,与回顾性研究结论一致;图 b 关联癌症检出率与召回率,清晰展示部署中数据分布偏移(设备、人群、流程变化)导致人类和 AI 性能同步波动,阈值校准是适配真实场景的关键;图 c 以周为单位追踪召回率和检出率,直观反映样本构成的周度差异,凸显低患病率筛查人群中,实时监测 AI 性能、及时校准阈值的必要性。
谷歌 AI 乳腺筛查系统在大规模多中心研究中,性能优于人类首阅、不劣于共识阅片,可显著提升乳腺癌检出率、识别潜在间期癌,尤其适配初筛人群与浸润性癌检测,兼顾不同年龄、种族、社会经济水平人群公平性。临床层面,AI 替代二阅可大幅缩短阅片时间、降低人力成本,缓解放射科医生短缺压力。前瞻性部署证实技术落地可行,但需根据设备、人群数据动态校准阈值,建立持续监测机制,才能保障 AI 筛查的安全性、有效性与公平性,为全球乳腺筛查 AI 化提供核心依据。
局限性:部分亚群样本量小,统计结论受限;未评估人机交互影响,未测算下游诊疗成本;前瞻性周期短,长期稳定性待验证。展望:扩大小众亚群样本量,优化人机协作模式;开展长期随访,评估成本效益;完善实时监测体系,应对数据偏移,推动 AI 规范化落地。
#AI乳腺癌筛查#乳腺钼靶AI系统#乳腺癌筛查精准性#乳腺AI公平性#AI替代乳腺阅片#乳腺癌间期癌检测#多中心乳腺AI研究#乳腺筛查临床落地
国家杰青答疑实录(1对1视频)
医学省自然申请答疑,立项的关键条件是哪一些?从哪些方向可以杀出重围
临床型博士如何准备国青标书?没有预实验怎么办?专家一对一解答规划
技术精讲 & 真实案例
夜雨聆风