医疗AI正在快速进入疾病筛查、辅助诊断、影像识别、病理分析、风险预测、治疗决策和健康管理等场景。很多AI模型可以发表论文,可以跑出不错的AUC、准确率、敏感度和特异度,却很难真正进入临床工作流。医疗场景不是单纯的数据竞赛。模型面对的是患者、医生、流程、责任、伦理、监管和真实世界变化。一个AI工具在开发数据集中表现很好,并不代表它能在不同医院、不同设备、不同人群、不同疾病谱和不同操作习惯中稳定运行。FUTURE-AI国际共识指南的价值就在这里:它把医疗AI从“模型性能”拉回到“可信赖、可部署、可监管、可持续使用”的完整框架中。研究者关心数据量、算法结构、训练策略和指标表现。医院管理者和临床医生则更关心另一个问题:这个AI工具能不能真正用于患者?能不能适配医院流程?出错后谁负责?模型性能下降能否发现?不同人群是否公平?系统升级后是否仍然可靠?FUTURE-AI提出的思路是,医疗AI从设计开始,就要考虑临床部署。AI工具不是等模型开发完成后再去补伦理、补验证、补说明书、补监管材料,而是在项目立项、数据收集、模型训练、外部验证、临床评价、上线运行和持续更新中,全程纳入可信赖要求。这对医院、科研团队、企业和监管部门都有直接影响。医疗AI评价不能停留在“模型准不准”,而应扩展到“是否可用、可解释、可监控、可追责、可更新”。FUTURE-AI中的六个字母,分别对应六类原则。要求AI工具在不同人群中尽量避免系统性偏倚。医疗AI可能因为性别、年龄、种族、社会经济状况、疾病基础、数据来源、设备差异、标注人员差异而产生偏差。模型如果只在某一类患者中表现良好,却在弱势群体或少数人群中误诊率更高,就不具备真正的临床公平性。强调AI工具能否推广到新的用户、新的医院和新的医疗场景。一个模型在研究中心表现良好,不代表在基层医院、不同品牌设备、不同信息系统或不同诊疗路径中依然有效。因此,外部数据验证、多中心验证和本地临床有效性评估不可缺少。要求AI工具从开发到部署都留下完整轨迹。包括使用了什么数据、哪个模型版本、输入是什么、输出是什么、谁使用了结果、医生是否采纳、系统是否发生过异常。没有日志、没有版本管理、没有审计机制,AI上线后就很难追责和纠错。关注终端用户能否安全、高效地使用AI。医生是否看得懂结果?界面是否影响工作效率?AI提示是否会增加负担?是否存在自动化偏倚?是否保留医生监督和干预机制?这些问题决定AI能否真正融入临床。强调模型面对真实世界变化时能否保持稳定。患者结构变化、设备更新、检验指标单位变化、影像协议调整、数据缺失、标签噪声、疾病谱变化,都可能导致AI性能漂移。医疗AI上线后不能“一劳永逸”,必须持续监测。要求AI输出不仅给出结论,还应提供对临床有意义的信息。解释不是装饰性的热力图,也不是简单告诉医生“模型认为高风险”。它应帮助医生理解模型判断依据、适用边界、不确定性和可能失效的情境。FUTURE-AI强调,设计阶段不应只由算法团队主导。医疗AI项目启动时,应让临床医生、患者代表、医院管理者、信息部门、伦理专家、数据科学家和未来终端用户共同参与。否则,很容易出现模型做得很好,但临床不愿用、不能用或用不上。对于医院来说,引入AI产品时也应反向追问这些问题。如果供应商无法说明模型的应用场景、适用人群、数据来源、偏倚评估和风险管理,说明该工具距离可信部署仍有距离。医疗AI不能只依赖单中心、单设备、单人群、单时间段的数据。真实临床环境充满变化,训练数据应尽量覆盖目标部署环境中的患者结构、疾病谱、设备协议、数据采集方式和流程差异。开发阶段还需要关注数据安全和隐私保护。医疗AI通常涉及高度敏感的健康信息,从采集、传输、存储、标注到建模分析,每个环节都可能出现泄露风险。此外,模型开发不能忽视人机交互。AI不是单独运行的“黑盒答案机”,而是嵌入医疗流程的辅助工具。医生如何输入信息、如何看到结果、如何反馈错误、如何覆盖AI建议,都应在开发阶段形成机制。很多AI模型最大的问题,是只在内部数据集上表现良好。FUTURE-AI强调,医疗AI应使用外部数据进行评估,最好在多个站点、多类人群、多种真实世界变化条件下检验模型表现。评价内容也不能只看准确率。应同时评估公平性、可用性、临床效用、安全性、稳健性和可解释性。- 公平性评估要看不同年龄、性别、地区、疾病基础和社会经济群体之间是否存在性能差异。
- 可用性评估要看医生是否愿意使用、是否容易理解、是否增加工作负担、是否影响诊疗效率。
- 临床效用评估要看AI是否真正改善患者结局、提高工作效率、减少漏诊误诊,或提升医疗质量。
- 稳健性评估要看输入数据发生变化时,模型是否仍然可靠。
- 可解释性评估要看解释是否具有临床意义,是否会导致医生过度自信或过度依赖。
这意味着,医疗AI评价要从“算法验证”走向“临床验证”。模型一旦进入临床,就会面对不断变化的真实世界。患者群体变化、诊疗路径变化、设备更新、数据格式变化、疾病流行趋势变化,都可能造成模型性能下降。因此,AI工具上线后需要持续质量控制、定期审计和更新机制。医院应建立AI日志系统,记录模型版本、输入摘要、输出结果、调用时间、用户角色、医生采纳或覆盖AI建议的行为。这些信息既用于风险识别,也用于后续审计和责任追溯。AI治理机制也不可缺少。医院需要明确谁负责准入评估,谁负责日常监测,谁负责异常上报,谁负责模型更新审核,谁负责患者安全事件处置。没有治理机制的AI部署,本质上是把临床风险转移给一线医生。医院在评估医疗AI产品时,不应只看演示效果和模型指标。这些问题决定AI工具能否从“可研究”变成“可使用”。FUTURE-AI对检验科、影像科、病理科和医院信息部门都有借鉴意义。- 检验AI如果用于异常结果提示、危急值预警、感染风险预测或报告辅助审核,就必须关注不同仪器、不同试剂、不同人群和不同实验室流程带来的数据漂移。
- 影像AI如果用于辅助诊断,就不能只依赖单设备、单中心数据训练,还要验证不同扫描协议、不同图像质量、不同疾病阶段下的稳健性。
- 病理AI如果用于分型、计数或预后预测,就需要关注切片制备、染色差异、扫描仪差异和标注一致性。
- 医院信息部门则要关注系统集成、接口标准、日志记录、权限管理、网络安全和上线后的监测机制。
FUTURE-AI的优势在于框架完整、覆盖全生命周期,并将可信赖AI从理念转化为实践建议。但它也存在现实局限。部分建议仍偏宏观,不同国家、不同医疗系统、不同医院的信息化能力和监管环境存在差异,具体执行细节还需要本地化转换。在我国实践中,医疗AI进入临床通常需要同时面对产品属性界定、注册审查、临床评价、数据合规、伦理审查、院内采购、信息安全和临床使用管理等多条线要求。因此,未来更需要把FUTURE-AI与国内监管政策、医院制度、临床路径、数据标准和质量管理体系结合起来,形成可操作的院内准入和持续监管清单。医疗AI的未来,不取决于模型能否做出漂亮结果,而取决于医生、患者、医院和监管部门能否信任它。信任不是口号,也不是企业宣传材料。信任来自可验证的数据、可解释的逻辑、可追溯的过程、可监测的运行状态、可承担的责任和可持续的治理机制。FUTURE-AI给医疗AI划出了一条清晰路线:从研发走向部署,从性能走向安全,从模型走向系统,从算法创新走向临床价值。对医院而言,未来引入AI工具时,最该问的不是“这个模型有多先进”,而是“这个模型能不能被安全、透明、持续地管理”。来源与出处:李希,刘珏.《可信赖且可部署的医疗健康人工智能国际共识指南》FUTURE-AI解读. 中华流行病学杂志,2026,47(2):207-212. DOI:10.3760/cma.j.cn112338-20250703-00458。傅彦文,周翔. FUTURE-AI:医疗保健领域中可信赖且可部署的人工智能国际共识指南解读. 数字医学与健康,2026,4(2):132-143. DOI:10.3760/cma.j.cn101909-20250905-00161声明:本文仅用于分享,不代表平台立场,如有侵权或涉及版权问题,请尽快联系我们,我们第一时间更正,谢谢!