乐于分享
好东西不私藏

医疗AI不能只看准确率:FUTURE-AI国际共识给出可信赖部署路线图

医疗AI不能只看准确率:FUTURE-AI国际共识给出可信赖部署路线图
医疗AI正在快速进入疾病筛查、辅助诊断、影像识别、病理分析、风险预测、治疗决策和健康管理等场景。
很多AI模型可以发表论文,可以跑出不错的AUC、准确率、敏感度和特异度,却很难真正进入临床工作流。
医疗场景不是单纯的数据竞赛。模型面对的是患者、医生、流程、责任、伦理、监管和真实世界变化。一个AI工具在开发数据集中表现很好,并不代表它能在不同医院、不同设备、不同人群、不同疾病谱和不同操作习惯中稳定运行。
FUTURE-AI国际共识指南的价值就在这里:它把医疗AI从“模型性能”拉回到“可信赖、可部署、可监管、可持续使用”的完整框架中。

PART 01

医疗AI进入新阶段:能不能安全使用
研究者关心数据量、算法结构、训练策略和指标表现。医院管理者和临床医生则更关心另一个问题:这个AI工具能不能真正用于患者?能不能适配医院流程?出错后谁负责?模型性能下降能否发现?不同人群是否公平?系统升级后是否仍然可靠?
FUTURE-AI提出的思路是,医疗AI从设计开始,就要考虑临床部署。
AI工具不是等模型开发完成后再去补伦理、补验证、补说明书、补监管材料,而是在项目立项、数据收集、模型训练、外部验证、临床评价、上线运行和持续更新中,全程纳入可信赖要求。
这对医院、科研团队、企业和监管部门都有直接影响。医疗AI评价不能停留在“模型准不准”,而应扩展到“是否可用、可解释、可监控、可追责、可更新”。

PART 02

FUTURE-AI的六个核心原则
FUTURE-AI中的六个字母,分别对应六类原则。
公平性
要求AI工具在不同人群中尽量避免系统性偏倚。医疗AI可能因为性别、年龄、种族、社会经济状况、疾病基础、数据来源、设备差异、标注人员差异而产生偏差。模型如果只在某一类患者中表现良好,却在弱势群体或少数人群中误诊率更高,就不具备真正的临床公平性。
通用性(普遍性)
强调AI工具能否推广到新的用户、新的医院和新的医疗场景。一个模型在研究中心表现良好,不代表在基层医院、不同品牌设备、不同信息系统或不同诊疗路径中依然有效。因此,外部数据验证、多中心验证和本地临床有效性评估不可缺少。
可追溯性
要求AI工具从开发到部署都留下完整轨迹。包括使用了什么数据、哪个模型版本、输入是什么、输出是什么、谁使用了结果、医生是否采纳、系统是否发生过异常。没有日志、没有版本管理、没有审计机制,AI上线后就很难追责和纠错。
可用性
关注终端用户能否安全、高效地使用AI。医生是否看得懂结果?界面是否影响工作效率?AI提示是否会增加负担?是否存在自动化偏倚?是否保留医生监督和干预机制?这些问题决定AI能否真正融入临床。
稳健性
强调模型面对真实世界变化时能否保持稳定。患者结构变化、设备更新、检验指标单位变化、影像协议调整、数据缺失、标签噪声、疾病谱变化,都可能导致AI性能漂移。医疗AI上线后不能“一劳永逸”,必须持续监测。
可解释性
要求AI输出不仅给出结论,还应提供对临床有意义的信息。解释不是装饰性的热力图,也不是简单告诉医生“模型认为高风险”。它应帮助医生理解模型判断依据、适用边界、不确定性和可能失效的情境。

PART 03

设计阶段:就要想清楚临床问题
FUTURE-AI强调,设计阶段不应只由算法团队主导。
医疗AI项目启动时,应让临床医生、患者代表、医院管理者、信息部门、伦理专家、数据科学家和未来终端用户共同参与。否则,很容易出现模型做得很好,但临床不愿用、不能用或用不上。
设计阶段需要明确几个问题:
  • AI工具解决什么临床问题;
  • 目标用户是谁;
  • 用于哪个科室、哪个流程、哪个决策节点;
  • 输入数据来自哪里;
  • 输出结果将如何影响医生判断;
  • 是否存在偏倚来源;
  • 是否涉及伦理、隐私和社会影响;
  • 是否符合现有临床、数据和技术标准;
  • 潜在风险如何识别、记录和降低。
对于医院来说,引入AI产品时也应反向追问这些问题。如果供应商无法说明模型的应用场景、适用人群、数据来源、偏倚评估和风险管理,说明该工具距离可信部署仍有距离。

PART 04

开发阶段:代表性数据比漂亮指标更关键
AI模型的能力很大程度取决于训练数据。
医疗AI不能只依赖单中心、单设备、单人群、单时间段的数据。真实临床环境充满变化,训练数据应尽量覆盖目标部署环境中的患者结构、疾病谱、设备协议、数据采集方式和流程差异。
开发阶段还需要关注数据安全和隐私保护。医疗AI通常涉及高度敏感的健康信息,从采集、传输、存储、标注到建模分析,每个环节都可能出现泄露风险。
此外,模型开发不能忽视人机交互。AI不是单独运行的“黑盒答案机”,而是嵌入医疗流程的辅助工具。医生如何输入信息、如何看到结果、如何反馈错误、如何覆盖AI建议,都应在开发阶段形成机制。

PART 05

评价阶段:不能只用内部测试集
很多AI模型最大的问题,是只在内部数据集上表现良好。
FUTURE-AI强调,医疗AI应使用外部数据进行评估,最好在多个站点、多类人群、多种真实世界变化条件下检验模型表现。
评价内容也不能只看准确率。应同时评估公平性、可用性、临床效用、安全性、稳健性和可解释性。
  • 公平性评估要看不同年龄、性别、地区、疾病基础和社会经济群体之间是否存在性能差异。
  • 可用性评估要看医生是否愿意使用、是否容易理解、是否增加工作负担、是否影响诊疗效率。
  • 临床效用评估要看AI是否真正改善患者结局、提高工作效率、减少漏诊误诊,或提升医疗质量。
  • 稳健性评估要看输入数据发生变化时,模型是否仍然可靠。
  • 可解释性评估要看解释是否具有临床意义,是否会导致医生过度自信或过度依赖。
这意味着,医疗AI评价要从“算法验证”走向“临床验证”。

PART 06

部署阶段:上线不是终点
医疗AI最容易被忽略的环节,是上线后的持续管理。
模型一旦进入临床,就会面对不断变化的真实世界。患者群体变化、诊疗路径变化、设备更新、数据格式变化、疾病流行趋势变化,都可能造成模型性能下降。
因此,AI工具上线后需要持续质量控制、定期审计和更新机制。
医院应建立AI日志系统,记录模型版本、输入摘要、输出结果、调用时间、用户角色、医生采纳或覆盖AI建议的行为。这些信息既用于风险识别,也用于后续审计和责任追溯。
AI治理机制也不可缺少。医院需要明确谁负责准入评估,谁负责日常监测,谁负责异常上报,谁负责模型更新审核,谁负责患者安全事件处置。
没有治理机制的AI部署,本质上是把临床风险转移给一线医生。

PART 07

提醒:引入AI前要问这几类问题
医院在评估医疗AI产品时,不应只看演示效果和模型指标。
需要重点关注以下问题:
  • 模型是否经过外部验证;
  • 是否有本地临床有效性数据;
  • 训练数据是否覆盖目标人群;
  • 是否完成公平性评估;
  • 是否有明确适用边界;
  • 是否能解释输出逻辑和不确定性;
  • 是否建立日志、审计和版本管理;
  • 是否有数据安全和隐私保护方案;
  • 是否符合监管要求;
  • 是否有医生培训和人机协作流程;
  • 模型上线后如何监测和更新。
这些问题决定AI工具能否从“可研究”变成“可使用”。

PART 08

对检验、影像和医院信息化的启示
FUTURE-AI对检验科、影像科、病理科和医院信息部门都有借鉴意义。
  • 检验AI如果用于异常结果提示、危急值预警、感染风险预测或报告辅助审核,就必须关注不同仪器、不同试剂、不同人群和不同实验室流程带来的数据漂移。
  • 影像AI如果用于辅助诊断,就不能只依赖单设备、单中心数据训练,还要验证不同扫描协议、不同图像质量、不同疾病阶段下的稳健性。
  • 病理AI如果用于分型、计数或预后预测,就需要关注切片制备、染色差异、扫描仪差异和标注一致性。
  • 医院信息部门则要关注系统集成、接口标准、日志记录、权限管理、网络安全和上线后的监测机制。
医疗AI不是单个科室的项目,而是医院级治理问题。

PART 09

FUTURE-AI仍需本地化落地
FUTURE-AI的优势在于框架完整、覆盖全生命周期,并将可信赖AI从理念转化为实践建议。
但它也存在现实局限。部分建议仍偏宏观,不同国家、不同医疗系统、不同医院的信息化能力和监管环境存在差异,具体执行细节还需要本地化转换。
在我国实践中,医疗AI进入临床通常需要同时面对产品属性界定、注册审查、临床评价、数据合规、伦理审查、院内采购、信息安全和临床使用管理等多条线要求。
因此,未来更需要把FUTURE-AI与国内监管政策、医院制度、临床路径、数据标准和质量管理体系结合起来,形成可操作的院内准入和持续监管清单。

PART 10

医疗AI真正的门槛,是信任
医疗AI的未来,不取决于模型能否做出漂亮结果,而取决于医生、患者、医院和监管部门能否信任它。
信任不是口号,也不是企业宣传材料。信任来自可验证的数据、可解释的逻辑、可追溯的过程、可监测的运行状态、可承担的责任和可持续的治理机制。
FUTURE-AI给医疗AI划出了一条清晰路线:从研发走向部署,从性能走向安全,从模型走向系统,从算法创新走向临床价值。
对医院而言,未来引入AI工具时,最该问的不是“这个模型有多先进”,而是“这个模型能不能被安全、透明、持续地管理”。
这才是医疗AI真正进入临床前必须跨过的门槛。
来源与出处:李希,刘珏.《可信赖且可部署的医疗健康人工智能国际共识指南》FUTURE-AI解读. 中华流行病学杂志,2026,47(2):207-212. DOI:10.3760/cma.j.cn112338-20250703-00458。
傅彦文,周翔. FUTURE-AI:医疗保健领域中可信赖且可部署的人工智能国际共识指南解读. 数字医学与健康,2026,4(2):132-143. DOI:10.3760/cma.j.cn101909-20250905-00161

声明:本文仅用于分享,不代表平台立场,如有侵权或涉及版权问题,请尽快联系我们,我们第一时间更正,谢谢!