
还在为急性胰腺炎患者突发呼吸衰竭而提心吊胆?这篇研究带来了一个好消息!科学家们利用机器学习,构建了一个能早期预测风险的模型,准确率还挺高。更棒的是,他们还做了一个免费在线工具,方便医生快速评估,为患者争取宝贵的救治时间。
真正开启不学R语言时代!!!关注本号私信“资料”两字,免费领取>5篇0代码云平台复现5-15分公共数据库挖掘SCI全文教程!轻松入门生信分析!秒变生信分析大神!

新鲜出炉!今天给大家深度剖析一篇2026年7月发表在《iScience》上的文章,题目为:机器学习模型用于急性胰腺炎急性呼吸衰竭的早期预测:多中心验证
Machine learning model for early prediction of acute respiratory failure in acute pancreatitis: Multicenter validation
本研究是一项回顾性多中心队列研究,旨在开发和验证一个基于机器学习、用于早期预测急性胰腺炎患者发生急性呼吸衰竭风险的模型。研究整合了美国MIMIC-IV数据库和中国两家医院的数据,最终确定了一个包含体温、血氧饱和度及七项血清指标的逻辑回归模型,并构建了在线计算平台。
影响因子:4.1
发表期刊:iScience
团队成员合影(位于上海陆家嘴中心,可随时预约参观)


- 多中心数据验证:
研究使用了来自美国MIMIC-IV数据库和中国两家医院的数据,分别作为训练集、外部验证集和跨专科验证集,确保了模型的泛化能力。 - 可解释的机器学习方法:
结合SHAP值和Lasso回归进行变量筛选,既考虑了非线性关系,也保留了重要的线性关系,增强了模型的临床可解释性。 - 模型性能优越且稳定:
逻辑回归模型在内部、外部和跨专科验证队列中均取得了最高的AUC值(分别为0.9048、0.8717和0.8557),且性能波动小于6%,显示出良好的稳定性。 - 探索模型应用边界:
研究创新性地在妊娠期急性胰腺炎患者中进行了跨专科验证,揭示了该模型在此特殊人群中的预测偏差,明确了其应用边界条件。 - 提供便捷的临床工具:
研究开发了一个免费、公开的在线计算平台,医生只需输入九个关键指标,即可快速获得患者的个体化风险概率,便于临床决策。
- 首次在妊娠期急性胰腺炎患者中验证模型:
该研究是少数探讨急性胰腺炎相关急性呼吸衰竭预测模型在妊娠期这一特殊生理状态人群中应用效果的研究,明确了直接应用非妊娠人群模型会引入显著的预测偏差。 - 采用时空框架进行模型开发与验证:
研究利用美国历史数据扩大训练集,使用中国历史数据调整模型参数,并采用中国最新数据(2024-2025年)进行时间外推验证,以评估模型的真实泛化能力和时效性。 - 构建了基于九个易获取变量的精简模型:
模型仅需体温、血氧饱和度和七项常规血清指标,这些指标在临床中易于获取,且无创、经济,提高了模型的临床可操作性和应用潜力。 - 通过亚组分析揭示模型局限性:
研究发现模型在糖尿病患者中的预测性能显著下降,提示糖尿病可能通过其他未被模型捕获的途径(如慢性炎症、内皮功能障碍)系统性地改变风险预测规则,为未来开发特定人群模型提供了数据驱动的证据。 - 整合SHAP可视化与在线平台:
将SHAP算法与最优逻辑回归模型整合,并在在线平台上以层级结构展示九个风险因素的重要性,帮助临床医生直观理解模型的决策过程。
急性呼吸衰竭是急性胰腺炎最常见且死亡率较高的器官衰竭类型,常最先发生且恢复最晚。早期识别和预测急性呼吸衰竭风险对改善患者预后至关重要。然而,现有的预测工具如急性肺损伤评分(LIPS)在急性胰腺炎患者中的验证有限,且传统评分系统如APACHE II和SOFA评分因数据获取复杂而限制了临床应用。因此,亟需开发一个简洁、准确且易于在临床推广的早期预测模型。
- 数据收集与队列构建:
从MIMIC-IV数据库和安徽医科大学第一附属医院收集2008-2019年及2010-2013年的急性胰腺炎患者数据作为训练集,以安徽医科大学第一附属医院2024-2025年数据作为外部验证集,并收集两家医院2016-2023年的妊娠期急性胰腺炎患者作为跨专科验证集。 - 变量筛选:
结合SHAP值和Lasso回归对候选变量进行重要性排序,并通过内部验证集的AUC评估,最终确定九个最关键的预测特征。 - 模型开发:
利用筛选出的九个特征,开发了决策树、逻辑回归、多层感知机、支持向量机和极端梯度提升五种机器学习模型,并通过5折交叉验证进行超参数调优。 - 模型评估:
在内部、外部和跨专科验证队列中,使用AUC、灵敏度、特异度、F1分数等多种指标全面评估各模型性能,并通过校准曲线和决策曲线分析评估模型的校准度和临床效用。 - 敏感性分析与平台构建:
排除入院2小时内诊断的急性呼吸衰竭患者进行敏感性分析,以验证模型的稳健性。最终,将最优的逻辑回归模型部署为免费的在线计算平台。
- 患者特征:
训练集包含3,101名急性胰腺炎患者(其中9.8%发生急性呼吸衰竭),外部验证集包含517名患者(13.9%发生急性呼吸衰竭),跨专科验证集包含103名妊娠期急性胰腺炎患者(29.1%发生急性呼吸衰竭)。 - 关键预测因素:
确定了九个最关键的预测特征,包括体温、血氧饱和度、白细胞计数、白蛋白、血尿素氮、血清肌酐、血小板、碳酸氢根和血糖。 - 模型性能比较:
逻辑回归模型在所有验证队列中均表现最佳,内部验证AUC为0.9048,外部验证AUC为0.8717,跨专科验证AUC为0.8557,且具有最高的灵敏度和F1分数。 - 亚组分析:
逻辑回归模型在高血压和非高血压患者中均表现出良好的区分能力(AUC分别为0.8302和0.8863),但在糖尿病患者中AUC(0.7934)显著低于非糖尿病患者(0.9086)。 - 敏感性分析:
排除入院2小时内诊断的急性呼吸衰竭患者后,模型在内部、外部和跨专科验证中的AUC分别为0.8431、0.8673和0.8397,与主要分析结果相似,支持了模型的稳健性。
结论:研究表明,基于体温、血氧饱和度和七项血清指标的逻辑回归模型能够有效、稳定地早期预测急性胰腺炎患者的急性呼吸衰竭风险,其性能优于其他四种机器学习算法。该模型具有较好的泛化能力和临床实用性,并已开发为免费的在线工具。然而,跨专科验证显示该模型不适用于妊娠期急性胰腺炎患者,且在糖尿病患者中的性能受限,提示未来需要开发针对特定人群的专用模型。
讨论:本研究通过整合SHAP值和Lasso回归进行变量选择,提高了模型的可解释性。逻辑回归模型因其线性特征假设而在新数据中表现更佳,优于复杂的机器学习模型如XGBoost。研究通过多中心、多国数据验证了模型的泛化能力,并通过时间外推验证了其时效性。研究还明确了模型的应用边界,即不适用于生理状态显著不同的妊娠期患者,且在糖尿病患者中需谨慎使用。这些发现为临床医生提供了重要的参考,并为未来开发更精准的预测模型指明了方向。



本研究以来自重症监护医学信息数据库IV(MIMIC IV)13 及中国安徽医科大学第一附属医院的3,101例急性胰腺炎(AP)患者作为开发队列,并以来自中国同一医院的517例患者作为外部验证队列。此外,从安徽医科大学第一附属医院和安徽医科大学第二附属医院提取了103例妊娠期急性胰腺炎(APIP)患者,作为跨专科验证队列(图1)。
在3,101例AP患者中,开发队列有303例(9.8%)发生急性肾衰竭(ARF),外部队列有72例(13.9%)发生ARF。呼吸机使用率在开发队列中为15.8%,外部队列为2.1%。在跨专科验证中,103例妊娠期AP患者中有30例(29.1%)发生ARF,呼吸机使用率为27.2%。随访期间,开发队列有20.3%的患者需入住重症监护病房(ICU),外部队列为7.2%,院内死亡率分别为2.1%和1.0%。在跨专科验证队列中,45.6%的患者需要ICU介入,无院内孕产妇死亡病例,胎儿丢失率为2.9%。患者基线特征详见表1。




Lasso优势比图展示了各特征与目标变量之间的线性关系,强调了关联强度(图S1A)。来自极端梯度提升(XGBoost)模型的Shapley加性解释(SHAP)值量化了各特征的影响,揭示了关键预测因子(图S1B)。将两种方法得出的重要性评分进行整合,在训练集上生成了综合特征重要性排序(图S1C)。通过特征重要性排序和内部验证集曲线下面积(AUC)评估,我们确定了排名前九位的最重要特征,即保留白细胞(WBC)、白蛋白、血尿素氮(BUN)、血清肌酐(Cr)、血小板、HCO3−、血糖(Glu)、脉搏血氧饱和度(SpO2)和体温。对上述九个变量的多重共线性分析显示,所有方差膨胀因子(VIF)值均低于5,表明各变量之间不存在显著的多重共线性问题。

利用上述排名前九位的最重要特征,我们开发了五种不同的机器学习模型,包括决策树(DT)、逻辑回归(LR)、多层感知机(MLP)、支持向量机(SVM)和XGBoost。各分类器的性能评估结果见表2。

在内部验证集中,LR表现最优,AUC最高,为0.9048,其次为XGBoost(0.8687),而DT、MLP和SVM的AUC分别为0.8437、0.8224和0.8203;LR同时展现出最高的敏感性(0.8947)、阴性预测值(NPV,0.9756)和约登指数(0.7028)(表2),受试者工作特征(ROC)曲线进一步证实了其强大的判别能力(图2A)。LR的校准斜率接近1,表明校准性能最优;XGBoost和DT表现出中等斜率,而SVM和MLP的斜率较低(表2)。将SHAP分析应用于AP患者ARF的最优LR模型,展示了各特征的重要性,红色表示高风险,蓝色表示低风险。WBC、BUN、Cr、血糖和体温升高,以及白蛋白、HCO3 −、血小板和SpO 2 降低与ARF相关,其中白蛋白和WBC对预测结果的影响最为显著(图2B)。

在外部验证队列中,LR取得了最高的AUC(0.8717),DT次之,AUC为0.7586。XGBoost的AUC为0.7452,而SVM的AUC最低,为0.6928。LR在敏感性(0.7361)、阳性预测值(PPV,0.4206)和NPV(0.9514)方面同样优于其他模型,F1分数(0.8406)和约登指数(0.5721)亦为最佳,表明其具有高度稳定性(表2)。LR的ROC曲线持续优于其他机器学习算法(图3A)。校准曲线显示LR模型的预测风险与观测风险之间具有令人满意的一致性(图3B)。LR模型展现出最佳的总体校准性能,其校准斜率最接近1,Brier评分最小,校准截距最接近零,支持其适用于临床部署(表2)。图3C所示的决策曲线分析(DCA)进一步表明,LR模型具有最高的临床效用。上述结果提示,基于AUC评估,LR仍为最有效的分类器,同时在多种额外的性能参数上也超越了其他四种模型。

在跨专科队列中,LR模型表现最佳,AUC为0.8557,其次为XGBoost模型(0.8018)和SVM模型(0.5639)(表2)。LR的ROC曲线在真阳性率方面优于其他模型(图4A),DCA表明LR在0.1至0.5的概率区间内具有更高的净获益(图4C)。尽管LR模型保持了接近1的稳定校准斜率,但校准曲线显示LR模型存在高估风险的情况(图4B)。这一偏差可能归因于妊娠特异性生理变化(如体温和血液成分)对预测稳定性的干扰。进一步分析表明,跨专科验证队列中九个关键特征中的七个(WBC、白蛋白、BUN、Cr、HCO3^−、体温和SpO2)的分布与开发队列相比存在显著差异,详见补充图S3。

此外,在外部验证队列的高血压和糖尿病亚组中对LR模型的性能进行了评估(表S1)。LR模型在高血压和非高血压患者中均表现出稳健的判别能力,AUC分别为0.8302和0.8863。在糖尿病方面,模型的AUC为0.7934,而非糖尿病患者为0.9086,差异具有统计学显著性(表S2)。
在排除入院后2小时内确诊ARF的患者后,LR模型在内部、外部及跨专科验证中均保持了较高且稳定的AUC值(分别为0.8431、0.8673和0.8397)。敏感性分析结果与主分析相似,进一步支持了模型的有效性和稳健的预测性能(表S3)。

更多结果和补充图表:
PMID:42375528
DOI:10.1016/j.isci.2026.116470
不想做实验,没数据,还想要快速发表文章,没问题的!公共数据库就是我们的数据宝藏!没思路不用担心,作为专业的生信团队,我们很乐意为您效劳,提供研究路线设计和数据挖掘分析,扫码联系我们吧!


可向下滑动发掘更多科研秘籍!
夜雨聆风





















