ARTICLE · 1040218
双路径人工智能用于儿童肱骨髁上骨折:可解释 AI 驱动的多分类 X 线片分类与基于 计算方法的诊断准确性 Meta 分析
往期推荐:
优化胶质瘤分类的 MRI 序列选择:基于影像组学的 WHO CNS 分级、最终病理诊断与 IDH 状态分析
预测颅内动脉瘤血管内治疗后不完全闭塞:多维度机器学习模型的开发与验证
多模态脑影像组学预测肺癌脑转移的病理亚型:成像模态、MRI 序列与空间范围的影响
一种用于无创预测胶质瘤 IDH 突变的 MRI 影像组学-栖息地-临床联合模型及其生物信息学相关性验证:多中心开发与外部验证
从双语语音识别到大语言模型辅助结论生成的两阶段工作流程:TI-RADS报告流程的精简优化
双路径人工智能用于儿童肱骨髁上骨折:可解释 AI 驱动的多分类 X 线片分类与基于 AI 计算方法的诊断准确性 Meta 分析
Dual-Approach AI for Pediatric Supracondylar Fractures: Multiclass Radiograph Classification with Explainable AI and Diagnostic Meta-analysis of AI-Based Computational Approaches
文献基本信息
期刊 | Academic Radiology(Available online 5 September 2026) |
文章类型 | 原创研究(Original Investigation)——实验研究 + 诊断准确性 Meta 分析双路径设计 |
作者 | Che-Wei Lin, Febryan Setiawan, Syaifullah Hikmahtiyar, Pei-Chun Lai, Fa-Chuan Kuan, Kai-Lan Hsu, Wei-Chen Lin, Pin-Yu Chen, Ming-Tung Huang, Chii-Jeng Lin, Su-Ying Lee, Po-Ting Wu, Kai-Cheng Lin, Chien-An Shih(Lin 与 Setiawan 为共同第一作者) |
DOI | 10.1016/j.acra.2026.08.048 |
伦理审批 | 国立成功大学医院 IRB No. B-ER-114–296(回顾性、去标识数据,豁免知情同意) |
方案注册 | PROSPERO CRD420251151932 |
资金支持 | 国立成功大学医院(NCKUH-11502010)与台湾国家科学及技术委员会(NSTC-115–2314-B-006–115) |
关键词 | 髁上骨折;深度学习;X 线诊断;骨折检测;Meta 分析 |
核心信息(Take Home Message)
核心信息一:YOLOv11-Nano 可实现儿童髁上骨折的准确多分类 Gartland 分型(准确率 90%–93%),其可解释性可视化在解剖学上具有一致性,整体表现接近主治医师水平。
核心信息二:基于 AI 的髁上骨折检测的 Meta 分析显示敏感性良好(92%),但特异性异质性较大(85%);现有证据仍属初步,临床部署前需要前瞻性、多中心验证。
目 录
一、研究背景与意义
二、研究目的与主要创新点
三、实验研究部分:材料与方法
四、诊断准确性 Meta 分析:方法
五、研究结果
六、讨论
七、研究局限性
八、结论与展望
九、可改进点与延伸思考
表1:YOLOv11-Nano 儿童髁上骨折诊断性能总表(见第五章)
表2:Meta 分析纳入研究的特征与诊断性能(见第五章)
一、研究背景与意义
肱骨髁上骨折(supracondylar fracture, SCF)是儿童人群中最常见的肘部损伤,占全部儿童肘部骨折的 50%–60%,发病高峰年龄为 5–8 岁。髁上区域之所以成为结构薄弱区,源于该处皮质骨菲薄,且正处于由干骺端向骨干移行的解剖过渡带。Gartland 分型系统(I 型:无移位;II 型:成角但后侧皮质完整;III 型:完全移位)是治疗方案制定的基础,I 型骨折通常采用保守治疗,而 II 型和 III 型往往需要手术干预。漏诊或延迟诊断可导致严重并发症,包括畸形愈合、神经血管损伤(神经损伤发生率 10%–20%,血管损伤 0.5%–3%)、骨筋膜室综合征(占 0.3%–3%)以及 Volkmann 缺血性肌挛缩。
X 线判读面临显著困难,原因在于发育中儿童肘部的解剖结构复杂,多个骨化中心与以软骨为主的结构使骨折识别变得困难。文献报道,急性儿童肘部骨折初次判读时的漏诊率介于 17% 至 77% 之间。人工智能(AI)在该领域的应用已显示出潜力,但仍存在明显局限。既往专门针对髁上骨折的研究均采用二分类框架且性能欠佳:一项双输入卷积神经网络(CNN)实现了 100% 的敏感性,但特异性仅 86.1%,阳性预测值偏低(69.7%);基于影像组学的方法仅获得 0.65–0.72 的曲线下面积(AUC);近期一项多尺度网络准确率达到 90.5%,但仍停留在二分类范式,未进行 Gartland 亚型区分。更广泛的研究仅聚焦于关节积液检测或一般性骨折检测,缺乏髁上骨折特异性,报告的准确率在 80%–91% 之间。一项临床落地研究进一步报告了将深度学习用于儿童肘部 X 线片分类的真实世界部署经验,但仍保留了“正常对异常”的二分类框架,而非亚型特异性的髁上骨折分类路径。近期另一项研究评估了AI 辅助临床医师在儿科急诊中的表现,证明深度学习支持可显著提升临床医师对肘部骨折检测的敏感性,凸显了AI 作为临床决策支持工具而非单纯独立分类器的潜在作用。然而,上述研究均未解决 Gartland 特异性亚型鉴别、髁上骨折检测中不同架构的系统比较,以及可解释 AI 框架在临床透明性方面的整合问题。唯一现有的肘部骨折 AI Meta 分析汇总了异质的骨折类型,未提供髁上骨折的亚型特异性准确度指标,异质性显著(I²>75%),且仅纳入了两项肘部创伤相关研究。
基于上述空白,本研究的意义体现在两个层面。在技术层面,本研究首次将多分类范式引入儿童髁上骨折的 AI 诊断,使模型输出与 Gartland 分型这一临床决策节点直接对接,从而超越了以往“骨折/无骨折”的二分类框架;在证据层面,本研究首次针对髁上骨折开展 AI 诊断准确性的 Meta 分析,把 CNN 深度学习与影像组学机器学习两类计算路径纳入同一证据框架进行系统比较,为临床转化提供基准性能参照。
二、研究目的与主要创新点
本研究设定了四项目的。第一,开发并验证首个多分类深度学习模型,采用 YOLOv11 Nano 架构区分正常 X 线片与 Gartland I–III 型髁上骨折。第二,实施包括随机划分、分层 k 折交叉验证与留一法交叉验证在内的综合验证策略,评估模型的稳健性与泛化能力。第三,通过 NormEnsemble 框架整合可解释 AI,提供具有临床可解读性的可视化,以应对“黑箱”局限。第四,遵循 PRISMA-DTA 指南开展系统诊断性 Meta 分析,比较 CNN 类与影像组学类方法,并建立基准性能指标。研究选择 YOLOv11 Nano 的理由在于其计算效率、多尺度特征融合能力、无锚框设计对多样骨折形态的适应性,以及原生多分类能力,这些特性共同支撑了治疗决策所必需的 Gartland 亚型鉴别。
本研究的创新贡献可归纳为三点:其一,构建首个用于 Gartland 亚型鉴别的多分类深度学习模型,突破既往所有研究的二分类范式;其二,完成首个专门针对 AI 髁上骨折检测的诊断准确性 Meta 分析;其三,首次将 NormEnsemble-HiResCAM 可解释 AI 与量化的模型间一致性评估用于骨折亚型鉴别。全文结构安排为:材料与方法部分描述数据集、模型架构、验证策略、可解释 AI 框架与 Meta 分析方法;结果部分呈现分类结果与 Meta 分析发现;讨论部分将结果置于既有文献背景中加以阐释,分析研究局限并讨论临床启示,最后给出总结与未来研究方向。
三、实验研究部分:材料与方法
3.1 数据集与研究对象
本回顾性研究分析了 2004 年至 2018 年间采集的 1082 例 18 岁以下患者的儿童肘部 X 线片,研究经本院机构审查委员会批准(编号 B-ER-114–296)。每例检查均包含用于急性创伤评估的标准正位(AP)与侧位投影。纳入标准为图像质量合格、正侧位投影完整、放射学记录可核实;排除标准包括运动伪影、既往存在的肘部病变、金属植入物以及先天性畸形。所有数据划分均在患者层面进行以防止数据泄漏:对同时具有正位与侧位投影的每例患者,两个体位均被分配至同一分区(训练集、验证集或测试集),在任何一种验证策略下,同一患者的图像均不会出现在一个以上的分区中。图像被标注为“无髁上骨折(No-SCF)”或“髁上骨折(SCF)”,SCF 病例进一步按 Gartland 分型(I、II、III 型)分层。骨折分类与包围框标注由两名委员会认证的儿童骨科专科医师(CAS 与 FCK)独立完成,两人均具有 10 年以上亚专科经验;观察者间一致性采用 Cohen's kappa 系数评估,κ = 0.87,提示高度一致。出现分歧时由第三位资深骨科医师(KLH)担任仲裁者,并通过结构化讨论达成共识。最终数据集包括 No-SCF 576 例、I 型 21 例、II 型 125 例、III 型 360 例。基线人口学与影像学特征通过分层患者层面划分在训练、验证与测试集之间保持均衡,详见附录 1。
3.2 图像预处理与数据增强
骨折区域由经验丰富的儿童骨科医师使用包围框进行标注以建立真值。图像经过灰度归一化与对比度增强处理,包括对比度受限自适应直方图均衡化(CLAHE),以提升骨性结构的可见度。此外,肘部周围的骨性区域被手工分割以勾勒感兴趣区(ROI),从而将模型注意力导向解剖学相关、与骨折相关的结构,进而提高检测性能。为应对显著的类别不平衡(No-SCF:576 例;III 型:360 例;II 型:125 例;I 型:21 例),研究评估了两种互补策略。作为主要方法,研究应用了基础数据增强,包括 90°、180° 与 270° 旋转以及水平与垂直翻转,以模拟真实临床采集过程中的变异。作为补充实验,研究在随机划分与分层 k 折两种框架下评估了类别加权(与类别频数成反比)与焦点损失(γ = 2)的联合策略,以进一步缓解梯度更新过程中多数类的支配作用。
3.3 目标检测模型:YOLOv11-Nano
本研究采用 YOLOv11 Nano 模型,该变体为轻量化版本,针对实时推理与更低的计算复杂度进行了优化。其架构包含一个整合深度可分离卷积与跨阶段部分(CSP)连接的主干网络,一个通过 PANet 式路径聚合与 BiFPN 式双向特征金字塔网络实现多尺度特征融合的颈部网络(二者均为 YOLOv11 的原生组件,而非自定义修改),用于增强跨尺度细微骨折线的检测能力,以及一个无锚框(anchor-free)检测头,可直接预测包围框坐标、目标置信度与类别概率(图 1)。该设计在准确性与计算效率之间取得了良好平衡,提升了对可变骨折形态的适应性,可满足实时临床使用需求。完整架构参数与训练超参数见附录 2。

图1(原文 Figure 1)用于儿童肱骨髁上骨折检测与分类的 YOLOv11 Nano 模型架构。该网络由三个主要部分组成:主干网络(绿色)用于在多个尺度上进行分层特征提取;颈部网络(紫色)通过 C3K2 模块、拼接(concat)、上采样(upsampling)、SPPF 与 C2PSA 模块实现多尺度特征融合;检测头(红色)在三个分辨率层级(80×80、40×40 与 20×20 像素)上执行多尺度目标检测。输入图像(640×640×3 像素)经网络处理后,将肘部 X 线片归入四个类别:正常、SCF 1 型、SCF 2 型与 SCF 3 型(左侧为代表性示例,以绿色检测框标注)。各层标注中的尺寸格式为高×宽×(最小通道数)×权重。C3K2,含 2 个卷积与 k 个卷积核的跨阶段部分瓶颈模块;CONV,卷积层;CONCAT,拼接;SPPF,快速空间金字塔池化;C2PSA,带空间注意力的跨阶段部分模块;SCF,髁上骨折。(原文):Architecture of the YOLOv11 Nano Model for Pediatric Supracondylar Fracture Detection and Classification.
3.4 交叉验证策略
研究采用了三种验证策略。随机划分将数据集分为 80% 训练集、10% 验证集与 10% 测试集,其中训练用于优化模型参数,验证用于超参数调优,独立测试集保留用于最终评估。分层 k 折交叉验证在 80% 的数据集上实施分层 5 折交叉验证,保持每一折内的类别分布,每次迭代使用四折训练、一折验证,共重复五次,剩余 20% 作为独立测试集留出。留一法交叉验证在 90% 的数据集上实施,每一张图像依次作为验证样本,其余图像用于训练,重复至每张图像均充当过一次验证样本为止,剩余 10% 作为独立测试集留出。
3.5 可解释 AI(XAI)方法与专家验证
研究采用基于 NormEnsemble 的可解释 AI 框架以增强可解释性。该方法通过对显著图进行归一化,并经由最小值、最大值与平均池化进行融合,从而生成比单一技术更可靠的解释。可解释性分析应用于按 F1 分数与准确率排序的前 1% 模型,其中高分辨率类激活映射(HiResCAM)在预测包围框内生成细粒度热图;这些热图通过 NormEnsemble 融合,以降低噪声、突出共识区域并改善对影响预测之特征的可视化,从而确保模型决策与医学相关特征保持一致。
为评估临床意义,三名委员会认证的资深儿童骨科医师(FCK、KLH、CAS,各自具有 10 年以上亚专科经验)以互盲方式独立评价了 170 对分层抽取的 X 线片–XAI 配对样本(No-SCF 50 例、SCF I 型 20 例、SCF II 型 50 例、SCF III 型 50 例)。每例病例按三个 5 点 Likert 条目评分:高亮区域的解剖适当性(Q1)、对 AI 预测的信任增强程度(Q2)、与诊断标志的对应性(Q3),评分 ≥ 4 定义为阳性一致。
3.6 性能评价、模型校准与实验设置
模型性能采用准确率、敏感性、精确率、特异性与 F1 分数进行量化,多分类(No-SCF 与 SCF I–III 型)与二分类(骨折对无骨折)两项任务均如此,其定义分别为:准确率等于(真阳性 + 真阴性)除以(阳性例数 + 阴性例数);敏感性等于真阳性除以阳性例数;精确率等于真阳性除以(真阳性 + 假阳性);特异性等于真阴性除以阴性例数;F1 分数等于 2 倍真阳性除以(2 倍真阳性 + 假阳性 + 假阴性)。研究为两种分类任务在随机划分与分层 k 折方案下分别计算了各类别及宏平均的受试者工作特征(ROC)曲线与 AUC。模型校准按类别分层绘制可靠性图进行评价,并以Brier 分数与期望校准误差(ECE,10 个等宽分箱)作为各数据分区(训练、验证、测试)在随机划分与分层 5 折两种方案下的校准摘要指标。临床效用采用决策曲线分析(DCA)评价,对每一类别单独以及宏平均曲线,在 0 至 1 的阈值概率范围内计算净获益,并以“全部治疗”与“全不治疗”参考策略作为基准。
为评价临床相关性,研究在 60 例未用于模型训练或验证的 X 线片(正常 15 例、I 型 14 例、II 型 15 例、III 型 16 例)上开展了独立的人机对比。共招募八名医师评分者,分为四组:初级住院医师(n = 2)、总住院医师(n = 2)、普通骨科主治医师(n = 2)以及具备专职影像判读专长的儿童骨科主治医师(n = 2)。每位评分者使用结构化评估表独立完成全部病例的分类,对 AI 输出与其他评分者均设盲;随后将 AI 模型在同一病例集上的分类结果与之比较,以评估其相对于不同经验层级临床医师(包括具备亚专科影像专长者)的诊断性能。评分者间信度采用组内相关系数 ICC(2,1)(双向随机效应模型、绝对一致性)量化,人机配对一致性采用二次权重的加权 kappa 评估。全部实验在 Python 3.12 与 PyTorch 1.10 环境下完成,硬件为一台配置 24 GB 内存、Intel Core i5–8400 处理器(2.80 GHz)与 NVIDIA GeForce GTX 1060 显卡(6 GB 显存)的工作站。
四、诊断准确性 Meta 分析:方法
4.1 方案注册与报告规范
该 Meta 分析依照 PRISMA-DTA 指南实施,并在 PROSPERO 前瞻性注册(CRD420251151932)。
4.2 检索策略与研究筛选
研究在 PubMed、Embase、Scopus、Web of Science、IEEE Xplore 与 ACM Digital Library 六个数据库中进行了从建库至 2025 年 10 月的系统性检索。检索策略采用 MeSH 主题词与自由词,涉及“deep learning”“artificial intelligence”“machine learning”“convolutional neural networks”“pediatric”“supracondylar fracture”“elbow fracture”“radiograph”以及“diagnostic accuracy”等概念。值得注意的是,检索词表被刻意构建为同时覆盖深度学习与经典机器学习方法学,这一点体现在所有数据库中采用的广义 AI 相关术语上。两名独立评审者(CWL 与 FCK)完成研究筛选,分歧由第三名评审者(CAS)解决。
4.3 纳入与排除标准及方案偏离
纳入标准包括:评估用于检测、诊断或分类儿童髁上骨折的自动化计算诊断算法,涵盖基于深度学习的 CNN 路径与基于影像组学的机器学习路径,二者均属与本综述比较目标相关的 AI 诊断方法学;提供可构建 2×2 列联表的诊断准确性数据,或报告了敏感性/特异性及样本量;使用儿童人群(年龄 <18 岁)的放射影像;采用明确界定的参考标准。排除标准包括:缺乏足够的诊断准确性数据;属于会议摘要、病例报告或无原始数据的综述;仅纳入成人或混合人群而未单独进行儿童分析;评估其他骨折类型而未单独分析髁上骨折;属于重复发表或使用模拟/合成数据;以及缺乏明确界定的参考标准。
需要说明一项与方案的偏离:原 PROSPERO 注册方案仅规定纳入深度学习研究,但有一项基于影像组学的机器学习研究满足其他全部资格标准且被认为具有方法学相关性,因此事后决定将纳入标准扩展至同时涵盖 CNN 深度学习与影像组学机器学习路径,并相应更新了文稿标题。值得指出的是,检索策略(附录 8)本就已在全部六个数据库中纳入了“deep learning”与“machine learning”两类术语,反映了检索设计在事先即具备的广度。研究另外开展了排除 Yao 等研究的敏感性分析以评估其对合并估计的影响,结果见附录 14。该偏离已依照 PRISMA-DTA 指南透明披露,鉴于由此引入的方法学异质性,相关发现应审慎解读。
4.4 数据提取与质量评价
两名评审者(CWL 与 FCK)使用标准化表格独立提取数据,内容包括研究特征、患者人口学资料、技术参数、验证方法学、参考标准与诊断性能指标,分歧由第三名评审者(CAS)解决。对于报告多个验证数据集的研究,每个数据集均作为独立条目处理以保持独立性。方法学质量采用诊断准确性研究质量评价工具 QUADAS-2 评估,并针对 AI 诊断研究进行了适配,评价四个领域:患者选择、索引试验的实施与判读、参考标准,以及流程与时间安排。作为补充工具,研究应用了 METhodological RadiomICs Score(METRICS)清单,以捕捉 QUADAS-2 未能充分覆盖的深度学习特异性方法学维度,包括数据划分策略、流程稳健性、校准报告、可解释性与开放科学实践,共涵盖 9 个类别下的 30 个加权条目。
4.5 诊断准确性指标、证据确定性与统计分析
主要诊断准确性指标为敏感性与特异性,以图像为评估单位计算。敏感性定义为被 AI 算法正确识别的髁上骨折 X 线片比例(真阳性/[真阳性 + 假阴性]);特异性定义为被正确识别为正常的无髁上骨折 X 线片比例(真阴性/[真阴性 + 假阳性])。次要诊断准确性指标包括阳性似然比(LR+)、阴性似然比(LR−)与诊断比值比(DOR)。对于报告多个验证数据集或按骨折严重程度分层结果的研究,每个数据集均作为独立条目处理,以维护诊断性能评估的完整性。证据确定性采用 GRADE 方法评价,分高、中、低、极低四个等级,考量偏倚风险、不一致性、间接性、不精确性与发表偏倚。
全部统计分析在 STATA 17.0(StataCorp, College Station, TX)中完成,采用 DerSimonian–Laird 随机效应模型。异质性以 I² 统计量与 Cochran Q 检验量化。发表偏倚通过 Egger 回归检验结合漏斗图可视化评估。汇总受试者工作特征(SROC)曲线连同 95% 置信区域与预测区域一并构建,SROC 曲线下面积(AUC-SROC)与 Q* 统计量由 Moses–Littenberg 加权回归导出。临床效用通过阳性与阴性似然比以及诊断比值比评估。预设亚组分析比较了算法架构(CNN 类对影像组学类)与个别算法(ResNet-50、影像组学、ConvNeXt+GAN、YOLOv11)。Meta 回归以 logit 转换后的敏感性与特异性为因变量,协变量包括算法类型、验证策略、发表年份与样本量。敏感性分析包括留一法分析、固定效应与随机效应比较,以及基于标准化残差绝对值超过 2.0 的离群值剔除。
五、研究结果
5.1 基线特征
训练、验证与测试三组之间的基线特征具有可比性(附录 1、表 1)。年龄、性别、侧别与类别分布在所有分区中均得到良好保持,证实了分层患者层面划分的适当性。
5.2 二分类分类性能
二分类任务在全部评价方案中均表现出稳定优异的性能(表 1 Panel B;ROC 曲线见附录 3)。在未整合骨分割条件下(图 2a–c),随机划分、分层 k 折与留一法三种方案的测试准确率分别为 88.89%、92.83% 与 88.46%,相应的敏感性为 90.11%、86.90% 与 88.46%,F1 分数为 0.9229、0.9176 与 0.8918。整合骨分割后(图 3a–c)三种策略均获得一致性提升,测试准确率升至 99.06%、99.06% 与 98.04%(敏感性分别为 99.06%、99.06% 与 98.04%;F1 分数为 0.9906、0.9906 与 0.9799),对应的准确率绝对增益分别为 +10.2、+6.2 与 +9.6 个百分点。

图2(原文 Figure 2)使用 YOLOv11 Nano 进行儿童肘部骨折检测的二分类性能与可解释 AI 分析(未使用骨分割)。(a–c)混淆矩阵,展示二分类(骨折对非骨折)性能:(a)随机划分验证,(b)分层 k 折交叉验证,(c)留一法交叉验证;具体准确率与敏感性数值见结果部分。矩阵中的数字为百分比,括号内为绝对例数。(d–e)基于 HiResCAM NormEnsemble 的 XAI 可视化(6 模型集成),其中(d)非骨折病例显示局灶性激活且模型间共识分数较高,(e)骨折病例显示分布性激活,反映与骨折相关的形态学改变。每个面板自上而下依次展示:带真值标注的原始 X 线片(绿色框)、集成平均注意力热图(红–黄渐变)、投票共识图(蓝–紫渐变,其中置信标记指示模型间高度一致的区域),以及带共识分数的关键区域放大图;具体解剖位置、量化共识指标与激活强度数值见结果部分。颜色越亮表示模型注意力越高、共识越强。CV,交叉验证;HiResCAM,高分辨率类激活映射;XAI,可解释人工智能。(图片彩色版本可在线获取。)

图3(原文 Figure 3)使用 YOLOv11 Nano 进行儿童肘部骨折检测的二分类性能与可解释 AI 分析(使用骨分割)。(a–c)混淆矩阵,展示应用骨分割后的二分类性能;(d–e)与骨分割二分类模型相对应的基于 HiResCAM NormEnsemble 的 XAI 可视化。XAI,可解释人工智能。
5.3 二分类任务的校准与决策曲线分析
校准通过可靠性图、Brier 分数与 ECE 评估,临床效用通过 DCA 评估。在随机划分条件下(附录 4 图 1),模型在训练、验证与测试集上的校准表现令人满意,Brier 分数分别为 0.0652、0.1281 与 0.0989,ECE 值分别为 0.1424、0.1859 与 0.1600。在分层 5 折交叉验证条件下(代表性 Fold 2,附录 4 图 2),校准进一步改善,三个数据分区的 Brier 分数降至 0.0243、0.0653 与 0.0577,ECE 值为 0.0702、0.0988 与 0.0933。在两种验证策略下,DCA 均显示模型在较宽的阈值概率范围内持续优于“全部治疗”与“全不治疗”策略,并且对“骨折”与“非骨折”两个类别均保持稳定的正净获益,支持该模型在儿童肘部骨折二分类检测中具有潜在的临床效用与泛化能力。
5.4 多分类分类性能
YOLOv11-Nano 模型在各验证策略下均表现出稳健性能(表 1 Panel A;ROC 曲线见附录 3)。在未使用骨分割条件下(图 4a–c),总体测试准确率为 90.98%(随机划分)、93.12%(分层 k 折)与 90.81%(留一法),宏平均敏感性为 92.01%、93.12% 与 75.15%,F1 分数为 0.9074、0.8619 与 0.7513。使用骨分割后(图 5a–c),三种验证策略的性能均实现一致性提升:随机划分(准确率 94.85%、敏感性 89.71%、F1 0.8971;ΔACC +3.9、ΔSEN −2.3)、分层 k 折(准确率 96.97%、敏感性 93.94%、F1 0.9394;ΔACC +3.9、ΔSEN +0.8)与留一法(准确率 94.75%、敏感性 89.50%、F1 0.8950;ΔACC +3.9、ΔSEN +14.4)。由此可见,骨分割在三种验证策略下对总体准确率的提升幅度几乎完全相同(均为 +3.9 个百分点),但其对敏感性的影响具有策略依赖性:在留一法下增益可观,在分层 k 折下幅度有限,而在随机划分下则伴随敏感性下降,后者主要由 I 型与 II 型敏感性降低所致,尽管 No-SCF 与 III 型类别的特异性与 F1 分数得以维持或改善。SCF I 型在所有条件下始终是最具挑战性的类别,这与其训练样本有限(n = 21)以及无移位骨折固有的诊断难度相一致。

图4(原文 Figure 4)使用 YOLOv11 Nano 进行髁上骨折类型检测的多分类性能与可解释 AI 分析(未使用骨分割)。(a–c)混淆矩阵,展示四分类(正常、SCF 1–3 型)性能:(a)测试集(随机划分),(b)交叉验证折平均,(c)留一法验证;具体准确率与敏感性数值见结果部分。矩阵中的数字为百分比,括号内为绝对例数。(d–g)基于 HiResCAM NormEnsemble 的 XAI 可视化(11 模型集成),分别对应:(d)正常病例,(e)SCF 1 型,(f)SCF 2 型,(g)SCF 3 型。其激活模式展示了随骨折严重程度分级而呈现的渐进性分化:正常与 1 型病例为以骨骺板为中心的激活,2 型病例为扩大的前侧骨骺板区域激活,3 型病例则表现为前侧移位骨折块边界处的多个高强度激活灶。每个面板自上而下依次展示:带真值标注的原始 X 线片(绿色框)、集成平均注意力热图(红–黄渐变)、投票共识图(蓝–紫渐变,其中置信标记指示 ≥60% 模型表现出一致特征重要性的区域),以及带共识分数的关键区域放大图;具体量化指标(包括激活强度数值、模型间不一致度量、分布参数与共识分数范围)见结果部分。颜色越亮表示模型注意力越高、模型间共识越强。共识分数量化每个解剖位置上模型间一致的程度,从而为不同骨折严重程度分级下的决策过程提供具有临床可解读性的可视化。CV,交叉验证;HiResCAM,高分辨率类激活映射;SCF,髁上骨折;XAI,可解释人工智能。(图片彩色版本可在线获取。)

图5(原文 Figure 5)使用 YOLOv11 Nano 进行髁上骨折类型检测的多分类性能与可解释 AI 分析(使用骨分割)。(a–c)混淆矩阵,展示应用骨分割后的四分类性能:(a)随机划分,(b)分层 k 折交叉验证,(c)留一法交叉验证。(d–g)与骨分割多分类模型相对应的基于 HiResCAM NormEnsemble 的 XAI 可视化:(d)正常病例,(e)SCF 1 型,(f)SCF 2 型,(g)SCF 3 型。
5.5 多分类任务的校准与决策曲线分析
在随机划分条件下(附录 4 图 3),可靠性图显示预测概率与观测结果在训练、验证与测试集之间具有良好一致性,Brier 分数低(0.0166、0.0300、0.0452),ECE 值为 0.0403、0.0561 与 0.0576,提示概率估计校准良好且具备泛化性。在分层 5 折交叉验证条件下(代表性 Fold 1,附录 4 图 4),校准依然稳健,Brier 分数为 0.0144、0.0376 与 0.0441,ECE 值为 0.0244、0.0412 与 0.0426。DCA 证实模型在较宽阈值范围内持续优于“全部治疗”与“全不治疗”策略,四个类别(正常、SCF I–III 型)均保持稳定的正净获益,且各分区之间的宏平均决策曲线保持一致,支持该模型在多分类儿童髁上骨折分类中的临床效用。
5.6 类别不平衡问题:类别加权与焦点损失策略
为应对显著的类别不平衡,研究在基线仅增强方案之外,进一步在随机划分与分层 k 折两种框架下评估了类别加权与焦点损失的联合策略(附录 5)。在随机划分条件下,该联合策略取得总体测试准确率 96.15%、敏感性 92.89%、特异性 97.51%、精确率 90.50% 与 F1 分数 0.9149;I 型测试敏感性达到 93.33%,相较于仅增强基线有适度改善,但鉴于 I 型样本有限(n = 21),置信区间依然较宽。验证集准确率为 90.98%(敏感性 89.79%、特异性 98.75%、F1 0.8898、AUC 0.9738),提示泛化稳定。
在分层 k 折交叉验证条件下,联合策略的测试准确率为 95.94%、敏感性 90.07%、特异性 97.23%、精确率 89.12% 与 F1 分数 0.8950(验证集 AUC 0.9472);I 型测试敏感性为 95.00%(95% CI 无法从单折测试数据中获得),No-SCF 与 III 型类别的敏感性分别为 98.60% 与 87.29%。综合两种验证策略,类别加权与焦点损失相对于基线增强在 I 型与 II 型敏感性上产生了边际增益,同时未造成总体准确率或特异性的明显下降。然而,考虑到 I 型病例的绝对样本量很小,这些改善应谨慎解读。因此,研究将仅增强配置保留为全部主要分析的主模型,类别加权与焦点损失结果作为补充性敏感性评估予以报告。
5.7 人机对比
分类准确率随临床经验增加而提升(附录 6 表 1):初级住院医师 68.3%–76.7%,总住院医师 78.3%–80.0%,普通骨科主治医师 88.3%–90.0%,具备专职影像判读专长的儿童骨科主治医师 91.7%–93.3%。AI 模型取得 90.0% 的总体准确率,与普通骨科主治医师相当并接近亚专科水平,其中正常病例识别达到完美(15/15,100.0%),与全部主治医师一致。I 型分类在所有组别中均最具挑战性(住院医师 57.1%–71.4%;总住院医师 71.4%–78.6%;普通骨科主治医师 78.6%–85.7%;儿童骨科主治医师 85.7%–92.9%;AI 为 85.7%),这与无移位骨折已知的诊断难点相符。
评分者间信度呈现一致的经验梯度(附录 6 表 2):住院医师 ICC = 0.891(良好)、总住院医师 ICC = 0.882(良好)、普通骨科主治医师 ICC = 0.931(优秀)、儿童骨科主治医师 ICC = 0.943(优秀)。将 AI 与全部主治医师一并纳入分析时 ICC = 0.957(95% CI:0.937–0.971),表明其一致性水平与资深医师表现相当。加权 kappa 介于 0.878(住院医师)至 0.967(儿童骨科主治医师及全部主治医师合并)之间。上述发现提示,该 AI 模型的表现达到主治医师水平,并且对初级与非亚专科临床医师提供的增量获益最大。
5.8 可解释 AI 可视化
基于 HiResCAM NormEnsemble 的可视化揭示了具有解剖学精确性的注意力模式(图 2d–e、3d–e、4d–g、5d–g)。该 XAI 框架整合了标准差映射(模型分歧)、最大激活热图(峰值响应)、投票共识图(>60% 模型间一致)与相关矩阵(模型一致性)。在二分类任务中(图 2d–e、3d–e),非骨折病例表现出位于肱骨远端骨骺板(正位)与肱骨远端前侧(侧位)的局灶性激活,对应前肱骨线;投票共识(0.04–0.06)与极小分歧(SD <0.175)证实了对正常解剖的高置信度识别。骨折病例则表现出与严重程度相关的模式:III 型骨折在移位骨折块边界处呈现多个高强度激活灶(>1.0)、强共识(0.02–0.05)与高相关性(>0.75);II 型骨折表现为弥散的前侧骨骺板激活,强度中等(0.4–0.8),投票共识超过 50%,反映细微的皮质中断。
在多分类任务中(图 4d–g、5d–g),各骨折分级之间的渐进性分化十分明显。正常病例表现出以骨骺板为中心的激活,分布范围窄(SD <0.10),模型间一致性强(相关性 >0.90)。I 型骨折的模式与正常相似,但方差略微升高(0.10–0.14),投票共识约为 0.03。II 型骨折表现为扩大的骨骺板激活,强度中等(0.6–1.0),模型间分歧增加(SD 0.12–0.20),投票共识约为 0.04。III 型骨折在移位骨折块边界处呈现特征性的多个高强度激活灶(>1.0),在解剖学上与 X 线片上可见的前侧移位骨块空间分布相对应;投票共识约为 0.05,模型间相关性同时表现出强一致区域与分歧区域,反映了多骨折块骨折分类的复杂性。
5.9 XAI 专家验证
三名资深骨科医师使用结构化的三条目 Likert 量表,对覆盖全部四个分类类别的 170 对 X 线片–XAI 配对样本进行了评价(附录 7)。总体平均分持续偏高:专家 I–III 分别为 4.38 ± 0.96、4.40 ± 0.93 与 4.33 ± 0.94,阳性一致率分别为 83.5%、84.9% 与 83.9%。No-SCF(均值 4.74–4.82;阳性一致率 96.7%–100%)与 SCF III 型病例(均值 4.64–4.73;阳性一致率 90.6%–95.3%)获得最高评分,反映了其解剖结构在视觉上无歧义且移位明显。SCF I 型(均值 3.98–4.08)与 II 型(均值 3.75–3.77)评分相对较低,中性评分更多,这与其固有的诊断细微性相符。在条目层面,Q3(与诊断标志的对应性)在全部评分者中获得最高分(均值 4.61–4.62;阳性一致率 92.3%–93.5%),而 Q2(信任增强)在细微骨折亚型中变异最大。总体而言,NormEnsemble-HiResCAM 框架产生了具有临床意义且以解剖学为基础的视觉解释,与专家诊断推理过程相一致。
5.10 Meta 分析:检索结果与研究特征
经筛选后,共有 34 项研究进入全文审查,其中 4 项研究(包括本研究在内)符合资格标准,提供了 7 个验证数据集,代表 2232 张来自儿童人群的图像;完整检索策略见附录 8,PRISMA 流程图见图 6,排除原因见附录 9。全部研究均采用回顾性设计,使用标准正位与侧位投照,样本量介于 601 至 3190 张图像之间。五个数据集采用 CNN 类方法(ResNet-50、YOLOv11、ConvNeXt+GAN),两个采用影像组学方法。三个数据集使用外部验证,四个使用内部验证,研究特征详见表 2。

图6(原文 Figure 6)用于儿童肘部骨折检测算法的系统综述与研究筛选流程 PRISMA 流程图。该流程分为三个主要阶段:识别阶段(通过数据库与注册库以及通过其他方法识别研究,其中数据库检索共获得 451 条记录——PubMed 119 条、Embase 81 条、Scopus 67 条、Web of Science 32 条、IEEE Xplore 9 条、ACM Digital Library 143 条,去除重复记录 32 条后剩余 419 条进入筛选),筛选阶段(419 条记录经筛选后排除 391 条,28 篇试验进入全文获取,评估后发现 5 篇评估成人骨折类型、19 篇评估多种儿童骨折类型、1 篇涉及治疗方案规划而予以排除),以及纳入阶段(共 4 项研究纳入综述)。流程同时展示了通过其他方法识别研究的并行路径,包括引文检索 5 条记录,最终纳入本研究 1 项。图注来源:Page MJ, McKenzie JE, Bossuyt PM, Boutron I, Hoffmann TC, Mulrow CD, et al. The PRISMA 2020 statement: an updated guideline for reporting systematic reviews. BMJ 2021;372:n71. doi: 10.1136/bmj.n71。
5.11 质量评价
QUADAS-2 评价(附录 10A)显示,由于回顾性设计,患者选择领域存在不清楚至中等的偏倚风险,而全部研究在索引试验实施与参考标准领域均表现为低风险。三项研究在流程与时间安排领域为低风险,一项因可能存在图像层面的数据泄漏而被判定为高风险。补充的 METRICS 评价(附录 10B)显示,四项研究中有三项达到良好至优秀的方法学质量(得分 64.9%–84.0%),其中本研究取得最高分(80.7%;优秀),其优势体现在患者层面的数据划分、正式的校准评估以及可解释 AI 的整合。总体方法学质量可接受。
5.12 主要 Meta 分析结果:合并诊断性能
随机效应 Meta 分析(图 7a–b)显示,合并敏感性为 92.0%(95% CI:87.0%–96.0%,I² = 60.4%,p = 0.019),范围从 84.1% 至 100.0%;合并特异性为 85.0%(95% CI:77.0%–92.0%,I² = 92.9%,p < 0.001),范围从 39.5% 至 98.2%。显著的异质性提示算法架构与验证方法学会实质性影响特异性的估计。
5.13 亚组分析结果
在算法架构层面(图 7c–d,附录 11.1–11.2),CNN 类算法取得合并敏感性 94.0%(95% CI:88.0%–100.0%,I² = 74.8%)与特异性 93.0%(95% CI:88.0%–98.0%,I² = 83.0%),数值上高于影像组学类数据集(敏感性 88.0%[95% CI:82.0%–94.0%],I² = 15.8%;特异性 50.0%[95% CI:29.0%–71.0%],I² = 68.8%)。但该比较仅涉及来自单一研究的两个影像组学数据集,因此应作描述性解读,而不能视为架构优越性的确定性证据。
在个别算法层面(图 7e–f,附录 11.3–11.4),由于这些结果源自单一研究或同一研究内的亚组分析,故以描述性的算法层面性能摘要呈现,而非正式的合并 Meta 分析估计,解读时需谨慎。ResNet-50 的敏感性为 97.0%(95% CI:91.0%–103.0%,I² = 30.6%),特异性为 90.0%(95% CI:85.0%–96.0%,I² = 36.3%)。影像组学的敏感性为 88.0%(95% CI:82.0%–94.0%,I² = 15.8%),特异性为 50.0%(95% CI:29.0%–71.0%,I² = 68.8%)。ConvNeXt+GAN 的敏感性为 97.0%(95% CI:90.0%–105.0%),特异性为 92.0%(95% CI:87.0%–96.0%)。YOLOv11 的敏感性为 87.0%(95% CI:83.0%–91.0%),特异性异常高,达到 98.0%(95% CI:96.0%–100.0%)。

图7(原文 Figure 7)诊断性能的 Meta 分析:儿童肘部骨折检测算法的敏感性与特异性。森林图展示随机效应 Meta 分析结果。(a–b)总体合并估计:(a)敏感性,(b)特异性;(c–d)按架构分层的亚组分析:(c)CNN 与非 CNN 算法的敏感性,(d)CNN 与非 CNN 方法的特异性;(e–f)按具体算法分析:(e)ResNet-50、影像组学(Radiomics)、ConvNeXt+GAN(图中标注为 ConvAttent-RAN)与 YOLOv11 的敏感性,(f)上述各算法的特异性。方块大小代表研究权重,水平线表示置信区间,菱形表示合并估计值。I² 量化异质性,数值越高表示研究间变异越大。全部分析均采用随机效应模型。CI,置信区间;CNN,卷积神经网络;I²,异质性度量。
5.14 Meta 回归分析
单变量分析(附录 12 表 1)显示,CNN 类算法对敏感性呈非显著趋势(系数 = 0.39,p = 0.513),但与更高的特异性存在统计学显著关联(系数 = 2.63,95% CI:0.63–4.62,p = 0.022,校正 R² = 77.32%)。样本量对特异性呈非显著趋势(p = 0.055)。多变量分析(附录 12 表 2)确认 CNN 类算法对特异性的关联仍保持显著(系数 = 3.12,p = 0.029)。
5.15 发表偏倚评估
Egger 检验揭示敏感性存在显著不对称(p = 0.010,截距 = 1.430,R² = 0.677),提示可能存在小样本研究效应导致的高估(附录 13)。特异性未显示发表偏倚(p = 0.844,R² = 0.009)。
5.16 敏感性分析
留一法分析(附录 14 表 A)显示合并敏感性保持稳定(范围 90.4%–93.3%,变异幅度 2.9%),而特异性波动较大(范围 76.9%–89.4%,变异幅度 12.5%)。固定效应与随机效应比较(附录 14 表 B)显示敏感性差异极小(固定效应 91.1% 对随机效应 92.0%),但特异性差异明显(固定效应 95.5% 对随机效应 85.0%,相差 10.5%),有力支持了采用随机效应模型。离群值分析(附录 14 表 B)识别出四个绝对残差大于 2.0 的离群值,剔除离群值后的敏感性为 95.3%(95% CI:90.4%–100.3%),特异性为 91.9%(95% CI:88.9%–95.0%)。
5.17 临床效用指标与 SROC 曲线
诊断比值比方面(附录 15),合并 DOR 为 61.41(95% CI:9.37–402.67,I² = 93.2%,p < 0.001),性能排序为 ConvNeXt+GAN(DOR = 371.38)、YOLOv11(DOR = 365.00)与 ResNet-50(DOR = 182.90)。似然比方面(附录 15),LR+ 介于 1.49 至 48.67 之间,其中四项研究达到 LR+ > 10;LR− 介于 0.00 至 0.26 之间,其中两项达到 LR− < 0.1;YOLOv11 获得最有利的似然比(LR+ = 48.67,LR− = 0.13)。
SROC 分析(附录 16)显示各项研究总体上具有较高的诊断准确性。经 Moses–Littenberg 加权回归导出的 SROC 曲线下面积为 0.989(95% CI:0.975–1.000),Q* 统计量为 0.895。形状参数 β = −0.872 提示曲线存在明显不对称,主要可归因于影像组学类数据集(Yao 2024;特异性 39.0%–60.5%)与 CNN 类方法(特异性 86.1%–98.2%)在阈值上存在显著差异。在仅限 CNN 类研究的敏感性分析中(n = 5 个数据集),曲线接近对称(β = −0.177),AUC 接近 1.000,Q* = 0.933,证实总体 AUC 的衰减由纳入影像组学研究所驱动,与亚组 Meta 回归的发现一致。
5.18 GRADE 证据评价
GRADE 分析(附录 17)显示,敏感性与特异性均为中等确定性证据(敏感性 92.0%[95% CI:87.0%–96.0%];特异性 85.0%[95% CI:77.0%–92.0%]),因存在严重不一致性(I² 分别为 60.4% 与 92.9%)而降一级,这种不一致性主要源于纳入研究在算法架构、验证策略与骨折患病率上的异质性。原始研究数量有限(n = 4)本身即限制了合并估计的精确度,构成 GRADE 标准域之外需要考虑的额外因素。
表1(原文 Table 1)YOLOv11-Nano 用于儿童髁上骨折检测的诊断性能:整合骨分割与未整合骨分割条件下的多分类与二分类结果
骨折类别 / 分层 | 验证策略 | 无骨分割 ACC (%) | 无骨分割 SEN (%) | 无骨分割 SPE (%) | 无骨分割 F1 | 无骨分割 AUC | 有骨分割 ACC (%) | 有骨分割 SEN (%) | 有骨分割 F1 |
总体 | 随机划分 | 90.98 (85–95) | 92.01 (86–95) | 97.54 (93–99) | 0.9074 (.85–.95) | 0.9423 (.90–.98) | 94.85 (93–96) | 89.71 | 0.8971 |
SCF I 型 | 随机划分 | — | 100 (80–100) | 97.41 (93–99) | 0.9091 (.67–.98) | 0.9760 (.93–.99) | — | — | — |
SCF II 型 | 随机划分 | — | 86.96 (68–95) | 96.30 (92–98) | 0.8511 (.66–.94) | 0.8808 (.68–95) | — | — | — |
SCF III 型 | 随机划分 | — | 91.30 (80–97) | 97.65 (93–99) | 0.9333 (.82–.98) | 0.9543 (.85–.99) | — | — | — |
No-SCF | 随机划分 | — | 89.80 (78–96) | 98.81 (95–100) | 0.9362 (.83–.98) | 0.9580 (.83–.98) | — | — | — |
总体 | 分层 k 折 | 93.12 (91–95) | 93.12 (90–95) | 96.84 (93–99) | 0.8619 (.85–.87) | 0.9840 (.97–.99) | 96.97 (96–97) | 93.94 | 0.9394 |
SCF I 型 | 分层 k 折 | — | 94.00 (93–95) | 96.51 (93–99) | 0.8710 (.85–.89) | 0.9947 (.98–1) | — | — | — |
SCF II 型 | 分层 k 折 | — | 93.25 (92–95) | 95.78 (92–98) | 0.8683 (.85–.88) | 0.9495 (.93–95) | — | — | — |
SCF III 型 | 分层 k 折 | — | 92.00 (91–94) | 96.05 (93–99) | 0.8316 (.81–.85) | 0.9954 (.99–1) | — | — | — |
No-SCF | 分层 k 折 | — | 93.25 (92–94) | 97.81 (95–99) | 0.8767 (.85–.88) | 0.9963 (.99–1) | — | — | — |
总体 | 留一法(LOO) | 90.81 (89–91) | 75.15 (74–76) | 86.50 (84–88) | 0.7513 (.73–.77) | 0.7600 (.74–.78) | 94.75 (94–95) | 89.50 | 0.8950 |
SCF I 型 | 留一法(LOO) | — | 92.74 (91–93) | 87.34 (85–89) | 0.5793 (.53–.60) | 0.8044 (.79–.82) | — | — | — |
SCF II 型 | 留一法(LOO) | — | 87.60 (85–89) | 84.72 (82–85) | 0.7040 (.70–.71) | 0.7918 (.77–.80) | — | — | — |
SCF III 型 | 留一法(LOO) | — | 91.07 (90–92) | 86.88 (84–87) | 0.8084 (.79–.82) | 0.8057 (.79–.83) | — | — | — |
No-SCF | 留一法(LOO) | — | 91.84 (90–94) | 87.19 (85–89) | 0.9134 (.89–.93) | 0.9692 (.96–.97) | — | — | — |
Panel B 二分类(骨折对无骨折) | |||||||||
总体 | 随机划分 | 88.89 (83–94) | 90.11 | 96.78 (91–99) | 0.9229 (.86–.96) | 0.9358 (.91–.96) | 99.06 (97–100) | 99.06 | 0.9906 |
总体 | 分层 k 折 | 92.83 (90–94) | 86.90 (83–91) | 98.20 (96–99) | 0.9176 (.90–.93) | 0.9578 (.91–.99) | 99.06 (98–100) | 99.06 | 0.9906 |
总体 | 留一法(LOO) | 88.46 (94–96) | 88.46 (86–90) | 94.62 (98–99) | 0.8918 (.86–.92) | 0.9086 (.89–.92) | 98.04 (97–98) | 98.04 | 0.9799 |
注:数值为测试集结果;括号内为 95% 置信区间,置于相应估计值下方。Δ 表示“整合骨分割”减去“未整合骨分割”的差值,粗体 Δ 值表示绝对变化 ≥ 2 个百分点;对 F1 分数(0–1 标度),Δ 乘以 100 以便与百分比指标比较。破折号(—)表示在按类别评价时未单独计算类别层面准确率。因原始网页版式在“整合骨分割”部分发生列截断,该部分仅能获得总体层面数据,各类别层面的对应数值无法从原文获取,故以“—”标注;原文报告的有骨分割总体结果为:多分类随机划分 94.85%(敏感性 89.71%,F1 0.8971,ΔACC +3.9、ΔSEN −2.3)、分层 k 折 96.97%(敏感性 93.94%,F1 0.9394,ΔACC +3.9、ΔSEN +0.8)、留一法 94.75%(敏感性 89.50%,F1 0.8950,ΔACC +3.9、ΔSEN +14.4);二分类准确率与敏感性均为 99.06%、99.06% 与 98.04%,F1 分数为 0.9906、0.9906 与 0.9799,对应准确率绝对增益 +10.2、+6.2 与 +9.6 个百分点。缩写:ACC,准确率;SEN,敏感性;SPE,特异性;F1,F1 分数;AUC,受试者工作特征曲线下面积;CV,交叉验证;LOO,留一法交叉验证;SCF,髁上骨折;No-SCF,无髁上骨折。
表2(原文 Table 2)AI 儿童髁上骨折检测系统综述纳入研究的特征与诊断性能
作者 | 年份 | 中心(机构) | 算法 | 图像类型 | 数据集(验证方式) | 敏感性 (95% CI) | 特异性 (95% CI) |
Choi 等 | 2019 | 单中心(SNUH) | 双输入 CNN(ResNet-50) | 正位 + 侧位 X 线 | 时间外部验证 | 0.94 (0.85–0.98) | 0.92 (0.87–0.96) |
Choi 等 | 2019 | 单中心(SNUH) | 双输入 CNN(ResNet-50) | 正位 + 侧位 X 线 | 地理外部验证 | 1.00 (0.85–1.00) | 0.86 (0.78–0.93) |
Yao 等 | 2024 | 单中心(ACDMU) | 影像组学 + 逻辑回归 | 正位 X 线 | 内部验证 | 0.90 (0.82–0.96) | 0.39 (0.24–0.57) |
Yao 等 | 2024 | 单中心(ACDMU) | 影像组学 + 逻辑回归 | 侧位 X 线 | 内部验证 | 0.84 (0.74–0.91) | 0.61 (0.43–0.76) |
Ye 等 | 2025 | 单中心(HZCH) | MPR + GAN(ConvNeXt+GAN) | 正位 + 侧位 X 线 | 内部验证 | 0.97 (0.85–1.00) | 0.92 (0.86–0.95) |
Ye 等 | 2025 | 多中心(HZCH + ZCHH) | MPR + GAN(ConvNeXt+GAN) | 正位 + 侧位 X 线 | 外部验证 | 0.89 (0.75–0.97) | 0.92 (0.87–0.96) |
本研究 | 2026 | 单中心(原文未报告机构) | YOLOv11 Nano | 正位 + 侧位 X 线 | 内部验证 | 0.87 (0.82–0.91) | 0.98 (0.96–1.00) |
注:ACDMU,安徽医科大学附属安徽儿童医院;AP,正位;CNN,卷积神经网络;FN,假阴性;FP,假阳性;GAN,生成对抗网络;HZCH,杭州市儿童医院;MPR,多平面重建;NR,未报告;SNUH,首尔大学医院;TN,真阴性;TP,真阳性;ZCHH,浙江大学医学院附属儿童医院(杭州)。括号内数值代表 95% 置信区间;短横线(–)用于表示数值范围。原始表格因网页版式发生列截断,参考标准一列及其后部分内容无法完整获取,故本表未列示,敏感性、特异性数值依据原文森林图(图 7)所报告的合并分析输入值整理。原文脚注说明:存在时间外部验证的单中心研究与不同机构的地理外部验证;Yao 等的 AP 与侧位图像分析均基于 601 张图像的 8:2 训练/测试划分(骨折患病率 68.4%),测试集数值由报告的敏感性、特异性与估计的骨折患病率计算得出;Ye 等的单中心开发与内部验证以及多中心验证均使用基于 GAN 的重建,原始数据集为 3190 张图像(骨折患病率 18.4%);对于 Yao 等与 Ye 等,TP、FP、FN、TN 值系依报告的性能指标与数据集构成计算得出,因原始发表未提供完整的 2×2 列联表原始数据;Choi 等的数值代表原始研究报告的实际混淆矩阵。
六、讨论
6.1 主要发现
本研究呈现了三项主要贡献。第一,构建了首个区分正常 X 线片与 Gartland I–III 型髁上骨折的多分类深度学习模型,采用 YOLOv11 Nano 取得 90.98% 的准确率。第二,完成了首个针对 AI 计算方法检测髁上骨折的诊断准确性 Meta 分析,基于四项研究显示合并敏感性 92.0%、合并特异性 85.0%,其中 YOLOv11 在纳入算法中取得最高特异性(98.0%)与最高诊断比值比(365.00);鉴于证据基础有限,CNN 类与影像组学类数据集之间的特异性数值差异应视为探索性发现。第三,通过 NormEnsemble-HiResCAM 整合可解释 AI,其可视化展示了具有解剖学精确性的注意力模式以及随骨折分级递进的差异化。
6.2 YOLO 在髁上骨折多分类与二分类中的表现
在多分类层面,本研究首次将 YOLOv11 Nano 用于儿童髁上骨折的多分类,在四个 Gartland 类别上取得 90.98% 的准确率、92.01% 的敏感性与 0.9074 的 F1 分数。选择 YOLOv11 Nano 的原因在于其在架构精细度与计算效率之间的最优平衡:C3K2 模块可实现更强的分层特征提取,C2PSA 模块整合通道与空间注意力以检测细微的皮质中断,无锚框设计提升了对可变骨折形态的适应性,共同实现了适合急诊临床流程的实时性能。这些架构特性已在近期的肌骨系统应用中获验证:多分类前臂骨折检测取得 0.714–0.944 的精确率,腕部创伤检测报告 mAP@50 为 0.651。本模型实现了比既往双输入 CNN(敏感性 100%、特异性 86.1%)更为均衡的性能。分层 k 折验证确认了稳健性(准确率 93.12%),但留一法交叉验证揭示了泛化挑战(90.81%),凸显了扩展多中心数据集的必要性。XAI 可视化揭示了既往未被记录的各 Gartland 亚型间递进式注意力差异,正常病例为以骨骺板为中心的激活(模型间相关性 >0.90),III 型骨折则表现为移位骨折块边界处的多个高强度激活灶,表明模型有效捕捉了具有临床相关性的形态学特征。
在二分类层面,YOLOv11 Nano 取得了良好的二分类性能(准确率 88.89%、敏感性 90.11%),并在分层 k 折验证下维持 92.83% 的准确率。需要指出的是,在类别不平衡的数据集中,准确率作为单一指标的解释价值有限;本研究数据集的骨折患病率(约 47.8%)高于典型儿科急诊场景,因此研究将特异性与似然比作为主要的比较指标。本研究结果优于既有方法:DenseNet-201 取得 94.1% 的准确率、93.2% 的敏感性与 94.8% 的特异性,多视角 CNN-RNN 报告 88% 的准确率;此前的 ResNet-50 方法虽达到 100% 的敏感性但特异性仅 86.1%,而本模型在保持相当敏感性的同时维持了更优的特异性,这在假阳性率高会导致不必要的影像检查、辐射暴露增加与可避免医疗支出的临床场景中尤为重要,且与任何机构特定的骨折患病率无关。与影像组学方法(准确率 76%、敏感性 61%、特异性 39.5%;AUC 0.65–0.72)相比,YOLO 的端到端学习通过自动学习捕捉纹理与语义信息的分层空间表征,明显优于手工特征流程。其性能与商用产品 BoneView™(敏感性 91.3%、特异性 90.0%、AUC 0.93)具有竞争力,同时推理速度更快,这在急诊分诊流程中是一项有意义的优势。随机划分(88.89%)与 k 折验证(92.83%)之间的准确率差异在重采样策略可预期的范围之内;在临床部署前,跨机构的前瞻性外部验证仍是必不可少的。
6.3 可解释 AI 可视化及其与文献的比较
本研究提出的 NormEnsemble-HiResCAM 框架超越了既往 XAI 实现,将模型一致性的系统量化与多分类骨折鉴别相整合,这些能力在早期单技术方法中均不具备。既往采用类激活映射或显著图的研究展示了模型对骨折线、皮质中断与相关解剖区域的关注,但仅提供定性评估,缺乏量化共识指标或跨骨折严重程度分级的模型间一致性评价。通过投票共识图、标准差映射与相关矩阵在 11 模型集成上对显著图进行归一化与融合,本框架生成更为可靠且可重复的解释,确认模型决策与医学相关特征一致,具体涉及放射学判读中常规评估的前肱骨线与骨折块移位。
这一方法学基础在全部四个分类类别中产生了临床合理且解剖学分层的注意力模式。与既往二分类检测文献一致,该框架成功识别出具有临床相关性的特征;但本研究独特地展示了各 Gartland 亚型间的递进式分化:正常与 I 型病例为以骨骺板为中心、模型间相关性高(>0.90)的激活,II 型病例为强度中等(0.6–1.0)的扩大前侧骨骺板激活,III 型病例为移位骨折块边界处多个高强度局灶性激活(>1.0)。该梯度直接对应骨折移位程度递增的病理解剖连续谱,反映了 Gartland 亚型判定背后的临床推理过程。值得注意的是,II 型骨折表现出最大的模型间分歧(SD 0.12–0.20),这与放射科医师公认的 II 型诊断模糊性一致;而非骨折病例取得最高共识(0.04–0.06),提示模型不确定性本身即是具有解剖学意义的信号,而非噪声。
专家验证证实这些注意力模式可转化为具有临床意义的可视化。在三名资深儿童骨科医师评价的 170 对分层抽取的X 线片–XAI 配对样本中,全部评分者的总体阳性一致率均超过 83%。与诊断标志的对应性(Q3)取得最高领域得分(均值 4.61–4.62;阳性一致率 92.3%–93.5%),反映了其与常规判读所依据的前肱骨线、骨骺板轮廓与骨折块边界的持续一致。No-SCF 与 SCF III 型类别的一致性最强(阳性一致率 90.6%–100%),而 SCF I 型与 II 型得分相对较低(均值 3.75–4.08),这一模式既反映了分类性能的梯度,也反映了无移位与轻微移位损伤固有的诊断细微性。量化模型间共识指标与专家临床判断之间的收敛,为该框架提供了双层次验证,并支持其作为急诊儿童创伤场景中决策增强工具的潜在作用,在这些场景中,AI 推理的透明性对于临床医师信任与恰当使用至关重要。
6.4 诊断准确性 Meta 分析的启示
本 Meta 分析显示,AI 检测儿童髁上骨折的合并敏感性为 92.0%(95% CI:87.0%–96.0%),合并特异性为 85.0%(95% CI:77.0%–92.0%)。与近期 Meta 分析相比,本研究敏感性相当但特异性较低:针对全部儿童肘部骨折的 Meta 分析报告敏感性 93%(95% CI:91%–96%)、特异性 89%(95% CI:85%–92%);跨多个解剖部位的 Meta 分析报告敏感性 93%(95% CI:92%–94%)、特异性 91%(95% CI:88%–93%);另有研究显示 AI 敏感性显著高于人类读者且特异性非劣。本研究批判性地专注于髁上骨折而非异质骨折类型,从而针对细微皮质中断等独特诊断挑战。既往 Meta 分析分别纳入六项涉及多种肘部骨折模式的研究、16 项跨不同解剖区域的研究,以及 11 项缺乏髁上骨折特异性指标的附肢骨折研究;与之相比,本研究的靶向分析所提供的证据在神经血管并发症风险高的背景下具有特别的相关性。
观察到的异质性(敏感性 I² = 60.4%,特异性 I² = 92.9%)反映了纳入研究间的实质性变异,值得进行结构化解读,研究识别出四类主要来源(附录 18)。其一是算法异质性:CNN 类架构与影像组学流程在捕捉皮质中断与骨折块移位相关分层空间特征的能力上存在根本差异。其二是数据集异质性:各研究的骨折患病率差异显著(18.4%–68.3%),通过基率效应差异直接影响特异性估计。其三是验证异质性:纳入研究采用了内部随机划分、时间外部验证与地理外部验证等不同策略,各自施加不同的泛化要求并系统性地产生不同的性能估计。其四是人群异质性:机构病例构成、年龄分布与成像方案的差异引入了无法在合并分析中完全解释的变异。值得注意的是,特异性的极端异质性(I² = 92.9%)主要归因于影像组学研究,其特异性(39.0%–60.5%)明显低于 CNN 类方法(86.1%–98.2%),构成研究间变异的主导驱动因素,也进一步促使对总体合并特异性估计采取审慎解读。
亚组分析揭示了CNN 类方法与更高特异性之间的统计学显著关联(Meta 回归 p = 0.022);然而,由于该发现在很大程度上受单一特异性明显较低的影像组学研究影响,因此应视为探索性与假设生成性的,而非确证性的。本研究的 YOLOv11 与 ConvNeXt+GAN 取得最高特异性(分别为 98.0% 与 92.0%),ResNet-50 则表现出最高敏感性(97.0%)。近期综述显示各 AI 系统性能不一,敏感性范围 88%–96%,特异性 63.7%–97%。然而,持续存在的异质性(I² = 92.9%)表明架构选择本身并不能解释全部变异;髁上骨折特异性因素,如 Gartland 分型、移位程度与合并损伤,可能贡献了相当一部分变异。
本研究对骨折类型的专门聚焦消除了多样骨折模式带来的混杂。既往研究或将多种肘部骨折合并,或混合多个解剖部位的儿童骨折类型,而本研究的方法为最常见的儿童肘部损伤提供了具有临床可操作性的证据,提升了在急诊分诊中的适用性。更广泛的证据提示 AI 在外部验证中保持了较高性能(敏感性 93%、特异性 88%),且 AI 辅助判读显著提升了临床医师的敏感性,表明其定位应为增强而非替代。本研究结果凸显了对髁上骨折专用训练数据集的需求。与其他骨折不同,髁上损伤需要评估包括前肱骨线中断与脂肪垫移位在内的细微征象,CNN 的优势提示端到端学习能更好地捕捉这些特征。AI 性能随损伤严重程度而变化显著:完全性骨干/干骺端骨折的检测率为 99%–100%,而细微损伤仅为 18%–60%。未来开发应优先采用纳入 Gartland 分型的髁上骨折专用标注。缺乏前瞻性、多中心外部验证仍是真实世界适用性的关键障碍。
七、研究局限性
7.1 实验研究部分的局限
本研究的发现需结合若干局限加以解读。首要且最关键的一点是,数据集由来自单一机构的 1082 张 X 线片构成,且缺乏外部验证。尽管研究实施了三种互补的内部验证策略(随机划分、分层 k 折与留一法交叉验证),但这些策略无法替代独立的外部验证。儿童肘部 X 线判读在很大程度上受机构成像方案(千伏值、探测器类型、放大率)、患者人口学特征与当地骨折流行病学的影响,因此性能可能在这些分布偏移来源之间出现有意义的下降,所报告的指标应被视为上界估计,而非预期的真实世界性能。除泛化性之外,缺乏外部验证还直接影响临床部署的可行性:现行监管框架(包括台湾食品药物管理署的医疗器械软件路径与美国 FDA 基于 AI/ML 的 SaMD 行动计划)要求在上市许可前证明跨机构的性能稳定性,此外还需要开展前瞻性临床流程整合研究,评估 AI 辅助与无辅助条件下的诊断准确性、警报疲劳以及下游决策影响。因此,当前模型应被视为证明技术可行性的概念验证,在考虑临床部署之前,必须在覆盖多种成像系统、患者人群与地理环境的独立多中心外部队列中开展前瞻性验证。
第二,数据集存在显著的类别不平衡,I 型(n = 21)与 II 型(n = 125)骨折相对于 III 型(n = 360)与 No-SCF(n = 576)明显不足。研究评估了两种缓解策略:基础增强(旋转与翻转)以及类别加权联合焦点损失方案(附录 5)。联合策略在随机划分与分层 k 折两种框架下对 I 型与 II 型敏感性产生了边际改善,且未造成总体准确率或特异性的实质下降;然而,鉴于 I 型绝对样本量极小,各类别召回率的差异在统计学上仍不确定,临床上也较为有限。基于总体性能的稳定性,研究将仅增强配置保留为主要方法。YOLOv11 无锚框多尺度架构所固有的结构优势可部分缓解,但无法消除极端少数类代表性不足带来的影响。前瞻性收集更大规模、类别均衡的数据集并对 I 型进行专门过采样,仍是未来模型开发的优先事项。第三,本研究仅聚焦于髁上骨折,未涉及其他常见儿童肘部损伤。未来工作应扩展至肱骨外髁骨折、内上髁骨折、经骺板骨折、桡骨头与桡骨颈骨折、Monteggia 骨折以及尺骨鹰嘴骨折,以期为更广泛的临床需求构建全面的 AI 辅助肘部创伤检测系统。
7.2 Meta 分析部分的局限
本 Meta 分析仅纳入四项研究、提供七个验证数据集,证据基础极为有限,实质性限制了全部合并估计与亚组分析的统计效能。标准随机效应方法(包括本研究所采用的 DerSimonian–Laird 方法)仅在大样本条件下渐近正确,当纳入研究数量较少时其统计性质已知会恶化,可能产生不稳定的异质性估计与不可靠的置信区间。因此,亚组比较,尤其是 CNN 类与影像组学类的架构分析,应解读为初步且假设生成性的,而非确证性的。非 CNN 算法代表性严重不足,仅有两个来自同一研究的影像组学数据集,而 CNN 类数据集有五个,这使得关于算法范式优越性的任何确定性结论都无法成立,也限制了基于架构的亚组比较的可解释性。因此,CNN 类与影像组学类数据集之间观察到的特异性数值差异应格外谨慎解读,因为它可能反映单一纳入影像组学研究所特有的特征(包括其患者人群、成像方案与特征工程流程),而非影像组学方法整体固有的局限。未来需要纳入数量更多、多样性更强的影像组学研究的 Meta 分析,才能得出更为稳健的比较性结论。外部验证仅限于三个数据集,可能高估合并估计值。敏感性检测到显著发表偏倚,提示选择性报告导致的高估。特异性存在显著异质性(I² = 92.9%),源于验证策略、人群与成像方案的差异。
若干亚组分析还因仅纳入单一研究而受限,某些亚组纳入了来自同一来源研究的多个验证数据集,尤其是 Choi 等(时间队列与地理队列)与 Ye 等(内部队列与外部队列)。在这些条件下得出的亚组发现需格外谨慎解读,因为它们可能反映人群或机构特异性特征,而非可泛化的算法性能,在此情形下进行正式的合并推断并不恰当。为部分应对这些问题,研究实施了留一法敏感性分析:合并敏感性在各次迭代中表现出可接受的稳定性(范围 90.4%–93.3%,变异 2.9%),特异性估计尽管波动较大(范围 76.9%–89.4%),但方向保持一致,提示尽管证据基础有限且异质性明显,总体合并估计仍具有合理稳健性。上述局限已通过 GRADE 评估加以整体处理,因严重不一致性(敏感性 I² = 60.4%,特异性 I² = 92.9%)将证据确定性降为中等。未来需要纳入更大规模、多中心、前瞻性收集且方案标准化、算法多样性更高并经过严格外部验证的研究,才能提供更确定且可泛化的证据。
八、结论与展望
本研究提出了首个用于儿童髁上骨折分类并实现 Gartland 亚型区分的多分类深度学习框架,取得了优于现有方法的诊断性能以及在现有方法中最高的特异性。可解释 AI 提供了具有解剖学精确性的可视化,回应了临床透明性的需求。Meta 分析显示纳入研究整体呈中等诊断性能,但鉴于证据基础有限且异质性显著,相关发现仍属初步。研究针对未来工作提出三项具体方向:其一,在成像系统与患者人群各异的机构之间开展前瞻性多中心外部验证;其二,构建规模更大、类别均衡的训练数据集,并对 I 型骨折实施专门过采样;其三,在临床部署前开展监管路径评估(如 TFDA 与 FDA 的 SaMD 框架)。
九、可改进点与延伸思考
在方法层面,最值得推进的是引入外部多中心验证队列,并采用域适应或联邦学习策略应对跨机构成像方案差异;YOLOv11 Nano 作为轻量模型可进一步与两阶段“检测 + 分型”流水线或分割辅助分支结合,以缓解骨分割依赖手工标注的问题,探索弱监督或自动骨分割以降低标注成本。此外,I 型样本仅 21 例是性能瓶颈所在,可考虑基于生成模型的合成数据扩充、迁移学习或专门的少样本学习策略,而非仅依赖旋转翻转增强与焦点损失。
在实验层面,建议补充与 U-Net、ResNet、DenseNet、Vision Transformer 等架构在同一切分与同一测试集上的公平对照,并系统报告各类别的置信区间与统计检验,以避免因小样本类别导致的过度解读。校准评估目前依赖 Brier 分数与 ECE,可进一步引入温度缩放或 Platt 标定以改善概率输出的可靠性,并通过风险–获益分析把 DCA 结果转化为临床可执行的阈值建议。人机对比部分目前为回顾性、非实时环境,未来可设计前瞻性、随机化的 AI 辅助判读试验,评估对急诊分诊时间、二次影像与漏诊率等硬终点的实际影响。
在泛化性与临床转化层面,模型目前仅覆盖髁上骨折,建议扩展至外髁、内上髁、经骺板等其他儿童肘部损伤,形成完整的肘部创伤分类体系;同时需评估在低剂量、低质量或床旁摄片条件下的鲁棒性。临床落地还需配套的警报阈值管理、医师培训与责任界定,并针对监管路径准备完整的性能验证文档,包括跨机构性能稳定性证据,而不能仅以内部交叉验证结果作为依据。
在 Meta 分析层面,四项研究、七个数据集的证据体量过小,难以支撑随机效应模型的稳定推断;未来应扩大检索时间跨度与数据库覆盖(包括灰色文献与预印本以评估发表偏倚),并以统一的数据提取模板要求原始研究报告完整的 2×2 列联表,从而避免由敏感性、特异性与患病率反推计算所带来的不确定性。亚组分析应避免将同一研究的多个数据集同时计入不同亚组,以减少伪独立性问题;同时建议预设并按 PRISMA-DTA 报告验证策略亚组,以厘清内部与外部验证对合并估计的贡献。若影像组学研究数量增加,还应开展正式的架构间比较与阈值效应分析。最后,在写作与呈现层面,本文的表格因网页排版出现列截断,正式发表版本宜以完整表格呈现全部类别层面的性能数据与置信区间,并明确区分内部验证与外部验证来源的研究权重,以提升结果的可复核性。