一组眼底光学相干断层扫描(OCT)通常包含数十甚至数百张二维切片,共同构成完整的三维影像数据。临床医生面对的问题也并非简单判断“这一张图像有没有病灶”,而是需要完成一系列连续任务:判断扫描质量、筛选关键切片、识别异常区域,并最终根据整组影像做出患者级疾病判断。
过去,许多AI模型往往只解决其中某一个环节。它们可以准确识别单张切片中的病变,却仍需要人工完成图像筛选、信息整合以及最终诊断。因此,模型在实验数据中展现出的高性能,距离真实临床工作流之间仍存在一道鸿沟。
近日,一项发表于 npj Digital Medicine 的研究提出FOCUS(Full-process OCT-based Clinical Utility System)。它没有把目标停留在单项分类,而是把图像质控、异常筛查、多病种识别和患者级聚合接进同一套系统。研究团队在内部数据上完成开发与测试,又在四家不同层级医疗中心进行了外部验证。

这里的“接管”有明确边界:FOCUS接手的是OCT影像从质控到患者级诊断的完整读片链条,并不包括问诊、治疗决策和其他临床工作。
这项工作的核心价值,并不只是再次刷新某个模型指标,而是探索三维OCT能否从“逐张切片识别”真正走向“基于整组影像完成患者级诊断”。

引言
OCT早已进入三维时代,AI却仍停留在“单张切片”
OCT能够以微米级分辨率呈现视网膜结构,已经成为多种眼底疾病诊疗的重要工具。但三维扫描带来的信息增量,也同步放大了读片负担:一名患者对应一组连续切片,其中既可能混有运动伪影、信号衰减等低质量图像,也可能只有少数切片真正包含病灶。
如果AI只判断单张图像,就会留下两个临床问题。
低质量切片进入诊断模型后,可能让预测产生偏差;几十张切片又该如何合成患者级结论,同样没有现成答案。简单求平均会稀释局部病灶,只取最高概率则容易被偶然误判带偏。
FOCUS从这两个缺口切入,直接处理质量参差、病灶分布不均的整组三维OCT数据。

图1 FOCUS的数据来源与验证框架。原论文Fig. 1
模型介绍
一套系统串联质控、异常检测与九类疾病诊断
FOCUS的第一道关口是图像质控。研究者使用EfficientNetV2-S将切片分为“可用”和“低质量”,只有通过筛选的图像才进入后续环节。用于这一任务的数据包含7061张OCT图像,其中4530张为低质量图像,2531张为可用图像。
第二步是异常检测。系统先判断切片是否存在异常,把正常与异常图像分开。这一步相当于在完整体数据中提前圈出需要关注的区域。
第三步才是多病种诊断。模型以眼科视觉基础模型VisionFM为骨干,通过LoRA进行参数高效微调,并加入可学习的提示解码器。任务覆盖正常以及8类视网膜疾病:年龄相关性黄斑变性、脉络膜新生血管、中心性浆液性脉络膜视网膜病变、糖尿病视网膜病变、黄斑裂孔、黄斑水肿、视网膜前膜和视网膜色素变性。
这套设计的顺序很重要。系统按照真实读片逻辑分工:先判断图像能不能看,再判断是否异常,最后回答可能是哪种疾病。
从单张切片预测到患者级诊断,关键在于三维信息整合
FOCUS最关键的模块是统一自适应聚合分类器UAAC。它不把每张切片视为同等重要,而是结合切片特征、异常概率和分类结果,为不同切片分配权重,再形成患者级诊断。
这解决了三维影像中的一个常见矛盾:多数切片可能接近正常,但少数切片包含决定诊断的局部变化。若直接平均,真正有用的信号可能被淹没;UAAC则试图让包含异常信息的切片在最终判断中获得更大影响。
系统还加入监督式对比损失,让同一疾病的表征更靠近、不同疾病的表征更容易区分。它的意义不只在内部数据上增加几个百分点,更在于面对不同医院和设备时,减少特征分布变化带来的性能下滑。

图2 FOCUS从质控到患者级诊断的流程。原论文Fig. 6
四家医院和多种设备共同检验跨中心稳定性
异常检测和疾病诊断模块的开发与内部评估使用了40672张OCT图像,涉及1964名患者。真实世界外部验证进一步纳入四家不同层级医疗中心,共18498张图像、1345名患者,数据来自Spectralis、Cirrus和Triton等设备。
多中心设计比单纯扩大同一家医院的数据量更有意义。医院层级、患者构成、扫描设备和采集习惯都会改变图像分布。一个只在单中心表现良好的系统,很可能记住了特定设备或特定人群的特征;跨中心验证才更接近模型真正会遇到的环境变化。
不过,这仍是回顾性研究。它能够说明系统在既有多中心数据上的稳定性,却不能直接替代前瞻性人群筛查试验。
研究结果
从影像质控到疾病诊断,三个环节均展现稳定性能
内部测试中,FOCUS的图像质控F1为99.01%,异常检测F1为97.46%,患者级多病种诊断F1为94.39%。这些数字对应三个不同任务,不能简单理解成同一个模型在连续流程中始终保持同等准确率。
质控模块回答“图像能不能用”,异常检测回答“切片是否异常”,患者级诊断则需要综合整组切片给出疾病类别。任务越靠后,输入信息与决策链条越复杂。患者级F1仍能达到94.39%,才是这项研究真正值得关注的结果。

图3 FOCUS在内部数据集上的表现。原论文Fig. 2
患者级判断成为优势:外部验证F1达到94.05%
合并四个外部中心后,FOCUS的患者级F1为94.05%,各中心患者级F1介于90.22%至95.24%之间。分设备看,Spectralis、Cirrus和Triton对应的F1分别为95.43%、92.86%和91.73%,说明设备差异仍会带来一定波动,但没有造成断崖式下降。
外部验证还有一处容易被总分遮住的细节:切片级F1为85.35%,明显低于患者级结果。由此可以看出,自适应聚合并非形式上的最后一步。单张切片的预测会受到病灶位置、图像质量和跨设备差异影响;把整组切片联合起来后,系统能够利用互补信息恢复更稳定的患者级判断。
研究还比较了不同性别、年龄和设备下的表现。男性与女性F1分别为92.88%和94.78%,青年组为90.29%,中老年组为92.67%。这些结果没有显示出巨大的群体落差,但样本构成和地域范围仍不足以证明普遍公平性。

图4 FOCUS的多中心外部验证结果。原论文Fig. 4
提示学习与自适应聚合,帮助AI适应跨中心差异
消融实验给出了比总分更有价值的信息。
在相同任务下,VisionFM的内部患者级F1为94.39%,高于RETFound的91.70%、UrFound的90.08%和MIRAGE的88.04%。这说明基础模型的预训练能力确实重要,但它并不能单独解释FOCUS的表现。
当研究者把可学习提示替换为固定one-hot提示时,外部F1从94.05%降至85.59%。使用传统池化策略时,外部准确率约为84.2%;移除监督式对比损失后,外部准确率也降至84.14%。这些实验使用的指标并不完全相同,不能直接横向相减,却共同指向同一个结论:真正决定跨中心稳定性的,不只是换一个更强的骨干网络,而是让模型学会表达疾病语义、识别关键切片,并抵抗不同数据域之间的变化。

图5 基础模型比较与关键模块消融。原论文Fig. 3
秒级分析展示效率潜力,但真实临床应用仍需验证
研究还设计了一组人机比较:842张OCT切片来自105名患者,由4名眼科技师完成异常筛查,9名不同资历的眼科医生完成多病种诊断。
异常检测中,FOCUS的F1为95.47%,技师平均为90.91%。多病种诊断中,FOCUS的F1为93.49%,初级医生、高年资医生和视网膜专家平均分别为62.35%、76.28%和91.35%。FOCUS的数值略高于视网膜专家,但差异没有统计学显著性(p=0.376),更准确的表述是“达到与专家相当的水平”,而不是“显著超越专家”。
速度差异十分明显。FOCUS处理整组842张图像耗时22.7秒;技师完成筛查平均需要83.4分钟,三组医生完成诊断平均需要29.3至40.8分钟。
但这里的22.7秒只代表受控条件下的影像分析时间。真实门诊还包括图像采集、病史询问、多模态检查、结果复核和医患沟通。把这个数字直接写成“22.7秒完成临床诊断”,会夸大论文的结论。

图6 FOCUS与技师、眼科医生的比较。原论文Fig. 5
研究意义
FOCUS推进的是流程自动化,不是又一次单点模型排名
这项研究的价值,在于把过去分散的AI能力组织成一条连续工作流。质控模块减少坏图干扰,异常检测定位可疑切片,基础模型完成疾病识别,UAAC再把二维结果转化为患者级结论。每个模块都不是全新的任务,但把它们接起来并完成多中心验证,改变了系统解决问题的尺度。
对于基层筛查或眼科资源不足的地区,这类系统未来可能先承担标准化、重复性强的环节:检查图像是否合格、标记需要复核的病例、为医生提供排序和初步判断。它更像一个自动化入口,而不是独立作出最终诊疗决策的“机器医生”。
高分距离真实筛查可用,仍隔着前瞻性验证
研究数据主要来自中国医疗中心,不同族群、疾病谱和临床流程下的泛化能力仍不确定。数据来自眼科专科或综合医院,视网膜疾病患病率高于一般人群,不能直接代表社区筛查。研究只纳入单标签患者,而真实病例可能同时存在多种眼病。人机比较只提供OCT影像,医生日常诊断还会结合病史、眼底照相和其他检查。
更关键的是,这仍是一项回顾性研究。FOCUS证明了“从图像到患者级结论”的技术链条可以被打通,但要判断它是否真正改善筛查效率、漏诊率和患者结局,还需要国际多中心、多设备以及前瞻性人群研究。
FOCUS把3D OCT人工智能向前推了一步:评价单位从单张切片扩展到整组检查,系统目标也从分类分数转向连续诊断流程。下一道门槛,是让这套流程在真实临床中接受检验。
葩米学术是PAMI面向医生、PI、医院科研团队、药企和生物医学实验室打造的专业内容与智能服务平台。我们持续解读医疗AI、AI for Science、生物医药AI和智能实验室前沿,汇聚科研项目、人才计划、比赛奖项与产业合作机会,并提供论文精读、机会匹配、科研建模及医院、实验室和药企智能体服务。

微信号:radiomier
邮箱:hr@pami.tech
夜雨聆风