ARTICLE · 1116086
中山大学等医疗AI安全:只审5%高风险病例,识别能力升至81.85%

论文基本信息
方法名称:临床人机协同决策系统(CHILD)
任务说明:分布外识别(OOD),即识别模型训练时没有覆盖的新疾病或异常样本
原文标题:CHILD: Human-in-the-Loop OOD Detection for Safe Clinical Deployment
首次公开:2026年9月7日
署名单位:中山大学、鹏城实验室、香港科技大学、教育部机器智能与先进计算重点实验室
原论文:https://arxiv.org/abs/2609.07188
开源代码:https://github.com/figec/CHILD
龙哥导读
医疗模型最危险的错误,不一定是“不会”,而是面对没见过的疾病图像时仍然很自信。中山大学、鹏城实验室与香港科技大学团队提出了一种更现实的协作方式:不让医生把所有病例重审一遍,而是把有限精力放在决策边界附近最容易误判的病例上。论文用5%的模拟人工反馈,把四个医学图像基准上的平均识别能力从75.53%提高到81.85%,同时不修改模型参数。
假设一个皮肤病识别模型只学过几种常见病。部署之后,来了一张训练中从未出现过的罕见病图像。最理想的反应不是硬猜一个熟悉类别,而是主动说:“这张图可能超出我的能力范围,请医生复核。”
问题在于,模型常常没有这种自知之明。它可能对错误答案给出很高置信度。所谓分布外样本,就是与训练范围不一致、却仍被送进系统的数据。它可能来自新疾病,也可能来自不同医院、设备、染色流程或患者群体。
在普通图片分类中,把猫认成狗已经很麻烦;在临床辅助系统中,把陌生病变误判成已知类别,风险显然更高。于是,研究者会在分类模型旁边加一个“守门员”:先判断当前图像是否属于模型熟悉的范围,再决定能不能相信后面的诊断结果。
可这个守门员也会犯错。尤其是那些刚好落在判断边界附近的病例,看起来既不像典型已知病例,也不像明显陌生病例。让模型自动适应不断到来的数据,可能提高表现,也可能把早期错误越滚越大;让医生逐张检查,又失去了自动化的意义。
这篇论文抓住的不是“怎样彻底去掉人工”,而是一个更现实的问题:如果医生只能复核很少一部分病例,怎样让每一次复核尽可能改变后续判断?

图1展示完整流程。上方是持续到来的医学图像、基础检测器和历史分数;左下方先找到最值得询问医生的风险区间,右侧再把医生确认过的已知与未知病例存入两个特征缓存,用来校准后续病例的分数。
一、为什么“全自动适应”在医院里不一定更安全
近年的测试时适应方法,会利用部署阶段不断到来的无标签数据,自动调整模型或检测规则。它的吸引力很直接:医院不必重新整理训练集,也不必等几个月再训练新版模型,系统就能适应新的数据分布。
但医学场景有一个绕不过去的问题:新来的数据本身没有答案。如果模型把错误判断当成可靠信号继续学习,后面的决策可能越来越偏。今天把某种罕见病当成普通病,明天又用这个错误认识去修正判断边界,错误就从一次误判变成了持续偏移。
论文因此没有让系统在后台偷偷改参数。它保留原来的分类模型和分布外检测器,只在最终分数上做轻量校准。医生确认的信息被放进一个小型记忆库,后续病例只需与这些已确认样本比较相似度。
这像给一个经验丰富但偶尔自信过头的助手配了一本“错题本”。助手原有知识不变,每当专家指出一个关键病例属于熟悉范围还是陌生范围,错题本就多一个可参照的样本。下一次遇到相似图像时,系统会参考专家留下的判断,而不是仅凭原始分数硬猜。
这种设计的价值不在于它绝对不会出错,而在于修正路径比较清楚:基础模型给出什么分数、医生确认了哪些病例、这些病例怎样改变当前结果,都可以逐步检查。对于强调责任链和可追溯性的临床系统,这通常比悄悄更新大量参数更容易管理。
二、第一步:先找到最危险的“灰色地带”
每张新图像到来时,基础检测器会给出一个分数。论文约定,高分更像模型熟悉的分布内识别(ID)一侧,低分更像训练范围之外的样本。系统再用一个阈值把两边分开。
如果某张图的分数极低,它已经很像一个明显陌生病例;如果分数极高,它通常很像模型熟悉的病例。真正值得花医生时间的,是阈值附近那些摇摆不定的样本,因为它们最可能被错误地放到“可以放心使用模型结果”的一侧。
团队没有固定一条永远不动的边界,而是持续记录已经出现过的分数,形成一条随时间变化的分布。然后使用大津阈值法寻找两组分数分离最明显的位置。这个方法原本常用于图像二值化:把灰度直方图分成前景和背景,使两组之间的差异尽量大。
放到这里,它不再分黑白像素,而是把“更像已知”和“更像未知”的检测分数分开。设候选边界为τ,系统计算边界两侧分数均值之间的差异,选择组间方差最大的τ作为当前参考线。随着病例流入,参考线也不断更新。
仅有一条线还不够。系统还要在它附近划出一个风险区间。区间宽度由历史分数的低分位数和最低分共同决定,因此会随当前数据分布自动伸缩。数据分散时,区间可以更宽;分数集中时,区间会收紧。
更有意思的是,这个区间不是左右对称的。论文重点覆盖边界中更像已知病例的一侧。原因很现实:把熟悉病例暂时交给医生确认,会增加工作量;把陌生病变错当成熟悉病例并直接接受模型结论,潜在后果更严重。
所以它不是平均照顾所有错误,而是优先防范“未知被当成已知”这一类高风险错误。人工预算不是随机撒出去,而是集中投到最可能让系统过度自信的位置。
三、第二步:医生不用理解模型术语,只需确认临床范围
论文设定中,医生不需要判断某个抽象的“模型分布”。他们提供的是自己熟悉的诊断类别,或判断该病例是否属于系统预先规定的适用范围。系统再按照既定类别表,把反馈转换为“范围内”或“范围外”。
例如,一个模型获准辅助识别四类皮肤病。医生确认新病例属于其中一类,它就进入已知病例缓存;医生认为这是第五类疾病,或图像根本不适合该模型处理,它就进入未知病例缓存。
这里有一个容易被标题数字遮住的细节:论文实验中的“医生反馈”由数据集已有标签模拟,并不是真实医生在前瞻性临床流程中实时操作。这样可以严格比较算法,但不能直接回答医生是否愿意使用、一次复核需要多久、不同医生意见不一致时怎么办。
尽管如此,这个任务定义仍然比“把整个测试集一次性拿给专家标完”更接近真实部署。样本按顺序到来,系统只能使用过去看到的数据和过去获得的反馈,不能提前偷看后续病例。当前病例的反馈也只用于未来病例,不会回头美化当前结果。
论文把人工复核总量限制为测试病例的5%。如果一共有一万张图,最多询问五百次。这项约束迫使算法回答一个真正有工程价值的问题:不是“有人无限帮忙时能多准”,而是“专家时间很贵时,哪些问题最值得问”。

四、第三步:用两个小记忆库校准后续分数
医生确认后,系统保存的不是原始图片列表,而是模型为图片提取的特征。可以把特征理解为一串压缩后的数字,它描述病灶纹理、形态和语义信息。已知病例放进一个缓存,未知病例放进另一个缓存。
新病例到来时,系统分别寻找它与两类缓存中最相似的样本。如果更接近医生确认过的已知病例,就把分数往“可接受”方向推一点;如果更接近确认过的未知病例,就把分数往“需要警惕”方向拉一点。
论文先计算两个最大余弦相似度:一个来自已知缓存,一个来自未知缓存。两者之差记为δ。这个差值是软校准项,因为它会连续地、小幅度地改变基础检测分数,而不是立刻翻转结果。
但有些病例与历史确认样本非常相似,只做小调整可能不够。于是系统又加了一道“语义可信门”:只有最高相似度超过0.8,才启用更明确的硬校准项。更接近已知缓存就加分,更接近未知缓存就减分。
最终分数由三部分组成:基础检测器原来的分数、相似度差带来的软调整,以及高可信匹配触发的硬调整。软调整的权重在主要实验中设为0.08。
这套机制没有重新训练网络,也不改变图像编码器。它只在决策最后一公里加入人类确认过的参照物。优点是轻量、可叠加在多种检测器上;代价是它非常依赖缓存里的反馈是否可靠,以及后续病例是否与缓存中的病例具有可比较的特征。
一个形象的类比是机场安检。原来的设备先给每件行李打风险分;遇到边界案例时,安检员开箱确认。以后看到与已确认危险物高度相似的图像,系统会提高警报;看到与已确认普通物品高度相似的图像,则减少不必要的误报。机器没有被拆开重装,但它的判断多了一层可追溯的人类经验。
五、四个医学图像基准,究竟测了什么
团队在四个医学图像基准上进行实验,覆盖皮肤病、皮肤镜、结直肠组织和乳腺组织图像。四组数据的图像来源、类别数量和病理形态不同,因此比只在单一数据集上验证更能说明方法是否具有通用性。
其中,皮肤病数据把40个类别作为模型熟悉范围,其余158类作为未知类别;皮肤镜数据选取四类常见病变作为已知范围,另外四类作为未知范围。结直肠和乳腺组织数据则使用既有研究中的多组已知与未知划分,并对结果取平均。
所有方法使用相同的五十层残差网络作为骨干,避免把更大的模型误当成算法进步。基础守门员既包括最大置信度、能量分数、激活修正和分数间隔等静态方法,也包括在线线性适应、动态类别缓存和动态字典等测试时方法。
论文采用两个常见指标。整体识别指标(AUROC)衡量系统把已知和未知样本排序分开的整体能力,数值越高越好。高风险误报指标(FPR95)表示在找回95%已知样本时,有多少未知样本被错误接纳,数值越低越好。
对医疗安全来说,第二个指标尤其直观。系统为了不漏掉太多正常适用病例,通常不能把门槛设得过严;这时仍有多少陌生病例混进来,决定了守门员是否真正减少了高风险误用。
六、最关键结果:75.53%升到81.85%,误报降了12.37个百分点
以论文中表现较强的动态字典检测器为基础时,四个数据集的平均识别能力为75.53%,平均误报率为72.63%。加入完整的人机协同框架后,识别能力提高到81.85%,误报率降到60.26%。
换句话说,在只复核5%样本的实验设定下,整体区分能力提高6.32个百分点,高风险误接纳指标降低12.37个百分点。这不是把某一个数据集的最好数字挑出来,而是四个医学基准的平均结果。
不同数据集上的收益并不一致。结直肠组织数据改善最明显:误报率从51.31%降到22.36%,识别能力从83.73%升到93.99%。皮肤镜数据也有明显提升。乳腺组织数据的改善相对较小,说明反馈缓存并非在所有分布变化下都同样有效。

表2逐项开关三个组件。第一行是基础检测器,最后一行同时启用相似度软校准、风险感知选择和高可信硬校准。最后一行获得60.26%的平均误报率和81.85%的平均识别能力,说明三部分共同工作时最好。
消融实验还能回答“到底是医生反馈有用,还是挑样本有用”。随机挑样本并只做软校准时,识别能力从75.53%升到76.82%,有帮助但幅度有限;加入风险感知选择后升到78.77%;再组合软、硬两种校准,才达到81.85%。
这说明人类反馈不是天然有价值。把医生时间花在一眼就能判断的简单病例上,留下的信息可能高度重复。真正产生增益的是三件事的组合:找对病例、记录可靠特征、在足够相似时才更果断地修正。
论文还设计了一个伪标签对照:不使用医生确认,而让模型自己生成标签,再执行相同的软硬校准。它的平均识别能力为76.11%,明显低于真实标签模拟得到的81.85%。这提醒我们,模型自我确认并不能等价替代外部可靠监督。
七、它不是只对一种守门员有效
一个实用模块不能只在作者最喜欢的基础方法上有效。论文把这套校准分别叠加到最大置信度、能量分数、激活修正、分数间隔和在线线性适应五种检测器上,平均识别能力都得到提升。

左图中蓝柱是五种基础检测器,红色斜纹柱是加入该框架后的结果,五组均提高。右图比较不同反馈比例和风险区间方向;把询问集中在边界右侧,也就是更容易被当成已知病例的一侧,整体更稳定。
在线线性适应的基础识别能力最低,为68.98%,加入该框架后升到76.40%;能量分数从73.90%升到78.85%;激活修正从75.66%升到78.50%。这支持了作者“即插即用”的说法:它更像一个附加校准层,而不是只能与某个专用模型绑定。
反馈预算曲线也很有启发。随着人工反馈从几乎为零增加到1%左右,表现提升最快;之后继续增加,收益开始趋于饱和;超过5%后,新增样本带来的改善很小。原因可能是风险区间中的病例逐渐重复,缓存已经覆盖了主要模式。
这正是论文最值得借鉴的工程结论:人类反馈的瓶颈未必只是数量,更可能是信息分配。如果前1%的复核就能覆盖关键错误模式,再把预算翻几倍,不一定获得同等回报。
八、参数会不会一换就崩
方法中有三个容易让人担心的参数:软校准权重、风险区间使用的分位数,以及触发硬校准的相似度门槛。如果结果只在某一个精心挑选的组合上成立,部署价值会大打折扣。

图4分别改变软校准权重、风险区间分位数和语义相似度门槛。蓝线越高越好,红线越低越好;虚线是最佳基础方法。较宽参数范围内,两条曲线都优于虚线,但门槛过高时性能明显下降。
实验显示,软校准权重从0.05到1.0时整体保持优势;风险区间分位数从0.3%到4%时变化较小;相似度门槛在0.65到0.85附近比较稳定,但提高到0.95后明显变差。
直觉上也说得通。门槛过低,系统可能把并不相似的病例当成强证据;门槛过高,大多数病例都无法触发明确修正,医生反馈就只剩很弱的作用。论文选择0.8,是在谨慎和利用率之间取平衡。
不过,参数稳定不等于医院之间无需重新校准。不同设备、疾病谱和工作流程会改变特征相似度的含义。真正部署时,应该在本院回顾性数据上预先确定合理范围,并持续检查缓存是否出现类别偏置。
九、放到研究演进中,它补上了哪一环
2020年的能量分数方法,核心是给预训练分类器设计一个比最大置信度更可靠的异常分数。它回答“机器怎样自己打分”。这篇新工作没有取代能量分数,反而把它作为可接入的基础检测器之一,再用少量人工确认继续校准。
2024年的在线线性分布外检测方法发现,检测分数与网络特征之间存在可利用的线性趋势。它可以根据测试数据做简单线性回归,并提供在线版本,回答“机器怎样利用数据流自动适应”。新论文与它的主要差异是:不只相信无标签统计规律,而是把少量医生确认作为决策依据。
同年关于数字病理的系统评测,则把问题拉回真实医疗数据:语义上全新的疾病与医院、染色、扫描条件造成的协变量变化并不是一回事,检测器在不同变化下的表现也可能完全不同。它回答“现有守门员在医学图像中究竟哪里会失效”。
把这三条路线连起来,可以看到清楚的演进:先设计更好的异常分数,再让系统适应测试数据,接着在医疗场景中识别真实失败模式;这篇工作进一步追问,当自动适应不够让人放心时,怎样把专家判断插入数据流,而且不让人工成本失控。
它真正补上的不是又一个更复杂的分类器,而是一种协作协议:机器负责筛出最值得问的病例,医生只回答临床上熟悉的问题,系统把回答变成后续可使用的局部记忆。
十、离真实临床使用,还有四道坎
第一,实验中的人工反馈来自数据集标签模拟。真实医生可能意见不一致,也可能无法立即确认罕见病例。反馈延迟、错误标签和多专家冲突都会改变缓存质量,而论文目前假设每次反馈都是可靠答案。
第二,四个基准虽然覆盖皮肤和病理图像,但仍是整理过的研究数据。真实医院的数据流会出现设备升级、成像协议变化、图像压缩、转诊人群变化和多种异常同时发生。一次性随机顺序实验无法完全复现这些长期变化。
第三,系统使用最近邻相似度传播医生判断。如果一个新疾病在特征空间里恰好靠近已知疾病,错误参照可能被放大。缓存规模虽受5%预算约束,但怎样淘汰过时样本、保护患者隐私、避免某类病例占满缓存,仍需工程设计。
第四,论文验证的是“守门员能否更好地区分范围内外”,不是最终诊断准确率,也不是患者结局。识别到模型不熟悉,只意味着应该转人工或切换流程,并不等于系统已经知道陌生疾病是什么。
官方代码仓库已经建立,但仓库说明显示完整实现和评测流程计划在2026年底进一步发布。现阶段可以核验论文、结果与仓库入口,但还不能把完整复现当作已经完成的事实。
十一、龙哥点评:医疗AI需要的不是“永不求助”,而是“知道何时求助”
很多人工智能产品把减少人工介入当成唯一进步方向。但在医学、自动驾驶、金融风控等高风险领域,完全不求助往往不是成熟,而是系统没有意识到自己正在越界。
这篇论文最值得肯定的地方,是把医生时间当成稀缺资源认真建模。它不喊“让医生参与”这种正确但空泛的口号,而是具体回答:什么时候询问、最多问多少次、答案存在哪里、怎样影响下一次决策。
从产品角度看,这比单纯把榜单提高几个点更重要。医院不只关心平均准确率,还关心谁来处理异常、系统何时升级、出了问题能不能回溯。一个保留原模型、只在分数层面吸收少量专家反馈的方案,更容易形成可审计的工作流。
但我也不会因为81.85%这个数字就直接说它可以临床落地。实验中的医生是标签替身,数据流是基准重排,完整代码仍待发布。真正决定价值的下一步,是让真实医生在真实时间压力下使用,记录复核耗时、分歧率、漏报类型和长期漂移。
我的判断是:它不是一套已经完成临床验证的安全系统,而是一个很值得继续验证的人机协作框架。它把问题从“模型能不能完全替代医生”,转成“模型怎样把最需要医生的病例送到医生面前”,这个方向更诚实,也更可能真正进入工作流程。
对普通研究者也有一个可迁移的启发:当标注预算很少时,不要只研究怎样多拿几个标签,还要研究哪一个标签最能改变系统判断。高质量反馈的价值,往往来自位置,而不只是数量。
龙迷三问
第一问:为什么不让医生直接检查所有低置信病例?因为低置信不一定等于高风险。明显陌生的病例已经容易被拦截,最危险的是靠近边界、却偏向“已知”一侧的病例。论文把预算集中在那里,是为了优先减少陌生病例被错误放行。
第二问:5%人工反馈是不是意味着医生工作量很小?不能直接这样理解。5%只是实验预算比例,真实工作量取决于每日病例数、复核需要的信息、反馈时限和现有流程。若每天处理十万张图,5%仍然是五千次复核。
第三问:这种方法能用在医学图像之外吗?方法结构并不依赖某一种疾病,只要任务有连续数据流、可靠专家反馈、可比较的特征和明确适用范围,就可能迁移。但每个领域的风险方向、反馈成本和错误后果不同,不能直接照搬医学实验参数。
十二、如果把它做成产品,界面应该长什么样
一个真正可用的版本,不能只在后台输出“请复核”。它至少需要给医生展示原始图像、模型当前判断、进入复核队列的原因,以及与哪些历史确认病例相似。医生不必看到复杂公式,但应该知道系统为什么在此刻犹豫。
复核队列也不应简单按先来后到排列。除了边界距离,还要考虑疾病严重程度、等待时间、患者状态和科室容量。同样是模型不确定,疑似恶性病变与普通图像质量问题的处理优先级显然不同。论文解决了算法层面的样本选择,临床产品还要把医疗优先级接进来。
对医生而言,反馈动作也必须足够轻。理想界面不是要求重新填写一份完整诊断报告,而是复用原有阅片结论,让医生用一次确认就完成范围判断。若系统为了获得一个标签,反而让医生在多个页面之间切换、重新查找病史,节省下来的算法预算会被交互成本抵消。
医生提交答案后,系统应保留反馈时间、适用范围和版本信息。若后续模型升级、设备更换或疾病类别表调整,旧缓存不能不加判断地永久使用。最稳妥的做法是让每条反馈都有生命周期,并定期检查它是否仍然代表当前环境。
对管理者而言,还要单独观察两类数字:系统每天请求多少次复核,以及这些复核实际纠正了多少高风险错误。前者代表成本,后者代表收益。只看最终平均分,可能掩盖某个科室被频繁打扰,也可能掩盖某类罕见病一直没有进入缓存。
还需要一个清楚的退出机制。当连续一段时间出现大量边界病例,或者未知样本比例突然升高时,系统不应只增加询问次数,而应提示管理者:当前数据可能已经整体偏离模型适用范围,需要暂停自动判断、重新验证或切换到人工流程。
因此,这项研究更适合作为安全工作流中的一层,而不是独立承担诊断。它前面需要图像质量控制,后面需要人工复核、升级管理和事件追踪。只有这些环节连起来,5%的反馈预算才会从论文中的漂亮数字,变成真正节省医生时间又降低风险的机制。
本文基于龙哥读论文PaperDaily数据库及PaperMiner的MCP进行汇总整理。本文为论文解读与个人学习笔记,不构成任何论文审核意见,及对产品能力、安全性或商业可用性的保证。
