研究人员开发了一种工具,用于发现用于训练医疗人工智能的海量数据集中隐藏的问题。该工具会搜索训练数据,寻找可能导致人工智能模型得出错误结论的细微模式,从而潜在地危及患者护理。这项工作旨在帮助研究人员和监管机构提高人工智能在实际临床应用中的可靠性和可信度。

“驱动精准医疗的模型会学习从训练数据中推断临床结果。在很多情况下,这种方法效果很好,但也可能导致一些不易察觉的有趣缺陷,”约翰·霍普金斯大学人工智能辅助医疗专家、资深作者马蒂亚斯·昂贝拉斯 (Mathias Unberath ) 说。“我们开发的这款工具可以让你清楚地了解哪些元数据元素最容易导致模型产生偏差。”
这项研究是约翰·霍普金斯大学与美国食品药品监督管理局合作完成的,最新发表在《npj数字医学》杂志上。
“聪明的汉斯现象”指的是一匹名叫汉斯的马,它在20世纪初因能用蹄子敲出正确的数学答案而闻名。但事实证明,汉斯其实并不会算数,它只是非常擅长解读人类的肢体语言,无意中就能知道该如何回应。
Unberath 表示,医疗人工智能模型可能很像 Hans,通过解读错误的信号得出结论。
“模型都会走同样的捷径,”他说道,并指出人工智能经过训练,可以通过观察眼睛来准确预测一个人的性别。结果发现,该模型依赖的是睫毛膏,而不是任何生物学特征。
“我们训练模型使其具有最强的预测能力,但我们对模型用于进行预测的内容没有任何控制权。”
该团队的工具可以检测出这种潜在错误关联。
虽然其他人已经根据人工智能模型的表现建立了保障措施,但这种名为“通用属性效用和可检测性引起的偏差测试”(简称 G-AUDIT)的新工具,会检查训练数据本身,以寻找模型可能从无意的线索而不是具有临床意义的信号中学习的迹象。
“最令人兴奋的是,这改变了我们做事的方式,”论文合著者、约翰·霍普金斯大学昂贝拉斯实验室的博士生米切尔·帕夫拉克说。“我们不再事后检查工作,而是分析数据,找出可能存在的问题。”
G-AUDIT 识别并排序数据中可能导致 AI 得出错误结论的属性。
研究人员使用包括图像、文本和电子表格在内的多种医疗数据对该方法进行了测试。结果显示,该方法揭示了数据收集、成像条件以及其他可能导致对患者健康状况得出错误结论的因素中存在的隐藏缺陷。
例如,一个皮肤癌数据集包含了来自一家服务于高危人群的癌症诊所的图像,以及来自一家接诊癌症病例较少的普通皮肤科诊所的图像。由于两家诊所的成像系统质量参差不齐,基于该数据集训练的人工智能可能会错误地推断出相机质量是癌症的关键预测因素。甚至可能错误地认为图像中出现标尺可以预测癌症,因为癌症诊所倾向于在图像中加入标尺来追踪肿瘤随时间的变化。
“想象一下,如果把这个算法应用到现实世界中,用智能手机摄像头进行测量,”昂贝拉斯说。“没有尺子,摄像头质量也完全无关紧要。但模型却学会了把‘尺子’和‘摄像头’联系起来。这样一来,你就造成了健康差距。”
该团队计划继续完善和扩展该工具,他们表示该工具可以应用于医疗保健以外的领域。
“最核心的一点是,目前人们都在审核模型,但他们并不真正知道应该审核什么。我们正在改变这种状况,”昂贝拉斯说。“如果你只审核那些你最先想到的东西,你很可能会错过很多可能导致虚假相关性的因素。”
参考文献
Detecting dataset bias in medical AI using a generalized and modality agnostic auditing approach

夜雨聆风