人工智能正在深刻改变医疗健康领域,但算法偏见问题日益引发担忧——而偏见的根源往往藏在训练数据之中。数据集文档被公认为是实现负责任AI发展的关键一环。然而,现有的标准化文档方法是否真正适用于医疗数据集?它们的实际使用情况如何?一篇发表于npj Digital Medicine(影响因子18.0)的最新研究对此进行了系统性的分析与评估。
医疗AI的“数据黑箱”困境
人工智能(Artificial Intelligence)正在变革临床研究与医疗实践,从诊断到治疗策略无不深受影响。然而,大量研究已经发出警示:AI驱动的技术可能固化既有偏见,甚至引入新的偏见。AI模型产生偏见的一个关键来源,正是其用于训练的数据。例如,用于检测皮肤病的皮肤科AI模型在深色皮肤和非典型皮肤疾病上的表现往往较差,原因在于这些模型的训练数据偏向于浅色皮肤和常见疾病。
偏见可能在数据集生命周期的各个阶段被引入——从研究设计、数据收集到数据处理。影响因素包括特定群体在数据集中的代表性不足、数据聚合与标注方式的选择,以及研究团队本身的多样性缺失等。
用于训练AI模型的医疗数据集通常来源于临床诊疗或观察性研究,不可避免地受到原始场景的限制,例如研究目标、数据采集地点或可用资源等。因此,对于数据集生成者而言,完全消除可能导致算法偏见的因素并不现实。然而,他们可以通过透明、结构化的方式记录数据集的特征——如目的、动机、推荐用途和属性等——来支持AI模型的负责任开发,使下游用户能够更好地评估潜在局限性和偏见来源。
正是基于这一背景,2026年5月9日,Anna Heinke(第一作者)与Bhavesh Patel(通讯作者)领衔的AI-READI联盟在npj Digital Medicine(Nature出版集团旗下数字医学领域顶级期刊,最新影响因子18.0)发表了题为 “Dataset documentation for responsible AI: analysis of suitability and usage for health datasets” 的研究论文。研究团队来自加州大学圣地亚哥分校(UCSD)等多所机构,系统性地评估了五种主流数据集文档方法在医疗数据集中的适用性与实际使用情况。
五种数据集文档方法概览
目前,学界已提出了多种旨在提升AI开发透明度的数据集文档方法,主要包括以下五种:
1. Datasheet(数据表)
受电子行业元器件数据表的启发,Datasheet以一系列问题的形式呈现。其初稿于2018年以预印本形式发布,经过多个版本迭代后,最终版本于2021年12月正式发表。
2. Dataset Nutrition Label(数据集营养标签)
受食品饮料营养标签的启发,Dataset Nutrition Label旨在总结用于AI/机器学习开发的数据集的关键信息。第一代于2018年推出,2020年和2022年分别推出了第二代和第三代。该标签通过交互式面板呈现数据集的关键信息,并辅以图标和符号,形成视觉上直观的快照。
3. Accountability Documentation(问责文档)
这一方法受软件开发生命周期实践的启发,由三份文档组成,每份包含多个字段,用于记录数据集开发过程中各阶段的信息。其预印本于2020年10月首次发布,2021年3月正式发表。
4. Healthsheet(健康数据表)
Healthsheet是Datasheet针对医疗健康领域的改编版本。其预印本于2022年2月发布,2022年6月正式发表。值得注意的是,Healthsheet是唯一专门为医疗数据集开发的文档方法。其作者指出,现有的文档方法(如Datasheet)未能充分应对医疗数据特有的复杂性和伦理考量,这促使了Healthsheet的开发。
5. Data Card(数据卡)
Data Card是数据集关键信息的结构化摘要,于2022年4月以预印本形式发布,2022年6月正式发表。其设计目标是面向多元读者群体提升可理解性,促进在产品、研究和政策中对数据使用的知情决策。Data Card采用灵活、模块化的结构,可根据不同数据集的需要进行扩展。
这五种方法虽然在目标上具有共性——提升AI开发的透明度与问责性,但在侧重点和结构上存在显著差异。Datasheet和Healthsheet通过详细的、通常是开放性的问题鼓励批判性反思;Dataset Nutrition Label采用更具视觉化和交互性的设计;Accountability Documentation独特地应用了生命周期模型;Data Card则提供了简洁、模块化的描述结构。
内容对比——没有一种方法“完美适配”
研究团队将五种文档方法的模板逐一拆解为“元数据元素”(metadata elements),即描述所询问信息的简明语句。当一个问题或字段包含多个不同的信息点时,将其拆分为多个元数据元素;反之,当不同问题询问相同的高层信息时,则将其归并为同一个元数据元素。
通过这一系统化的比较方法,研究团队共识别出138个独特的元数据元素。其中,76个(55%)仅存在于五种文档方法中的某一种。
具体来看:
• Datasheet仅有1个独占元数据元素(2%),涉及记录数据集中个体可识别风险; • Dataset Nutrition Label有14个独占元数据元素(33%),包括文档创建者信息、关键词、数据集格式/结构、使用所需的领域知识等; • Accountability Documentation有21个独占元数据元素(43%),聚焦于数据及其收集的伦理影响、数据收集成本、相关数据集和文档的详细信息; • Healthsheet有12个独占元数据元素(18%),涵盖医疗数据集相关信息,如数据集代表的受试者数量、研究纳入标准、与研究参与者沟通使用的语言、数据收集国家、避免重新识别的策略等; • Data Card有28个独占元数据元素(53%),包括各数据字段的详细统计、异常值处理、数据集验证过程、数据集标注、与上游数据源的对齐等。

图1 | 将数据集文档方法的每个问题/字段分配为元数据元素的示意流程

图2 | 每种数据集文档方法中识别的元数据元素数量
在方法之间的重叠程度上,Datasheet与Healthsheet最为相似——Datasheet中98%的元数据元素可在Healthsheet中找到,而Healthsheet中69%的元数据元素可在Datasheet中找到。这反映了Healthsheet是在Datasheet基础上增加新元素而开发的。Datasheet与Dataset Nutrition Label之间也有明显的重叠。其他方法对之间的重叠均低于50%。

图3 | 数据集文档方法的比较(源文档方法中的元数据元素在目标文档方法中发现的百分比)
与STANDING Together推荐的差距
STANDING Together(STANdards for data Diversity, Inclusivity and Generalizability)项目制定了18项关于医疗数据集文档的推荐,以应对医疗数据用于AI开发时的偏见、代表性不足和不平等问题。这是目前针对数据生成者最为全面的指导框架。然而,STANDING Together并未提供数据集文档的结构指导,而是“邀请使用这些推荐的人考虑现有的文档工具,包括Datasheet或Healthsheet”。
研究团队将STANDING Together的51个独特元数据元素与五种文档方法进行了对比。结果显示:
• Healthsheet覆盖了51个元数据元素中的29个(57%) ,是所有方法中覆盖最多的; • Data Card覆盖最少,仅16个(31%); • 13个元数据元素在所有五种文档方法中均未出现,包括数据集创建者之间的利益冲突、减轻偏见的措施描述、数据标注过程可能引入的偏见描述等。
这一发现意味着,即便是专门为医疗数据集设计的Healthsheet,也未能完全满足STANDING Together的核心推荐。现有的文档方法在覆盖医疗AI数据集文档的关键需求方面,仍存在系统性缺口。
实际使用——引用虽高,落地寥寥
研究团队通过四种方法系统性地搜索了实际的数据集文档使用情况:(1)查阅每种文档方法的主要论文和资源;(2)查阅引用这些主要论文的文献;(3)在GitHub上搜索;(4)其他非定向搜索。共识别出3077份资源,手动筛选了919份。
最终,共发现260份数据集文档,涵盖了254个数据集。其中:
• Datasheet:176份(含11个医疗相关数据集) • Data Card:55份(含1个医疗相关数据集) • Dataset Nutrition Label:24份(含4个医疗相关数据集) • Healthsheet:2份(含2个医疗相关数据集) • Accountability Documentation:0份

图4A | 五种数据集文档方法的实际使用数量(含医疗相关数据集数量)
更令人警醒的是引用数据。以Datasheet为例,在1888篇引用Datasheet论文的资源中,研究团队能够获取并分析1332篇,手动筛选了其中246篇(因包含Datasheet相关关键词两次及以上),而仅有64篇实际包含或提及了Datasheet——占所有分析资源的不足5%,占手动筛选资源的不足26%。

图4B | 每种文档方法论文的引用数量、符合纳入标准的数量、关键词筛选后全文阅读的数量,以及全文阅读中包含或提及该文档方法的数量
这些数据揭示了一个严峻的现实:尽管这些文档方法被大量引用,且支持负责任AI发展的需求已被广泛认可,但它们的实际应用仍然非常有限,在医疗数据集方面几乎处于空白状态。
调查结果——生成者嫌“难”,消费者觉得“有用”
为进一步了解这些文档方法在医疗数据集中的使用情况和实用性,研究团队在2024年7月至9月期间对两类领域专家进行了调查:(1)数据生成者——收集或生成医疗数据的人员;(2)数据消费者——使用医疗数据集开发AI模型的人员。
共有29名参与者完成了调查:5人(17%)为数据生成者,14人(48%)为数据消费者,10人(35%)兼具双重身份。

图5 | 调查参与者对数据集文档方法的熟悉程度
熟悉度方面:大多数参与者(86%)此前曾听说过至少一种数据集文档方法。Datasheet是最广为人知的——90%的参与者听说过,59%曾准备或使用过。相比之下,Accountability Documentation最不为人知——仅21%听说过,10%曾准备或使用过。
准备难度方面:在24份有效评估中,42%对准备文档的总体难度持“中立”态度,25%认为“困难”。Datasheet获得最高比例的“容易”或“非常容易”评价(60%) 。其他方法获得“容易”或“非常容易”评价的比例均低于40%。值得注意的是,Accountability Documentation的4份评估中,没有任何一份评为“容易”或“非常容易”。在分项评估中,所有文档方法都有多个部分被至少一份评估评为“困难”或“非常困难”。
实用性方面:在45份有效评估中,82%将文档方法的总体实用性评为“有用”或“非常有用” 。所有方法的“有用”或“非常有用”评价均超过70%,其中Healthsheet达到100%,Datasheet达到90% 。在分项评估中,所有文档方法的大部分部分都被50%以上的评估评为“有用”或“非常有用”。
信息缺口方面:参与者指出了各文档方法在支持负责任AI发展方面的不足:
• Datasheet:缺少全面的人口统计学信息、数据集版本控制、采样过程、数据偏差与公平性考量、模型特定使用警告、数据集使用历史、用户反馈机制、IRB协议和知情同意程序等; • Dataset Nutrition Label:缺少偏差识别与缓解策略、详细的人口统计细分、伦理审批、知情同意、环境与社会背景、缺失数据原因、数据分布指标的清晰呈现等; • Accountability Documentation:缺少上下文引用、核心透明度要素(如人口统计和仪器信息)、明确的偏差缓解措施、伦理合规测试等; • Healthsheet:缺少对缺失数据模式的全面报告、偏差缓解步骤、伦理审批、同意流程、数据谱系、安全考量、适当和不适当使用的明确指导; • Data Card:缺少健康的社会决定因素、弱势群体保护、数据集可推广性与局限性、伦理审查与同意细节、潜在偏见来源、引用指南、缺失数据及原因的文档。
为什么文档方法“叫好不叫座”?
研究团队在讨论中指出,文档方法实际采用率极低的原因是多方面的,涉及激励机制、基础设施、监管和文化等多重因素。
首先,缺乏职业或经费激励。据研究所知,目前没有任何与透明数据集文档相关的职业发展或经费激励,使得文档编制在很大程度上成为自愿行为。
其次,准备文档需要大量时间、专业知识和机构资源。研究团队在亲自为AI-READI数据集准备Healthsheet时就深有体会——需要超过15人参与,耗时超过2个月才最终完成。AI-READI是美国国立卫生研究院(NIH)Bridge2AI项目创建的多模态数据集,包含来自约4000名2型糖尿病或有患病风险参与者的眼科影像、生理测量、可穿戴传感器数据和调查问卷。
第三,监管指导不足。现有推荐通常以非约束性的最佳实践形式呈现,缺乏强制执行力。
第四,文化因素。数据生成者中盛行的文化规范倾向于优先追求快速创新和发表成果,而非数据共享和系统化的数据文档编制,导致标准化文档方法未能充分嵌入常规数据工作流程。
建议与展望
基于上述发现,研究团队提出了三项关键建议:
第一,建立标准的医疗数据集文档方法。该方法应完全覆盖医疗数据的需求,特别是STANDING Together推荐中所传达的内容。
第二,提高认知度并建立激励机制。需要资助机构、数据存储库和学术期刊制定明确的指南。
第三,开发自动化工具以降低文档编制的负担和复杂性。目前,研究团队已在GitHub上公开了其分析代码,为后续工具开发奠定了基础。
研究局限性
研究团队也坦诚地指出了本研究的局限性:
• 将文档方法和STANDING Together推荐拆分为元数据元素的过程涉及解释性判断,可能无法完全捕捉文档方法呈现和意图的所有细微差别; • 实际使用分析聚焦于已发表的引用和GitHub,可能低估了在工业界或内部学术环境中的使用; • 调查样本较小,可能无法全面反映医疗数据生成者和消费者的多元视角。
结语
在AI日益深入医疗领域的今天,数据集文档已不再是一个可有可无的“附加项”,而是负责任AI发展的基石。这项研究以详实的数据揭示了当前五种主流文档方法在医疗数据集中的适用性差距与实际使用困境——尽管数据消费者普遍认为这些文档“有用”,但数据生成者却普遍感到“难做”;尽管论文被大量引用,但实际应用寥寥无几。
从AI-READI项目耗时两个月、动员15余人的亲身经历,到STANDING Together推荐中13项关键信息在所有方法中均告缺失的系统性分析,这项研究为医疗AI社区敲响了警钟。建立标准化的医疗数据集文档方法、完善激励机制、开发自动化工具——这三项建议不仅是学术呼吁,更是医疗AI走向负责任发展的必经之路。
夜雨聆风