一张临床数据表:日期格式统一,诊断已经编码,空白格很少,甚至连颜色都整理好了。此时能直接跑回归、训练模型吗?未必。真正危险的问题往往不在单元格里:一行究竟代表患者还是住院,所谓“基线”是否发生在结局之前,没记录的结局又是否被当成“未发生”。
先给结论
Excel整齐只说明表格容易打开,不说明数据适合回答当前研究问题。 高质量数据至少要同时证明:研究对象选对了,变量含义没有漂移,缺失和异常可以解释,时间顺序成立,而且每次清洗和推导都能追溯、重现。
这里的“六道门”不是监管机构发布的统一评分表,而是依据常用数据质量、常规医疗数据报告和数据全生命周期原则整理出的审计框架。

表面整齐不等于研究可用;真正的质量审计要同时经过六类证据检查。
01 对象门:一行到底代表什么?
先锁定目标人群、纳排规则、分析单位和时间零点。一个患者多次住院、一次住院多次检查、同一样本重复检测,都可能制造“样本量变大”的假象。若预测问题以患者为单位,训练集和验证集还不能出现同一患者的不同记录。
02 定义门:同名变量真的是同一件事吗?
变量字典不能只有中英文名称,还应写清来源表、临床定义、提取算法、单位、允许值、编码版本和时间窗。“糖尿病”来自出院诊断、用药记录,还是一次血糖升高?“基线肌酐”是入院前、入院即刻,还是治疗后24小时内最低值?定义不同,回答的已不是同一个问题。

患者、住院、检查和样本不是可以互换的分析单位。
03 完整门:缺失少,不等于信息完整
缺失要看原因、位置和模式,不能只报总体比例。未开检查、检查未执行、结果未入库、链接失败,是四种不同问题;空值集中在某个病区、年份或病情较轻者,还可能形成选择偏倚。反过来,“0缺失”也要警惕默认值、999或“未记录=否”。

总体缺失率9.0%,却掩盖了普通病房13.4%与急诊4.0%的分层差异。
04 合理门:数值能成立,时间也要成立
质量检查至少包括取值范围、跨字段关系和纵向顺序。血氧饱和度105%、出院早于入院容易发现;更隐蔽的是把转入ICU后的化验称为“基线”,或把结局发生后才获得的信息放进预测变量。这样的时间穿越,格式再统一也会导致反向因果或信息泄漏。
05 来源门:每个关键值能追到哪里?
抽取、去重、单位换算、文本判定、数据库链接和人工修订,都应留下来源与变更记录。关键暴露和结局最好做分层源数据核对,不只随机抽几个“正常病例”。如果无法说明某个派生变量由哪些原始字段、哪版规则生成,就无法判断错误发生在哪一层。
06 重现门:换个人能否得到同一分析集?
冻结原始数据后,研究者应能依靠队列规则、变量字典、清洗代码和版本记录,重新生成同一纳排流程、同一变量和同一分析样本。靠复制粘贴、覆盖原值或口头约定完成的“最终版”,即使结果看起来合理,也很难复核。

原始记录、变量字典、清洗代码、版本记录和分析集应形成连续留痕。
教学情景案例:1260行,不等于1260名可分析患者
某教学情景拟研究“入院乳酸与30天不良结局的关系”。导出表有1260条住院记录,删除表面重复行后看起来很整齐。按去标识化患者ID审计发现:这些记录实际来自1084名患者;按“每名患者首次符合条件住院”重建后,预设入院2小时内有98人未测乳酸,其中普通病房78/584(13.4%),急诊20/500(4.0%)。在其余986人中,又有74人的首次乳酸发生在转入ICU之后,而“转入ICU”本身属于结局。因此,只有912人具有时间顺序成立的基线乳酸。
更关键的是,现有系统只记录本院事件,院外死亡和外院再入院无法识别。错误做法是把未记录一律填成“无结局”,再用插补补齐乳酸。合适修订是:按患者重建队列;把暴露限定为时间零点后2小时内且结局前的测量;分层说明缺失机制;补充可验证的30天随访或数据链接。若无法补充,就应把问题明确限定为院内结局,而不能继续声称研究了完整的30天结局。此时912只是“基线暴露有效”的人数,还不是已经通过全部质量门的最终样本。
不拿到原始数据,也能做的六问
阅读论文时,依次查:研究单位和队列流程是否清楚?暴露、结局的代码与时间窗是否公开?缺失是否按人群、机构或年份描述?是否报告重复、异常和时间逻辑检查?关键算法或数据链接是否验证?协议、字典、清洗方法或代码能否追溯?六问中若有一项只能靠猜,数据可信度就应相应下调。
三个常见误区
误区一|“没有空值,就是完整数据”
默认填0可能比空白更危险,因为它把未知伪装成阴性。
误区二|“随机核对10%就足够”
随机样本可能漏掉少见结局、特定病区和跨年份编码变化;核对应围绕关键变量和高风险层分层进行。
误区三|“通过数据质控,就能得到因果结论”
数据质量只是必要条件,不能消除混杂、选择偏倚、测量偏倚或错误研究设计。
风险边界
本文六道门是面向临床数据库研究的通用审计框架,不是适用于所有研究的法定阈值。观察性研究、注册研究和监管性临床试验的伦理、隐私、系统验证及留痕要求并不相同,应按研究类型和所在地现行规则执行。通过六道门不代表变量测量无误,也不能把统计关联自动升级为因果,更不承诺发表、录用或转化。
今天就做一件事
暂时别检查整张表。先选主要暴露和主要结局,各写一张“变量追溯卡”:对象、定义、来源、时间窗、缺失原因、验证方式。只要其中一格写不清,就先别跑主分析。
参考文献
1. Kahn MG, Callahan TJ, Barnard J, et al. A Harmonized Data Quality Assessment Terminology and Framework for the Secondary Use of Electronic Health Record Data. eGEMs. 2016;4(1):1244. doi:10.13063/2327-9214.1244
2. Benchimol EI, Smeeth L, Guttmann A, et al. The REporting of studies Conducted using Observational Routinely-collected health Data (RECORD) Statement. PLoS Med. 2015;12(10):e1001885. doi:10.1371/journal.pmed.1001885
3. U.S. Food and Drug Administration. Real-World Data: Assessing Electronic Health Records and Medical Claims Data To Support Regulatory Decision-Making for Drug and Biological Products. Final Guidance, July 2024.
4. International Council for Harmonisation. ICH E6(R3) Guideline for Good Clinical Practice. Final Consolidated Guideline, adopted 16 June 2026.
5. U.S. Food and Drug Administration. Electronic Systems, Electronic Records, and Electronic Signatures in Clinical Investigations: Questions and Answers. Final Guidance, October 2024.
更多专题|按研究问题继续阅读
02|临床病例数据库实操全教程
关于我们


夜雨聆风