ARTICLE · 1051873
拿到一张临床 Excel,第一步到底应该看什么?
拿到一张临床 Excel,很多人的第一反应是:
接下来做什么统计?
t 检验?
卡方检验?
Logistic 回归?
ROC?
随机森林?
先别急。
真正决定后面分析能不能做下去的是这张表本身。
第一步,先把数据看懂。
一张 Excel,先看这 5 件事
假设你现在拿到一份临床数据:

先不要建模型。
建议依次看下面 5 个问题。
01 这一行、这一列分别代表什么?
最基础,却非常重要。临床数据通常应该满足:
一行 = 一个研究对象
一列 = 一个变量
例如:
年龄:一个变量
性别:一个变量
BMI:一个变量
是否复发:一个变量
但真实数据经常不是这么干净。
比如:
一个患者出现了多行;
同一个指标拆成多个位置;
“年龄+性别”写在一个单元格;
随访数据和基线数据混在一起。
这时候,后面的分析方法很容易选错。
所以第一眼先问:我的研究对象是谁?一行数据究竟代表什么?
02 哪个是结局变量?
这是后续统计分析的核心。你最终想解释什么?
例如研究:哪些因素与术后并发症有关?那么:“是否发生术后并发症”就是结局变量。如果研究:哪些因素与住院时间有关?那么:“住院时间”就是结局变量。
如果研究:哪些因素影响患者生存?那么通常需要:生存状态 + 生存/随访时间。先找到结局变量,后面的统计路径才会逐渐清晰。
03 每个变量到底是什么类型?
这是统计方法选择最重要的一步之一。临床数据可以先粗略分成两大类:
连续变量
可以直接测量的数值,例如:
年龄
BMI
血压
血糖
CRP
住院时间
这些变量后面通常还要进一步看:分布是否偏斜、有没有异常值、是否近似正态分布。
分类变量
表示类别,例如:
男 / 女
有 / 无
阳性 / 阴性
死亡 / 存活
A方案 / B方案
这一步非常重要。因为后续很多统计方法,本质上都取决于:你的变量属于什么类型。
例如:
连续变量两组比较,可能涉及 t 检验或非参数检验;
分类变量比例比较,可能涉及 χ² 检验或 Fisher 精确检验;
二分类结局进一步分析危险因素时,常见方法是 Logistic 回归;
涉及随访时间和事件结局时,则可能进入生存分析。
04 有没有缺失值和异常值?
这是拿到临床 Excel 后非常容易忽略的一步。比如:

这里已经出现两个问题:一个 BMI 缺失;另一个 BMI = 238。238 是真实值?录入时少了一个小数点?还是单位出了问题?
如果不检查,后面的均值、回归分析甚至模型结果都会受到影响。所以拿到数据后,至少要检查:
每个变量缺失多少;
有没有明显超出生理范围的值;
单位是否统一;
编码是否统一;
有没有重复患者。
05 数据是怎么编码的?
临床 Excel 中有一类问题特别常见:人看得懂,统计软件不一定看得懂。例如“性别”这一列可能同时出现:
男
女
Male
Female
1
0
M
F
在研究者眼里都能理解。在数据分析里,它们可能被识别成不同类别。再比如:“是否吸烟”这一列里同时出现:
是
否
有
无
Y
N
1
0
所以在数据分析之前,需要先统一编码。
所以,拿到 Excel 后真正的第一步是什么?
可以记住一个非常简单的顺序:看结构 → 找结局 → 分变量 → 查缺失 → 查异常。把这五步做完,你基本就知道下一步该往哪里走了。接下来才轮到:选统计方法。
拿到 Excel,可以先给自己做一次“数据体检”

一句话记住:临床 Excel 拿到手,先别急着跑模型。
先回答三个问题:我的结局是什么?我的变量是什么类型?我的数据干净吗?等这三个问题弄清楚之后,t 检验、卡方检验、Logistic、Cox,甚至机器学习,才真正有意义。
如果 Excel 很复杂怎么办?
真实临床数据往往有几十甚至上百个变量。人工逐列检查:缺失值、异常值、变量类型、分布、相关性……本身就是一项很耗时间的工作。
这也是刀客轻研希望解决的问题之一。
在刀客轻研上传临床数据后,可以进一步完成数据解析、统计分析和可视化,帮助研究者把更多时间留给真正重要的问题:
这份数据,到底能回答什么临床问题?
刀客轻研
从选题到统计,让临床回归研究本身。

点击「阅读原文」,一键直达刀客轻研官网,开启高效新范式!