夜雨聆风学习资料网

ARTICLE · 1039315

AI做医学分析|02基线表,先核对例数、均值和检验

AI做医学分析|02基线表,先核对例数、均值和检验

先看一张表:两组并排,年龄、性别、临床分期、几项化验指标,格子个个填得满满当当,p 值一列也齐,看不到一处报错。

它是 AI 跑的。数据洗干净了,列名报给 AI,让它写代码出基线表,几秒钟成品就在眼前。复制进论文的 Table 1,格式调一调,这件事就算交差。多数人不会停下来核它:格子全满、零报错,排得比手拼的还规整,挑不出毛病。

可偏偏是这份整齐,最值得多看两眼。真实数据总有缺失、总有偏态,一张每格都填满的表,多半是这两件事被代码一声不吭地办了,连个招呼都不打。

这里用一份 200 例的演示数据把两种跑法各跑一遍,问题刚好落在三处。

格子越满,越要多看一眼

先交代这份演示数据:200 例,两组(A 组 96 例、B 组 104 例),五个变量。肿瘤标志物一列我埋了 14 个缺失值,性别一列埋了 3 个。真实的回顾性数据里,某项指标本来就不是每个病人都测过。

接着让 AI 写代码,出一版「默认口径」的基线表,不额外提要求,拿到的就是这张:连续变量一律「均值±标准差」、一律 t 检验,分类变量一律卡方检验。表上每个格子都是满的。

格子为什么这么满?缺的人在表上没有记号,只让每一行的统计悄悄变了。既没有缺失计数,也不标有效例数;AI 只管把格子填满,缺失怎么处理,它不问。所谓「完整」,说穿了就是「没报」。

缺的人去哪了?只留在统计里

第一步核组 N。第一行两组相加,96 加 104 等于 200,与总例数对得上,说明分组列没有缺失,这行过。

但别停在这行。往下看每行自己的 n:性别这行有效例数 95 和 102,两下相加 197,有 3 个人在这行里没了踪影;标志物行 90 和 96,合计 186,少的正是那 14 例。

这是基线表最容易骗人的地方:第一行的 N 对了,后面各行未必都对。每一行统计的都是这一列有值的人,缺几例就漏几例。审稿人一句「标志物怎么只有 186 例」就能把你问住:整张表看不出任何缺过人的痕迹。

核对动作分两步:每行 n 逐行跟总数对;对不上的,回头数这列缺了多少、缺在哪一组。缺了 14 例不是问题,不知道缺了 14 例才是问题。

标准差比均值还大,这行该换报法

再看那项肿瘤标志物,默认口径给出 A 组 20.6±20.3、B 组 21.5±23.1。

两个数摆在一起,标准差比均值还大。偏到这个程度,均值已经说明不了典型水平:186 个值大多堆在十几以下,右边的长尾硬把均值从 14 顶到 21。心里想着「21 上下」去理解这组病人,第一步就走偏了。

正确报法是「中位数(四分位距)」:A 组 14.5(9.1~27.2),B 组 14.2(7.5~27.7),这才是典型病人的位置。

问题在于 AI 默认不问分布。代码里写一行均值±标准差,它就照给,数据再偏也照报。标准差大得离谱是表上唯一的线索,而审稿人最会抓这个线索:标准差比均值还大,十有八九,是偏态数据被硬塞进了均值这个描述方式。

这一步怎么核?看分布。画张直方图,或者干脆问它一句:这列偏不偏;偏的报中位数和四分位距,齐的才用均值±标准差。用哪种报法,你来定,别让代码替你做主。

检验方法,得跟变量类型对上

还是那项标志物,默认口径给的 p=0.785。换成秩和检验,跟数据形态匹配、不看均值只看排名先后的一种方法,p=0.935。同一份数据,检验一换,p 值跟着变。变量类型和检验对不上,p 值再精确也没有意义。

分类变量同样有这个问题。临床分期那行,A 组 IV 期只有 2 例,摊进四格表一算期望频数,最小的格子只有 4.8,够不着卡方检验要求的 5。默认口径给的是普通卡方,p=0.228;按规范该报 Fisher 确切概率法,小样本格专用的算法;这份演示数据用固定种子模拟 2 万次,算出的 p 是 0.236。两种报法结论都碰巧没翻,靠的是运气。

核这一处最简单:让 AI 把每个变量各自用的检验方法挨个报出来。你逐行对:分类的核卡方或确切法,连续的按形态挑 t 或秩和。你不问,它不会主动报;问了,它才会列出来。

顺带一条边界:随机化研究(RCT)的基线表,组间 p 值这一列不少期刊根本不让放:随机化做完,两组差异就谈不上「显著不显著」了。基线表的 p 值当不了合格章,「两组可比」轮不到它来证明。

核完三处,再把表贴进论文

回到那张满格子的表。它没有一处报错,每个数都是真的,只是每个数都是代码自作主张选了口径算出来的,它做决定的时候没问过你。

贴表之前,三处挨个过一遍:组 N 相加跟总数对、每行 n 跟缺失对、描述方式和检验方法跟变量类型对。核对这件事同样可以交给 AI,一句话的事:

「把表里每个变量用的描述方式和检验方法、每行的有效例数和缺失数,一并列出来。」

这句话不会让表变漂亮,但那些一直没被报出来的事,从这往后藏不住了。缺掉的人在表上不会出声,得靠你自己数出来。下回表跑出来,三处各核完再贴。

声明:本文由我独立撰写,所有观点、案例、数据及核心判断均由我本人提供并负责。AI仅梳理思路和辅助优化表达。

相关学习资料