夜雨聆风学习资料网

ARTICLE · 1083166

97.5% 的准确率,可能什么都没说明

97.5% 的准确率,可能什么都没说明

「97.5%」——这是一个足够漂亮的数字。

如果一篇论文告诉你,某个 AI 判断细胞类型的准确率到了 97.5%,你大概会觉得:这事基本成了。但今年 9 月的一篇预印本把这个数字放到显微镜下,发现它盖住了一件更要命的事:模型在最罕见、也最可能致病的那些细胞类型上,系统性失败。

这不是孤例。

最近三个月,至少三篇论文从不同角度指向同一个问题:生物医药 AI 报告的高分,常常测的不是你以为的东西。

一、97.5% 掩盖了什么

论文:Rethinking Class Imbalance for Single-Cell Foundation ModelsarXiv:2609.23325 | 2026-09-20

作者在三个主流单细胞基础模型(scGPT、scBERT、Geneformer)、三个数据集、六种长尾损失函数上,跑了 162 组受控训练。

结论有三层。

第一层:整体准确率最高 97.5%,但整体准确率、Macro-F1、罕见类召回率之间的鸿沟,在全部九种「架构 × 数据集」组合里都稳定出现——说明问题来自数据结构,不是预训练。

第二层:罕见类的失败分成两种,而且在选损失函数之前就能看出来。

·  一种是「可救的」:合适的损失函数能把它捞回来

·  另一种是「没救的」:这类细胞在嵌入空间里明明线性可分,却在所有损失函数、所有架构下,都被吞进无关类别的邻域

第三层,也是最实用的一条:对「可救」的那一类,重加权管不管用,取决于这个类的绝对样本数,而不是它在数据集里的占比,也不是整个数据集的不平衡比例。

翻译成人话:如果你的罕见细胞只有几十个样本,换个损失函数救不了你。你得回去补数据。

作者给的实用建议是:Class-Balanced Loss 和 LDAM 在九种设置下表现最稳,而 logit adjustment 是拿罕见类的精确率换召回率,不是两边都变好。

二、换一台扫描仪,冠军掉到第十

论文:Can You Trust Frozen Hematology Foundation Models under Acquisition Shift?arXiv:2608.25148 | 2026-08-25

血液细胞形态学是 AI 落地最快的场景之一。这篇论文审计了 15 个冻结编码器(血液学、病理、通用视觉),横跨四个公开采集域。

域内的结果,漂亮到不真实:线性探针 macro-F1 达到 0.98–0.997。

然后换数据集。

macro-F1 掉 34%–72%,排名整个重排。

域内第一的 DinoBloom-L,在最偏移的目标集上掉到 15 个里的第 10 名,输给通用视觉编码器和病理编码器。

更麻烦的是校准。

源域训练的探针,域内几乎完美校准(ECE 0.004);一到域外,自信地答错,ECE 直接飙到 0.35。而温度缩放这类常见的补救手段,基本迁移不过去。

论文还做了两件少见的事:

·  审计预训练曝光:发现 MLL23 其实是 DinoBloom 的内部队列。这意味着这个 benchmark 分不清「模型记住了」和「扫描仪偏移」

·  测试自适应方法:无标签自适应、基于边缘熵的模型选择,在类别均衡时看着安全,在真实的白细胞类别先验偏移下就失效

三、一个根本没在用你喂它数据的模型

论文:Discover, Falsify, RevisearXiv:2609.27234 | 2026-09-23

这篇最扎心。

虚拟细胞的目标,是预测细胞对扰动的响应。一个 agent 挑出来的模型,留出集 Global Pearson 相关系数 0.3153——看着有信号。

作者然后做了一件事:把化合物换成别的,预测几乎不变。

而一个完全不用化合物信息、只看对照组的基线模型,能拿到 0.3142。

也就是说,那个 0.3153 里的信息,基本不来自化合物。

作者接着审计了 48 个候选模型:替换化合物后,47 个预测会变;但只有 20 个在两个折上都显示出高于零的目标损失增益。

结论很锋利:预测能泛化,不代表「模型用了你给的输入」这个结论能泛化。

四、三篇论文打的其实是同一个靶子

放在一起看,它们指向的是同一件事。

把「分数」当成了「能力」。

·  第一篇:整体准确率 ≠ 罕见类能力

·  第二篇:域内分数 ≠ 临床可靠性,高置信 ≠ 高正确

·  第三篇:留出集表现 ≠ 用对了输入

对做生物医药 AI 的人来说,这意味着三件很具体的事。

1. 报告指标必须分层

整体准确率之外,把罕见类召回、跨域表现、校准误差一起报。不然你报的不是能力,是数据集的类别分布。

2. 做替换测试

把关键输入换掉,看预测是不是真的变了。这是最便宜、也最有效的伪相关探测器。

3. 分清「记住了」和「学会了」

审计预训练曝光,这一步绕不过去。

五、需要说清楚的话

这三篇目前都是 arXiv 预印本,未经同行评议。样本规模和 benchmark 覆盖面都有限,结论不应直接外推到临床。

但它们的价值恰恰在方法:提出的不是「某个模型不行」,而是「该怎么测」。

在一个模型分数越来越容易刷高的领域里,能提出更好的测法,比多刷两个点重要得多。

回到开头那个 97.5%。

它不是假数字。它只是回答了一个没有人在问的问题。

真正该问的是:在那 2.5% 里,有多少是罕见的、致病的、最需要被认出来的细胞?

相关学习资料