
AI制药圈最近出了个大新闻,而且是那种“打脸”型的。
微软在《Nature Methods》上发表了一篇论文,直接给现在最火的“AI虚拟细胞”敲了一记警钟:
你以为数据越多模型越强?在虚拟细胞这里,根本不成立。
也就是说,行业从100万卷到上亿细胞数据的大战,可能全走错了方向。

微软做了什么实验?

微软的Project Ex Vivo团队搞了一个大规模测试。
他们用了一个包含2220万个细胞的巨型数据集,训练了400个不同的单细胞基础模型,做了6400组实验。
结论很扎心:
只用了全部数据的1%到10%,模型性能就已经涨不动了。再往上堆更多的数据,效果几乎没有变化。
更惨的是,有些花大价钱搞出来的复杂模型,表现还不如那些简单到掉渣的传统算法。
翻译成人话:在AI虚拟细胞这件事上,大力出奇迹,可能真的行不通。
问题出在哪?不是数量,是多样性

那微软的团队认为关键是什么?
不是数据的数量,而是细胞状态的“多样性”。
什么意思呢?你可以这么理解:
如果你想把全中国所有人的照片拿来训练一个AI。光是堆100亿张自拍,但全都是20岁年轻人的脸,那这个AI永远不知道老人长什么样、小孩长什么样。
虚拟细胞也是这个道理。 你光有海量的细胞数据不够,关键是你得覆盖细胞在不同状态下的样子——健康的、生病的、用药后的、耐药后的……
如果这些“多样性”不够,数据再多也是白搭。
项目负责人打了个比方:别光顾着堆数据了,得找一个“算力-数据-参数量”的黄金平衡点。
一个让大厂尴尬的发现
这篇论文里还有一个特别扎心的对比。
微软的团队发现,在很多实际任务中,那些特别吃算力的复杂AI模型(比如Transformer),效果居然还不如一个几十年前的老算法——PCA(主成分分析)。
PCA是一种非常基础的统计学方法,简单、轻量、不费钱。
但结果就是:它和那些烧了无数显卡训练出来的大模型,打得有来有回,有时候甚至还能赢。
这就很尴尬了。说明现阶段很多虚拟细胞模型的“智能”,可能只是虚假的繁荣。你把算力撤掉,它可能还不如一个简单的数学公式。
AI制药
该从“拼规模”转向“拼精细”了

微软这篇论文,其实戳中了一个更大的问题。
过去几年AI圈子的习惯是什么?“更大就是更好”——更大的模型、更多的数据、更强的算力。在聊天、画画这些事上,这条路确实跑通了。
但到了生命科学,到了虚拟细胞,这条逻辑可能要改改了。
生物学的本质,不是“重复”,而是“变化”。
同一个细胞,在不同时间、不同环境、不同药物刺激下,状态是完全不同的。你不能只给它看一种状态的细胞,就指望它理解所有状态。
微软的研究其实给出了一个更务实的方向:与其花几个亿去堆数据,不如好好思考怎么用更聪明的办法,去捕捉细胞那千变万化的状态。
对于创业公司和投资人来说,这也是一个提醒。过去大家比谁的数据集大,以后可能要比特训数据“花样多”了。
谁能在有限的数据里,捕捉到更丰富的生物学多样性,谁才可能真正跑通AI虚拟细胞这条路。
夜雨聆风