乐于分享
好东西不私藏

AI虚拟细胞被微软判“死刑”?砸钱堆数据白费了,效果还不如老古董算法!

AI虚拟细胞被微软判“死刑”?砸钱堆数据白费了,效果还不如老古董算法!

AI制药圈最近出了个大新闻,而且是那种“打脸”型的。

微软在《Nature Methods》上发表了一篇论文,直接给现在最火的“AI虚拟细胞”敲了一记警钟:

你以为数据越多模型越强?在虚拟细胞这里,根本不成立。

也就是说,行业从100万卷到上亿细胞数据的大战,可能全走错了方向。

微软做了什么实验?

微软的Project Ex Vivo团队搞了一个大规模测试。

他们用了一个包含2220万个细胞的巨型数据集,训练了400个不同的单细胞基础模型,做了6400组实验。

结论很扎心:

只用了全部数据的1%到10%,模型性能就已经涨不动了。再往上堆更多的数据,效果几乎没有变化。

更惨的是,有些花大价钱搞出来的复杂模型,表现还不如那些简单到掉渣的传统算法。

翻译成人话:在AI虚拟细胞这件事上,大力出奇迹,可能真的行不通。

问题出在哪?不是数量,是多样性

那微软的团队认为关键是什么?

不是数据的数量,而是细胞状态的“多样性”。

什么意思呢?你可以这么理解:

如果你想把全中国所有人的照片拿来训练一个AI。光是堆100亿张自拍,但全都是20岁年轻人的脸,那这个AI永远不知道老人长什么样、小孩长什么样。

虚拟细胞也是这个道理。 你光有海量的细胞数据不够,关键是你得覆盖细胞在不同状态下的样子——健康的、生病的、用药后的、耐药后的……

如果这些“多样性”不够,数据再多也是白搭。

项目负责人打了个比方:别光顾着堆数据了,得找一个“算力-数据-参数量”的黄金平衡点。

一个让大厂尴尬的发现

这篇论文里还有一个特别扎心的对比。

微软的团队发现,在很多实际任务中,那些特别吃算力的复杂AI模型(比如Transformer),效果居然还不如一个几十年前的老算法——PCA(主成分分析)。

PCA是一种非常基础的统计学方法,简单、轻量、不费钱。

但结果就是:它和那些烧了无数显卡训练出来的大模型,打得有来有回,有时候甚至还能赢。

这就很尴尬了。说明现阶段很多虚拟细胞模型的“智能”,可能只是虚假的繁荣。你把算力撤掉,它可能还不如一个简单的数学公式。

AI制药

该从“拼规模”转向“拼精细”了

微软这篇论文,其实戳中了一个更大的问题。

过去几年AI圈子的习惯是什么?“更大就是更好”——更大的模型、更多的数据、更强的算力。在聊天、画画这些事上,这条路确实跑通了。

但到了生命科学,到了虚拟细胞,这条逻辑可能要改改了。

生物学的本质,不是“重复”,而是“变化”。

同一个细胞,在不同时间、不同环境、不同药物刺激下,状态是完全不同的。你不能只给它看一种状态的细胞,就指望它理解所有状态。

微软的研究其实给出了一个更务实的方向:与其花几个亿去堆数据,不如好好思考怎么用更聪明的办法,去捕捉细胞那千变万化的状态。

对于创业公司和投资人来说,这也是一个提醒。过去大家比谁的数据集大,以后可能要比特训数据“花样多”了。

谁能在有限的数据里,捕捉到更丰富的生物学多样性,谁才可能真正跑通AI虚拟细胞这条路。