乐于分享
好东西不私藏

AI赢了蛋白质,却算不出一颗细胞

AI赢了蛋白质,却算不出一颗细胞

AlphaFold拿下了蛋白质折叠,却连一颗细胞对药物的反应都预测不准。8月中旬,《Cell》给生成式AI出了15道世纪难题,题题戳在行业最疼的地方。

一、分子层的胜利,看起来很美

过去五年,生成式AI在生物领域拿下一连串战果:AlphaFold几乎终结了蛋白质结构预测,大模型能从头设计抗体和酶,医疗影像判读逼近放射科医生。这些成功有个共同点——研究对象是相对有序的线性序列,背后有PDB这类攒了几十年的大数据库撑着。

写下这些判断的人分量不轻:哥伦比亚大学Andrea Califano领衔,Biohub、斯坦福、卡内基梅隆、耶鲁的16位学者联名,不少是系统免疫学和单细胞测序的开创者。

但论文说得直白:这些胜利都发生在"分子层"。蛋白质能折叠、能设计,细胞不行。神经退行性疾病是神经元、星形胶质细胞和免疫细胞互动的结果,肿瘤的命运捏在微环境手里。会叠蛋白质的AI,离会算细胞的AI还差着十万八千里。

二、最先进的AI,输给了线性回归

2025年,EMBL学者Ahlmann-Eltze等人在《自然·方法》发了一篇"打脸"研究:把scGPTGeneformer等五个单细胞基础模型拉去和简单线性基线PK,预测基因扰动效应,结果没有一个模型赢。双重扰动预测里,所有模型的误差都高于"两个单基因效应直接相加"这种朴素算法。

Arc研究所2025年发起的虚拟细胞挑战赛同样残酷,考题明确对标CASP:在从未见过的H1人类胚胎干细胞上,预测300CRISPRi扰动下的基因表达变化,配套约30万个单细胞图谱。全球5000多人、114个国家、1200多个团队参赛,热情是真实的,结果却很现实——大多数模型在分布偏移面前溃败。后续的VCBench评测把五个主流模型全测了一遍:4个维度上,基线模型和基础模型打平甚至反超。更扎心的是,有研究拆开scGPTGeneformer的注意力权重看,发现它们学到的只是基因共表达,不是调控逻辑——拿基因方差排序这种土办法去预测,AUROC反而更高。

三、三道硬墙:数据、组合爆炸、刷分

为什么会这样?论文给出三层解释。

第一层是数据。语言模型拿数万亿个token喂大,生物数据满打满算只有101011次方个token,差着三个数量级。人类免疫组计划(HIP)把目标定在几十万个体、每人上万次测量,即便加上CellxGene的十亿单细胞图谱,和NLP的训练量比仍是杯水车薪。

第二层是组合爆炸。一个60S核糖体亚基的组装需要47种蛋白协同,按这个规模把基因调控基序和蛋白异构体排列组合,可能性是3.48×10150次方——宇宙里的原子数才1080次方。两万个基因做两两交互,就超过十亿种。这个空间不是靠堆数据和算力能硬啃下来的。

第三层最要命,是评价体系。现在发论文标配的"细胞分类"任务(比如区分CD8+CD4+ T细胞)生物学上近乎无意义——表面标记物早就够用,线性回归干得也不差。论文还算了一笔账:精度-召回曲线里,只有假发现率≤5%的区域对实验设计有用,剩下95%AUC曲线都是在自嗨。回顾性刷分,成了这个领域最体面的注脚。

四、反对"苦味教训":生物先验不是手搓知识

AI圈有个著名的"苦味教训":通用方法加算力,终究会碾压一切领域知识。这篇论文明确唱反调,理由有三。

数据不够。自然语言是几百年攒出的万亿token,生物数据差着千倍量级,再堆也补不上高阶相互作用的组合空间。

先验不同。Sutton教训针对的是人类经验、直觉这类主观知识,而蛋白质相互作用受热力学、静电、结构约束支配,是物理定律。AlphaFold自己就靠显式植入蛋白质几何和化学键约束起家——把物理约束编码进模型不是手搓知识,是限制搜索空间。

医学等不起。游戏和语言模型可以等数据和算力自然增长,医学多等一年,就是成批的临床试验失败和可预防的死亡。哪怕先验只带来小幅加速,也值得。

他们的解法,是把分子相互作用网络作为先验"预埋"进注意力机制,用图注意力、扩散核去约束搜索空间。团队自己的GREmLN模型已经尝到甜头:在"预测哪个基因扰动会改变转录状态"这类硬问题上,掺入网络先验后,数据量和参数量需求都明显下降。

五、15道题,从分子到临床层层加码

论文模仿1900年希尔伯特的23个数学问题,列出15道挑战,分四层:分子相互作用(调控信号、表观遗传、细胞通讯)、分子功能(合成机制、基因组到功能、药物机制)、细胞与系统功能(最小基因组、细胞重编程、生物回路、微环境)、临床转化(生物标志物、毒性、疗效、个体免疫、临床试验结局)。

论文还提了一个反例:免疫检查点抑制剂这种"免疫学答对了"的疗法,选对患者时响应率能到40%50%,却几乎全部来自生物学直觉和临床试错,没有一条是AI算出来的。如果模型能提前预测谁应答、谁耐药,省下的失败试验和患者代价难以估量。

每道题都配了可落地的验证方案。测药物毒性,参照系是TGN1412——那个让6名健康志愿者几小时内集体细胞因子风暴、直接终结试验的惨案;测药物疗效,先拿只有约15%患者携带敏感突变的赫赛汀试刀;测临床试验结局,肿瘤免疫疗法的成功率至今不到3%

配套的还有一套"双层评估"框架:Tier 1允许回顾性刷分,用于方法迭代;Tier 2必须前瞻性实验验证,预测能落地才算数。更野的提议是搞公私联盟,五年内凑齐500个带分子水平数据的临床试验语料,并重启AI-DREAM盲测——就像当年CASP比赛逼出AlphaFold那样。

六、中国玩家已经下场,这是一场几十年的长跑

这场全球讨论升温时,中国团队的动作比论文发表还快。阿里达摩院的"灵枢细胞"在虚拟细胞挑战赛基因扰动基准测试中拿了综合第一;百曜科技发布12B参数的AURA CellOS,公开参数规模全球最大,背后站着中国国新的钱;西湖大学郭天南团队在《自然》抛出"虚拟酵母"框架,华大的RegFormerCellVQ也在单细胞大模型上刷存在感。2026年,AI虚拟细胞成了融资最热的叙事之一。

但作者提醒所有人别急着欢呼。AlphaFold用了4年冲刺,背后是50年结构生物学的积累。细胞级建模要的是同样的耐心:数据按挑战定向采集,基准从回顾性转向前瞻性,先验知识与模型架构真正融合。希尔伯特23问至今只完全解出9个,却催生了整个现代数学的分支——15道题的意义,或许不在于何时答完,而在于它逼着整个行业直面一个问题:AI到底想刷榜,还是想懂生命。

附表:15大挑战一览

层级

挑战

核心问题

分子相互作用

1. 调控与信号

细胞环境下蛋白-DNA/RNA/小分子互作

2. 表观遗传

染色质开放与组蛋白修饰的组合逻辑

3. 细胞通讯

配体-受体如何决定下游细胞状态

分子功能

4. 合成机制

设计抗沉默、不泄漏的基因元件

5. 基因组到功能

突变是失活、增强还是获得新功能

6. 药物机制

全蛋白组范围的靶点与脱靶效应

细胞/系统功能

7. 基因组到表型

设计最小活细胞基因组

8. 细胞重编程

预测驱动状态转换的扰动

9. 生物回路

抗噪声、抗适应的合成逻辑电路

10. 微环境

多细胞共培养的最简条件

临床转化

11. 生物标志物

跨组学的复杂标志物组合

12. 药物毒性

器官与系统性毒性前瞻预测

13. 药物疗效

细胞状态特异性的药物敏感度

14. 个体免疫

疫苗/感染响应的免疫设定点

15. 临床试验

应答者vs非应答者预测