ARTICLE · 1048509
【Cell】哥伦比亚大学发表生成式AI想读懂细胞生物学,还差这十五道难题
预测细胞行为时,生成式AI常像把蛋白质折叠那套硬套过来,数据、机制和评测都让人头疼。这篇论文索性列出十五个挑战,像一张解题地图。它2026年9月17日发表于Cell,英文题目是Fifteen challenges for generative AI applications to cell biology,中文可译作“生成式AI应用于细胞生物学的十五个挑战”。团队由哥伦比亚大学欧文医学院领衔,联合多家机构。

Gen-AI 在分子任务上很成功,但能否预测细胞和多细胞表型仍不明;作者主张用互作网络等先验约束新模型,并仿 Hilbert 提出十五个挑战。
先看起点:预测扰动对细胞的影响是关键,但传统实验范式低效,临床试验成功率仅 14.6%、6.7%。
随后对比:计算与 Gen-AI 在蛋白/图像任务上突破,细胞状态预测却多靠回顾性基准,少前瞻验证。
再往下:神经退行、心血管和肿瘤微环境都涉及多细胞互作,虚拟细胞未必自然出现;免疫系统因可采样、迁移、工程化、体内验证被选作范例。
与此同时,作者质疑 LLM:多细胞调控不是线性 token,而需 N-way 高阶互作,如三方调控,组合空间达 3.48×10^150。
由此主张预置生物知识,用图注意力整合 STRING、PrePPI、ENCODE、ARACNe 等先验;scGPT、Geneformer 不敌线性基线。最终提出十五个挑战。
这篇文章采用了以概念综合和问题清单为核心的观点/展望型框架,而不是实验研究设计。它没有开展湿实验、设置实验对照或进行数据集建模分析,而是整合跨领域专家判断,围绕生成式AI在细胞生物学中的应用展开论证,比较分子层面已有成功与细胞及多细胞预测的局限,讨论虚拟细胞、免疫系统建模和当前大语言模型架构的瓶颈,并提出十五项面向未来的AI挑战。这样的策略更接近问题定义与路线图构建,旨在引导后续建模、数据与验证框架的发展。
Figure 1:这张图把十五个Gen-AI生物学挑战按分子互作、分子功能、细胞/系统功能、临床转化四层排开,想回答Gen-AI该把力气集中到哪里;看到的是从分子到多细胞的难度阶梯,指向分子层面的成功不能自动外推到细胞和多细胞行为,必须引入生物先验并做前瞻验证。

Figure 1
这张图讲的是全文的总路线图:先定问题,再为后面各层挑战和基准铺路。
方法上,原文没交代 Figure 1 的绘图工具或数据来源;它只是概念性分层框架,不是实验结果。
一句话,它解决的是“该朝哪打”;结论是十五个挑战要绑定盲法前瞻验证,而非只看回顾性分数。
我觉得它最大的新意是把“为什么 AlphaFold 行、细胞不行”说透了:线性 token 扛不住 N-way 互作,单细胞基础模型常打不过线性基线,于是主张把调控网络、物理约束当先验塞进架构,这对我这种还在手搓网络推断的人挺解气。但是真到设计验证,它更像一张许愿单:先验从哪来、质量差怎么办、动态重评估阈值谁定、十五个挑战怎么排出可证伪的基准,都没给硬方案。作为 Perspective 可以,可要说服我做湿实验,还差一份能跑起来的对照。