乐于分享
好东西不私藏

AI for Science 一周综述(7.20-7.25)

AI for Science 一周综述(7.20-7.25)

AI for Science 一周综述(7月20日-7月25日):单细胞基础模型大爆发,AI驱动的生物医学进入"全栈智能"时代

一句话总结

本周的AI for Science日报可谓"开年最精彩的一周"——从RegFormer将基因调控网络嵌入Mamba架构实现25M细胞级预训练,到DrugGen 2让AI从疾病机制出发设计药物,再到单细胞转录组"变成"图像的scVision——三篇单细胞相关论文几乎同时刷新了领域标准,标志着AI生物学正从前沿探索进入范式转换的关键节点。

一、本周重磅:单细胞基础模型的"三国杀"

如果要给本周设置一个主题词,那一定是单细胞基础模型的密集突破。周一、周四、周五的文章恰好构成了一组完美的"技术路线对比实验"。

RegFormer(周一):走的是"生物学先验注入"路线——将基因调控网络(GRN)的结构信息而非原始序列嵌入Mamba状态空间模型。在25M人类细胞(45种组织)上预训练后,它在细胞聚类、类型注释、扰动预测、药物响应四个维度全面超越了scGPT、Geneformer、scFoundation和scBERT。

Tabula(周四):走的是"隐私保护+表格学习"路线——它不是用NLP式的序列建模,而是专门为单细胞数据的表格结构设计了一个基础模型,叠加联邦学习框架Chiron。数据不出本地,却在15M细胞、8个组织上实现91%的细胞注释准确率。

scVision(周五):走的是一条完全不同的路——它用Gromov-Wasserstein最优传输将10,816个基因映射到104×104的二维网格上(共表达基因成为空间邻居),再用Vision Transformer做掩码图像建模。在7200万人类细胞上预训练后,1个标注细胞就能超越其他模型用50个标注细胞的性能。

这三项工作恰好代表了单细胞基础模型的三个技术方向:先验知识注入隐私保护联邦学习模态转换+视觉建模。它们在同一周的密集出现,表明单细胞AI领域正在从"模型竞赛"走向"路线分化"——一个健康的技术生态正在形成。

二、AI + 虚拟细胞:RegFormer——Mamba+GRN的基因调控新范式

本周一的核心工作是RegFormer(Nature Communications, 2026),由华大研究院主导。

RegFormer的核心理念是:单细胞数据本质上是一个多层次的基因调控层级——转录因子调控靶基因,靶基因产物调控下游通路——现有的Transformer模型(如scGPT)用序列自注意力捕捉的是"共表达模式"而非"因果关系"。RegFormer通过将GRN作为显式结构先验注入Mamba架构,让模型学会区分"谁调控谁"而不是"谁和谁一起表达"。


图:RegFormer架构——基因调控层级嵌入Mamba状态空间模型。来源:Nature Communications, 2026

结果令人印象深刻:在9个标准benchmark上全面超越scGPT(平均提升12-18%),特别是在扰动预测任务上(预测基因敲除后的表达变化),RegFormer的GRN先验提供了显著的优势。

三、AI 药物发现:DrugGen 2——从"疾病机制"出发的分子生成

如果说上一轮的AI药物发现(DrugGPT等)关注的是"分子好不好看",那DrugGen 2关注的是"分子治什么病"。

本周二的论文来自国内团队,其核心创新在GRPO强化学习优化中融入MeSH疾病编码上下文。简单来说,模型在生成分子时不仅看分子结构,还"读"疾病描述(如"糖尿病肾病""ACE靶点"),让生成过程从一开始就对齐疾病生物学。


图:DrugGen 2疾病感知生成流程——MeSH编码引导分子优化。来源:arXiv, 2026

效果数据非常硬:在糖尿病肾病5个靶点上,DrugGen 2的独有分子生成数(409-444)是基线模型DrugGPT的3-8倍;ACE靶点的3个候选分子对接分数超过临床一线药物依那普利。这意味着AI不再只是生成"看起来像药"的分子,而是开始理解"什么机制治什么病"。

四、AI + 器官芯片:17张标注图搞定镰刀红细胞智能识别

本周三的论文来自Lab on a Chip,解决的是一个非常实际的问题:微流控芯片中高密度(重叠率0.9)镰刀红细胞的自动识别。

传统图像分割方法在细胞密集重叠时表现极差,而这篇工作的精妙之处在于:它用nnU-Net做初始分割,然后叠加分水岭算法(watershed)做重叠分离。最令人惊讶的是,整个训练集只有17张人为标注图


图:微流控芯片镰刀红细胞识别——nnU-Net+分水岭算法,仅17张标注即达高精度。来源:Lab on a Chip, 2026

在药物反应评估中,模型自动检测显示氧维洛托治疗组的镰刀细胞比例从94%降至21%,与人工计数的误差小于1.5%。这不仅是一个算法工作,更展示了"少量标注+强先验"策略在微流控-生物医学图像分析中的巨大潜力。

五、生物基础模型:Tabula——联邦学习让单细胞数据"不出本地"

本周四的Tabula(arXiv 2607.19400)提出了一个非常务实的洞察:单细胞数据是高度敏感的——患者基因组、转录组信息无法共享到中心服务器做训练。现有的单细胞基础模型要么放弃隐私(集中式训练),要么牺牲性能(本地小模型)。

Tabula的解决方案是将表格学习(而非NLP序列建模)与联邦学习框架Chiron结合。15M细胞、8个组织的数据各自在本地处理,只有梯度信息上传聚合。最终模型在91%的细胞注释准确率上超越了所有集中式训练的基线模型。


图:Tabula架构——联邦学习+表格学习的隐私保护方案。来源:arXiv, 2026

更令人兴奋的是其在衰老研究中的发现:Tabula识别出CPE和OLFM2等基因作为衰老逆转因子,与寿命延长显著正相关。这说明联邦学习不只是隐私保护的手段——多中心异质数据的联合训练可能反而提升了模型的泛化能力。

六、AI 生物医学交叉:scVision——把转录组"画成"图像,用ViT做零样本注释

本周五的scVision(arXiv 2607.14163)可能是本周最具想象力的工作。它问了一个问题:如果单细胞数据"看起来"像图像,我们是否能用Vision Transformer做零样本细胞注释?

答案是肯定的。scVision用Gromov-Wasserstein最优传输将10,816个基因映射到104×104的二维网格上(共表达基因成为视觉邻居),然后用ViT-Base + 掩码图像建模在7200万人类细胞上预训练。结果:1个标注细胞即超越其他模型用50个标注细胞的性能


图:scVision——Gromov-Wasserstein最优传输将基因映射为图像,ViT零样本注释。来源:arXiv, 2026

这个方法还有一个"副作用":由于模型是在图像空间而非序列空间工作的,它可以做"空间掩码操作"——遮挡图像中的某个区域观察注释变化——这本质上是单细胞版的"因果推理"实验,是词元模型做不到的。


本周推荐阅读

论文 期刊/年份 核心贡献
RegFormer: a single-cell foundation model powered by gene regulatory hierarchies Nature Communications, 2026 GRN先验嵌入Mamba,全面超越scGPT/Geneformer
DrugGen 2: A disease-aware language model for enhancing drug discovery arXiv, 2026 MeSH疾病编码+GRPO,ACE靶点超临床药物
An AI-enabled tool for quantifying overlapping RBC sickling in microfluidic assays Lab on a Chip, 2026 17张标注+nnU-Net+分水岭,重叠0.9细胞的智能识别
Tabula: Privacy-preserving single-cell foundation model via federated learning arXiv, 2026 联邦学习+表格学习,91%注释准确率+衰老因子发现
scVision: A vision foundation model for single-cell biology arXiv, 2026 Gromov-Wasserstein最优传输+ViT,1细胞零样本注释