乐于分享
好东西不私藏

Cell | 腾讯 AI for Life Sciences + 中南大学,提出 UniPert-G2CP 两阶段深度学习框架:打通遗传与化学扰动筛选,构建" 虚拟细胞

Cell | 腾讯 AI for Life Sciences + 中南大学,提出 UniPert-G2CP 两阶段深度学习框架:打通遗传与化学扰动筛选,构建" 虚拟细胞

系统模拟与预测多样化干预在异质细胞环境中的表型效应,是"AI 虚拟细胞"愿景的核心。然而,扰动方式的多模态、检测平台的异质性、数据产出效率的悬殊长期阻碍着遗传筛选与化学筛选的统一建模与分析;小分子药物的 in silico 筛选与CRISPR 基因扰动的高内涵读出之间,更存在一条尚未被跨越的"鸿沟"。更棘手的是,单一模态训练的模型往往缺乏跨模态泛化能力,难以在多细胞、多域的扰动"因—果"空间中稳健预测。

https://doi.org/10.1016/j.cell.2026.06.005

中南大学与腾讯 AI for Life Sciences Lab 团队,在 Cell发表题为UniPert-G2CP bridges genetic and chemical screens from molecular representation to phenotype modeling 的研究,提出 UniPert-G2CP 两阶段深度学习框架。主要结论是:(1) 第一阶段统一多模态分子扰动表征,把遗传扰动(CRISPR 基因敲除/敲低) 与化学扰动(小分子药物) 投影到同一表征空间;(2) 第二阶段实现遗传→化学扰动表型的迁移学习,让化学扰动的预测借用遗传筛选的海量信号;(3) 框架在多细胞、多域扰动"因—果"空间上更高效、更准确、更鲁棒、更可解释、更可泛化,并通过联合分析揭示药物响应背后的细胞异质性,为药物作用与耐药机制提供新洞见,加速 AIVC 的实现与 AI 驱动的精准医学。

工作原理:两阶段桥接遗传与化学筛选

UniPert-G2CP 的核心思想是把"多模态分子扰动(cause)"与"扰动引发的表型(effect)"显式拆解为两个阶段。第一阶段:构建统一的分子扰动编码器,把遗传扰动(基因序列、敲除靶点) 与化学扰动(药物 SMILES、分子指纹、3D 构象) 映射到同一多模态表征空间——这是跨模态"对话"的前提。第二阶段:在表型预测任务上预训练于大规模遗传筛选数据集,把学到的"扰动→表型"映射关系迁移到化学筛选;利用遗传筛选的高数据量、低成本、可重复性弥补化学筛选的数据稀疏,从而突破化学扰动预测的样本效率瓶颈。

图1,UniPert-G2CP 总体框架与工作原理(具体 panel 待 PMC 全文收录后补充)。本文主要描述了 UniPert-G2CP 的两阶段流水线设计——多模态分子扰动表征与遗传→化学表型迁移学习的统一架构。

多模态分子扰动表征:把遗传与化学"翻译"到同一语言

第一阶段的关键挑战是异质模态对齐——CRISPR 基因扰动本质上是离散生物序列,小分子化学扰动本质上是分子图/分子指纹,二者原本属于完全不同的"语言"。研究通过统一的分子扰动编码器(包含序列编码器、化学编码器、跨模态融合层)将二者投影到共享嵌入空间;并通过对比学习/掩码预测等自监督目标让两套模态在该空间内语义对齐。这样,下游的表型预测器可以无差别地接收任一模态输入,从而实现"统一建模"。

图2,多模态分子扰动表征的具体设计与消融(具体 panel 待 PMC 全文收录后补充)。本文展示了在统一表征空间中遗传与化学扰动的嵌入可视化、跨模态检索实验,以及不同编码器组合对下游预测性能的影响。

遗传→化学表型迁移学习:让小分子借用 CRISPR 的数据红利

第二阶段是 UniPert-G2CP 的核心创新——预训练—迁移学习架构:在大规模 CRISPR 遗传筛选数据集上预训练扰动→表型映射模型(这些数据集读出稳定、样本量大、扰动明确),然后把学到的扰动响应规律作为先验,迁移到化学扰动表型预测任务上。该策略的精妙之处在于:遗传筛选本身揭示的是"敲除/敲低某基因—下游通路—细胞表型"的因果链,而药物作用本质上是"扰动多个蛋白—下游通路—细胞表型"的因果链——两者在"扰动→通路→表型"的拓扑结构上高度同构,因此迁移学习具备生物学合理性。

图3,遗传→化学扰动表型迁移学习的实现细节(具体 panel 待 PMC 全文收录后补充)。本文呈现了预训练—微调的策略、不同迁移比例下的性能曲线,以及在小样本化学筛选任务上的样本效率提升。

大规模数据集验证:多细胞多域的稳健预测

研究在多个大规模遗传/化学筛选基准数据集上系统评估 UniPert-G2CP,覆盖多种细胞系、多种表型读出(如细胞活力、形态学特征、分子标志物表达、药物响应曲线)。结果显示,相较于仅用化学数据训练的基线(如传统 QSAR、图神经网络、Transformer-based 分子模型),UniPert-G2CP 在预测准确性、跨细胞系泛化、对未见化合物的鲁棒性、模型可解释性等维度上均取得显著提升,且大幅降低了化学扰动预测对标注数据的依赖。

图4,UniPert-G2CP 在大规模基准数据集上的性能对比(具体 panel 待 PMC 全文收录后补充)。本文比较了 UniPert-G2CP 与多种基线方法在多个数据集与多种细胞系下的预测准确性、AUC、跨域泛化能力。

多细胞多域"因—果"空间模拟:揭示药物响应的细胞异质性a

借助统一的扰动→表型映射,UniPert-G2CP 可以在多细胞、多域扰动"因—果"空间中进行大规模 in silico 模拟——扫描某种药物在不同细胞系、不同遗传背景下的预测响应分布。联合分析这些模拟结果,揭示出驱动药物响应的关键细胞亚群与分子标志物——即"为什么同一药物在不同病人中疗效差异巨大"的细胞层面答案。这一能力把 AIVC 从"单细胞预测"推到了"群体异质性解析"。

图5,多细胞多域扰动"因—果"空间模拟与药物响应异质性分析(具体 panel 待 PMC 全文收录后补充)。本文展示了跨细胞系的扰动响应分布、聚类分群结果,以及与已知生物标志物的关联分析。

药物作用与耐药机制:把"黑盒预测"变成"机制洞见"

可解释性是 AI 虚拟细胞走向临床的关键瓶颈。UniPert-G2CP 通过注意力可视化、特征归因、与已知通路数据库的比对等手段,把模型的预测归因到具体的生物学通路、关键蛋白、分子指纹片段。在药物响应预测场景中,这使得研究者能够推断候选药物的作用靶点、预测耐药机制、识别协同用药组合——为AI 驱动的精准医学提供了从"预测"到"机制"再到"干预"的完整闭环。

图6,UniPert-G2CP 的可解释性分析与药物作用/耐药机制洞见(具体 panel 待 PMC 全文收录后补充)。本文呈现了注意力热图、特征重要性排序、关键通路富集分析,以及耐药相关生物标志物的识别结果。

整体机制闭环:从多模态扰动到 AIVC 群体模拟

整体机制可以收束为一条"多模态扰动统一表征 → 跨模态迁移学习 → 多细胞多域模拟 → 机制可解释 → 精准医学落地"的闭环:UniPert-G2CP 解决了遗传与化学筛选长期被孤立建模的痛点;通过预训练—迁移架构,把 CRISPR 海量数据的红利注入到小分子预测;最终以多细胞多域模拟的形式,让 AIVC 从单细胞单域走向群体异质性解析。研究不只在于又一项深度学习基准的提升,而在于首次系统打通"遗传扰动—化学扰动—表型预测—机制解释"的跨模态桥梁,为 AIVC 落地提供了可复用的统一框架。

不过,限制 1:当前迁移学习的"因—果同构"假设在跨模态差异较大时可能失效(如某些表型读出依赖药物的非蛋白靶点机制);限制 2:预训练数据偏向特定筛选平台,对罕见细胞系/罕见表型的外推仍需验证;限制 3:模型对扰动的"因果性"理解仍是统计相关而非严格因果,耐药机制的推断需要湿实验验证;限制 4:临床转化还需与真实患者队列、真实药物响应数据做前瞻性比对。

参考文献

Li Y, Zeng M, Zhu J, Liu L, Wang F, Huang L, Yang F, Li M, Yao J. UniPert-G2CP bridges genetic and chemical screens from molecular representation to phenotype modeling. Cell (2026). https://doi.org/10.1016/j.cell.2026.06.005

声明:本文仅用于分享,仅供参考,如有侵权或错误,请联系删除修正~~~

往期热文:

相关学习资料