乐于分享
好东西不私藏

Nat Methods|AI蛋白质组学:从蛋白质鉴定到虚拟细胞

Nat Methods|AI蛋白质组学:从蛋白质鉴定到虚拟细胞

2026年7月28日,西湖大学医学院郭天南、美国贝勒医学院章冰、德国马克斯·普朗克生物化学研究院Matthias Mann,联合来自中国、美国、德国、瑞士、比利时、澳大利亚、英国、加拿大共8个国家47个研究机构的62位专家,在Nature Methods发表了题为AI proteomics: from protein identification to virtual cells的评述性文章,系统展望了人工智能如何推动基于质谱(MS)的蛋白质组学发展,涵盖从基础的数据解析到前沿的AI虚拟细胞(AI Virtual Cell, AIVC)构建。

随着人工智能与多组学技术的深度融合,AI正加速渗透至科学研究的各个前沿。其中,AlphaFold在蛋白质结构预测领域取得的突破性进展,成为AI赋能生命科学的标志性成果之一。事实上,AI在蛋白质组学数据分析中的应用早已广泛展开:它不仅覆盖数据库搜索、肽段从头测序等经典谱图解析任务,还已拓展至空间蛋白质组学、扰动蛋白质组学以及多组学整合等新兴方向,持续推动领域创新。

该文章将当前AI驱动的蛋白质组学发展概括为六个关键领域:蛋白质鉴定与定量、蛋白质互作与复合物分析、空间蛋白质组学、扰动蛋白质组学、多组学整合以及人工智能虚拟细胞,讨论了这些领域的关键科学问题及基于AI的潜在解决方法。

图1 人工智能驱动的蛋白质组学六大关键领域变革

关键领域1:蛋白质鉴定与定量

蛋白质鉴定仍然是当前基于质谱的蛋白质组学领域最基础的问题之一。尽管近年来深度学习已经显著提升数据库搜索与肽段从头测序的鉴定能力,但文章指出,目前蛋白质组学中仍存在大量未解析信号,例如,在公共数据库MassIVE-KB中,超过70%的串联质谱谱图目前依然无法被识别。

这些未识别谱图中,部分可能对应真实存在但尚未系统解析的蛋白质型(Proteoforms),包括可变剪接产生的蛋白异构体、单氨基酸变异以及大量翻译后修饰。目前实验层面已验证的蛋白质型数量与理论复杂度之间仍存在明显差距。

除了鉴定深度,文章还讨论了鉴定准确性问题。目前大量数据库搜索方法仍依赖目标-诱饵策略进行错误发现率控制,但已有文章指出,这一方法在蛋白质水平鉴定以及单细胞蛋白质组学中仍可能存在偏差。与此同时,当前许多肽段从头测序模型主要基于较早期的人类蛋白质组数据训练,在不同物种、不同质谱平台以及不同碎裂模式之间的泛化能力仍然有限。因此,未来模型可能需要纳入更多样化和高质量的训练数据,同时引入类似大语言模型中的“链式推理”、检索增强生成以及混合专家模型等机制,以提升模型的推理能力与可解释性。

关键领域2:蛋白质复合物与蛋白质互作网络

大量细胞功能依赖蛋白质复合物与蛋白质互作完成,但目前相关研究仍面临数据异质性与动态建模能力不足的问题。目前蛋白质互作数据来源于AP-MS、CF-MS、XL-MS以及结构生物学等多种平台,不同数据之间在格式、分辨率与覆盖深度上差异明显。与此同时,传统蛋白质互作模型往往更倾向于学习静态互作网络,难以描述翻译后修饰、蛋白质异构体以及环境变化引起的动态复合物重构。

文章特别提到,随着AlphaFold3开始进入蛋白质互作以及蛋白质-分子相互作用预测领域,基于AI的结构预测正在逐渐从单蛋白质结构预测扩展至细胞级网络建模。此外,文章提出,超图(hypergraph)可能比传统图神经网络更适合描述蛋白质复合物,因为真实复合物天然具有高阶、多元关系,而不仅仅是简单的双分子互作。

关键领域3:空间蛋白质组学

当前的空间蛋白质组学技术路线主要有两类:一类是CODEX、MIBI等成像型方法,具有较高的空间分辨率,但蛋白质检测深度有限;另一类是基于质谱的空间蛋白质组学,能够实现更深层蛋白质覆盖,但目前仍难以实现连续全组织分析。文章随后介绍了DVP、SCPro以及FAXP等技术路线。其中,DVP和SCPro尝试将多重成像与质谱结合,实现细胞类型分辨的空间蛋白质组学;FAXP则进一步结合组织膨胀技术,将空间分辨率推进至单细胞甚至亚细胞水平。

与此同时,AI开始被用于空间推断。例如,S4P与PLATO等技术流程,已经开始利用深度学习与迁移学习,在有限质谱采样条件下重建更完整的空间蛋白质图谱。文章认为,未来空间蛋白质组学的发展方向,将是AI空间推断、组织膨胀技术、超分辨显微成像以及质谱检测的进一步融合。

关键领域4:扰动蛋白质组学

相比静态测量,扰动蛋白质组学更强调系统在受到干预后的动态响应能力。目前大量研究已经开始利用蛋白质组学分析药物扰动后时序性以及剂量梯度下的动态蛋白组响应,并用于药物机制研究与药物再利用。但文章认为,真实扰动空间理论上几乎无限,不同刺激、剂量、时间过程以及细胞状态之间的组合无法通过传统实验完全覆盖。

闭环主动学习框架将极大缩小扰动组合,模型首先从已有扰动数据中学习规律,再主动识别信息缺口,并推荐最具信息增益的新实验,形成“实验-模型-再实验”的循环系统。这一方向与当前AI for Science中的自动化闭环实验室概念高度接近。

关键领域5:多组学整合

如今,尽管多组学数据已经大量积累,但mRNA丰度与蛋白质丰度之间只有有限相关性。蛋白质状态不仅受到翻译调控影响,还涉及蛋白质降解、翻译后修饰、蛋白质复合物组装以及空间微环境等多层调控。因此,多组学整合并非简单的数据叠加,而是需要解决不同组学之间的数据对齐的问题。由于不同平台在检测深度、覆盖范围、量化方式和技术偏差等方面存在差异,AI需要学习基因、转录、蛋白质和代谢状态之间复杂的动态调控关系,而非仅建立表层相关性。

文章指出,仅靠扩大训练数据规模并不能真正解决动态细胞状态建模问题。未来AI模型需要进一步引入“翻译后修饰感知”的特征空间,并结合空间位置、局部代谢环境以及细胞邻域等上下文信息。此外,文章还提到图卷积网络、联合嵌入以及超图卷积网络等方法已经开始被用于多组学整合,用于建模蛋白质互作、药物-蛋白质互作以及跨组学特征空间。

关键领域6:虚拟细胞

前述几个方向最终汇聚到全文最后讨论的AI虚拟细胞。文章回顾了从生殖支原体到大肠杆菌以及酵母全细胞模型的发展历程,并指出相比微生物,人类细胞涉及更复杂的高阶调控、细胞间通讯以及组织异质性。

在这一背景下,单纯基于RNA的基础模型已经难以满足动态细胞建模需求。文章列举了GeneFormer、scFoundation、ProteinTalks以及State等基础模型的发展。其中,西湖大学郭天南研究团队构建的ProteinTalks模型基于大规模扰动蛋白质组数据训练,已经开始具备药物疗效与药物协同效应预测能力;来自美国Arc研究所的State模型则进一步尝试预测未见过的细胞状态中的扰动响应。

未来AI虚拟细胞的实现,需要同时整合蛋白质组、空间组学、扰动组学、多组学数据以及动态成像信息,从而建立真正具备时空动态预测能力的细胞模型。

除了技术方法本身,建立AI友好的蛋白质组学生态是AI模型赋能蛋白质组学发展的基础。文章认为,目前限制AI蛋白质组学发展的关键问题不仅在于数据总量不足,同时也缺少真正适用于AI训练的数据体系。当前大量质谱原始数据虽然已经存储于PRIDE、MassIVE等数据库中,但不同数据之间仍存在格式不统一、数据标签缺失以及AI友好性不足的问题。因此,文章强调未来需要建立类似ImageNet和PDB那样的大规模AI-ready蛋白质组资源,并进一步推动Tensor、Parquet等适用于AI训练的数据格式。

这一愿景的实现,需要全球范围内生物学、医学、蛋白质组学、人工智能等多个领域专家的协同合作,共同推动数据资源、技术方法和研究体系的发展。在这一过程中,国际性科研组织和合作计划,包括人类蛋白质组计划(Human Proteome Project, HPP)、HUPO蛋白质组学标准化倡议(HUPO-PSI)、临床蛋白质组肿瘤分析联盟(CPTAC)、国际癌症蛋白质基因组联盟(ICPC)、ProCan以及π-Hub项目等,将发挥重要的推动作用,加速构建面向人工智能的蛋白质组学生态系统,推动蛋白质组学迈向智能化、预测化的新阶段。

图2 构建面向人工智能的质谱蛋白质组学生态系统

总体而言,这篇文章描绘了AI在蛋白质组学中的全链条赋能图景:从提高质谱数据的解析能力,到揭示蛋白质功能、空间定位、动态扰动响应,再到整合多组学数据构建可预测的AI虚拟细胞,最终推动精准医学与生命科学变革。

作者与资助信息

该展望文章由西湖大学郭天南团队、美国贝勒医学院章冰团队、德国马克斯·普朗克生物化学研究院Matthias Mann团队牵头,联合来自中国、美国、德国、瑞士、比利时、澳大利亚、英国、加拿大共8个国家的47个研究机构共同完成。论文第一作者是西湖大学助理研究员孙莹莹,郭天南、章冰和Matthias Mann为通讯作者。参与单位有:西湖大学、西湖生命科学与生物医学实验室、贝勒医学院、马克斯·普朗克生物化学研究所、杨百翰大学、安特卫普大学、柏林夏里特医科大学、莫纳什大学、欧洲生物信息学研究所、哈佛医学院、苏黎世联邦理工学院、布鲁克有限公司、腾讯生命科学人工智能实验室、人工智能科学研究院、国家蛋白质科学中心(北京)、赛默飞世尔科技有限公司、百时美施贵宝、复旦大学、印第安纳大学、悉尼大学、加州大学圣迭戈分校、中原人工智能研究院、滑铁卢大学、北京大学、中山大学、密歇根大学、中国科学院数学与系统科学研究院、杜兰大学、不列颠哥伦比亚大学、鹏城实验室、系统生物学研究所、上海交通大学、国际明哲医学研究院(广东)、安徽大学、北京航空航天大学、上海大学、温州医科大学、四川大学等。课题获得国家自然科学基金、国家重点研发计划、浙江省相关科研计划、西湖大学、人体蛋白质组导航计划等多方支持。具体基金项目和致谢信息以论文正式发表版本为准。

论文链接:

https://www.nature.com/articles/s41592-026-03085-y

--------- End ---------

感兴趣的读者,可以添加小邦微信加入读者实名讨论微信群添加时请主动注明姓名-企业-职位/岗位姓名-学校-职务/研究方向