蛋白质工具大全
** 如果觉得本文对你有帮助,欢迎推荐、点赞、转发支持,让更多科研小伙伴看到!如有疑问或建议,欢迎留言。
** 本文信息收集于2026年5月,如有变动请以官网为准。
** 整理不易,禁止盗用、洗稿或商业使用,如需转载,请注明来源。
** 查找资源开源链接,可关注公众号后私信资源名获取。
通用表征模型的核心任务是理解蛋白质的序列规律与功能含义,而生成式模型是更进一步从零创造具有特定功能的全新蛋白质。生成式模型不满足于对已有蛋白质进行分类或注释,而是在序列与结构空间中主动探索,尝试设计自然界中从未存在的新分子。早期的生成式模型是自回归语言模型,通过序列续写的方式生成类天然蛋白。后来出现扩散模型,能从噪声中迭代构建全原子三维结构。然后是多模态框架,支持以功能描述或几何约束为条件的可控生成。逆折叠模型则是给定一个骨架结构填充适配序列,与结构生成模型形成完整设计闭环。除此之外,还有一些针对特定场景的专用生成模型,比如治疗性肽、抗体、酶等方向。
本文梳理了当前最具代表性的蛋白质生成式模型工具(15个),帮助科研人员快速了解各工具的定位与优势,为药物研发、酶工程与合成生物学等领域的蛋白质设计任务提供实用参考。
ESM系列
(开源链接可关注公众号后私信关键词【ESM-IF1】或【ESM3】获取。)
1.ESM-IF1
1.开发/维护方:Meta AI(企业)
2.核心功能:基于等变几何输入层和序列到序列变换器的逆折叠模型,以蛋白质主链原子坐标(N、Cα、C)为输入,自回归地预测适配该骨架的氨基酸序列,通过跨度掩码训练支持部分掩码结构的序列预测。
3.适用场景:结构引导的蛋白质序列设计、肽结合剂设计(配合结构预测工具进行反向验证)、从给定骨架高效生成候选序列、单链蛋白和蛋白复合物序列优化。;也适用于蛋白复合物界面残基的定向重设计。
4.免费/开源:免费,MIT许可
5.原文:Unsupervised evolution of protein and antibody complexes with a structure-informed language model
Meta的逆折叠精兵,用等变几何变换实现骨架到序列的高效映射。
2.ESM3
1.开发/维护方:EvolutionaryScale(企业)
2.核心功能:多模态生成式掩码语言模型,能够联合推理蛋白质的序列、结构和功能三个模态,通过迭代地解除掩码实现部分指定蛋白质的生成,支持残基序列、3D原子坐标、二级结构、表面积和功能注释等多维度条件约束。
3.适用场景:多模态约束下的蛋白质生成设计,结蛋白等特殊拓扑结构的从头设计,功能位点导向的功能蛋白设计、亲和肽生成(用于色谱纯化等应用);同时适用于结构预测和功能注释。
4.免费/开源:ESM3开放版本免费,完整版需商业授权
5.原文:Simulating 500 million years of evolution with a language model
序列-结构-功能三位一体的生成式语言模型,在蛋白质语言模型领域树立了新标杆。
ProGen系列
(ProGen/ProGen2/ProGen3)
(开源链接可关注公众号后私信关键词【ProGen】获取。)
1.开发/维护方:Salesforce Research、Profluent Bio(企业)
2.核心功能:ProGen家族是基于条件语言模型的蛋白质序列生成工具,通过集成分类学、功能等条件标签,可控生成多样化的全新蛋白质序列;模型规模从12亿逐步扩展至460亿参数(ProGen3采用稀疏专家混合架构),支持全长蛋白质从头生成及特定功能域靶向重设计。
3.适用场景:
ProGen:可控、可定制化的全新蛋白质从头生成;
ProGen2:适用于大规模蛋白质序列数据分布建模、多样化蛋白质序列从头生成、零样本蛋白质适应性预测;
ProGen3:适用于高保真全长蛋白质从头生成、现有蛋白质特定功能域靶向重设计、抗体快速生成与基因编辑器等复杂功能蛋白设计。
ProGen与ProGen2也适用于蛋白质序列性质预测,ProGen3还可用于抗体和酶等复杂功能蛋白的工程化设计。
4.免费/开源:ProGen和ProGen2开源,ProGen3需申请访问
ProGen系列清晰描绘了大语言模型在蛋白质生成领域的技术演进路线图,是规模驱动能力跃迁的经典实证案例。
RITA
(开源链接可关注公众号后私信关键词【RITA】获取。)
1.开发/维护方:LightOn、牛津大学、哈佛大学(企业+学术机构)
2.核心功能:轻量化的自回归蛋白质序列生成模型家族,使用纯解码器Transformer架构,通过给定前缀序列自回归地生成高质量、可执行的新蛋白质序列。
3.适用场景:酶工程、抗体库生成、轻量级快速原型设计(适合基于少量种子序列扩展生成同类蛋白)。
4.免费/开源:开源,免费。
5.原文:RITA: a Study on Scaling Up Generative Protein Sequence Models
轻量但生成质量优秀的模型,适合快速原型和序列扩展。
Evo/Evo2
(开源链接可关注公众号后私信关键词【Evo】获取。)
1.开发/维护方:Arc Institute、斯坦福大学、Together AI、NVIDIA(企业+学术机构)
2.核心功能:基于StripedHyena架构的基因组基础模型,以DNA、RNA、蛋白质共进化方式生成全基因组尺度序列的多模态生成模型,可处理长达百万碱基的序列。
3.适用场景:跨模态可控蛋白质从头生成(抗体、酶、结合剂),长序列上下文中的DNA-RNA-蛋白协同设计,全基因组DNA序列生成及CRISPR等分子机器设计,零样本突变效应预测与适应度评估;也适用于蛋白质功能注释、结构生成(需配合ESMFold)。
4.免费/开源:是(Apache 2.0/NVIDIA Open Model License)。
5.原文:
Evo:Sequence modeling and design from molecular to genome scale with Evo
Evo 2:Semantic design of functional de novo genes from a genomic language model
基因组基础模型,以DNA为统一语言,实现从分子到基因组的跨模态生命序列设计。
ZymCTRL
(开源链接可关注公众号后私信关键词【ZymCTRL】获取。)
1.开发/维护方:Basecamp Research、巴塞罗那分子生物学研究所(企业+学术机构)
2.核心功能:基于BRENDA酶数据库训练的条件语言模型,能够根据用户输入的酶委员会编号直接生成对应酶类别的全新酶序列,生成的人工酶与天然酶功能分布相似。
3.适用场景:按EC编号定向生成新的酶序列(碳酸酐酶、乳酸脱氢酶等)、工业酶定制化设计、生物燃料生产用酶开发;也适用于蛋白质功能注释(基于序列的功能预测辅助)。
4.免费/开源:免费,学术研究使用
5.原文:Conditional language models enable the efficient design of proficient enzymes
输入EC编号即可生成活性的全新酶序列,简化酶设计。
ProtGPT2
(开源链接可关注公众号后私信关键词【ProtGPT2】获取。)
1.开发/维护方:University of Bayreuth(学术机构)
2.核心功能:基于GPT-2架构的深度无监督语言模型,从蛋白质空间中学习自然序列规律,从头生成符合天然序列特征的蛋白质序列。
3.适用场景:从头蛋白质序列设计与工程化改造、药物候选蛋白生成、未知功能蛋白空间的探索。
4.免费/开源:免费
5.原文:ProtGPT2 is a deep unsupervised language model for protein design
首个将GPT-2成功应用于从头蛋白序列设计的开源模型,快至秒级。
EvoDiff
(开源链接可关注公众号后私信关键词【EvoDiff】获取。)
1.开发/维护方:微软研究院(企业)
2.核心功能:基于进化规模蛋白质序列数据训练的离散扩散生成模型,通过序列空间的扩散过程生成高保真、多样且结构合理的蛋白质序列。
3.适用场景:可控蛋白质序列生成(通过固定部分子序列条件生成)、序列空间的功能探索、高多样性候选蛋白的从头设计,无接触3D结构信息生成结构合理的蛋白;也适用于通用表征。
4.免费/开源:免费,MIT许可
5.原文:Protein generation with evolutionary diffusion: sequence is all you need
微软团队的序列空间扩散先锋,让“仅用序列”就能生成多样化的可设计蛋白。
RFDiffusion系列
(RFDiffusion/RFdiffusion2/RFDiffusion3)
(开源链接可关注公众号后私信关键词【RFDiffusion】获取。)
1.开发/维护方:华盛顿大学David Baker实验室(学术机构)
2.核心功能:
RFDiffusion:基于RoseTTAFold结构预测网络的扩散生成模型,根据目标结合界面、对称性等分子规格从头生成功能性蛋白质骨架;
RFDiffusion2:基于流匹配训练的全原子级生成模型,根据功能基团几何描述(无需指定残基顺序)直接生成含定制活性位点的酶结构;
RFDiffusion3:实现全原子级别3D构象生成模型,对配体、核酸等非蛋白原子显式建模,简化酶设计中的原子级约束处理。
3.适用场景:
RFDiffusion:从头蛋白结合剂设计、对称寡聚体设计、酶活性位点支架构建;也适用于蛋白-小分子对接、蛋白-蛋白互作。
RFDiffusion2:复杂酶活性位点支架设计、新型工业酶(如塑料降解酶)、原子级抗体可变区设计;也适用于蛋白-小分子相互作用、蛋白-蛋白互作。
RFDiffusion3:对氢键、配体接触、核酸相互作用进行原子级精确控制的酶与生物分子相互作用设计,蛋白-DNA/RNA复合物设计。
4.免费/开源:免费,学术使用
5.文章解读:
RFDiffusion2方法学:David Baker团队实现原子级酶活性位点从头搭建,成功率高达100%
RFDiffusion2应用验证:RFdiffusion2:零优化设计出催化效率超5万 M⁻¹s⁻¹的锌金属水解酶
6.原文:
RFDiffusion:De novo design of protein structure and function with RFdiffusion
RFDiffusion2方法学:Atom-level enzyme active site scaffolding using RFdiffusion2
RFDiffusion2应用验证:Computational design of metallohydrolases
RFDiffusion3:De novo Design of All-atom Biomolecular Interactions with RFdiffusion3
RFdiffusion开创了通用蛋白质骨架从头设计范式,RFdiffusion2和RFdiffusion3将精度从残基级提升至原子级,成功应用于复杂酶活性位点及治疗性抗体的设计。
Chroma
(开源链接可关注公众号后私信关键词【Chroma】获取。)
1.开发/维护方:Generate Biomedicines(企业)
2.核心功能:可编程的蛋白质生成扩散模型,通过对称性、亚结构、形状甚至自然语言提示等外部约束条件,从头设计符合指定约束的多样化全原子蛋白质结构,是结构与序列的联合模型,支持从单体到复合物的设计。
3.适用场景:受对称性和几何约束的蛋白质结构设计、自然语言提示下的蛋白质生成、功能蛋白和抗体从头设计;也适用于结构生成和端到端生成,以及功能注释。
4.免费/开源:免费
5.原文:Illuminating protein space with a programmable generative model
将蛋白质设计系统化为可编程的贝叶斯推理,在全原子精度下用自然语言即可操控多种几何约束。
ProteinSGM
(开源链接可关注公众号后私信关键词【ProteinSGM】获取。)
1.开发/维护方:多伦多大学(学术机构)
2.核心功能:基于图像表示和分数生成模型的扩散模型,将蛋白质结构转化为基于图像的表示进行生成,可无条件生成类天然蛋白质结构,支持骨架和结构域的填充。
3.适用场景:从头蛋白质折叠设计、功能位点支架填充、无序列前提的蛋白质结构生成、序列设计、侧链旋转异构体重排等任务;也适用于结构生成。
4.免费/开源:免费
5.原文:Score-based generative modeling for de novo protein design
2023年首次通过实验验证天然蛋白质生成性能的扩散模型,是领域内最早的实用案例之一。
SeedProteo
(开源链接可关注公众号后私信关键词【SeedProteo】获取。)
1.开发/维护方:字节跳动(企业)
2.核心功能:基于扩散模型的从头全原子蛋白质设计工具,面向结合剂设计任务,通过自条件特征增强生成能力,能够建模侧链原子信息。
3.适用场景:蛋白质结合剂从头设计、靶向特定分子(小分子/蛋白)的结合蛋白生成、全原子精度生物大分子设计;也适用于蛋白-小分子对接和结构生成。
4.免费/开源:在线服务器免费
5.原文:SeedProteo: Accurate De Novo All-Atom Design of Protein Binders
在多个治疗靶点干湿实验性能超越AlphaProteo、RFdiffusion和Chai-2。
ProteinGenerator
(开源链接可关注公众号后私信关键词【ProteinGenerator】获取。)
1.开发/维护方:华盛顿大学David Baker实验室(学术机构)
2.核心功能:基于RoseTTAFold的序列空间扩散模型,从加噪声的序列表征出发,通过迭代去噪同时生成蛋白质序列与结构对。
3.适用场景:蛋白质序列与结构联合设计、特定氨基酸组成和序列重复的热稳定蛋白生成、笼型肽(如蜂毒肽)等功能性肽的设计、能主动学习的蛋白质功能优化;也适用于结构生成和序列设计。
4.免费/开源:免费
5.原文:Multistate and functional protein design using RoseTTAFold sequence space diffusion
首款序列空间扩散模型,打破传统结构优先的采样模式。
ProteinGPT
(开源链接可关注公众号后私信关键词【ProteinGPT】获取。)
1.开发/维护方:加州大学洛杉矶分校、佐治亚理工学院、Meta AI(学术机构+公司)
2.核心功能:多模态蛋白质大型语言模型,可以上传蛋白质序列或结构文件,通过自然语言对话获取蛋白质序列、结构和功能的分析及回答。
3.适用场景:蛋白质知识问答与理解、蛋白质文件交互式分析、非专业人士蛋白质研究辅助、教育与科普应用;也适用于功能注释和结构预测。
4.免费/开源:免费(目前主要通过本地部署的方式运行)。
5.原文:ProteinGPT: Multimodal LLM for Protein Property Prediction and Structure Understanding
蛋白质领域的ChatGPT,可以通过对话了解并理解蛋白质。
ProteinMPNN
(开源链接可关注公众号后私信关键词【ProteinMPNN】获取。)
1.开发/维护方:华盛顿大学David Baker实验室(学术机构)
2.核心功能:基于图神经网络的逆折叠模型,输入给定蛋白质三维骨架结构,预测并生成能够折叠成该结构的全新氨基酸序列。
3.适用场景:蛋白质骨架的序列设计、蛋白质复合物的序列优化、酶活性位点保留下的序列重设计、抗体工程中的序列优化、与RFdiffusion等结构生成模型配合使用形成完整设计流程;也适用于蛋白-蛋白互作。
4.免费/开源:是(MIT许可证),模型权重开源
5.原文:Robust deep learning–based protein sequence design using ProteinMPNN
逆折叠领域的标杆模型,广泛应用于单体和复合物的序列设计。
下篇预告:AI蛋白质工具大全系列:蛋白质语言模型——生成式模型②
往
期
文
章

Inf.Fusion(IF=17.4)|中山大学提出DAMPE:OT对齐+CGG生成融合,蛋白质功能预测AUPR达0.671
Nat.Chem.Biol(IF=15.8)|中科院上海药物所提出PBCNet2.0:零样本首次达FEP⁺精度,效率提升7倍
NAR(IF=13.1)|单步虚拟筛选+机器学习:AI高效设计高活性低脱靶碱基编辑器
NAR(IF=13.1)|昆士兰大学开发SGGly结构引导分析工具,N-糖基化位点预测MCC达0.888
JACS(IF=15.7)|华盛顿大学David Baker团队从头设计近红外荧光激活蛋白,激发波长892nm
NAR(IF=13.1)|韩国KRIBB联合嘉泉大学团队开发DeepKinomeWeb:一个用于激酶抑制剂筛选与选择性分析的网页平台
NAR(IF=13.1)|南加州大学开发PLATE-VS:一个免费、防数据泄漏的蛋白质-配体数据集平台
NAR(IF=13.1)|伯克利实验室发布BilboMD:一个可通过网页访问的SAXS与AlphaFold引导建模流程
NPJ Digit.Med.(IF=15.1)|中山大学中山眼科中心证实AI+蛋白组学时钟可预警4类老年眼病
Nat.Commun.(IF=15.7)|浙江大学通过机器学习增强采样工作流程,靶向固有无序蛋白AR-NTD,发现前列腺癌耐药新分子K53
Nat.Biotechnol.(IF=41.7)|韩国首尔国立大学开发蛋白质结构基序搜索工具Folddisco,速度比现有方法快20倍,存储效率高4倍
Nature(IF=48.5)|美国西北大学团队开发mHDX-MS技术,大规模解析5,778个蛋白质能量景观,AI赋能构象波动精准设计
Nat.Commun.(IF=15.7)|德国莱比锡大学团队计算改造PHL7酶,PET降解活性提升110倍+耐热达88-95℃
Nat.Biotechnol.(IF=41.7)|滑铁卢大学+清华大学研发RNovA,零样本肽段从头测序实现开放PTM发现,性能达SOTA水平
NAR(IF=13.1)|ProteinNetworkSight:批量解析蛋白共表达模式,一键生成个性化抗癌治疗策略
NAR(IF=13.1)|新工具SPSignal:结构辅助预测核转运信号,候选信号减少35-40%且灵敏度100%
NAR(IF=13.1)|酶挖掘工具EnzymeMiner 2.0全新升级:搜索空间暴增2.8倍,AI赋能酶发现再升级
Adv.Sci.(IF=14.1)|上海中医药大学团队开发机制引导机器学习框架MISPOP,从1033条肽库中筛出溶瘤肽,肿瘤抑制率超92%
- end -

点赞
收藏
分享
夜雨聆风