结构决定功能。一栋大楼怎么盖,决定了它能住人还是只能当仓库。蛋白质也是如此:折叠成什么形状,就决定了它能不能催化某个化学反应、能不能识别某个病毒、能不能传递某个信号。
过去,人类只能从自然界里 “找” 蛋白质 , 从动植物体内提取,或者用随机突变碰运气。一个新药抗体从发现到上市,平均要花十年时间,烧掉十亿美元。
2026 年 7 月,上海超级计算中心完成了 AI 模型 Protenix 的大规模部署,中国科研工作者如今可以调用国家级算力预测蛋白质结构。
同一个月,旧金山一家成立仅两年的 AI 公司 Chai Discovery 完成 4 亿美元 C 轮融资,估值冲到 38 亿美元 ,它的核心产品是给分子做 CAD 设计图。
一个在中国落地基础设施,一个在美国跑通商业模式。蛋白质设计的 “工业化时代”,不是即将到来,是已经到来。
现在,AI 正在改写这个剧本。过去几年里,全球涌现出三十多个 AI 工具,它们各管一段工序,合在一起就是一座完整的 “蛋白质设计工厂”。有的负责看图纸,有的负责画图纸,有的负责选砖瓦,有的专门造抗体,有的甚至能用一句话指挥整条流水线。
接下来,我们逛一遍这座工厂,全程六站:
🏗️ 第一站:看图纸 → 结构预测
✏️ 第二站:画图纸 → 骨架生成
🧱 第三站:选砖瓦 → 序列设计
🎯 第四站:造武器 → 抗体设计
⚙️ 第五站:流水线 → 一站式平台
🚀 第六站:商业化 → 明星公司
🏗️ 第一站:看图纸 —— 结构预测
第一道工序叫结构预测。你给 AI 一条氨基酸序列,它告诉你这条序列会折叠成什么三维形状。
这件事困扰了生物学界五十年。2021 年,DeepMind 的 AlphaFold2 交出了答卷:它能以原子级精度预测蛋白质结构,精度逼近实验手段。这一成果登上《Nature》,被公认为 AI for Science 的里程碑。
AlphaFold 系列:行业的标尺
2024 年 5 月,AlphaFold3 进一步升级,不仅能预测蛋白质本身,还能预测蛋白质和 DNA、RNA、小分子药物之间的复合物结构。这意味着你可以让 AI 模拟 “药物分子如何结合到蛋白质靶点上”。不过 Google 只开源了推理代码,没有公开模型权重,科研人员无法在本地完整部署和二次训练,社区对此颇有微词。
AlphaFold 系列就像工厂里的 “标准尺子”:几乎所有 AI 蛋白质设计的论文,最后都要用它来验证设计结果对不对。
开源替代者:四路并进
既然 AlphaFold3 不开放权重,社区就自己造,而且不止造了一个。四个开源模型各有侧重:
MIT 的 Boltz-1 学术友好、迭代快,性能与 AlphaFold3 持平,代码和权重全部开源; David Baker 团队的 RoseTTAFold All-Atom,与 Baker 设计生态深度绑定,提供全原子结构预测的开源方案; 字节跳动 Seed 团队的Protenix,是首个在严格对齐 AlphaFold3 的数据截止日、模型规模和推理预算条件下,性能达到甚至超越 AlphaFold3 的完全开源模型。它还支持推理时扩展 ,增加采样预算就能持续提升预测质量,采样越多越准。它衍生的设计工具 PXDesign,在多个靶点上的湿实验成功率达到20%-73%,是 DeepMind 自家设计工具 AlphaProteo 的 2-6 倍。2026 年 7 月,上海超级计算中心完成了 Protenix 的大规模部署,使其成为国家级算力平台上的结构预测服务。 OpenFold 联盟的 OpenFold3,有 NVIDIA 提供加速支持,训练数据最丰富,采用商业友好的开源协议,能预测多链复合物、核酸和小分子配体。
以上几个模型的目标是 “追平甚至超越 AlphaFold3 的精度”。但精度不是唯一的追求,如果你需要的是速度,还有另一条技术路线。
更快的方案:ESMFold2 与 ESM-2
AlphaFold 虽准,但速度不快,因为需要先搜索同源序列构建多序列比对,找到相似的蛋白质亲戚来辅助推断结构。Meta 的 ESMFold2 省掉了这一步,直接从单条序列预测结构,速度快了上百倍。
ESMFold2 的背后是 ESM-2, 一个参数量高达 150 亿的蛋白质语言模型。它的工作方式很像 ChatGPT 理解文字:把氨基酸序列当成一种 “语言”,从数亿条蛋白质序列中学会了蛋白质的 “语法规则”。Meta 用它预测了超过 6 亿个蛋白质结构,构建了迄今最大的蛋白质结构图谱。
此外,国内还有 TDFold、MMFold、SeedFold 等走轻量化路线的结构预测工具,各有特定优化场景。
📌 第一站怎么选:精度标尺是 AlphaFold3,但不开源;开源首选 Protenix 和 Boltz-1,Protenix 在国内算力部署上占优;追求极致速度就选 ESMFold2。
✏️ 第二站:画图纸 —— 骨架生成
看清楚已有蛋白质的结构只是第一步。真正的突破是:能不能让 AI 画出一张全新的图纸 , 自然界从未存在过的蛋白质?
RFdiffusion:从噪声中雕刻蛋白质
2022 年 12 月,David Baker 团队发布了 RFdiffusion。它的原理借鉴了 AI 图像生成:从一团随机噪声开始,逐步 “雕刻” 出有意义的蛋白质结构。给它一些约束条件 , 比如 “在这个位置放一个活性位点”“整体做成对称的六聚体”,它就能生成满足要求的全新蛋白质骨架。
2025 年,团队连续推出 RFdiffusion2 和 RFdiffusion3。RFdiffusion2将精度推进到原子级,能直接根据化学反应设计酶的活性口袋,在41个活性位点测试中骨架生成成功率达100%。RFdiffusion3进一步升级为全原子模型,能为任意分子设计蛋白质结合剂,计算成本降至前代的十分之一。三代均已开源。
Chroma:可编程的蛋白质生成器
Generate:Biomedicines 公司在 2023 年发表于《Nature》的 Chroma 走了另一条路。它的特色是 “可编程约束”:你可以用高层次的指令控制生成方向,比如 “设计一个 C5 对称的五聚体”“直径不超过 5 纳米的球状蛋白”。
Chroma 的理念是 “照亮蛋白质空间”,自然进化只探索了蛋白质可能性的极小角落,而 AI 可以系统性地生成自然界从未出现过的蛋白质。基于Chroma平台优化改造的抗体药物GB-0895(治疗哮喘的长效抗TSLP抗体)已经进入III期临床试验,是首个由AI驱动改造并进入III期的抗体药物
Salad:快两个数量级的 3D 打印机
如果说 RFdiffusion 是 “雕刻家”,欧洲分子生物学实验室的 Salad 就是 “高速 3D 打印机”。它最大的亮点是极致的生成效率:在单张 RTX 3090 显卡上生成一个 1000 个氨基酸的蛋白质仅需 19 秒。作为对比,RFdiffusion 在同等条件下需要数十分钟,Salad 的速度提升了近百倍(约两个数量级)。
同时它的参数量仅约 800 万,小巧到可以在消费级显卡上跑。更重要的是,Salad 成功设计出长达 1000 个氨基酸的蛋白质,突破了此前 AI 设计约 400 个氨基酸的长度天花板 ,这意味着 AI 可以着手设计更大、更复杂的蛋白质机器。
VibeGen:设计能动的蛋白质
此前所有工具设计的是蛋白质的 “静态照片”,就像设计一座雕塑,只定格折叠完成的形状。但蛋白质在人体内是活的,它们会振动、摆动、开合,像一台机器一样运转。
MIT 的 VibeGen 开创了一个全新维度:基于蛋白质的动态轨迹来设计序列。它不只是画一栋楼的静态外观,而是设计这栋楼在受力时如何摇摆、如何变形却不倒塌。这相当于从设计 “雕塑” 进化到设计 “机器”,为设计具有特定机械功能的蛋白质打开了新大门。
APM:专门设计多链蛋白复合物
真实生物体内的很多蛋白质不是单条链,而是由多条链组装而成的复合物,比如细胞膜上的受体、细胞内的分子马达。APM 针对的就是多链蛋白质复合物的设计,如果说 RFdiffusion 擅长设计 “独栋别墅”,APM 更擅长设计 “联排别墅” 甚至 “建筑群”,能精确建模链与链之间的相互作用,代表了多链蛋白设计这个重要的技术方向。
更多特色工具
- Void-X
中科院上海有机所研发,采用独特的 “自下而上” 策略,像一个 “原子 3D 打印机”:直接在特定结构区域逐个原子地 “打印” 出能与之最优匹配的原子团簇,为设计蛋白质相互作用界面提供了全新思路。 - CPDiffusion
采用条件扩散模型,适合做骨架的可控设计,代码已开源。 - BindCraft
完全不走扩散路线,直接利用 AlphaFold2 的网络做反向传播优化,给一个目标蛋白,让 AI 一步步调整候选结合剂的序列,直到预测它们能牢牢结合。2025 年发表于《Nature》,实验成功率号称 10-100%,被称为 “目前最强的开源结合剂设计工具”。
📌 第二站怎么选:通用骨架生成首选 RFdiffusion,精度最高;追求速度和长蛋白设计用 Salad;动态功能设计选 VibeGen;多链复合物设计用 APM;做结合剂设计优先试 BindCraft。
🧱 第三站:选砖瓦 —— 序列设计
骨架画好了,问题来了:该用什么氨基酸来填?
一栋楼有了结构图,还得选砖、选水泥、选钢筋。蛋白质也一样:主链骨架确定了形状,但每个位置该放哪种氨基酸,才能让它真正稳定地折叠成这个形状?
ProteinMPNN:序列设计的标配
David Baker 团队在 2022 年发表于《Science》的 ProteinMPNN 解决的就是这个核心问题:给定一个蛋白骨架,如何快速找到最匹配的氨基酸序列。它的计算效率远高于传统方法,是目前科研领域使用最广的序列设计工具。
在实际工作流中,ProteinMPNN 扮演的是 “骨架到序列” 的桥梁。标准流程是:RFdiffusion 生成骨架 → ProteinMPNN 填充序列 → AlphaFold 验证序列能否折叠回目标结构。这三件套已成为科研文献中引用最多的组合方案。
LigandMPNN:能看见配体的升级版
ProteinMPNN 有个盲区:它只看得见蛋白质自己的原子,看不见周围的配体(与蛋白质结合的小分子、DNA 等)。设计酶活性口袋时,模型不知道底物长什么样,只能盲填。
2025 年发表于《Nature Methods》的 LigandMPNN 补上了这个短板。它能同时感知小分子、DNA、RNA、金属离子的原子坐标,在配体存在的条件下设计最合适的氨基酸。团队已用它设计了超过 100 种经实验验证的结合蛋白,比传统方法快 250 倍,亲和力提升上百倍。
更多思路
- ESM-IF
来自 Meta,与 ProteinMPNN 齐名,同样解决 “结构到序列” 的问题,常与 ESMFold 配合使用,是逆折叠领域的另一标杆。 - Caliby
打破了 “一个结构对应一个序列” 的常规思路,能基于一整套结构的 “集合” 来设计序列 —— 好比设计一把钥匙不是只匹配一把锁,而是匹配一个锁的 “家族”,对设计能适应多种构象变化的蛋白质特别有价值。
📌 第三站怎么选:通用序列设计首选 ProteinMPNN;涉及配体、酶活性口袋设计用 LigandMPNN;和 Meta 生态搭配选 ESM-IF。
🎯 第四站:造武器 —— 抗体设计
抗体是人体免疫系统的 “精确制导武器”,也是当今最大的药物类别。设计抗体有一个特殊挑战:不仅要结合靶标,还要保证全人源 —— 也就是序列与人体自身抗体足够相似,否则会被免疫系统当作外来物排斥。
和铂医药:数据壁垒
和铂医药在 2025 年 10 月发布了全球首个全人源重链抗体(HCAb)生成与筛选模型。它的核心竞争力不在算法,而在数据:基于Harbour Mice转基因小鼠平台十余年积累的超过900万条NGS HCAb序列数据训练而成,这是全球规模最大的全人源重链抗体数据库。
HCAb 天然缺失轻链,单一结构域即为完整的功能单元,尺寸小、穿透性强。该模型已产出首款 AI 候选药物 LET003(用于肥胖症),并与百时美施贵宝、英矽智能等达成合作。
序列 + 结构一体化工具
- DualGPT-AB
西北工业大学等团队在《Nature Computational Science》发表的抗体设计框架,采用双阶段生成优化策略,将条件生成式语言模型与强化学习相结合,在靶向HER2的抗体优化中验证了优于赫赛汀的候选抗体
- IgGM
腾讯研发,能同时生成抗体的序列和结构,尤其擅长纳米抗体设计,代码已开源。 - AntiFold
AntiFold 要解决的是一个实际问题:通用逆折叠模型在抗体上精度不足,因此需要专门针对抗体优化的特异版本。它在抗体 CDR 区域(决定抗体特异性的关键可变环)的序列恢复上表现优异,是抗体设计流程中非常实用的专用工具。
高效设计框架
- Germinal
能设计出纳摩尔级别亲和力抗体的生成式框架。最惊人的特点是:每个抗原只需测试 43 到 101 个设计,就能从中获得高亲和力抗体。传统方法通常需要筛选成千上万个候选,Germinal 用极低的实验量就达到了目标,证明了其设计精度之高。 - Origin-1
Absci 公司的平台,独特之处在于能针对 “零先验” 表位进行抗体设计,也就是靶点上没有任何已知结合剂的结构信息可用。它整合了从结构生成到序列设计的全流程,在 10 个人类蛋白质靶点上得到了实验验证。
Latent-Y:一句话指挥整条流水线
Latent Labs 的 Latent-Y,代表了抗体设计的最高自动化水平。
它能从自然语言文本提示出发,自主完成文献调研、靶点分析、候选设计、计算验证的全过程。比如你输入 “设计一个能结合新冠病毒刺突蛋白 RBD 区域的纳米抗体”,Latent-Y 会自己查文献、选靶点、生成候选结构、评估结合能、筛选最优几款 —— 全程不需要你再操心任何中间步骤。这不是一个简单的聊天机器人,而是一个能调用文献数据库、结构预测工具、结合能评估模型的多智能体系统。它就像一个不知疲倦的全能研究员,能把原本需要数周的专业工作压缩到短短几个小时。
📌 第四站怎么选:看重全人源数据积累选和铂医药;想快速出高亲和力抗体试 Germinal;追求极致自动化、一句话搞定全流程,选 Latent-Y。
⚙️ 第五站:流水线 —— 一站式平台
前面几站讲的都是 “单工序工具”,有的只管预测,有的只管生成,有的只管填序列。但大多数科研工作者和药企更需要的,是一个能从头到尾跑完整个流程的平台。
晓鹜(MatwingsVenus)定位为对话式蛋白质科研智能体,打开网页用自然语言描述需求即可完成设计,无需写代码或搭建模型。
晓鹜适合个人研究者或小团队做快速验证,相当于蛋白质设计的 “入门版”。如果需要处理工业级规模的项目,则需要下面这些全栈平台。
工业级全栈平台
- ToursynClaw
- VenusFactory
(上海交大研发):定位为蛋白质工程全栈平台,支持零样本突变预测和功能预测,已可一键部署在线体验。
中国版 ESM-2:VenusPLM
VenusFactory 背后,有一个更底层的基础设施 ——VenusPLM。这是上海交大基于全球规模最大的蛋白质序列数据集 VenusPod(近 150 亿条序列)训练的百亿参数蛋白质通用语言模型。
如果说 ESM-2 是 Meta 用 150 亿参数读懂了蛋白质的 “语法”,那 VenusPLM 就是用更大规模数据训练出的中国对应版本,它衍生出 Venus-REM(定向进化)和 Venus-Mine(酶挖掘)等专用模型,具备强大的零样本预测能力。
商业生态矩阵
- XtalPi(晶泰科技)
旗下大分子药物发现部门Ailux Biologics拥有三大AI平台,结构建模平台XtalFold™、生成式蛋白质大语言模型XenProT™以及药物性质预测平台Xentient™。其路线是量子物理加AI,覆盖小分子和蛋白质,以企业服务为主。
MoleculeOS与MMDesign(分子之心)
MoleculeOS定位为“蛋白质操作系统”,以自研的NewOrigin多模态大模型为基座,AI理解研发意图后自动拆解任务、调度模型,完成从预测到设计再到决策的全流程;MMDesign则是分子之心的AI生物药从头设计平台,专注序列与结构的联合优化。两者一个偏流程广度(操作系统级编排),一个偏模型深度(序列-结构联合设计),且MMDesign正逐步集成至MoleculeOS中,形成统一平台。
- 书生 AMix
由上海 AI 实验室联合清华大学、复旦大学等机构推出,用多模态大模型实现功能、序列、结构的联动设计,让 AI 从 “调用专业工具” 向 “原生理解和设计蛋白质” 升级。
如果你是学术研究者想跑完整流程但不想花钱,标准开源三件套仍然是黄金组合:RFdiffusion 生成骨架 + ProteinMPNN 填充序列 + AlphaFold 验证结构。代码公开,教程齐备,只需要一台带 GPU 的机器。
📌 第五站怎么选:纯好奇体验选晓鹜;学术研究用开源三件套;工业级全流程需求可以对接 VenusFactory、晶泰科技等商业平台。
🚀 第六站:商业化 —— 明星公司
Chai 系列:为分子造 CAD
Chai Discovery 是 2024 年在旧金山成立的公司,由前 OpenAI 员工创立,定位是 “为分子构建计算机辅助设计工具”。
首个模型 Chai-1 于 2024 年 9 月发布,能同时预测蛋白质、小分子、DNA、RNA 的三维结构及相互作用,蛋白质 - 配体预测成功率达 77%,与 AlphaFold3 同一水平,且完全开源。最新的 Chai-3 平台不仅能预测分子间相互作用,还能对相互作用进行 “重编程” 设计 —— 从 “读懂” 分子跨越到 “改写” 分子。
2026 年 7 月,公司完成 4 亿美元 C 轮融资,估值达 38 亿美元,与礼来、辉瑞、诺华等药企建立了合作。Chai 采用纯软件的轻资产模式:不自建药物管线,只做设计平台,然后和药企合作推进。这与和铂医药 “自己做药又做平台” 的模式形成了有趣的对照。
📌 第六站怎么看:AI 蛋白质设计的商业价值已经被资本市场验证,平台型公司正在成为行业核心基础设施,纯软件授权与自研管线两种模式并行发展。
从看图纸到画图纸,从填砖瓦到造抗体,从单工序到一站式,甚至用一句话指挥整条流水线,AI 蛋白质设计的工具链已经初具规模。
普通人能上手吗?
答案是:看你想上到哪一层。
- Level 1 - 纯好奇体验
打开晓鹜网页,打字描述需求就行,不需要任何背景知识。 - Level 2 - 科研结构预测
用 AlphaFold 在线服务器或 ESMFold 在线数据库,上传序列即可出结果;想跑复合物可以用 Protenix 或 Boltz-1。 - Level 3 - 学术全流程设计
部署 RFdiffusion+ProteinMPNN+AlphaFold 开源三件套,需要 GPU 设备和一定的工程能力。 - Level 4 - 工业落地与新药研发
对接晶泰科技、VenusFactory、和铂医药等商业平台,获取端到端解决方案。
这意味着,蛋白质设计正在从 “生物学家的专利” 变成 “工程师的工具”。
二十年前,一个科学家要花五年才能做出一个新蛋白;
五年前,一个团队要花一年;
现在,一个课题组加上一台 GPU 服务器,从设计到拿到候选序列,可能只需要几周。
这不是科幻,这是 2026 年正在发生的事情。
工具已经就位,接下来的问题,不再是 “AI 能不能设计蛋白质”,而是 “想用它设计什么”。
从“能不能”到“想设计什么”,问题的转变,恰恰宣告了一个新时代的到来。
当工具不再是瓶颈,想象力就成了唯一的边界。
夜雨聆风