乐于分享
好东西不私藏

AI设计蛋白质,和你有什么关系?

AI设计蛋白质,和你有什么关系?
封面图
COLUMN 01超级图图·生 | 第 1 期生:生物科技方向。

聚焦生命科学、生物制造、合成生物与生物基材料,观察生物技术如何从实验室走向产业与工程应用。

陈图图 | 2026-06-12
导语重点图

提到蛋白质,很多人首先想到的是鸡蛋、牛奶和健身餐。

但人体里的抗体、酶、受体,以及一些药物,本质上也是蛋白质。

它们像钥匙、开关和微型机器:有的识别病毒,有的传递信号,有的推动人体内的化学反应。

现在,AI开始尝试设计自然界里可能从未出现过的新蛋白质。

它可能改变的,不只是实验室,还有我们未来怎样制药、生产和制造材料。

一、设计蛋白质,就像为一把锁设计钥匙

锁与钥匙原理图

可以把一个疾病相关的靶点想象成一把结构极其复杂的锁。

如果想阻止它发出错误信号,或者把药物精准送到它附近,就需要找到一把合适的“钥匙”。

这把钥匙不能只是外形相似。

它还要认准目标、贴合得足够牢、自身保持稳定,并且能够在实验室里真正生产出来。

过去,研究人员主要从自然界已有的蛋白质中寻找候选,再通过大量实验反复改造。

问题在于,蛋白质由不同氨基酸组成,可能的排列方式几乎难以穷尽。逐个尝试,就像在一片看不到边界的钥匙堆里寻找正确答案。

AI蛋白质设计想做的,是先看清“锁”的结构,再直接提出一批可能匹配的新“钥匙”。

二、它会怎样影响我们的生活?

蛋白质设计的生活影响图

最直接的影响,可能来自药物研发。

许多疾病与蛋白质之间的异常作用有关。如果AI能更快设计出识别特定靶点的结合蛋白、抗体或酶,就可能帮助研究人员更早找到值得验证的药物候选。

这里最重要的两个字,是“候选”。

AI不能跳过细胞实验、动物实验和临床试验,更不能保证电脑里生成的结构最终一定能成为药物。

但它可以减少前期的盲目搜索,让有限的实验资源优先用在更有希望的方向上。

蛋白质设计还可能带来更精准的治疗。

传统药物有时会同时影响多个位置,因此产生副作用。新的设计方法希望让分子更准确地识别目标,或者把药物送到特定细胞和组织。

这有点像从“在一个区域里撒网”,逐渐走向“认准门牌再敲门”。

它的影响也不只在医药领域。

酶同样是蛋白质。食品、纺织、化工、制药和废弃物处理等产业,都在利用酶推动反应。

如果AI能够设计出效率更高、耐高温或适应特殊环境的酶,一些原本需要高温、高压或强腐蚀条件的生产过程,就可能在更温和的条件下完成。

这意味着更低的能耗,也可能意味着更少的副产物。

在更远的地方,蛋白质还可能参与制造生物胶黏剂、功能涂层、过滤材料、可降解材料和生物基复合材料。

所以,蛋白质设计不只是医学问题。

它也可能成为生物制造和新材料研发的一项底层能力。

三、AI不只是在屏幕上“画分子”

很多人第一次听说蛋白质AI,是因为AlphaFold。

AlphaFold主要解决的问题,可以粗略理解为:

已知一段氨基酸序列,预测它可能折叠成什么结构。

这像是拿到一张零件清单,推测它组装完成后的样子。

蛋白质设计把问题反了过来:

如果我需要一个能够完成特定任务的结构,应该怎样安排它的形状和氨基酸序列?

这不是“看懂”,而是“创造”。

但创造一张漂亮的结构图,还远远不够。

电脑里的钥匙看起来再合适,也必须回答三个现实问题:

  • 它能不能被制造出来?
  • 它能不能真的抓住目标?
  • 它在真实环境中能不能稳定工作?

所以,判断AI蛋白质设计走到了哪一步,不能只看电脑生成了多少结构。

更重要的是看它有没有依次跨过几道门:

能不能制造出来 → 有没有真实功能 → 能不能进入人体试验 → 能不能通过监管审批。
AI蛋白质产品现实进度图

四、离我们最近的一步:已经进入人体试验

截至2026年6月,还没有明确的AI从头设计蛋白质药物获得监管批准、正式上市。

但它也不再只是停留在论文里的未来设想。

有些AI设计的蛋白质已经在实验室中表现出真实功能。

一个直观的例子是esmGFP

研究人员使用蛋白质生成模型ESM3设计出一种新的绿色荧光蛋白。它与已知最相近蛋白的序列相似度只有约58%,但被真实合成以后,确实能够发出荧光。

esmGFP实验验证图

它不是治疗疾病的药物,却证明了AI能够提出自然界中未被发现的新蛋白质方案,并让它在现实中工作。

比实验室验证更进一步的,是进入人体临床试验。

2025年12月,生物技术公司Absci启动了ABS-201的Ⅰ/Ⅱa期临床试验。

ABS-201人体试验进展图

这是一款由其生成式AI平台参与设计的抗体,目标是阻断催乳素受体,用于研究雄激素性脱发的治疗。试验计划在澳大利亚招募最多227名参与者,首先观察安全性、耐受性,以及它在人体内如何变化。

这件事之所以值得普通人关注,是因为它把“AI设计蛋白质”从抽象概念变成了一个具体场景:

AI设计的抗体,已经开始在人身上测试能不能治疗脱发。

但这句话必须说完整。

ABS-201目前仍是研究性药物。它的安全性和有效性尚未得到确认,也没有获得美国FDA或其他监管机构批准。

因此,AI蛋白质产品当前更准确的现实进度是:

实验室做出来了,部分候选开始进入人体试验,但距离药店和医院里的正式产品还有很长的路。

五、PPIFlow从哪里来?450个候选结果怎么样?

讲到这里,需要介绍一个贯穿本文后半段的研究项目:PPIFlow

名字里的PPI,是Protein-Protein Interaction的缩写,中文叫“蛋白质—蛋白质相互作用”。

Flow指它采用的“流匹配”生成方法。简单理解,就是让模型从一个粗略的初始状态出发,一步步生成更符合目标的蛋白质三维结构。

许多药物发挥作用,靠的正是让一个蛋白质精准识别并结合另一个目标蛋白。可以把目标蛋白想成一把结构复杂的锁,研究人员要设计的结合蛋白,就是一把能够扣住特定位置的钥匙。

PPIFlow来自一项发表于2026年预印本平台bioRxiv的蛋白质结合物设计研究。研究团队把生成模型、计算优化和实验筛选连接起来,并公开了相关代码。它不是一种药物,也不是面向普通用户的软件,而是一套帮助研究人员设计蛋白质结合物的专业模型和研发流程。

如果说ABS-201展示的是一个候选药物怎样向临床推进,那么PPIFlow回答的是另一个问题:

在进入漫长的临床道路以前,AI能不能先批量提出候选,并帮助实验室找出更值得制造和测试的方案?

它把整个过程组织成了一条计算流水线:

先批量提出候选,再打磨结合界面的关键位置,最后筛出最值得进入实验室的一批。

换句话说,AI开始参与的不只是“画方案”,还有“改方案”和“选方案”。

这是整项研究最有分量的部分。

研究团队把450个AI设计的候选送进了实验室。它们全部完成了蛋白表达,也就是说,这些设计不再只是电脑屏幕上的结构图,而是变成了能够拿来测试的真实样品。

接下来,研究人员测试这些蛋白质能不能抓住指定目标。

第一轮测试了210个普通结合蛋白,其中76个达到了研究设定的较强结合水平。

换成更容易记住的说法:

每测试100个AI候选,大约有36个表现出了较强的结合能力。
PPIFlow实验数据图

第二轮测试的是240个设计难度更高的VHH纳米抗体,也有大约三分之一能够与目标结合。

这并不意味着AI已经解决了蛋白质设计。

不同靶点的难度并不相同,候选会失败,计算结果也可能与真实实验不一致。即使能够结合目标,距离成为真正的药物仍有很长的路。

但它至少证明了一件事:

AI提出的部分设计,确实能够被制造出来,也确实能在真实实验中抓住目标。

AI没有取代实验室。

它正在帮助实验室决定:哪些候选最值得先做。

六、真正改变的,是寻找答案的方式

过去的研发,常常需要先做大量实验,再从结果里寻找规律。

AI正在尝试把一部分试错提前到计算机里:

定义目标 → 生成候选 → 计算筛选 → 实验验证 → 数据反馈。

对普通人来说,它可能意味着更快找到药物候选、更精准的治疗工具,以及效率更高的工业酶和新的生物材料。

对研发人员来说,它带来的变化更加直接:

不是取消实验,而是让每一次实验都更接近真正的问题。
结尾重点判断图

读到这里,我想到的是另一个离蛋白质很远的领域——混凝土。

一套超高性能混凝土,同样要在水泥、砂、矿物掺合料、纤维、外加剂和用水量组成的巨大空间里寻找答案。

既然AI已经开始按照目标设计蛋白质,它能不能用类似的思路设计下一代混凝土?

这个问题,我会在下一篇「超级图图·筑」中继续讨论。

下期预告|超级图图·筑 第2期
AI能设计蛋白质,为什么还不能设计混凝土?

你更希望AI设计蛋白质首先改善哪件事:新药研发、精准治疗、绿色制造,还是新材料?

「超级图图·生」关注生物科技、生物制造、合成生物与生物基材料,观察生命科学如何从实验室走向产业和工程应用。

资料边界

  • PPIFlow是一套面向蛋白质结合物设计的专业模型和开源流程。
  • 450个候选完成蛋白表达,不等于它们全部具备目标结合能力。
  • esmGFP
    是经过实验验证的AI生成荧光蛋白,不是获批药物。
  • ABS-201
    已进入Ⅰ/Ⅱa期临床试验,但仍是研究性药物,尚未获得监管批准。
  • 截至2026年6月,尚无本文能够确认的AI从头设计蛋白质药物正式获批上市。
  • 计算设计和筛选不能代替湿实验,更不能代替药物研发中的安全性、有效性和临床验证。
  • PPIFlow代码采用CC BY-NC-SA 4.0许可,不应直接表述为可免费商用。

主要资料

  • Hayes et al.:Simulating 500 million years of evolution with a language model,Science,2025
  • Absci:ABS-201项目与临床试验说明
  • Absci:Biologics Pipeline
  • PPIFlow GitHub:Mingchenchen/PPIFlow
  • Yu et al.:High-Affinity Protein Binder Design via Flow Matching and In Silico Maturation,bioRxiv,2026
  • PPIFlow Flow Matching综述:2024—2026年代表性方法、挑战与技术路线整理

蛋白质设计前沿技术

Frontier technologies in protein design

     近年来,人工智能已彻底颠覆了蛋白质设计领域。以AlphaFold、ESM、RFdiffusion为代表的一系列AI工具,使得从零开始创造具有全新结构和功能的蛋白质成为可能,为生物医药、酶工程等领域带来了前所未有的机遇。 然而,强大的工具也带来了新的挑战:复杂的软件环境配置、多样的模型调用方式以及从“想法”到“设计”的完整工作流整合,成为了许多研究者,尤其是初学者的现实门槛。

      本课程旨在系统性地解决这些问题。我们将从最基础的Linux与Conda环境管理讲起,确保每位学员搭建起稳定、可复现的计算平台。课程核心将深度实践三大前沿工具:利用ESM模型进行序列分析与特征提取;掌握ProteinMPNN为给定骨架设计最优序列;并通过RFdiffusion实现从无到有的蛋白质骨架生成。最终,我们将以一个完整的“设计靶向EGFR的全新结合蛋白”综合项目,串联所有技术环节,带领学员亲历从靶标分析、骨架生成、序列设计到AI结构验证的完整闭环,快速获得独立开展AI蛋白质设计的能力。因此,中国化工企业管理协会医药化工专业委员会决定于2026年6月26-28日杭州市举办2026 AI蛋白质设计前沿技术实战培训班”。届时将邀请行业内实践专家针对相关内容进行讲解与实操教学参会名额有限,有关单位积极转发或组织相关人员尽快报名参加。现将有关事项通知如下:

 组织机构

主办单位:中国化工企业管理协会医药化工专业委员会
承办单位:中科凯晟(北京)化工技术研究院

 会议安排

时间:2026年6月26-28日(26日全天报到)

地点:杭州市

 培训形式

l基础奠基工具实践,实例分析,互动答疑

完成全部培训课程者由协会颁发培训证书

 课程对象

1.蛋白质工程领域科研单位专家及学者;

2.农学、医学、药学及食品学院校及企业蛋白质功能开发负责人;

3.生物工程领域从业工作者。

 课程安排

第一天:计算环境搭建与蛋白质序列设计

6月27日,上午09:00-12:00;下午13:30-16:30
上午 : 模块一 & 模块二
模块一:Linux基础 — Linux, Conda, VScode & Docker & Claude Code,kimi code
目标:为后续所有软件安装和运行扫清障碍,建立规范、可复现的科研计算环境管理能力。
Linux基础操作精讲:
文件系统与导航: ls, cd, pwd, mkdir 的高效使用技巧。
文件管理: cp, mv, rm, vi, cat, head, tail 的实战应用。
权限管理:理解并使用 chmod 解决脚本执行权限问题。
实操:在服务器上创建课程项目目录,并进行基本的文件组织。
Conda环境管理核心:
核心理念:通过环境隔离解决不同项目间的依赖冲突问题。
环境生命周期:创建(create)、激活(activate)、退出(deactivate)、删除(remove)
软件包管理:安装(install/pip install)、查看(list)、导出配置(env export)
实操:为后续的ESM、ProteinMPNN和RFdiffusion创建独立的Conda环境。
Docker容器化入门:
概念对比:Docker与虚拟机的异同,镜像(Image)与容器(Container)的核心关系。
核心命令: docker pull (拉取官方镜像), docker run (运行容器)。
应用场景:讲解如何利用Docker一键部署复杂的生物信息学工具。
VScode远程开发实战:
SSH远程连接:配置Remote-SSH插件,一键连接实验室服务器,本地浏览远程文件。
科研扩展生态:安装Python、Jupyter、Docker插件,构建蛋白质设计的编程环境。
实操:通过VScode连接服务器,在课程目录中创建、编辑并直接运行蛋白质生成脚本。
Claude Code & Kimi Code AI辅助编程:
核心理念:AI嵌入终端与IDE,实现代码生成、重构、Debug闭环,加速生物信息学开发。
工具定位:自主编程Agent,自然语言直驱文件系统与脚本执行,独立完成"写代码—运行—报错修复—结果分析"完整链路。
实操:以自然语言驱动蛋白质设计全流程——自动生成RFdiffusion推理脚本、批量处理PDB文件、解析ProteinMPNN序列打分输出。
模块二:ESM模型探索 — 从安装到基础应用
目标:掌握Meta AI的ESM系列工具,为蛋白质序列分析和结构预测打下基础。
ESM (Evolutionary Scale Modeling) 简介:
蛋白质语言模型:讲解ESM如何将自然语言处理的思想应用于蛋白质序列。
主要应用:序列嵌入、突变效应预测、结构预测 (ESMFold)。
软件安装与环境配置: 
使用 pip 在之前创建的Conda环境中安装 fair-esm 库。
依赖检查与GPU环境确认 ( torch, cuda)。
基础操作演示与实战:
获取序列嵌入 (Embeddings):编写Python脚本,为给定的FASTA序列生成高维特征表示,并解释其用途。
序列分类模型训练:基于ESM提取的序列嵌入特征,构建简单的分类器,完成蛋白质功能分类或亚细胞定位预测任务。
单序列结构预测 (ESMFold):使用ESMFold命令行工具或API,对一条蛋白质序列进行快速结构预测。
结果分析:解读输出的PDB文件,重点关注pLDDT分数,并使用PyMOL等软件进行三维结构可视化。
实操练习:学员独立完成一个未知蛋白的结构预测,并评估预测结果的可靠性。
下午: 模块三
模块三:ProteinMPNN深度实践 — 反向折叠与序列设计 (3小时)
目标:精通使用ProteinMPNN,根据给定的蛋白质骨架设计出全新的、高稳定性的氨基酸序列。
软件安装与环境配置 : 
从GitHub克隆 ProteinMPNN 官方仓库 ( git clone)。
使用Conda创建专用环境并安装所有依赖项。
下载预训练好的模型权重文件,并放置到指定目录。
序列设计核心流程:
基础工作流:输入PDB结构文件,运行设计脚本生成候选序列。
重要参数解析:输入输出路径、生成序列数量、采样温度等。
结果文件解读:理解输出FASTA中的序列评分及其意义。
进阶设计技巧:
位点控制策略:固定关键残基、排除特定位置、氨基酸偏好等。
复杂体系设计:多链蛋白、同源多聚体的序列优化。
参数调优实践:通过温度参数平衡序列多样性与结构匹配度。质量评估方法:筛选高分序列、分析氨基酸组成合理性。

第二天:蛋白质结构生成与综合项目实战

6月28日,上午09:-12:00;下午13:30-16:30

                                       上午: 模块四
模块四:RFdiffusion核心技术 — 从无到有生成蛋白质骨架 (3小时)
目标:掌握蛋白质结构生成工具RFdiffusion,实现从头设计全新拓扑结构的能力。
软件安装与环境配置: 
详细安装流程:分步指导通过git clone 获取源码,使用Conda/Mamba创建环境。
常见问题排查:总结安装过程中可能遇到的编译错误、依赖冲突等问题及解决方案。
结构生成操作流程: 
核心脚本run_inference.py :演示完整的命令行调用格式。
Contig字符串详解:详细讲解如何通过 contig 字符串定义生成长度、引入已知motif、指定二级结构等。例如: 'A1-100' (生成100个残基), '10-20/A1-10/10-20' (在A链1-10号残基两侧各生成10-20个残基)。
常用参数设置和输出结果解析:  
inference.output_prefix: 输出文件命名
denoiser.noise_scale_ca: 主链噪声水平控制
denoiser.noise_scale_frame: 局部构象噪声控制
scaffolder.symmetry: 对称性参数(C2, D2, I等)。
输出结果深度解析:使用PyMOL加载.traj.pdb轨迹文件,观察结构生成过程,并学习如何筛选最优候选结构。
下午: 模块五 & 模块六
模块五:RFdiffusion引导的Binder骨架生成
项目背景:  设计一个能够特异性结合EGFR(表皮生长因子受体)的全新蛋白binder,用于潜在的癌症治疗应用。EGFR在多种癌症中过表达,是重要的药物靶点。
EGFR靶标分析:
解析EGFR蛋白结构特征(621 AA,胞外域关键结合位点)。
确定设计目标:针对EGFR胞外域设计小分子binder。
识别关键结合界面和潜在的相互作用热点区域。
RFdiffusion Binder设计实操:  
输入EGFR结构PDB文件,指定目标结合区域。
设置binder长度范围、扩散步数等关键参数。
运行脚本生成20-50个候选binder骨架。
结果筛选与评估:
筛选策略实践:从生成结果中筛选出3-5个最优候选骨架,并进行可视化分析,检查结合界面的合理性。
模块六:序列生成
ProteinMPNN序列设计:
针对筛选骨架进行序列优化:输入RFdiffusion生成的top3候选骨架,固定界面关键残基,优化其余位置。
参数调整与序列生成:设置合适的采样温度,每个骨架生成10-20条序列。
序列筛选与优化:分析ProteinMPNN评分和氨基酸组成,检查界面残基的化学性质,选择每个骨架的top3序列进入验证阶段。
AlphaFold3结构验证:
序列折叠预测:将ProteinMPNN设计的序列提交AlphaFold3预测,评估pLDDT分数。
结构比对与验证:计算预测结构与RFdiffusion骨架的RMSD(目标 < 2Å),在PyMOL中叠加比对,检查界面保持情况。
课程总结与讨论
回顾完整设计流程:靶标分析→ 骨架生成 → 序列设计 → 结构验证。
讨论挑战与改进方向,介绍后续优化策略。
课程总结与Q&A: 
回顾两天课程的核心知识点与工作流。
探讨AI蛋白质设计的当前局限与未来发展方向。
提供进一步学习的资源和路径建议。开放式问答环节,解决学员所有遗留问题。

 收费标准

3500 元/人(含会议费、资料费等);同一单位报名 2 人以上3000 元/人;住宿统一安排,费用自理。

 报名信息表

 联系人

组委会秘书处: 电 话:18701692140(同微)

 联 系 人: 张立  

电子邮箱:huagong_zhangli@163.com