夜雨聆风学习资料网

ARTICLE · 990215

AI驱动的蛋白设计实战课程——从 ProteinMPNN 到 De Novo 生成式酶设计

AI驱动的蛋白设计实战课程——从 ProteinMPNN 到 De Novo 生成式酶设计

一、课程特色

近年来,AlphaFold、ProteinMPNN 以及生成式人工智能的发展正在快速改变传统蛋白设计模式。计算蛋白设计逐渐形成从“目标结构—序列设计—结构预测—设计验证”到“功能需求—结构生成—序列设计”的完整技术路线。

本课程聚焦 AI 蛋白设计的实际科研应用。第一部分以 ProteinMPNN 为核心,从 Linux 计算环境和蛋白结构基础入门,结合经典研究及真实论文案例,系统学习蛋白序列设计与设计序列筛选。第二部分以《De Novo Design of Miniature and Efficient Metallo-Ketoreductases》为主体案例,讲解从理论催化活性中心、生成式结构设计、序列设计到计算筛选和实验验证的 De Novo 酶设计逻辑,并进一步介绍 RFdiffusion3 和 LigandMPNN 在新一代蛋白设计中的应用。

二、课程安排

第一部分:ProteinMPNN 蛋白设计、结构验证与论文复现

第一节:Linux 系统与蛋白设计计算基础

1.Linux 系统基础介绍 Linux 文件系统、目录结构以及蛋白设计过程中常用的 Linux 操作命令。

2.Conda 环境管理讲解 Conda 环境创建、激活以及不同蛋白设计软件运行环境的管理方法。 

3.蛋白序列与结构文件介绍 FASTA、PDB 等蛋白设计过程中常见文件格式及基本信息。 

4.Python 与 Shell 脚本介绍蛋白设计程序和批处理脚本的基本运行方法。

5.CPU 与 GPU 计算介绍 CPU、GPU 的基本区别以及 GPU 计算状态查看方法。 

6.GitHub 科研工具介绍蛋白设计开源项目的下载、安装以及 README 文档阅读方法。

第二节:AI 蛋白设计基本原理与 ProteinMPNN

1.蛋白设计基本概念介绍蛋白结构预测、蛋白序列设计以及从头蛋白设计之间的区别。

2.Sequence-to-Structure介绍从氨基酸序列预测蛋白三维结构的基本思想。

3.Structure-to-Sequence介绍蛋白逆折叠(Inverse Folding)的基本概念及其在蛋白设计中的应用。 

4.ProteinMPNN 算法介绍结合 Baker 团队 ProteinMPNN 经典论文,介绍基于蛋白骨架进行序列设计的核心思想。

5.ProteinMPNN 模型原理介绍蛋白骨架、残基局部结构环境以及序列生成之间的关系。

6.ProteinMPNN 设计逻辑理解为什么给定一个蛋白 Backbone,可以利用 ProteinMPNN 产生大量与目标结构相容的候选序列。

第三节:ProteinMPNN 蛋白序列设计实操

1.ProteinMPNN 环境配置完成 ProteinMPNN 安装、运行环境配置以及程序测试。 

2.蛋白结构输入准备目标蛋白 PDB 结构并完成 ProteinMPNN 输入文件处理。 

3.蛋白序列生成基于目标蛋白 Backbone 批量生成候选蛋白序列。 

4.关键参数设置介绍 temperature、sequence number、fixed positions 等常用设计参数。 

5.局部与整体序列设计根据实际科研问题选择全蛋白设计或指定区域设计。

6.ProteinMPNN 结果解析读取 ProteinMPNN 输出结果并理解模型评分及序列信息。 

7.候选序列初筛根据模型评分、序列差异以及设计目标筛选优势设计序列。

第四节:AlphaFold2 / ColabFold 结构回验与结果评价

1.AlphaFold2 基本原理介绍 AlphaFold2 蛋白结构预测的基本思想及其在蛋白设计中的作用。 

2.ProteinMPNN 与 AlphaFold2 的关系理解 Structure-to-Sequence 和 Sequence-to-Structure 两类模型之间的互补关系。 

3.ColabFold 环境与使用介绍 ColabFold 版本 AlphaFold2 的运行方法及蛋白序列输入。 

4.设计序列结构预测 ProteinMPNN 获得的候选序列重新进行蛋白三维结构预测。 

5.pLDDT 结果解析介绍 pLDDT 的含义以及不同区域结构预测置信度的判断方法。 

6.PAE 结果解析介绍 Predicted Aligned Error 及其在蛋白整体结构评价中的应用。 

7.设计结果结构回验结合预测结构及置信度信息进一步评价候选设计序列。

第五节:PyMOL 蛋白结构比对与 RMSD 分析

1.PyMOL 基础操作介绍蛋白结构导入、显示、残基选择以及基本结构可视化方法。

2.目标结构与预测结构叠合 ProteinMPNN 原始目标 Backbone 与预测结构进行三维结构比对。 

3.RMSD 基本原理介绍 Root Mean Square Deviation 及其在蛋白设计评价中的意义。 

4.RMSD 计算实操计算设计蛋白预测结构与目标结构之间的 RMSD。 

5.整体与局部结构评价比较蛋白整体骨架以及关键功能区域在设计前后的结构变化。

6.多指标联合评价综合结构预测置信度与结构一致性评价候选设计。

7.蛋白设计闭环建立“序列设计—结构预测—结构比较—候选筛选”的完整验证流程。 

第六节:真实论文 ProteinMPNN 蛋白设计流程复现

1.论文研究思路解析以季鹏飞团队 ACS Catalysis 相关研究为案例,拆解文章中的蛋白设计技术路线。 

2.设计目标确定分析论文为什么使用 ProteinMPNN,以及作者希望解决的具体蛋白设计问题。 

3.原始结构准备获取并处理论文研究对象的目标蛋白结构。

4.ProteinMPNN 设计复现按照论文研究思路完成候选蛋白序列生成。

5.设计结果整理对批量生成的候选序列进行统计、比较和初步筛选。

6.候选结构回验对设计序列进行结构预测并评价其与目标构象的一致性。

7.论文结果比较将计算复现结果与论文报道结果进行比较,分析设计结果的一致性与差异。

8.完整技术路线总结掌握从目标结构、序列设计、结构回验到候选筛选的完整蛋白设计流程。

第二部分:De Novo 生成式酶设计——从理论活性中心到人工酶

第七节:De Novo 酶设计思想与 JACS 论文案例解析

1.De Novo 蛋白设计基本概念介绍从“已有 Backbone 上设计序列”进一步发展到“从功能需求出发设计新蛋白”的技术变化。 

2. ProteinMPNN 到 De Novo Design回顾给定 Backbone 设计序列的基本逻辑,并提出没有天然 Backbone 时如何开展蛋白设计。 

3.核心论文解析以《De Novo Design of Miniature and Efficient Metallo-Ketoreductases》为主体案例,介绍人工金属酮还原酶的研究目标与整体设计思路。 

4.理论催化活性中心介绍金属中心、关键催化残基、底物及催化几何关系在 De Novo 酶设计中的作用。 

5.功能优先的设计思想理解如何从“设计一个稳定结构”进一步转向“围绕目标催化功能组织结构和序列”。 

6.论文整体技术路线拆解“理论活性中心—结构生成—序列设计—计算筛选—实验验证”的完整流程。 

第八节:RFdiffusion 生成式结构设计——从活性中心到 Backbone

1.RFdiffusion 基本思想介绍扩散生成模型用于蛋白三维结构设计的基本逻辑。

2.从理论活性中心到 Backbone理解如何围绕预先定义的催化结构和功能几何关系生成新的蛋白骨架。

3.功能 Motif Scaffolding介绍如何将关键功能残基及其空间关系作为约束嵌入新生成的蛋白结构。

4.候选结构批量生成围绕目标催化中心生成大量不同的候选蛋白 Backbone。 

5.生成结构筛选理解 De Novo 设计为什么需要从大规模计算候选中逐步筛选少量优势结构。 

6.论文结构生成流程解析结合 metallo-ketoreductase 案例,理解生成式结构设计在真实人工酶研究中的应用。 

第九节:ProteinMPNN 与 LigandMPNN——从 Backbone 到功能序列

1. Backbone 到 Sequence生成候选蛋白结构后,利用逆折叠模型寻找能够形成目标结构的氨基酸序列。

2.ProteinMPNN 序列设计将第一部分掌握的 ProteinMPNN 应用于 De Novo 生成的候选 Backbone。 

3.批量候选序列生成针对不同 Backbone 生成多条候选序列并进行初步筛选。 

4.LigandMPNN 基本思想介绍进一步考虑小分子、底物、辅因子和金属离子局部环境的序列设计方法。

5.金属中心与配体环境设计围绕金属配位、底物结合和催化几何关系优化功能区域周围的氨基酸环境。

6.关键催化残基固定保留必要的功能残基,对其周围结构区域进行定向序列设计。

7.ProteinMPNN 与 LigandMPNN 比较理解普通 Backbone 序列设计与配体感知序列设计分别适合解决的问题。 

第十节:总结完整设计流程与新一代方法

1.完整设计流程复盘从科学问题、理论催化中心、生成式 Backbone 设计到序列设计,串联论文的核心计算路线。 

2.设计结果计算筛选结合结构合理性、功能几何保持情况及模型评价逐步缩小候选范围。

3.功能中心检查重点评价金属配位、催化残基以及底物结合区域是否保持预期空间几何关系。

4.多阶段候选筛选理解如何从大量生成结构和序列逐步获得少量进入实验验证的候选蛋白。

5.从论文复现到独立设计讨论如何将该流程迁移到其他金属酶、结合蛋白和人工酶设计任务。

6.RFdiffusion3 技术拓展介绍新一代生成式蛋白设计模型的发展,以及如何与 LigandMPNN 组织成面向功能的新设计流程。

会议相关问题

授课方式

腾讯会议线上直播

会议时间

10月9日开始

四个晚上7点30-10点

会议费用

3200元/人
报名方式
扫码咨询报名

相关学习资料

返回首页浏览学习资料