乐于分享
好东西不私藏

炸裂Nature!AI设计蛋白新工具——镭射枪(Raygun),开启蛋白质设计新思路!

炸裂Nature!AI设计蛋白新工具——镭射枪(Raygun),开启蛋白质设计新思路!
目前,主流的蛋白质设计方法——从头设计de novo design),即研究人员利用计算机从零开始搭建全新的蛋白质结构。这种方法虽然强大,但每次都从头开始,显然耗时耗力。
而大自然告诉我们还有另外一条路——进化。蛋白质在数十亿年的进化过程中,新的蛋白质并不总是从头诞生,而是在已有的蛋白质的基础上,通过协调的替换、插入和删除,不断修饰,最终形成具有不同功能的全新蛋白质。然而,目前的计算蛋白质设计,尚无法完全复制大自然利用已有蛋白质模板来构建新蛋白质的能力。
2026 年 7 月 29 日,杜克大学的研究人员在国际顶尖学术期刊 Nature 上发表了题为:Miniaturizing and modifying natural proteins with Raygun 的研究论文。
该研究开发了一个生成式 AI 模型——Raygun(镭射枪)利用基于语言模型嵌入构建的蛋白质序列概率编码,能够在不破坏蛋白质结构和功能的前提下,将天然蛋白质进行“缩小”、修饰或“放大”处理。不同于其他从头设计全新蛋白质的蛋白质语言模型Raygun 通过模拟自然进化中的步骤来改造现有蛋白质——添加或删除单个蛋白质亚基,或将一个蛋白质亚基替换为另一个。

八大热门专题

名师手把手教学
01
AI蛋白质设计
02
人工智能构建虚拟细胞
03
CADD计算机辅助药物设计
04
AIDD人工智能药物发现与设计
05
合成生物学与基因电路设计
06
机器学习代谢组学
07
深度学习多组学的应用
08
蛋白晶体结构解析

特惠福利:

(报名一门直播课赠送两门回放)

(报名三门直播课赠送以下全部)

01.单细胞测序与空间转录组学

02.深度学习解析宏基因组学

03.机器学表观组与转录组

04.深度学习质谱蛋白组学

05.机器学习生物医学

06.AI智慧医疗影像

07.医疗AI多模态大模型

08、深度学习在基因组学中的应用

09、CRISPR-Cas9基因编辑技术

10、AI抗菌肽设计

11、CADD(进阶班)

12、机器学习微生物组学

课程内容详细安排
01
AI蛋白质设计
上下滑动查看更多

(向上滑动查看内容)

第一天
模块一:基础理论与设计思想

学习目标: 理解现代蛋白质设计的理论基石,建立从“功能”到“结构”再到“序列”的正确设计观。

蛋白质折叠问题与经典设计

。回顾CASP历史”以及蛋白质折叠问题的复杂性 。

。介绍David Baker实验室与IPD的设计哲学:以最终功能为导向,设计自然界不存在的全新蛋白质结构

。讲解Rosetta软件的核心思想,理解其作为蛋白质设计基石的历史地位与方法论

模块二:核心AI模型原理与代码实现

学习目标:从原理和代码层面,彻底理解驱动现代蛋白质预测与设计的两大核心神经网络架构

·基础工具与环境

o掌握Numpy进行多维数组(Tensor)操作 。

o学习PyTorch的核心概念:张量、自动求导机制

o讲解服务器GPU与CUDA的基本工作原理,为后续的本地化部署打下基础。

·关键模型架构拆解

oTransformer与Attention机制:深入讲解Transformer模型如何通过自注意力机制捕捉序列中的长距离依赖关系,并分析其如何被AlphaFold 2用于整合多序列比对(MSA)信息和空间几何信息,构成Evoformer模块的核心 。

o扩散模型 (Diffusion Model):详细阐述扩散模型的前向加噪(Forward Process)与反向去噪(Reverse Process)的数学原理 。重点讲解该模型如何被应用于RFdiffusion,实现从高斯噪声中逐步生成结构合理的蛋白质骨架

代码实践:所有模型原理都将配合Jupyter Notebook进行代码实操,确保学员不仅理解理论,更能动手实现。

第二天

模块三:前沿设计工具链:原理、部署与应用

学习目标:掌握当前最高效的蛋白质设计“三要素”工具链,并完成本地化部署,具备独立开展计算设计的能力。

A. 结构生成 (RFdiffusion)

功能详解:学习RFdiffusion如何从随机噪声中生成全新的蛋白质骨架 。

实操技术:重点讲解几种核心设计模式的应用场景与参数设置:

无条件生成 (Unconditional generation):用于创造全新的拓扑结构。

基于骨架的生成 (Scaffolding):在已有的结构骨架上进行延申或构建。

功能位点限定生成 (Inpainting):在固定关键功能位点(如活性中心、结合界面)的前提下,生成包裹该位点的全新结构

B. 序列设计 (ProteinMPNN):o核心问题:讲解“蛋白质反向折叠 (Inverse Folding)”问题的挑战性,即如何为给定的骨架设计出能正确折叠的氨基酸序列 。o协同工作流:演示如何将RFdiffusion生成的骨架(Backbone)作为输入,利用ProteinMPNN设计出高稳定性的氨基酸序列,形成完整的“结构-序列”设计流程 。

C. 结构验证与功能拓展 (AlphaFold 3)

o精度验证:学习使用AlphaFold 2/3验证由ProteinMPNN设计的序列,能否高精度地折叠回RFdiffusion所设计的初始结构 。重点讲解pLDDT和PAE图的解读,用于评估预测结果的置信度 。

o功能预测:介绍AlphaFold 3的核心突破——其预测能力已从单一蛋白质扩展到蛋白质、DNA、RNA、配体等多种分子的复合物 。探讨如何利用这一特性,初步评估设计的蛋白质与靶点分子的相互作用,为药物设计提供关键信息。

第三天

模块四:应用方向专题实战

学习目标:将前面学习的工具链应用到三个主流的生物医药研发场景中,解决具体问题。

总学习目标:通过三个独立的、项目驱动的专题,让学员完整地、端到端地执行计算蛋白质设计的流程。在课程结束时,学员不仅掌握了工具的使用,更能理解在不同应用场景下(酶、抗体、从头设计)的设计策略、关键考量和技术组合。

专题:从头设计功能性Binder

技术流程:一个完整的综合性项目。学员将选择一个具体靶点,独立运用“RFdiffusion → ProteinMPNN → AlphaFold”的全套技术流程,从零开始设计一个能够特异性结合该靶点的全新小分子蛋白(Binder),完成一个标准化的de novo设计流程。

项目目标:执行一个完整的、工业界标准的de novo设计流程,针对一个选定的蛋白靶点,从零开始设计一个能够特异性结合其表面的全新小分子蛋白(Binder)。

核心概念De novo设计、蛋白质-蛋白质相互作用(PPI)、形状互补性、计算流程的端到端整合。

技术流程详解

1.靶点分析与结合位点选择

o选择一个感兴趣的靶点蛋白(如疾病相关蛋白)。

o分析其表面性质,选择一个适合作为结合靶点的区域(通常是相对平坦、具有一定疏水性的表面)。

2.基于靶点的骨架生成 (RFdiffusion)

o此为设计的核心创造步骤。学员将学习使用RFdiffusion的功能位点限定生成 (Inpainting)模式

o将靶点蛋白的结构作为固定的“环境”,RFdiffusion会在此环境的约束下,从噪声中“生长”出一个与靶点表面形状高度互补的全新蛋白质骨架。

3.序列填充与优化 (ProteinMPNN)

o将上一步生成的最优骨架输入ProteinMPNN。

oProteinMPNN会为这个全新的骨架设计出能够稳定折叠的氨基酸序列,完成从“形状”到“化学本质”的转化 。

4.双重计算验证 (AlphaFold)

o步骤一:单体验证。将ProteinMPNN设计的序列输入AlphaFold,预测其单体结构。验证该序列能否独立折叠成我们设计的形状(高pLDDT得分,且RMSD与设计模型低)。

o步骤二:复合物验证。使用AlphaFold-Multimer 预测设计的Binder和靶点蛋白的复合物。验证Binder能否如预期般结合到靶点的正确位置(低界面PAE得分)。

第四天
专题:酶的计算改造与性能优化
o技术流程:学习利用同源结构数据库进行搜索,结合计算工具进行定向突变,以优化酶的催化活性、底物特异性或热稳定性。课程将介绍定向进化与适应性景观等核心概念

项目目标:针对一个给定的酶,通过计算方法,设计出具有更高热稳定性或催化活性的突变体,并提供一套可供实验验证的候选序列。

核心概念:适应性景观 (Fitness Landscape) ,定向进化 ,酶催化与过渡态理论 (Transition State Theory) ,计算诱变 (In-silico Mutagenesis),折叠自由能 (ΔG)。

技术流程详解

1.模板选择与结构准备

o从蛋白质结构数据库(PDB)中选取一个具有已知结构和功能的酶作为改造模板。

o若无实验结构,将学习利用UniProt 寻找同源序列,并使用SWISS-MODEL 或本地AlphaFold进行结构预测,获得可靠的起始模型。

o使用PyMOL 或ChimeraX 分析酶的活性位点、底物结合口袋以及潜在的不稳定区域(如高柔性loop)。

2.计算突变扫描与稳定性预测

o学习使用Rosetta等工具包中的能量函数,对酶的特定区域(或全长)进行计算饱和突变扫描。

o核心技术点是计算每个突变体相对于野生型的折叠自由能变化 (ΔG)。学员将学习如何解读ΔG值,以筛选出能够提升蛋白质热稳定性的有益突变。

3.催化性能的计算评估

o对于活性位点附近的突变,将引入分子对接(Molecular Docking)方法,模拟底物或过渡态类似物与突变酶的结合情况。

o通过比较结合能、关键相互作用(氢键、盐桥等)的变化,来半定量地预测突变对催化活性(kcat/KM)的潜在影响。

4.候选突变体的筛选与组合

o基于上述计算结果,学员将学习如何制定筛选策略,例如,优先选择同时提升稳定性且不损害(或提升)活性的突变。

o探讨如何组合多个有益的单点突变,以获得性能提升更显著的多点突变体。

第五天
专题:抗体药物的计算设计
o技术流程:掌握计算辅助的抗体设计方法,包括靶点抗原的分析、互补决定区(CDR)的设计与优化,以及利用AlphaFold-Multimer等工具预测抗体-抗原复合物结构,评估亲和力与特异性 。                      

项目目标:掌握计算辅助的抗体亲和力成熟(Affinity Maturation)流程,针对一个已知的抗体-抗原复合物,设计新的互补决定区(CDR)序列,以增强其结合能力。

核心概念:抗体结构域、CDR与框架区(FR)、抗原表位(Epitope)与互补位(Paratope)、抗体人源化、亲和力与特异性。

技术流程详解

1.抗体-抗原复合物的结构分析

oPDB中选取一个抗体-抗原复合物结构作为起始点。

o利用可视化软件,精确识别构成结合界面的CDR loop,特别是贡献最大的CDR-H3。

o详细分析界面上的氢键、疏水作用、盐桥等关键相互作用,理解亲和力的结构基础。

2.CDR区域的序列设计

o固定抗体的框架区和抗原结构,仅针对CDR区域进行序列设计。

o学员将使用ProteinMPNN等工具,在保持CDR loop骨架构象的同时,重新设计其氨基酸序列,以期发现能与抗原形成更优相互作用的新序列。

3.利用AlphaFold-Multimer进行复合物结构预测与评估

o将新设计的CDR序列整合回抗体,形成一个完整的突变抗体序列。

o使用AlphaFold-Multimer 预测新设计的抗体与抗原的复合物结构。这是流程中最关键的一步。

o学员将学习如何解读AlphaFold-Multimer的输出结果,特别是利用PAE(Predicted Aligned Error)图来评估界面预测的置信度,判断新设计的抗体是否仍能以正确的模式结合抗原。

4.亲和力排序与候选筛选

o通过比较不同设计方案的界面结合面积、预测的氢键网络、以及界面PAE得分等指标,对设计的抗体进行排序。

o筛选出1-3个预测结合能力最强、且结构最可靠的候选抗体序列。

02
人工智能构建虚拟细胞
上下滑动查看更多    

(向上滑动查看内容)

第一天 细胞数据数字化与基础表征
上午 理论讲解(第一、二阶段)
第一阶段:细胞数据数字化(Data Representation) 核心目标:解决“如何让细胞被AI理解”,讲解细胞多组学数据的复杂性,以及将复杂细胞数据转化为 机器可读结构的核心逻辑与关键需求,为后续模型应用奠定数据基础。
配套模型理论:多组学虚拟细胞基础表征模型(Virtual Cell Foundation Representation Models),详 细讲解scVI、totalVI、MultiVI、scANVI、MOFA+的核心原理,重点阐述潜变量建模、多模态数据统一 编码的思路,明确该模型核心结果(解决批次效应、数据降噪、潜变量空间统一)及其作为后续所有模型 底座的核心价值。
第二阶段:细胞状态建模(State Learning)
核心目标:解决“如何识别细胞处于什么状态”,讲解从“细胞数据”到“细胞状态”的转化逻辑,以及 细胞状态建模在医药研发中的核心意义。
配套模型理论:细胞状态学习与潜空间建模模型(Cell State Learning Models),系统讲解AE、VAE、 Hierarchical VAE、β-VAE、Contrastive Cell Embedding 等理论的核心原理,说明其核心结果(细胞 状态向量、亚群识别及稀有细胞发现),以及在药物敏感细胞亚群发现中的应用价值。
下午 实操演练(对应上午第一、二阶段理论)
实操前置准备:GPU服务器环境适配、Linux与Python环境调试 
1. Linux 常用命令进阶:细胞数据文件(单细胞RNA、ATAC数据)的批量管理、权限设置、格式转换; 
2. Python 环境搭建与优化:细胞数据处理相关包(scanpy、torch、scvi-tools)的安装与调试。
实操模型讲解(Python代码解析 + GPU服务器上机实操)
1. 实操模型1:MultiVI(多模态统一表征)—— 对应第一阶段理论,实现RNA+ATAC数据统一编码, 完成数据降噪与批次效应校正,掌握潜变量空间构建方法,理解其作为模型底座的核心作用;
 2. 实操模型2:scVI(单细胞潜变量建模)—— 对应第一、二阶段理论,基于单细胞RNA数据,完成潜 变量建模、细胞聚类初步分析,掌握基础表征模型的训练与评估方法,衔接细胞状态识别的核心需求;
 3. 实操模型7:Nicheformer(空间基础模型)—— 对应第二阶段细胞状态建模理论,整合空间信息与 单细胞数据,完成细胞空间状态表征,掌握空间基础模型的核心应用,深化细胞状态识别的实操能力。
第二天 细胞状态建模与调控机制推理

上午 理论讲解(第三、四阶段)

 第三阶段:细胞调控机制建模(Regulatory Modeling)

 核心目标:解决“为什么细胞会发生变化”,讲解细胞调控的底层机制,从表型识别深入到机制层面,明 确调控机制建模在药物研发中的核心价值。

 配套模型理论:细胞调控网络与机制推理模型(Regulatory Network Models),详细讲解Graph Attention Network (GAT)、Message Passing Neural Network (MPNN)、SCENIC、Gene Regulatory Graph、Protein Interaction Graph 的核心原理,阐述其核心结果(TF调控网络、基因因 果关系、蛋白互作机制),以及在药物靶点发现中的应用逻辑。

第四阶段:细胞动态预测(Dynamic Evolution)

 核心目标:解决“细胞下一步会走向哪里”,讲解细胞命运轨迹推演的核心逻辑,以及动态预测对药物研 发(如耐药、复发预测)的重要意义。

配套模型理论:结合细胞状态建模与调控机制理论,补充细胞动态预测的核心思路,衔接大模型驱动的细 胞语言模型基础,为下午scGPT、CellRank 2实操铺垫理论基础。

下午 实操演练(对应上午第三、四阶段理论)

 实操前置准备:图神经网络与动态预测工具包调试

1. Python 工具包适配:PyTorch Geometric(图神经网络)、CellRank(动态预测)工具包的安装与调试;

 2. 数据预处理复习:回顾上午理论相关的基因表达数据、调控关系数据的预处理方法。

 实操模型讲解(Python代码解析 + GPU服务器上机实操)

 1. 实操模型3:GAT(调控网络机制推理)—— 对应第三阶段理论,基于基因表达数据,构建基因调控 网络,识别关键调控节点,掌握机制推理的核心方法,理解其在药物靶点发现中的应用;

 2. 实操模型5:CellRank 2(命运与轨迹推演)—— 对应第四阶段理论,基于单细胞数据,推演细胞分 化轨迹,预测细胞未来状态,掌握动态预测的核心方法,贴合药物研发中耐药、复发预测的需求;

 3. 实操模型4:scGPT(基础大模型时代)—— 衔接第四阶段动态预测理论,基于基因表达数据,完成 细胞语言特征提取,预测药物扰动前后的细胞状态差异,掌握大模型在细胞动态预测中的基础应用。

第三天 细胞动态预测与大模型应用

上午 理论讲解(第五阶段)

 第五阶段:药物作用建模(Drug Perturbation Modeling)

 核心目标:解决“药物如何改变细胞命运”,讲解药物作用于细胞的核心逻辑,以及药物扰动建模在药物 研发全流程中的应用场景(筛选、联合用药、毒性预警等)。

 配套模型理论:生成式药物扰动虚拟细胞模型(Generative Perturbation Models),详细讲解 scDiffusion、Geneformer perturbation mode、CPA、ChemCPA、scGen、CellOT 的核心原理,明 确其核心结果(单药作用、联合给药、剂量反应、细胞未来状态预测),以及在药物筛选预实验、联合用 药预测、毒性预警、MOA机制解释中的具体应用。

下午 实操演练

 实操前置准备:药物扰动模型工具包调试 

1. Python 工具包适配:ChemCPA、scGen等药物扰动相关工具包的安装与调试;

 2. 数据准备:药物作用相关数据(药物剂量、细胞反应数据)的预处理与导入方法。 

实操模型讲解(Python代码解析 + GPU服务器上机实操)

 1. 实操模型6:ChemCPA(药物扰动预测)—— 对应第五阶段理论,构建药物扰动模型,预测不同药物 剂量的作用效果、联合用药反应,掌握虚拟筛选的核心能力,理解其在药物研发ROI提升中的作用; 

2. 补充实操:结合scGPT模型,预测药物扰动前后的细胞语言差异,衔接大模型与药物扰动建模的核心 逻辑,巩固上午理论与实操的联结。

第四天 药物作用建模与疾病系统建模
上午 理论讲解(第六阶段)
第六阶段:疾病系统建模(Disease System Modeling)
 核心目标:解决“疾病中细胞网络如何重构”,讲解疾病状态下细胞网络的变化规律,以及疾病系统建模 在患者分层、疾病亚型预测中的核心价值。
配套模型理论:疾病虚拟细胞系统模型(Disease Cell System Models),详细讲解DeepOmix、 DeepProg、GraphST、CancerCellNet、Tumor Evolution Graph 的核心原理,阐述其核心结果(癌症 细胞演化图谱、微环境重构、疾病亚型预测),以及在患者分层用药中的具体应用。
下午 实操演练 
实操前置准备:疾病系统建模工具包调试
1. Python 工具包适配:GraphST、CancerCellNet 等疾病建模相关工具包的安装与调试;
 2. 数据准备:疾病相关单细胞数据、空间数据的预处理与整合方法。
 实操模型讲解(Python代码解析 + GPU服务器上机实操)
 1. 实操模型8:GraphST(疾病微环境系统模型)—— 对应第六阶段理论,整合空间数据与疾病数据, 重构疾病微环境网络,完成患者分层分析,掌握疾病系统建模方法,理解其在患者精准用药中的应用;
 2. 补充实操:结合GAT模型,分析疾病状态下细胞调控网络的重构差异,衔接第三阶段调控机制理论与 第六阶段疾病建模理论,深化实操应用。
第五天 数字孪生与虚拟临床应用
上午 理论讲解(第七、八阶段)
 第七阶段:数字孪生细胞/组织(Digital Twin)
 核心目标:解决“如何构建可推演虚拟人体局部系统”,讲解数字孪生技术在细胞、组织层面的应用逻 辑,以及其在降低药企湿实验成本中的核心价值。
 配套模型理论:数字孪生药物研发模型(Digital Twin for Drug Development),详细讲解DrugCell、 DeepDrug、PRODeepSyn、PhysiCell、BioFVM、Agent-based tumor twin 的核心原理,阐述其核 心结果(虚拟细胞药效、药物耐药演化),以及在药企成本控制中的具体应用。
第八阶段:虚拟临床与药物研发(Virtual Clinical Translation)
 核心目标:解决“如何直接服务药物研发和临床决策”,讲解虚拟临床试验的核心逻辑,以及其在药物研 发价值预测、临床入组策略制定中的应用。
 配套模型理论:虚拟临床试验与药物决策模型(Virtual Clinical Trial Models),详细讲解VCell、 OpenCOR、PK/PD neural surrogate model、Digital Biomarker Model、Clinical Response Simulator 的核心原理,明确其核心结果(毒性、疗效、剂量、临床入组策略预测),以及在药物研发全 流程落地中的价值。
下午 实操演练(对应上午第七、八阶段理论)+ 课程总结
实操前置准备:数字孪生与虚拟临床模型工具包调试
1. Python 工具包适配:DrugCell、PhysiCell 等数字孪生相关工具包的安装与调试;
实操模型讲解(Python代码解析 + GPU服务器上机实操)
 1. 实操模型9:DrugCell(产业级药物反应预测)—— 对应第七阶段理论,构建药物反应预测模型,解 释药物作用机制,掌握产业级模型的应用方法,理解其在降低湿实验成本中的作用;
 2. 实操模型10:PhysiCell(数字孪生底层仿真)—— 对应第七阶段理论,搭建虚拟细胞仿真环境,完 成从虚拟细胞到虚拟组织的仿真闭环,掌握数字孪生底层操作,衔接虚拟临床应用;
03
CADD计算机辅助药物设计
上下滑动查看更多

(向上滑动查看内容)

第一天

启程·洞见药物设计的微观世界 (Vision & Foundation)

上午:理论基石——计算药物设计的思想与方法

·模块一:药物发现的源头——为何蛋白质三维结构至关重要?

o经典方法:同源建模(Homology Modeling)的逻辑与应用

o前沿探索:从头建模(de novo Modeling)的挑战与突破

·模块二:锁定靶心——蛋白质活性位点的识别与意义

o探索药物与靶点的“钥匙-锁”关系

·模块三:分子之舞——优秀药物分子的关键结构特征

o解构小分子药物的构效关系奥秘

·模块四:CADD核心武器库概览

o分子对接(Molecular Docking):预测分子间的“亲密接触”

o虚拟筛选(Virtual Screening):在百万分子中“大海捞针”

o分子动力学模拟(Molecular Dynamics):观测分子的动态行为

o其他前沿计算方法简介

下午:实战预备——可视化工具与数据解读

·模块五:解锁生命蓝图——蛋白质结构数据库(PDB)深度解析

o高效检索:精准定位你的目标蛋白

o信息解读:全面掌握PDB页面信息与生物学含义

o数据获取:标准数据的下载与管理

o破译密码:PDB文件格式的结构化解读

·模块六:PyMOL大师课——从入门到精通的分子可视化

o初识PyMOL:核心功能与界面导览

o基础操作:旋转、缩放、选择与着色

o高级渲染:绘制精美的蛋白/小分子表面图与静电势分布图

o成果展示:精准绘制相互作用图并制作引人注目的科学动画

第二天:构建·从序列到三维结构的创生 (From Sequence to Structure)

上午:同源建模专题——预测未知的蛋白质结构

·模块一:同源建模的原理与应用场景

o何时以及为何选择同源建模?

o揭秘同源建模背后的核心算法

·模块二:Swiss-Model实战工坊

o第一步:通过BLAST等工具寻找最佳同源模板

o第二步:序列比对的艺术与技巧

o第三步:精准选择决定模型质量的蛋白模板

o第四步:自动化与手动搭建蛋白三维模型

o第五步:模型质量的生命线——拉曼图(Ramachandran Plot)分析与解读

o第六步:模型的迭代优化与精修

·案例演练:以新冠病毒Spike蛋白序列为例,从零开始构建高质量三维结构模型,并进行全流程质量评估。

下午:小分子设计与数据库探索

·模块三:ChemDraw化学绘图实战

o从零开始,构建任意复杂的小分子结构

o一键计算:快速获取分子量、clogP等关键理化性质

o挑战练习:灵活构建大环分子、氨基酸、DNA/RNA片段等特殊结构

·模块四:探索海量的小分子化合物库

o主流数据库巡礼:DrugBank, ZINC, ChEMBL的特色与高效使用技巧

o特色资源探索:天然产物与中药成分数据库的挖掘与应用

第三天:对接·分子间的识别与结合 (The Docking Dance)

上午:分子对接的理论核心

·模块一:解密分子对接的黑箱

o核心原理:计算机如何模拟分子的结合过程?

o对接类型:刚性、半柔性与柔性对接的分类与选择

o评价标准:深入理解不同打分函数(Scoring Function)的物理意义

·模块二:常规分子对接流程实战

o配体准备:药物小分子的能量最小化与构象优化

o受体准备:蛋白靶点的预处理(加氢、去水、修复残基)

o定义靶点:受体结合口袋(Grid Box)的精确计算

o执行对接:运行高效的半柔性对接任务

下午:对接结果的深度分析与验证

·模块三:结果评估的多维视角

o黄金标准:与晶体结构(co-crystal structure)构象进行对比验证

o能量视角:从结合能与打分函数值评价结合强度

o聚类分析:洞察配体在口袋中的优势结合模式

o决策时刻:如何科学选择最优的结合构象?

·模块四:探索不同的对接策略与软件实现

第四天:进阶·柔性对接与虚拟筛选 (Advanced Docking & Screening)

上午:柔性对接——更真实的分子识别模拟

·模块一:柔性对接的核心流程

o配体的精细化准备与构象生成

o受体准备的特殊考量

o关键一步:定义需要柔性处理的氨基酸残基

o重新定义格点:适应受体柔性的计算盒子

o执行计算并进行结果分析与评估

·模块二:策略选择——半柔性 vs. 柔性对接

o深入比较两种方法的优缺点与适用场景

·模块三:柔性对接的替代实现方案

下午:高通量虚拟筛选——从海量分子中发现先导化合物

·模块四:药物发现的加速器

o小分子文件的“语言”:SDF, MOL2等格式的理解

o瑞士军刀OpenBabel:精通小分子格式的批量转化与处理

·模块五:基于对接的虚拟筛选实战

o流程构建:设计一套完整、高效的虚拟筛选工作

o准备阶段:靶点蛋白的选择与百万级化合物库的获取

o执行阶段:自动化运行高通量对接任务

o结果分析:如何从海量结果中筛选出高潜力的“Hits”分子(Hit Identification)?

第五天:拓展·探索非经典分子相互作用 (Expanding the Horizon)

上午:特殊分子体系的对接挑战

·模块一:小分子-小分子对接

o超越蛋白靶点:探索小分子间的相互作用(例如:药物-糖类)

o独特的结构预处理与对接策略

o案例分析:以糖-小分子对接为例,解读结果并展示

·模块二:蛋白-核酸对接

o探索基因调控与药物干预的奥秘

·模块三:蛋白-蛋白对接(PPI)

otackling a new frontier in drug discovery

下午:QM/MM计算——融合量子化学与经典力学

·模块四:量子化学(QM)基础入门

o理论核心:薛定谔方程的启示

o方法概览:从半经验、HF到后HF方法

o中流砥柱:密度泛函理论(DFT)简介

·模块五:Gaussian计算入门示例

o从分子构建到单点能计算

o结构优化与振动分析

o探索化学反应:过渡态搜索与势能面扫描

·模块六:QM/MM在生物体系中的应用实例分析

oQM/MM如何精确模拟酶催化反应等复杂过程

第六、七天:升华·分子动力学模拟与自由能计算 (Dynamics & Energetics)

第六天:驾驭Linux与GROMACS——开启MD模拟之旅

·上午:Linux系统基础

o迈入高性能计算的门槛:Linux系统简介

o效率倍增:常用核心命令实操

o软件安装:以GROMACS为例,掌握Linux环境下的程序部署

·下午:MD实战一:溶剂化环境中蛋白质的动态行为

o目标:全面掌握并亲手操作分子动力学模拟的完整标准流程(力场选择、构建体系、能量最小化、平衡、生产模拟)。

第七天MD高级应用——配体结合与能量计算

·上午:MD实战二:蛋白质-配体复合物的动力学模拟

o挑战:学习处理非标准残基(如药物分子)的力场参数化与拓扑文件生成。

·下午:从模拟到定量——MD轨迹分析与自由能计算

o分析模块:掌握RMSD, RMSF, Radius of Gyration等常用分析方法

o定量模块:初步接触蛋白-配体结合自由能的计算方法(如MMPBSA/GBSA),定量评估结合强度

04
AIDD人工智能药物发现与设计
上下滑动查看更多

(向上滑动查看内容)

第一天

AIDD 概述与药物数据库 & Python 环境工具

1.AIDD 人工智能辅助药物设计概述(0.75h) 

·传统药物研发痛点,AIDD 发展背景,小分子药物、抗体 / Nanobody 生物药 AI 研发场景AI 在药物研发全流程介入位点

·AIDD 技术栈总览:传统机器学习、GNN、NLP 生成模型;课程框架:小分子 + 生物药双主线介绍

2.Python 环境搭建与包管理(0.75h) 

·Anaconda、VSCode、虚拟环境、pip/conda 镜像源配置;AIDD 生态库介绍

3.科学计算库基础(1h) 

·numpy、pandas 分子数据清洗,matplotlib 绘图,requests 网络爬虫

4.药物公开数据库体系(0.5h) 

·ChEMBL、PubChem、KEGG、ChEBI、BiGG;DeepChem & MoleculeNet 数据集。

抗体 / Nanobody 相关数据库简单引入(SAbDab 等)

1.AIDD 虚拟环境搭建,库安装调试

2.多数据库批量获取小分子数据:KEGG、ChEBI、PubChem、ChEMBL、BiGG 接口调用

3.DeepChem 安装、MoleculeNet 数据集下载与预处理

小作业:批量下载靶点活性分子,输出 csv 数据集
第二天
传统机器学习辅助药物设计

理论部分(3h)

1.机器学习基础理论(1h) 

监督 / 无监督 / 强化学习;决策树、SVM、朴素贝叶斯、CNN;药物任务:分类(毒性 ADMET)、回归(活性预测)

2.模型评价指标(0.75h) 

分类:准确率、精确率、召回率、F1、ROCAUC;回归:MAE、MSE、R²;交叉验证;药物数据集过拟合、数据偏差问题

3.分子表征与化学信息学(1.25h) 

SMILES、分子指纹、分子描述符、化合物相似性;RDKit 原理;分子构象、RMSD、子结构匹配

实操上机(3h)

1.scikitlearn 完整模型训练、评估、交叉验证流程

2.RDKit 实操:分子读写、绘图、描述符 / 指纹计算、相似度、子结构检索、构象生成与 RMSD

3.项目实战 

实战 1:Lipinski Ro5、ADMET 规则分子筛选

实战 2:Tanimoto 相似度配体筛选

实战 3:分子指纹化合物聚类

实战 4:机器学习生物活性预测

实战 5:分子毒性预测模型构建

第三天
图神经网络 GNN 辅助药物设计

理论部分(3h)

1.图神经网络基础(1.5h) 

图数据表达:小分子、蛋白复合物;节点 / 边 / 图级预测任务;PyG/DGL/TorchDrug 框架;消息传递,GCN/GAT/GIN 原理

SMILES 转分子图、蛋白配体复合物图构建逻辑

2.GNN 药物领域任务(1.5h) 

小分子毒性、属性预测;蛋白配体相互作用预测;拓展:GNN 在抗体、Nanobody 结构预测、CDR 区建模的应用思路;数据集不平衡问题

实操上机(3h)

1.PyTorch+PyG 环境调试,图数据集基础操作

2.实战 1:DeepChem 图卷积实现分子特征提取与属性预测

3.实战 2:PyG 构建分子图数据集,GNN 分子毒性预测

4.实战 3:蛋白配体相互作用预测 

蛋白配体复合物构建 PyG 图数据集;GIN 模型搭建与相互作用预测

第四天
NLP 大模型辅助药物化学

理论部分(3h)

1.药物领域 NLP 基础(1.5h) 

·序列向量表示,RNN、Seq2Seq、EncoderDecoder、Attention、Transformer;SMILES 分子语言、化学反应文本表示

2.深度生成模型(1.5h) 

·VAE/GAN/RNN/Transformer 分子生成;化学反应预测;分子 BERT 预训练;抗体序列生成、Nanobody CDR 序列设计的 NLP 模型思路

实操上机(3h)

1.PyTorch 与 Transformer 模块调试

2.实战 1:Seq2Seq 无监督分子表示学习

3.实战 2:Transformer 化学反应表示

4.实战 3:NLP 化学反应分类

实战 4:BERT 实现化学反应产率预测
第五天
综合项目实战:分子生成 + PyMOL 结构可视化 + 抗体 / Nanobody AI 设计

理论部分(3h)

1.RDKit 化学反应计算化学信息(0.5h) 

SMARTS 语法、反应指纹、反应相似度、AI 分子生成原理

2.蛋白数据库与结构可视化基础(0.75h) 

PDB、UniProt、SAbDab(抗体数据库)介绍;蛋白序列、三维结构数据;

PyMOL 原理:蛋白结构渲染、残基选择、结合口袋显示、复合物作图、抗体 CDR 区可视化基础理论

3.抗体与 Nanobody AI 药物设计专题(1h) 

抗体、Nanobody 结构基础:重链、轻链、CDR 互补决定区;纳米抗体单域蛋白特点

AI 在抗体药物的任务:序列生成、CDR 设计、亲和力优化、人源化、结构预测、抗原抗体相互作用预测

主流模型:GNN、Transformer、蛋白大模型在抗体 / Nanobody 的应用;公开数据集 SAbDab、OAS

4.AIDD 完整项目工程流程(0.75h) 

数据集构建预处理表征训练评估落地;数据集偏差、模型踩坑;小分子 + 抗体药物不同落地思路对比

实操上机(3h)

1.RDKit 化学反应实操:反应解析、绘制、SMARTS 定义反应、产物生成、反应指纹与相似度

2.PyMOL 实操教学(1h) 

1.PDB 结构导入、蛋白链、残基选择操作

2.蛋白配体复合物可视化:结合口袋、小分子配体渲染、氢键 / 疏水相互作用展示

3.抗体 / Nanobody 结构可视化:定位 CDR 区,抗原抗体复合物作图,导出科研级图片

4.Python 脚本调用 PyMOL(pymolapi)批量处理蛋白结构

3.抗体 & Nanobody AI 设计实战(1h) 

1.SAbDab/OAS 数据库下载抗体 / Nanobody 序列与结构数据,数据清洗

2.基于序列大模型做 Nanobody CDR 序列生成、突变设计

3.抗原Nanobody 相互作用简单预测实操

05
合成生物学与基因电路设计
上下滑动查看更多

(向上滑动查看内容)

第一天
合成生物学基础概念与应用领域剖析
1.深度解读合成生物学精准定义,系统阐述其涵盖研究内容,沿着发展历程脉络回溯,展望未来趋势,全方位扫描应用领域。
2.通过详实案例分析,将合成生物学在医药、农业、工业等实际场景的应用具象化,让学员感知其变革力量。
生物元件功能精讲与标准化设计准则
1.聚焦生物元件,如启动子精准调控转录起始、终止子界定转录终点、RBS 驱动核糖体结合开启翻译。
2.结合 BioBrick 元件设计范式与应用实例,传授生物元件模块化设计黄金法则,助力学员掌握构建标准化生物模块的精髓。
第二天
基因线路逻辑架构搭建与实例演练
1.开启基因线路逻辑世界大门,详细拆解与、或、非基本逻辑门运作原理及设计技巧。
2.引入 iGEM 竞赛中经典逻辑门线路应用案例,手把手指导学员实践操作,使其能独立构思简单基因线路并洞悉其功能。
复合元件整合与电路深度设计
以前两天所学生物元件、基因线路知识为基石,引导学员梳理合成生物学核心玩法。亲手设计、搭建、分析经典电路,实现知识融会贯通,掌握复杂电路中各模块协同运作奥秘。
第三天
代谢途径精细构建与优化策略
1.深入讲解代谢途径搭建步骤,剖析定向进化、代谢工程等优化策略。
2.以青蒿素生物合成途径优化为典型案例,传授从理论到实践的代谢途径设计方法,助力学员提升生物合成效率。
基因组合成与编辑技术前沿
1.系统讲解基因组合成底层原理、多元方法,深度剖析 CRISPR/Cas9 等基因组编辑技术原理。
2.结合海量案例,呈现基因组合成与编辑技术在定制生物、精准医疗等前沿领域的实际应用。
第四天
底盘生物特性解析与应用
1.引入底盘生物概念,剖析常见底盘生物(如大肠杆菌、酵母菌等)特性。
2.讲解其在基因线路搭载、基因表达中的关键作用,结合实例探讨如何依据项目需求选择适配底盘生物,实现高效基因操作。
合成生物系统搭建与优化实践
1.全方位讲解合成生物系统定义、分类,通过案例剖析系统构建流程,传授优化策略。
2.组织实践操作,让学员亲身体验合成生物系统的构建与优化全过程,学会依据反馈调控系统参数。
第五天
合成生物学数学建模与性能分析
1.开启生物系统数学建模之旅,介绍常微分方程、逻辑模型等常用建模方法。
2.结合基因线路动力学模拟案例,指导学员运用数学模型精准分析生物系统性能,为系统设计与优化提供量化支撑。
合成生物学全景总结与未来瞻望
1.回溯课程所学知识,通过多领域案例分析,展现合成生物学应用广度与深度。
2.组织学员热烈讨论未来发展趋势、潜在影响,着重介绍伦理、生物安全与生物安保等关键议题,培养学员全面视角。
06
机器学习代谢组学
上下滑动查看更多

(向上滑动查看内容)

第一天
A1 代谢物及代谢组学的发展与应用
(1)  代谢与生理过程;
(2)  代谢与疾病;
(3)  非靶向与靶向代谢组学;
(4)  空间代谢组学与质谱成像(MSI);
(5)  代谢组学与药物和生物标志物;
(6)  代谢流与机制研究。
A2 代谢通路及代谢数据库
(1)  几种经典代谢通路简介;
(2)  三大常见代谢物库:HMDB 、METLIN 和 KEGG;
(3) 代谢组学原始数据库:Metabolomics Workbench 和 Metabolights. A3 参考资料推荐
A4 代谢组学实验流程简介
A5 色谱 、质谱硬件与原理解析
(1)  色谱分析原理与构造;
(2)  色谱仪和色谱柱的选择;
(3)  色谱的流动相:梯度洗脱法;
(4)  离子源、质量分析器与质量检测器解析;
(5)  质谱分析原理及动画演示;
(6)  色谱质谱联用技术(LC-MS);
第二天
B1 代谢物样本处理与抽提
(1) 各种组织、血液和体液等样本的提取流程与注意事项;
(2) 代谢物抽提流程与注意事项;
(3) 样本及代谢物的运输与保存问题;
B2 LC-MS 数据质控与搜库
(1) LC-MS 实验过程中 QC 和 Blank 样本的设置方法;
(2) LC-MS 上机过程的数据质控监测和分析;
(3) 代谢组学上游分析原理——基于 Compound Discoverer 与 Xcms 软件;
(4) Xcms 软件数据转换、提峰、峰对齐与搜库;
B3 R 软件基础
(1) R 和 Rstudio 的安装;
(2) Rstudio 的界面配置;
(3) R 中的基础运算和统计计算;
(4) R 中的包:包,函数与参数的使用;
(5) R 语言语法,数据类型与数据结构;
(6) R 基础画图;
B4 ggplot2
(1) ggplot2 简介
(2) ggplot2 的画图哲学;
(3) ggplot2 的配色系统;
(4) ggplot2 数据挖掘与作图实战;
第三天
机器学习
C1 有监督式机器学习在代谢组学数据处理中的应用
(1) 人工智能、机器学习、深度学习的关系;
(2) 回归算法:从线性回归、Logistic 回归与 Cox 回归讲起;
(3) PLS-DA 算法:PCA 降维后没有差异的数据还有救吗?
(4) VIP score 的意义及选择;
(5) 分类算法:决策树,随机森林和贝叶斯网络模型;
C2 一组代谢组学数据的分类算法实现的 R 演练
(1) 数据解读;
(2) 演练与操作;
C3 无监督式机器学习在代谢组学数据处理中的应用
(1) 大数据处理中的降维;
(2) PCA 分析作图;
(3) 三种常见的聚类分析:K-means、层次分析与 SOM
(4) 热图和 hcluster 图的 R 语言实现;
C4 一组代谢组学数据的降维与聚类分析的 R 演练
(1) 数据解析;
(2) 演练与操作;
第四天
D1 在线代谢组分析网页 Metaboanalyst 操作
(1) 用 R 将数据清洗成网页需要的格式;
(2) 独立组、配对组和多组的数据格式问题;
(3) Metaboanalyst 中的上游分析(原始数据峰提取、峰对齐与搜库)
(4) Metaboanalyst 的 pipeline 以及参数设置和注意事项;
(5) Metaboanalyst 的结果查看和导出;
(6) Metaboanalyst 的数据编辑;
(7) 全流程演练与操作。
D2 代谢组学数据清洗与 R 语言进阶
(1) 代谢组学中的 t、fold-change 和响应值;
(2) 数据清洗流程;
(3) R 语言 tidyverse;
(4) 数据预处理:数据过滤与数据标准化(样本的 Normalization 和代谢物的 Scaling);
(5) 代谢组学数据清洗演练;
第五天
E1 文献数据分析部分复现(1 篇)
(1) 文献深度解读;
(2) 实操:从原始数据下载到图片复现;
(3) 学员实操。
E2 机器学习与代谢组学顶刊解读(3 篇);
(1) Signal Transduction and Targeted Therapy 一篇有关饥饿对不同脑区代谢组学影响变
化的小鼠脑组织代谢图谱类的文献;(数据库型)
(2) Cell 一篇代谢组学孕妇全程血液代谢组学分析得出对孕周和孕产期预测的代谢标志物
的文献;(生物标志物型)
(3) Nature 一篇对胰腺癌患者肠道菌群的代谢组学分析找到可以提高化疗效果的代谢物的文献。(机制研究型)
07
深度学习多组学的应用
上下滑动查看更多

(向上滑动查看内容)

第一天

多组学测序技术及数据库

上午、理论讲解

1. 多组学测序技术

 2. 介绍多组学数据库 

3. 深度学习融合多组学模型及应用介绍 

GPU 服务器上机实操

1.Linux 操作系统

 1.1 常用的Linux 命令

 1.2 Vim 编辑器 

1.3 基因组数据文件管理, 修改文件权限 

1.4 查看探索基因组区域

 2.Python 语言基础 

2.1.Python 包安装和环境搭建

 2.2.常见的数据结构和数据类型

下午、深度学习实现多组学数据插补模型理论讲解Python代码解析及GPU服务器上机实操

1. 多组学融合通用框架模型CustOmics 

2. 非监督深度学习癌细胞系合成数据增强模型MOSA (Multi-Omic Synthetic Augmentation)

第二天

深度学习识别基因变异及疾病亚型

上午、深度学习识别基因变异模型理论讲解Python代码解析及GPU服务器上机实操

1. 深度学习识别基因变异诊断阿尔茨海默病SWAT  

 2. 多阶段融合多组学表观遗传数据预测转录因子深度学习模型TRAPT

下午、深度学习识别疾病亚型模型Python代码解析及GPU服务器上机实操

1. 多组学识别癌症亚型生成对抗式深度学习模型Subtype-GAN 

2. 多尺度可解释的多组学深度学习模型DeepOmix预测癌症生存期

 3. 联邦深度学习多组学数据预测癌症演化DeepProg模型

第三天

深度学习识别疾病标志物

上午、深度学习模型识别疾病标志物Python代码解析及GPU服务器上机实操

 1. 多组学特征排序识别COVID-19疾病标志物Deep IDA模型 

2. 基于肠道微生物组预测肠道代谢物高可解释性神经编码器-解码器网络模型BioNED  

下午、深度学习模型识别病理图像标志物Python代码解析及GPU服务器上机实操

 1. 基于深度学习的集成方法从组织病理学图像预测胃腺癌分子亚型DEMoS 

2. 基于深度学习的结直肠癌病理图像预后标志物挖掘DigiPathAI  

第四

深度学习融合单细胞多组学数据

上午、深度学习融合单细胞多组学模型Python代码解析及GPU服务器上机实操 1. 单细胞多组学聚类多模态深度学习模型scMDC  

 2. 基于深度学习的生成式模型融合单细胞多组学数据scMM (mixture-of-experts deep generative model)

下午、融合单细胞空间多组学深度学习模型Python代码解析及GPU服务器上机实操

 1. 空间反卷积多尺度深度模型TACIT推断细胞类型及细胞状态

 2. 深度学习模型从单细胞数据解析醣基化生物过程

第五天

深度学习融合多模态功能学习识别疾病通路、药物重定位

上午、深度学习模型融合多模态功能学习识别疾病通路Python代码解析及GPU服务 器上机实操

1. 基于Transformer 的深度学习模型整合多组学数据与癌症通路DeePathNet

 2. 一种识别泛癌种Ras通路激活的深度学习方法NatDRAPl

下午、深度学习模型多组学整合药物重定位Python代码解析及GPU服务器上机实操

1. 基于核方法的深度学习框架实现多组学整合的药物重定位DeepDRK 

2. 基于蛋白质相互作用网络嵌入细胞系以预测抗癌协同药物组合模型PRODeepSyn

08
蛋白晶体结构解析
上下滑动查看更多

(向上滑动查看内容)

一、蛋白质结晶前准备 
课程介绍和蛋白质结构功能基本介绍
提纯蛋白质,确定浓度、pH值、缓冲液等条件,控制蛋白质稳定性等。
1、目的蛋白质信息检索与调查
- 利用生物信息学工具搜集目标蛋白质的基因序列、结构域、同源蛋白质的信息
- 分析目标蛋白质的理化性质,如分子量、等电点、聚合程度、稳定性等
2、质粒制备
- 设计引物,克隆目标基因到表达载体
- 转化表达宿主,提取重组质粒
- 质粒测序等验证目标基因插入
3、蛋白质纯化
- 选择合适的诱导表达等条件,表达可溶性或不溶性重组蛋白
- 裂解菌体,释放重组蛋白质
- 蛋白质纯化:亲和层析、离子交换层析、凝胶过滤等层析技术的原理和实践等
4、蛋白质不表达和包涵体问题
- 分析不表达的原因,优化诱导条件
- 改进溶解缓冲液条件,提高蛋白从包涵体中释放
5、蛋白质活性鉴定
- 进行Western Blot或酶活性实验验证蛋白质活性
6、蛋白质结晶前分析
- 测定蛋白质的纯度、聚合状态、稳定性等
- 优化缓冲液条件,调整蛋白质到适宜的pH和离子浓度等
二、 蛋白质结晶与衍射数据收集  
利用协同结晶筛选获得蛋白质结晶,在同步辐射光源下收集衍射数据。
1、蛋白质结晶
- 蛋白质结晶的基本原理
- 蛋白质结晶的影响因素
- 蛋白质结晶的基本方法
- 结晶条件筛选策略- 结晶条件筛选策略
- 没有晶体或者改善晶体质量的策略
- 晶体后处理
- 晶体冻存的基本原理和策略
2、SSRF(同步辐射光源)的介绍
- SSRF简介
- SSRF的光源优势
- SSRF的实验站介绍
3、蛋白质晶体衍射数据收集
- X射线结晶学基本原理
- 晶体探针和晶体定位
- 晶体测试和优化
- 衍射数据收集参数设定和收集策略
- 衍射数据处理和分析
三、蛋白质晶体结构解析软件安装 
安装相关计算机程序,如Phenix, XDS, Pymol等用于后续的数据处理与模型建立。
1、下载和安装简要介绍
2、蛋白质晶体结构解析软件安装
- CCP4安装
- Phenix安装
- Coot安装
- PyMol安装
- 其他结构解析支持软件安装
依次介绍CCP4、Phenix、Coot、PyMol等主要的结构解析软件的下载和安装方法。也可以介绍一些结构解析中需要的其他软件工具的安装。
Index、integrate与scale & merge等软件使用和介绍
利用软件index及integrate衍射点,scale& merge等处理衍射数据以校正强度。
1、晶体结构学基础知识
- 晶体学中的衍射理论基础
- 布拉格定律和倒易空间
- 晶体的对称性
2、蛋白质晶体结构解析流程
- 蛋白质的表达与纯化
- 蛋白质的结晶
- X射线晶体学数据收集
- 晶体结构解析流程概述
3、Index和integrate
- Indexing的目的和原理
- Integration的目的和过程
4、Scale & merge
- Scale & merge的目的——校正数据
- Scale& merge常用方法
5、使用Scala/XSCALE/Aimless等进行Scale & merge
- Scala/XSCALE/Aimless等软件介绍
- Scala/XSCALE/Aimless进行数据scale& merge的步骤
6、使用HKL2000进行index、integrate和scale & merge
- HKL2000软件介绍
- 使用HKL2000进行indexing
- 使用HKL2000进行integration
- 使用HKL2000进行scaling & merge
四、相位解析、电子密度重构、分子结构模型构建修正和优化与结构提交 
利用直接法/分子置换法/M(S)AD/M(S)IR 等等相位解析方法确定蛋白质框架,手动模型构建余下结构,进行修正和优化后达到标准后提交蛋白质坐标库。
1、直接法/分子置换法/M(S)AD/M(S)IR 等方法解析相位
(1)直接法/分子置换法/M(S)AD/M(S)IR等的基本原理
(2) 直接法/分子置换法/M(S)AD/M(S)IR等的目的
(3) 常用的软件介绍
(4) 直接法/分子置换法/M(S)AD/M(S)IR等的具体操作步骤
2.电子密度修饰:
(1)电子密度修饰的基本原理:
(2)电子密度修饰的目的
(3)电子密度修饰的常用软件介绍
(4)电子密度修饰的具体操作步骤
3.电子密度重构
(1)电子密度重构的目的和基本原理
(2)电子密度重构的操作
4、蛋白质晶体结构模型构建
(1) 蛋白质序列比对确定构建起始模型
(2) 主链构建方法
(3) 侧链构建方法
(4) 构建完成后的模型检查
5、蛋白质晶体结构修正与优化
(1) 能量最小化原理 
(2) 模拟退火原理
(3) 分子动力学模拟原理
(4) 优化过程中的评估标准
(5)结构修正常用软件介绍
(6)结构修证的具体操作步骤
6、蛋白质晶体结构验证
(1)结构验证的目的和基本原理
(2) Ramachandran图分析
(3) 各类键长和键角分布
(4) 密接点分析
(5) B因子分布
(6) 电子密度匹配度评价
(7)各种指标与统计数据
7、蛋白质晶体结构提交到PDB
(1) PDB数据提交要求
(2) 各项验证确认无误后压缩需提交文件
(3) 在PDB网站提交表单,上传文件,等待审核结果,回复信息
五、蛋白质晶体结构展示与分析 、结构与功能的关系
5.1 利用Pymol等软件分析并展示蛋白质的二级结构、三级结构,活性口袋等结构信息。
1、pdb格式文件简介
- pdb文件概述:包含蛋白质晶体学数据的标准格式
- 原子坐标:记录每个原子的xyz坐标
- 温度因子:记录每个原子的热运动参数
- 二级结构:记录α螺旋和β片层的位置
- 结构注解:记录配体、酶活性中心等重要结构信息
2、PyMOL制作蛋白质晶体结构图
- PyMOL简介:流行的分子可视化软件
- 加载pdb文件
- 显示蛋白质链、α螺旋和β片层
- 调整视角、变色和放大关键结构
- 导出高质量图像3、使用PyMOL制作蛋白质配体结合位点信息
- 识别蛋白质与配体的相互作用
- 突出显示配体结合位点残基
- 在结合位点生成表面模型
- 制作配体结合位点的特写图
4、使用PyMOL调查蛋白质的温度因子B-factors
- 显示温度因子putty图
- 分析柔性域和稳定域
- 与酶活性中心和功能位点的关系
5、使用PyMOL重叠对比不同的蛋白质晶体结构
- 载入不同状态的pdb文件
- 重叠对齐蛋白质结构
- 比较构象变化,如酶动力学过程中的不同中间状态6、使用PyMOL显示蛋白质晶体结构中配体的电子密度图
- 加载包含配体密度的pdb文件
- 显示2Fo-Fc 和 Fo-Fc电子密度图
- 检查配体与电子密度的匹配程度
- 评估配体定位和取向的准确性7、使用PyMOL结合Chimera实现同步显示非对称单元的蛋白质分子
- 在PyMOL中显示蛋白质非对称单元
- 在Chimera中同步显示非对称单元
- 细节对比不同分子中的相同结构
- 分析蛋白质多聚体形成的分子间相互作用
 5.2 生物大分子结构介绍
5.3 结构与功能关系:
(1)如何分析结构与功能关系:
(2)分析结构的目的:
(3)结构与功能关系的研究手段:
(4)结构能带来什么?
(5)测定结构之后的思路介绍
学习目标 名师介绍
01
AI蛋白质设计
授课老师均来自北京大学和清华大学,专注于蛋白设计和多肽药物靶点,具有丰富的代码开发经验和授课教学经验。在对应领域有过多篇中科院一区top期刊/CCF-A会议,如ICLR,ICML等主流会议的第一作者和审稿人经历。
本课程是一门面向生物医学领域学生和研究人员的高阶技术课程。课程旨在系统性地讲解AI在蛋白质设计领域的关键模型原理,并结合代码实践,最终让学员掌握一套完整的、可在本地部署的、从头(de novo)设计蛋白质的计算流程。
02
人工智能构建虚拟细胞
生物学博士,深耕生命科研,转化医学及药物研发领域,先后任职于新加坡淡马锡生命科学院, 新加坡科学技术研究局等机构,系统追踪基因与细胞治疗, 抗体及ADC等药物研究领域,学术成果发表于Molecular cell, ASCO, ESMO 等国际会议及期刊,拥有丰富的产业实践经验。
本课程以虚拟细胞(Virtual Cell)构建为总体框架,系统拆解当前国际前沿细胞人工智能模型在多组学建模、机制推理、药物设计预测、疾病系统重构及数字孪生中的完整技术路径。课程以理论体系建立为核心,结合当前国际主流代表模型(如 MultiVI、scVI、DrugCell等)进行结构化解析,使学员能够从单点模型理解上升到整体建模逻辑理解。
03
CADD计算机辅助药物设计
Z老师,多年Ai4science研究经验,研究方向为蛋白设计、药物发现与计算生物学。曾获多项国家级奖项,在计算机辅助药物设计,药物发现等领域具有丰富的理论知识和实践经验。
本培训是系统的CADD课程培训,主要包含五种主要技术:Pymol画图、分子对接、虚拟筛选、QSAR建模、分子动力学模拟以及掌握这五种技术需要的辅助技术,如蛋白和小分子数据库的介绍和使用、蛋白和小分子的结构处理及性质分析、linux使用、openbabel使用等。
04
AIDD人工智能药物发现与设计
AIDD授课老师曹老师,有十余年的计算机算法研究和程序设计经验。研究方向涉及生物信息学,深度学习,药物合成路径设计,药物不良反应等。发明专利5项,参与国家重点科研项目4项,发表SCI高水平论文10篇,包括BMC Bioinformatics, Journal of Biomedical Informatics, International Journal of Molecular Sciences等知名期刊。
本课程让学员了解药物发现的前沿背景,学习人工智能领域的各类常见算法,熟悉工具包的安装与使用,掌握一定的算法编程能力,能够运用计算机方法研究药物相关问题。通过大量的案例讲解和实践操作,具备一定的AIDD模型构建和数据分析能力
05
合成生物学与基因电路设计
两位授课老师均来自清华大学,干湿结合分别引领本课程的实验设计和建模分析,研究方向涉及植物生物学、合成生物学与生物信息学。在对应领域中科院一区有多篇产出,同时曾作为队长和评委多次参加过合成生物学(iGEM)顶级赛事,曾获得全球十佳项目(TOP10)和多个单项奖及提名。
通过理论与实践结合,掌握合成生物学基础、基因电路设计、代谢途径优化、基因编辑技术及数学建模,培养学员在合成生物领域的创新能力和系统思维,为未来研究与应用奠定基础。
06
机器学习代谢组学
主讲老师来自985高校,主要利用代谢组学、转录组学和分子生物学等技术研究神经内科慢性病的发病机制和生物标志物。擅长高效液相色谱-质谱联用(LC-MS)技术进行非靶向和靶向代谢组学从样本制备到数据分析的全流程研究,以及多组学大数据的生物信息学整合分析。5年内在J Clin Invest, EBioMedicine, Cell Death Dis, Cell Death Discov, Nanotoxicology等杂志发表SCI论文10篇。
熟悉代谢组学和机器学习相关硬件和软件;熟悉代谢组学从样本处理到数据分析的全流程;能复现至少1篇CNS或子刊级别的代谢组学文章图片。
07
深度学习多组学的应用
刘老师,生物信息学博士,从事医学生物信息及人工智能研究15年,曾在新加坡基因组研究院及美国加州大学洛杉矶分校研究多组学数据在复杂疾病诊疗中的应用。研究领域涉及人工智能、自然语言处理、功能基因组学、宏基因组学、转录组学、miRNA 及靶基因网络分析,单细胞测序数据分析,基因调控网络时序分析,蛋白质互作网络分析,多组学联合分析等。主持省级自然科学基金等项目4项,开发过数个生物信息学工具,发表SCI论文20余篇,其中人工智能算法文章10余篇,编著医学数据分析实用教材一部。
课程通过基础入门+应用案例实操演练的方式,从初学及应用研究的角度出发,带大家实战演练多种深度学习模型(深度神经网络DNN、卷积神经网络CNN、循环神经网络RNN、自动编码器AE、图卷积神经网络GCN)在多组学融合分析中的各种应用
08
蛋白晶体结构解析
课程将让学员了解蛋白质晶体结构解析的原理、方法与技术,学习分子克隆、蛋白表达纯化、蛋白结晶方法、软件安装,蛋白结构数据处理,得到高分辨率的蛋白晶体结构。使学员通过本次课程的学习,很轻松地解析出蛋白晶体结构,并进行晶体结构的精修。
授课时间安排

.人工智能构建虚拟细胞

2026.09.06全天(9-12-2-5点)

2026.09.07晚上授课(1900-2200

2026.09.08晚上授课(1900-2200

2026.09.09晚上授课(1900-2200

2026.09.10晚上授课(1900-2200

2026.09.12全天(9-12-2-5点)

2026.09.13全天(9-12-2-5点)

AI蛋白质设计

2026.09.14晚上授课(1900-2200

2026.09.15晚上授课(1900-2200

2026.09.16晚上授课(1900-2200

2026.09.17晚上授课(1900-2200

2026.09.19全天(9-12-2-5点)

2026.09.20全天(9点-12点-2点-5点)
2026.09.21晚上授课(19:00-22:00)
2026.09.22晚上授课(19:00-22:00)

蛋白晶体结构解析

2026.10.12晚上授课1900-2200

2026.10.13晚上授课1900-2200

2026.10.14晚上授课1900-2200

2026.10.15晚上授课1900-2200

2026.10.17全天(9-12-2-5点)

2026.10.18全天(9-12-2-5点)

2026.10.19晚上授课1900-2200

2026.10.20晚上授课1900-2200

CADD计算机辅助药物设计

2026.09.14晚上授课(1900-2200

2026.09.15晚上授课(1900-2200

2026.09.16晚上授课(1900-2200

2026.09.17晚上授课(1900-2200

2026.09.19全天(9-12-2-5点)

2026.09.20全天(9-12-2-5点)

2026.09.21晚上授课(1900-2200

2026.09.23晚上授课(1900-2200

2026.09.24晚上授课(1900-2200

2026.09.28晚上授课(1900-2200

2026.09.29晚上授课(1900-2200

2026.09.30晚上授课(1900-2200

AIDD人工智能药物发现与设计

2026.09.12全天(9-12-2-5点)

2026.09.13全天(9-12-2-5点)

2026.09.19全天(9-12-2-5点)

2026.09.21晚上授课(19:00-22:00)
2026.09.22晚上授课(19:00-22:00)
2026.09.23晚上授课(19:00-22:00)
2026.09.24晚上授课(19:00-22:00)

合成生物学与基因电路设计

2026.10.12晚上授课(19:00-22:00)

2026.10.13晚上授课(19:00-22:00)

2026.10.14晚上授课(19:00-22:00)

2026.10.15晚上授课(19:00-22:00)

2026.10.17全天(9点-12点-2点-5点)

2026.10.18全天(9点-12点-2点-5点)

2026.10.19晚上授课(19:00-22:00)

2026.10.20晚上授课(19:00-22:00)

机器学习代谢组学

2026.09.14晚上授课(1900-2200

2026.09.15晚上授课(1900-2200

2026.09.16晚上授课(1900-2200

2026.09.17晚上授课(1900-2200

2026.09.18晚上授课(1900-2200

2026.09.19晚上授课(1900-2200

2026.09.21晚上授课(19:00-22:00)
2026.09.22晚上授课(19:00-22:00)
2026.09.23晚上授课(19:00-22:00)
2026.09.24晚上授课(19:00-22:00)

深度学习在多组学融合中的应用

2026.10.12晚上授课(19:00-22:00)
2026.10.13晚上授课(19:00-22:00)
2026.10.14晚上授课(19:00-22:00)
2026.10.15晚上授课(19:00-22:00)
2026.10.17全天(9点-12点-2点-5点)
2026.10.18全天(9点-12点-2点-5点)
2026.10.19晚上授课(19:00-22:00)
2026.10.20晚上授课(19:00-22:00)

报名费用及福利

AI蛋白质设计、

公费价:6380元       自费价:5880元

人工智能构建虚拟细胞、

蛋白晶体结构解析、

CADD计算机辅助药物设计、

AIDD人工智能药物发现、

合成生物学与基因电路设计、

机器学习代谢组学、

深度学习在多组学融合中的应用、

每人每班公费价:5880元       

每人每班自费价:5480元

优惠福利如下:

优惠一:报二赠一:10880(可选三门课程)

优惠二:报三赠一:13880(可选四门课程)

优惠三:报四赠二:18880(可选六门课程)

优惠四:全报25880(两年内可参加本公司举办的任何课程,不限次数及课程,包括之后新课)

限时福利:报名成功后转发朋友圈或转发50人以上群聊即可获得300元现金红包(只限前15名)

课程福利:报名缴费后可获取往期课程回放(包含全套课程回放和课件资料ppt)提供学员课前预习

报名费用可开具正规报销发票及提供相关缴费证明、邀请函,可提前开具报销发票、文件用于报销 。报名缴费后即可获得全套预习资料供大家课前准备

证书:参加培训并通过考试的学员,可以申请获得工业和信息化部工业文化发展中心颁发的“工业强国建设素质素养提升尚工行动”岗位能力适应评测证书。该证书可在中心官网查询,可作为能力评价,考核和任职的重要依据。评测证书查询网址:www.miit-icdc.org(自愿申请,须另行缴纳考试费500元/人)

SIMPLICITY

官方联系人

联系人:孙老师
报名咨询电话:18638251323(同V)