夜雨聆风学习资料网

ARTICLE · 1078417

AI时代,如何真正学好AIDD?

AI时代,如何真正学好AIDD?

从“会用软件”到真正理解人工智能药物发现与设计

如果你正在学习人工智能药物发现与设计(Artificial Intelligence for Drug Discovery,AIDD),可能会有一种越来越明显的感觉:

这个领域正在变得越来越“卷”,但同时也越来越容易入门。

以前,一个刚接触药物设计的人,可能需要花很长时间学习分子对接、分子动力学、QSAR、药效团、虚拟筛选等传统计算药物设计技术。

而现在,AlphaFold、AlphaFold 3、ESMFold、DiffDock、分子生成模型、Graph Neural Networks、Transformer、Foundation Models、Generative AI……

大量AI工具正在不断降低技术门槛。

AlphaFold 3甚至已经能够对包含蛋白质、核酸、小分子、离子和修饰残基等在内的复杂生物分子体系进行联合结构预测,显示出深度学习正在从“预测蛋白结构”进一步走向“理解生物分子相互作用”。 (Nature)

问题也随之出现:

工具越来越多,我们真的更懂药物发现了吗?

答案未必。

因为AI时代学习AIDD最大的陷阱,就是:

把“会使用AI工具”误认为“掌握了AI药物发现”。


一、AIDD不是“AI + 一个药物软件”

很多初学者对AIDD的理解是:

找一个蛋白 → 下载一个结构 → AI预测 → 分子对接 → 分子动力学 → 找几个结合能好的分子 → 写论文。

这确实可以形成一个计算流程。

但它距离真正意义上的AIDD,还有很大的距离。

真正的AIDD并不是某一个软件,也不是某一个算法。

它更像是一个巨大的交叉学科体系:

疾病机制

↓

靶点发现

↓

靶点验证

↓

蛋白结构与生物分子相互作用

↓

虚拟筛选

↓

Hit发现

↓

Lead优化

↓

ADMET / Toxicity

↓

多参数优化

↓

实验验证

↓

临床转化

AI可以进入这个流程中的很多环节。

2025年的相关综述已经将AI/ML的应用覆盖到靶点识别、先导发现、命中优化、毒性预测以及临床开发等多个阶段。 (PubMed Central (PMC))

所以:

AIDD不是一个模型,而是一整套药物研发方法论。


二、AI时代,AIDD学习最重要的不是“学得多”,而是建立知识结构

如果你现在刚开始学习AIDD,我不建议你一上来就:

  • 学Transformer
  • 学Diffusion
  • 跑AlphaFold
  • 跑DiffDock
  • 跑分子生成
  • 下载一个超大的化合物数据库
  • 然后开始“AI筛药”

这样很容易陷入:

模型越来越懂,药物越来越不懂。

真正合理的学习顺序应该是:

第一层:生物学

首先要知道:

疾病到底发生了什么?

例如:

癌症为什么发生?

某个基因为什么异常?

蛋白为什么过表达?

某条信号通路为什么被激活?

肿瘤细胞和正常细胞有什么不同?

免疫微环境发生了什么?

一个靶点为什么可能成为药物靶点?

如果这些问题都回答不了,那么AI再强,也很难告诉你:

“为什么应该研究这个靶点?”


三、第二层:分子生物学与生物信息学

进入AIDD以后,你必须逐渐能够理解:

DNA → RNA → Protein → Function → Disease

进一步理解:

  • Genomics
  • Transcriptomics
  • Proteomics
  • Single-cell RNA-seq
  • Spatial transcriptomics
  • Epigenomics
  • Multi-omics
  • PPI
  • Pathway
  • Gene regulation
  • Mutation
  • Expression

这也是为什么:

AIDD正在越来越多地与Bioinformatics、AI4Science和Multi-omics融合。

未来的药物发现,很可能不是简单地:

“给我一个蛋白,我帮你找一个分子。”

而是:

“给我一个疾病系统,我帮你理解疾病机制、寻找潜在靶点,并进一步设计具有特定生物学性质的治疗分子。”

这会是完全不同的科研范式。


四、第三层:化学——这是很多AI研究者最容易忽略的部分

如果你想真正做好AIDD,必须懂一些药物化学。

至少应该理解:

  • SMILES
  • Molecular Graph
  • Fingerprint
  • Molecular Descriptor
  • Scaffold
  • Functional Group
  • Lipinski Rule of Five
  • LogP
  • Molecular Weight
  • H-bond Donor
  • H-bond Acceptor
  • TPSA
  • Rotatable Bonds
  • Solubility
  • Permeability
  • Metabolic Stability

进一步还需要理解:

SAR——Structure Activity Relationship

也就是:

一个分子为什么有效?

以及:

把分子的某个位置换掉以后,为什么活性变高或者变低?

如果只懂AI,不懂化学,很容易出现一个问题:

模型生成了一大堆“看起来很漂亮”的分子,但化学家根本不会去合成。

所以AIDD真正的竞争力不是:

AI生成了多少分子。

而是:

AI能不能生成具有生物活性、化学可合成性、药代动力学合理性以及进一步开发价值的分子。


五、第四层:机器学习——不要只会调用模型

当你真正进入机器学习以后,不应该只学习:

Random Forest怎么跑?

XGBoost怎么跑?

CNN怎么跑?

Transformer怎么跑?

而应该理解:

数据 → 特征 → 模型 → 验证 → 泛化 → 生物学解释

例如:

你预测一个化合物是否具有某种活性。

首先要问:

数据从哪里来?

数据是否存在偏差?

训练集和测试集是否存在数据泄漏?

随机划分是否合理?

Scaffold split是否更合适?

模型是否过拟合?

AUC很高是否真的意味着模型很好?

模型是否只是在记忆某些化学骨架?

这才是真正的机器学习思维。


六、第五层:深度学习——从“预测”走向“生成”

传统机器学习更多是在做:

Prediction

例如:

预测:

  • 活性
  • 毒性
  • ADMET
  • Binding affinity
  • Solubility
  • Protein property

而现在AIDD正在进一步走向:

Generation

也就是:

不只是预测一个分子好不好,而是直接生成一个新的分子。

这也是Generative AI进入药物发现之后非常重要的方向。

目前已经出现了:

  • VAE
  • GAN
  • Transformer
  • Autoregressive model
  • Diffusion model
  • Graph generative model
  • Protein language model
  • Molecular foundation model

等不同技术路线。

2025年的综述也指出,生成式AI已经被用于小分子和蛋白质设计,并涉及VAE、GAN、Transformer以及扩散模型等架构。 (DOI)

但这里一定要记住:

生成分子 ≠ 发现药物。

这是AIDD学习过程中非常重要的一条原则。


七、真正值得学习的是“完整闭环”

如果让我给AI时代的AIDD学习者设计一条主线,我会建议:

Disease

↓

Target identification

↓

Target validation

↓

Multi-omics

↓

Protein structure

↓

Binding site

↓

Virtual screening

↓

Molecular property prediction

↓

Hit discovery

↓

Lead optimization

↓

Molecular generation

↓

ADMET

↓

Docking

↓

Molecular Dynamics

↓

Free-energy / binding analysis

↓

Experimental validation

这才是一个相对完整的AIDD思维框架。


八、不要迷信Docking

这是很多AIDD初学者特别容易踩的坑。

很多论文的流程是:

AI筛选100万个分子

↓

Docking

↓

选Top 10

↓

MD

↓

找一个最好的

↓

宣布“potential drug candidate”

实际上,这里面有非常多需要谨慎处理的问题。

Docking score不是实验活性。

MD稳定也不等于一定有活性。

Binding energy也不等于临床有效。

AI预测结果也不等于真实生物学机制。

因此:

计算结果应该被理解为证据,而不是结论。

真正高水平的AIDD研究,需要不断进行:

Prediction → Validation → Interpretation → Iteration

而不是:

Prediction → Screenshot → Paper


九、真正厉害的AIDD研究者,应该学会“让不同AI模型协作”

未来的AIDD,很可能不是:

一个模型解决所有问题。

而是:

AI模型1

负责疾病机制和靶点发现。

AI模型2

负责蛋白结构预测。

AI模型3

负责分子性质预测。

AI模型4

负责虚拟筛选。

AI模型5

负责分子生成。

AI模型6

负责ADMET。

AI模型7

负责实验结果解释。

最后由研究者把这些结果整合起来。

因此未来AIDD研究者的重要能力之一是:

AI Orchestration

也就是:

如何把多个AI模型、数据库、生物信息学工具和计算化学工具组织成一个完整科研系统。


十、AI时代,真正稀缺的不是“会不会写代码”

很多人认为:

“我要学AIDD,所以我要先成为一个Python大神。”

其实不完全正确。

Python当然非常重要。

你至少应该熟悉:

  • Python
  • NumPy
  • Pandas
  • Scikit-learn
  • PyTorch
  • RDKit
  • Matplotlib
  • Jupyter
  • Linux
  • Git
  • Conda

但是:

代码只是工具。

真正决定你能不能做出好研究的是:

你能不能把一个生物医学问题转化成一个可以计算、可以验证、可以解释的科学问题。

例如:

普通问题:

“使用AI预测乳腺癌相关药物。”

科学问题:

“能否利用多组学信息识别具有功能依赖性的潜在治疗靶点,并进一步通过结构基础的生成式模型设计候选分子?”

这两句话的科研价值完全不同。


十一、AI时代最重要的能力:提出好问题

未来真正拉开差距的可能不是:

谁会用最新模型。

而是:

谁能提出真正值得研究的问题。

因为模型会越来越容易获得。

代码会越来越容易生成。

GPU会越来越强。

数据库会越来越大。

甚至很多算法实现都可以由AI直接帮助完成。

但是:

“到底应该研究什么?”

仍然需要研究者判断。

所以你必须训练自己的:

Scientific Question

Hypothesis

Experimental Design

Computational Design

Validation Strategy

Biological Interpretation

这才是科研能力。


十二、AIDD学习不要追热点,而要建立自己的“技术栈”

如果你今天学习AlphaFold。

明天学习DiffDock。

后天学习某个新的Foundation Model。

大后天又换一个Generative Model。

那么一年之后,你可能:

什么都看过,但什么都没有真正掌握。

更好的方法是建立自己的AIDD技术栈。

例如:

Level 1:基础

Python + Linux + Git

↓

Level 2:Bioinformatics

R / Python + GEO / TCGA / public omics

↓

Level 3:Machine Learning

Scikit-learn + XGBoost + SHAP

↓

Level 4:Deep Learning

PyTorch + CNN + GNN + Transformer

↓

Level 5:Cheminformatics

RDKit + Molecular descriptors + fingerprints

↓

Level 6:Structural Biology

PDB + AlphaFold + binding pocket

↓

Level 7:CADD

Docking + virtual screening + pharmacophore

↓

Level 8:Molecular Simulation

MD + trajectory analysis + free-energy methods

↓

Level 9:Generative AI

Molecular generation + diffusion + foundation models

↓

Level 10:AI4Science

Multi-omics + multimodal AI + biological foundation models

这样你会逐渐从:

“软件使用者”

变成:

“AIDD研究者”。


十三、如果你是计算机背景,应该怎么学?

如果你本身是计算机、人工智能或者数据科学背景,那么其实有一个非常明显的优势:

你不需要重新把自己培养成一个传统药学本科生。

你应该采用:

计算机能力 + 生物医学知识 + 药物设计知识

这样的路线。

也就是说:

你的优势

AI

↓

Machine Learning

↓

Deep Learning

↓

Computer Vision

↓

NLP

↓

Generative AI

↓

Large Models

然后补:

Biology

↓

Bioinformatics

↓

Chemistry

↓

Structural Biology

↓

Pharmacology

这样形成:

Computer Science × Biology × Chemistry × Medicine

这才是非常有竞争力的AIDD知识结构。


十四、如果你是生物、药学、医学背景呢?

路线则可以反过来。

先建立:

Biology

↓

Medicine

↓

Pharmacology

↓

Drug Discovery

↓

Bioinformatics

然后学习:

Python

↓

Machine Learning

↓

Deep Learning

↓

Generative AI

最终形成:

Biology × Medicine × AI

所以AIDD最大的特点就是:

不同背景的人,可以从不同入口进入同一个领域。


十五、AI时代,不要把“论文数量”当成唯一目标

AIDD特别容易出现一个问题:

一个简单的数据集。

一个机器学习模型。

几个筛选结果。

一个Docking。

一个MD。

然后:

“我们发现了一个潜在药物靶点。”

这种研究未来会越来越难体现真正的创新性。

因为AI工具越来越普及之后:

“跑一个模型”本身越来越不稀缺。

真正稀缺的是:

新数据

新机制

新模型

新方法

新生物学发现

新药物设计策略

实验验证

临床意义

所以未来真正有价值的AIDD研究,应该越来越强调:

科学问题,而不是软件数量。


十六、未来AIDD可能走向哪里?

我认为未来几年值得重点关注的方向至少包括:

① Biological Foundation Models

不再只训练一个疾病模型。

而是让AI理解:

DNA、RNA、蛋白质、细胞、组织、疾病。


② Multimodal Biology

未来可能同时处理:

DNA + RNA + Protein + Cell + Spatial + Imaging + Clinical

也就是:

多模态生物医学AI


③ Generative Drug Design

从:

“寻找已有分子”

逐渐走向:

“设计新的分子”。


④ Protein Design

AI不只是研究小分子。

也可能进一步设计:

  • Protein
  • Peptide
  • Antibody
  • Enzyme
  • Protein binder

⑤ Virtual Cell

这是一个非常值得关注的方向。

未来AI可能进一步尝试:

在计算环境中模拟细胞状态变化。

例如:

敲除一个基因会发生什么?

增加一个药物会发生什么?

改变一个蛋白会发生什么?

不同细胞之间会发生什么?

这会让:

AI + Single-cell + Spatial Transcriptomics + Drug Discovery

产生非常大的交叉空间。


十七、所以,AI时代到底应该如何学AIDD?

如果把整个学习过程压缩成一句话:

先懂疾病,再懂生物学;先懂分子,再懂算法;先学预测,再学生成;先学工具,再建立自己的科研体系。

真正的学习路线可以浓缩成:

Biology

↓

Bioinformatics

↓

Chemistry

↓

Drug Discovery

↓

Machine Learning

↓

Deep Learning

↓

Structural Biology

↓

CADD

↓

Generative AI

↓

Multimodal AI

↓

AI4Science

↓

New Drug Discovery

最终形成自己的能力闭环:

发现问题 → 获取数据 → 理解机制 → 构建模型 → 设计分子 → 计算验证 → 生物学解释 → 实验验证


十八、最后:AI不会淘汰AIDD研究者,但会淘汰“只会使用工具的人”

这是我认为AI时代学习AIDD最值得思考的一句话。

未来:

AI会写代码。

AI会查文献。

AI会分析数据。

AI会预测蛋白结构。

AI会生成分子。

AI会做虚拟筛选。

AI甚至会帮助设计实验。

那么研究者还需要做什么?

答案恰恰变得更加重要:

提出问题。

判断问题。

设计研究。

理解生物学。

验证AI。

解释结果。

发现真正有意义的科学规律。

所以,未来真正优秀的AIDD研究者,并不是一个“会调用最多AI工具的人”。

而应该成为:

一个能够让AI参与科学发现的人。

从传统的:

Computer-Aided Drug Design

走向:

AI-Driven Drug Discovery

再走向:

AI for Science

最终可能走向:

AI × Biology × Chemistry × Medicine

这才是人工智能药物发现与设计真正值得学习的地方。

不要只学会让AI帮你找药。

更重要的是,学会让AI帮助你理解疾病、理解生命,并最终发现新的科学规律。

这可能才是AI时代AIDD最值得投入的方向。


参考资料

  1. Abramson et al. Accurate structure prediction of biomolecular interactions with AlphaFold 3. Nature, 2024. (Nature)
  2. AI-Driven Drug Discovery: A Comprehensive Review. ACS Omega, 2025. (ACS Publications)
  3. The future of pharmaceuticals: Artificial intelligence in drug discovery and development. Journal of Pharmaceutical Analysis, 2025. (DOI)
  4. Generative AI for drug discovery and protein design: the next frontier in AI-driven molecular science. 2025. (DOI)
  5. 《创新药物设计——从计算机辅助到人工智能》,2025。 (nature.shu.edu.cn)

相关学习资料