ARTICLE · 1078417
AI时代,如何真正学好AIDD?
从“会用软件”到真正理解人工智能药物发现与设计
如果你正在学习人工智能药物发现与设计(Artificial Intelligence for Drug Discovery,AIDD),可能会有一种越来越明显的感觉:
这个领域正在变得越来越“卷”,但同时也越来越容易入门。
以前,一个刚接触药物设计的人,可能需要花很长时间学习分子对接、分子动力学、QSAR、药效团、虚拟筛选等传统计算药物设计技术。
而现在,AlphaFold、AlphaFold 3、ESMFold、DiffDock、分子生成模型、Graph Neural Networks、Transformer、Foundation Models、Generative AI……
大量AI工具正在不断降低技术门槛。
AlphaFold 3甚至已经能够对包含蛋白质、核酸、小分子、离子和修饰残基等在内的复杂生物分子体系进行联合结构预测,显示出深度学习正在从“预测蛋白结构”进一步走向“理解生物分子相互作用”。 (Nature)
问题也随之出现:
工具越来越多,我们真的更懂药物发现了吗?
答案未必。
因为AI时代学习AIDD最大的陷阱,就是:
把“会使用AI工具”误认为“掌握了AI药物发现”。
一、AIDD不是“AI + 一个药物软件”
很多初学者对AIDD的理解是:
找一个蛋白 → 下载一个结构 → AI预测 → 分子对接 → 分子动力学 → 找几个结合能好的分子 → 写论文。
这确实可以形成一个计算流程。
但它距离真正意义上的AIDD,还有很大的距离。
真正的AIDD并不是某一个软件,也不是某一个算法。
它更像是一个巨大的交叉学科体系:
疾病机制
↓
靶点发现
↓
靶点验证
↓
蛋白结构与生物分子相互作用
↓
虚拟筛选
↓
Hit发现
↓
Lead优化
↓
ADMET / Toxicity
↓
多参数优化
↓
实验验证
↓
临床转化
AI可以进入这个流程中的很多环节。
2025年的相关综述已经将AI/ML的应用覆盖到靶点识别、先导发现、命中优化、毒性预测以及临床开发等多个阶段。 (PubMed Central (PMC))
所以:
AIDD不是一个模型,而是一整套药物研发方法论。
二、AI时代,AIDD学习最重要的不是“学得多”,而是建立知识结构
如果你现在刚开始学习AIDD,我不建议你一上来就:
- 学Transformer
- 学Diffusion
- 跑AlphaFold
- 跑DiffDock
- 跑分子生成
- 下载一个超大的化合物数据库
- 然后开始“AI筛药”
这样很容易陷入:
模型越来越懂,药物越来越不懂。
真正合理的学习顺序应该是:
第一层:生物学
首先要知道:
疾病到底发生了什么?
例如:
癌症为什么发生?
某个基因为什么异常?
蛋白为什么过表达?
某条信号通路为什么被激活?
肿瘤细胞和正常细胞有什么不同?
免疫微环境发生了什么?
一个靶点为什么可能成为药物靶点?
如果这些问题都回答不了,那么AI再强,也很难告诉你:
“为什么应该研究这个靶点?”
三、第二层:分子生物学与生物信息学
进入AIDD以后,你必须逐渐能够理解:
DNA → RNA → Protein → Function → Disease
进一步理解:
- Genomics
- Transcriptomics
- Proteomics
- Single-cell RNA-seq
- Spatial transcriptomics
- Epigenomics
- Multi-omics
- PPI
- Pathway
- Gene regulation
- Mutation
- Expression
这也是为什么:
AIDD正在越来越多地与Bioinformatics、AI4Science和Multi-omics融合。
未来的药物发现,很可能不是简单地:
“给我一个蛋白,我帮你找一个分子。”
而是:
“给我一个疾病系统,我帮你理解疾病机制、寻找潜在靶点,并进一步设计具有特定生物学性质的治疗分子。”
这会是完全不同的科研范式。
四、第三层:化学——这是很多AI研究者最容易忽略的部分
如果你想真正做好AIDD,必须懂一些药物化学。
至少应该理解:
- SMILES
- Molecular Graph
- Fingerprint
- Molecular Descriptor
- Scaffold
- Functional Group
- Lipinski Rule of Five
- LogP
- Molecular Weight
- H-bond Donor
- H-bond Acceptor
- TPSA
- Rotatable Bonds
- Solubility
- Permeability
- Metabolic Stability
进一步还需要理解:
SAR——Structure Activity Relationship
也就是:
一个分子为什么有效?
以及:
把分子的某个位置换掉以后,为什么活性变高或者变低?
如果只懂AI,不懂化学,很容易出现一个问题:
模型生成了一大堆“看起来很漂亮”的分子,但化学家根本不会去合成。
所以AIDD真正的竞争力不是:
AI生成了多少分子。
而是:
AI能不能生成具有生物活性、化学可合成性、药代动力学合理性以及进一步开发价值的分子。
五、第四层:机器学习——不要只会调用模型
当你真正进入机器学习以后,不应该只学习:
Random Forest怎么跑?
XGBoost怎么跑?
CNN怎么跑?
Transformer怎么跑?
而应该理解:
数据 → 特征 → 模型 → 验证 → 泛化 → 生物学解释
例如:
你预测一个化合物是否具有某种活性。
首先要问:
数据从哪里来?
数据是否存在偏差?
训练集和测试集是否存在数据泄漏?
随机划分是否合理?
Scaffold split是否更合适?
模型是否过拟合?
AUC很高是否真的意味着模型很好?
模型是否只是在记忆某些化学骨架?
这才是真正的机器学习思维。
六、第五层:深度学习——从“预测”走向“生成”
传统机器学习更多是在做:
Prediction
例如:
预测:
- 活性
- 毒性
- ADMET
- Binding affinity
- Solubility
- Protein property
而现在AIDD正在进一步走向:
Generation
也就是:
不只是预测一个分子好不好,而是直接生成一个新的分子。
这也是Generative AI进入药物发现之后非常重要的方向。
目前已经出现了:
- VAE
- GAN
- Transformer
- Autoregressive model
- Diffusion model
- Graph generative model
- Protein language model
- Molecular foundation model
等不同技术路线。
2025年的综述也指出,生成式AI已经被用于小分子和蛋白质设计,并涉及VAE、GAN、Transformer以及扩散模型等架构。 (DOI)
但这里一定要记住:
生成分子 ≠ 发现药物。
这是AIDD学习过程中非常重要的一条原则。
七、真正值得学习的是“完整闭环”
如果让我给AI时代的AIDD学习者设计一条主线,我会建议:
Disease
↓
Target identification
↓
Target validation
↓
Multi-omics
↓
Protein structure
↓
Binding site
↓
Virtual screening
↓
Molecular property prediction
↓
Hit discovery
↓
Lead optimization
↓
Molecular generation
↓
ADMET
↓
Docking
↓
Molecular Dynamics
↓
Free-energy / binding analysis
↓
Experimental validation
这才是一个相对完整的AIDD思维框架。
八、不要迷信Docking
这是很多AIDD初学者特别容易踩的坑。
很多论文的流程是:
AI筛选100万个分子
↓
Docking
↓
选Top 10
↓
MD
↓
找一个最好的
↓
宣布“potential drug candidate”
实际上,这里面有非常多需要谨慎处理的问题。
Docking score不是实验活性。
MD稳定也不等于一定有活性。
Binding energy也不等于临床有效。
AI预测结果也不等于真实生物学机制。
因此:
计算结果应该被理解为证据,而不是结论。
真正高水平的AIDD研究,需要不断进行:
Prediction → Validation → Interpretation → Iteration
而不是:
Prediction → Screenshot → Paper
九、真正厉害的AIDD研究者,应该学会“让不同AI模型协作”
未来的AIDD,很可能不是:
一个模型解决所有问题。
而是:
AI模型1
负责疾病机制和靶点发现。
AI模型2
负责蛋白结构预测。
AI模型3
负责分子性质预测。
AI模型4
负责虚拟筛选。
AI模型5
负责分子生成。
AI模型6
负责ADMET。
AI模型7
负责实验结果解释。
最后由研究者把这些结果整合起来。
因此未来AIDD研究者的重要能力之一是:
AI Orchestration
也就是:
如何把多个AI模型、数据库、生物信息学工具和计算化学工具组织成一个完整科研系统。
十、AI时代,真正稀缺的不是“会不会写代码”
很多人认为:
“我要学AIDD,所以我要先成为一个Python大神。”
其实不完全正确。
Python当然非常重要。
你至少应该熟悉:
- Python
- NumPy
- Pandas
- Scikit-learn
- PyTorch
- RDKit
- Matplotlib
- Jupyter
- Linux
- Git
- Conda
但是:
代码只是工具。
真正决定你能不能做出好研究的是:
你能不能把一个生物医学问题转化成一个可以计算、可以验证、可以解释的科学问题。
例如:
普通问题:
“使用AI预测乳腺癌相关药物。”
科学问题:
“能否利用多组学信息识别具有功能依赖性的潜在治疗靶点,并进一步通过结构基础的生成式模型设计候选分子?”
这两句话的科研价值完全不同。
十一、AI时代最重要的能力:提出好问题
未来真正拉开差距的可能不是:
谁会用最新模型。
而是:
谁能提出真正值得研究的问题。
因为模型会越来越容易获得。
代码会越来越容易生成。
GPU会越来越强。
数据库会越来越大。
甚至很多算法实现都可以由AI直接帮助完成。
但是:
“到底应该研究什么?”
仍然需要研究者判断。
所以你必须训练自己的:
Scientific Question
Hypothesis
Experimental Design
Computational Design
Validation Strategy
Biological Interpretation
这才是科研能力。
十二、AIDD学习不要追热点,而要建立自己的“技术栈”
如果你今天学习AlphaFold。
明天学习DiffDock。
后天学习某个新的Foundation Model。
大后天又换一个Generative Model。
那么一年之后,你可能:
什么都看过,但什么都没有真正掌握。
更好的方法是建立自己的AIDD技术栈。
例如:
Level 1:基础
Python + Linux + Git
↓
Level 2:Bioinformatics
R / Python + GEO / TCGA / public omics
↓
Level 3:Machine Learning
Scikit-learn + XGBoost + SHAP
↓
Level 4:Deep Learning
PyTorch + CNN + GNN + Transformer
↓
Level 5:Cheminformatics
RDKit + Molecular descriptors + fingerprints
↓
Level 6:Structural Biology
PDB + AlphaFold + binding pocket
↓
Level 7:CADD
Docking + virtual screening + pharmacophore
↓
Level 8:Molecular Simulation
MD + trajectory analysis + free-energy methods
↓
Level 9:Generative AI
Molecular generation + diffusion + foundation models
↓
Level 10:AI4Science
Multi-omics + multimodal AI + biological foundation models
这样你会逐渐从:
“软件使用者”
变成:
“AIDD研究者”。
十三、如果你是计算机背景,应该怎么学?
如果你本身是计算机、人工智能或者数据科学背景,那么其实有一个非常明显的优势:
你不需要重新把自己培养成一个传统药学本科生。
你应该采用:
计算机能力 + 生物医学知识 + 药物设计知识
这样的路线。
也就是说:
你的优势
AI
↓
Machine Learning
↓
Deep Learning
↓
Computer Vision
↓
NLP
↓
Generative AI
↓
Large Models
然后补:
Biology
↓
Bioinformatics
↓
Chemistry
↓
Structural Biology
↓
Pharmacology
这样形成:
Computer Science × Biology × Chemistry × Medicine
这才是非常有竞争力的AIDD知识结构。
十四、如果你是生物、药学、医学背景呢?
路线则可以反过来。
先建立:
Biology
↓
Medicine
↓
Pharmacology
↓
Drug Discovery
↓
Bioinformatics
然后学习:
Python
↓
Machine Learning
↓
Deep Learning
↓
Generative AI
最终形成:
Biology × Medicine × AI
所以AIDD最大的特点就是:
不同背景的人,可以从不同入口进入同一个领域。
十五、AI时代,不要把“论文数量”当成唯一目标
AIDD特别容易出现一个问题:
一个简单的数据集。
一个机器学习模型。
几个筛选结果。
一个Docking。
一个MD。
然后:
“我们发现了一个潜在药物靶点。”
这种研究未来会越来越难体现真正的创新性。
因为AI工具越来越普及之后:
“跑一个模型”本身越来越不稀缺。
真正稀缺的是:
新数据
新机制
新模型
新方法
新生物学发现
新药物设计策略
实验验证
临床意义
所以未来真正有价值的AIDD研究,应该越来越强调:
科学问题,而不是软件数量。
十六、未来AIDD可能走向哪里?
我认为未来几年值得重点关注的方向至少包括:
① Biological Foundation Models
不再只训练一个疾病模型。
而是让AI理解:
DNA、RNA、蛋白质、细胞、组织、疾病。
② Multimodal Biology
未来可能同时处理:
DNA + RNA + Protein + Cell + Spatial + Imaging + Clinical
也就是:
多模态生物医学AI
③ Generative Drug Design
从:
“寻找已有分子”
逐渐走向:
“设计新的分子”。
④ Protein Design
AI不只是研究小分子。
也可能进一步设计:
- Protein
- Peptide
- Antibody
- Enzyme
- Protein binder
⑤ Virtual Cell
这是一个非常值得关注的方向。
未来AI可能进一步尝试:
在计算环境中模拟细胞状态变化。
例如:
敲除一个基因会发生什么?
增加一个药物会发生什么?
改变一个蛋白会发生什么?
不同细胞之间会发生什么?
这会让:
AI + Single-cell + Spatial Transcriptomics + Drug Discovery
产生非常大的交叉空间。
十七、所以,AI时代到底应该如何学AIDD?
如果把整个学习过程压缩成一句话:
先懂疾病,再懂生物学;先懂分子,再懂算法;先学预测,再学生成;先学工具,再建立自己的科研体系。
真正的学习路线可以浓缩成:
Biology
↓
Bioinformatics
↓
Chemistry
↓
Drug Discovery
↓
Machine Learning
↓
Deep Learning
↓
Structural Biology
↓
CADD
↓
Generative AI
↓
Multimodal AI
↓
AI4Science
↓
New Drug Discovery
最终形成自己的能力闭环:
发现问题 → 获取数据 → 理解机制 → 构建模型 → 设计分子 → 计算验证 → 生物学解释 → 实验验证
十八、最后:AI不会淘汰AIDD研究者,但会淘汰“只会使用工具的人”
这是我认为AI时代学习AIDD最值得思考的一句话。
未来:
AI会写代码。
AI会查文献。
AI会分析数据。
AI会预测蛋白结构。
AI会生成分子。
AI会做虚拟筛选。
AI甚至会帮助设计实验。
那么研究者还需要做什么?
答案恰恰变得更加重要:
提出问题。
判断问题。
设计研究。
理解生物学。
验证AI。
解释结果。
发现真正有意义的科学规律。
所以,未来真正优秀的AIDD研究者,并不是一个“会调用最多AI工具的人”。
而应该成为:
一个能够让AI参与科学发现的人。
从传统的:
Computer-Aided Drug Design
走向:
AI-Driven Drug Discovery
再走向:
AI for Science
最终可能走向:
AI × Biology × Chemistry × Medicine
这才是人工智能药物发现与设计真正值得学习的地方。
不要只学会让AI帮你找药。
更重要的是,学会让AI帮助你理解疾病、理解生命,并最终发现新的科学规律。
这可能才是AI时代AIDD最值得投入的方向。
参考资料
- Abramson et al. Accurate structure prediction of biomolecular interactions with AlphaFold 3. Nature, 2024. (Nature)
- AI-Driven Drug Discovery: A Comprehensive Review. ACS Omega, 2025. (ACS Publications)
- The future of pharmaceuticals: Artificial intelligence in drug discovery and development. Journal of Pharmaceutical Analysis, 2025. (DOI)
- Generative AI for drug discovery and protein design: the next frontier in AI-driven molecular science. 2025. (DOI)
- 《创新药物设计——从计算机辅助到人工智能》,2025。 (nature.shu.edu.cn)