乐于分享
好东西不私藏

AIDD酶设计(二):AIDD酶设计相关软件安装

AIDD酶设计(二):AIDD酶设计相关软件安装

AIDD · 酶设计



在上一篇中,我们介绍了AIDD酶设计的完整工作流。对于从事 AI 辅助设计的科研人员而言,配置一个稳定、高效且无冲突的计算环境,是迈向产业级酶设计的第一步。很多初学者在这一步耗费数周,甚至因为版本冲突而放弃。本篇将为你提供一套开箱即用的环境搭建方案,涵盖从硬件选型到核心 AI 模型与分子模拟工具的批量化安装脚本,助你跨越环境配置的“死亡之谷”。

硬件选型建议:CPU、GPU与显存的博弈

计算生物学与传统的生物信息学不同,它对算力的需求呈现出明显的“两极分化”:推理阶段依赖 GPU 的大规模并行矩阵运算,而传统的分子动力学(MD)模拟和对接则极度依赖 CPU 的多核性能与内存带宽。

GPU 显存是运行 RFdiffusion2 等生成式 AI 模型的核心瓶颈。生成 300 个氨基酸以上的酶骨架,通常需要 16GB 以上的显存以保证批量采样的顺利进行。如果显存不足,程序会频繁触发 Out of Memory (OOM) 错误。

硬件组件
入门级配置(学习/小测试)
产业级配置(并行/大蛋白)
GPU
RTX 3090 / 4090 (24GB)
RTX 6000 Ada (48GB) / A100
CPU
Intel i7 / AMD Ryzen 7 (8核)
AMD Threadripper (32核+)
内存 (RAM)
32GB – 64GB DDR4
128GB – 256GB DDR5 ECC

Linux环境准备:Ubuntu 22.04 + CUDA 12.1

Ubuntu 22.04 LTS 是目前计算生物学界支持度最广泛的 Linux 发行版。在 AI 驱动的蛋白质设计领域,CUDA 12.1 已成为当前 PyTorch 2.x 生态的黄金标准,它能最大化兼容最新的 RFdiffusion2 和 ColabFold 框架。

为了避免污染系统主环境,我们通常不使用 apt 直接安装显卡驱动,而是通过官方提供的 runfile 或 apt 仓库进行精准控制。以下脚本演示了如何在纯净的 Ubuntu 22.04 上安装 NVIDIA Driver 及 CUDA 12.1 工具包。

# 1. 安装 NVIDIA 显卡驱动 (以 535 版本为例,完美兼容 CUDA 12.1) sudo apt update sudo apt install -y build-essential dkms sudo ubuntu-drivers autoinstall sudo reboot  # 重启后确认驱动安装 nvidia-smi  # 2. 下载并安装 CUDA 12.1 (网络安装版,体积更小) wget https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2204/x86_64/cuda-ubuntu2204.pin sudo mv cuda-ubuntu2204.pin /etc/apt/preferences.d/cuda-repository-pin-600 sudo apt-key adv --fetch-keys https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2204/x86_64/3bf863cc.pub sudo add-apt-repository "deb https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2204/x86_64/ /" sudo apt update sudo apt install -y cuda-toolkit-12-1  # 3. 配置环境变量 (写入 ~/.bashrc) echo 'export PATH=/usr/local/cuda-12.1/bin:$PATH' >> ~/.bashrc echo 'export LD_LIBRARY_PATH=/usr/local/cuda-12.1/lib64:$LD_LIBRARY_PATH' >> ~/.bashrc source ~/.bashrc nvcc -V 

Conda环境管理与镜像加速

环境隔离是 AIDD 工作流的重中之重。Rosetta 的 C++ 依赖往往与 PyTorch 的依赖发生冲突,因此强烈建议使用 Miniconda 为不同的工具链建立独立的虚拟环境。

对于国内用户,直接拉取 Anaconda 官方源的速度极慢。我们必须在安装 Miniconda 后的第一时间配置清华大学的镜像源,这能将包下载时间从数小时缩短至几分钟。

# 1. 安装 Miniconda (静默安装) wget https://repo.anaconda.com/miniconda/Miniconda3-latest-Linux-x86_64.sh bash Miniconda3-latest-Linux-x86_64.sh -b -p $HOME/miniconda3 $HOME/miniconda3/bin/conda init bash source ~/.bashrc  # 2. 配置清华镜像源 (加速 conda 与 pip) conda config --add channels https://mirrors.tuna.tsinghua.edu.cn/anaconda/pkgs/main/ conda config --add channels https://mirrors.tuna.tsinghua.edu.cn/anaconda/pkgs/free/ conda config --add channels https://mirrors.tuna.tsinghua.edu.cn/anaconda/cloud/conda-forge/ conda config --set show_channel_urls yes  pip config set global.index-url https://pypi.tuna.tsinghua.edu.cn/simple  # 3. 为本系列文章创建一个综合 Python 环境 (命名为 aidd) conda create -n aidd python=3.10 -y conda activate aidd

Rosetta与PyRosetta的编译与安装

Rosetta 是蛋白质设计领域的“老牌重型武器”,其物理能量函数在评估酶催化活性位点的几何构象时依然不可替代。而 PyRosetta 则为其提供了 Python 接口,极大方便了与 AI 模型的数据流转。

由于 Rosetta 是闭源商业软件(学术研究可申请免费 License),我们需要通过官方渠道获取源码包。为了防止编译过程导致系统卡死,建议使用 make 的 -j 参数限制并发数。

# 1. 安装 Rosetta (通过 bioconda 直接安装预编译二进制文件,省去数小时编译时间) conda install -c bioconda rosetta=2024.0 -y  # 2. 安装 PyRosetta (需提前获取学术版 License 密钥) # 假设你已下载 PyRosetta4.conda.Linux.tar.gz tar -zxvf PyRosetta4.conda.Linux.tar.gz cd PyRosetta4.conda.Linux source setup.sh  # 3. 验证 PyRosetta 是否能成功导入 python -c "import pyrosetta; pyrosetta.init('-mute all'); print('PyRosetta 初始化成功!')"

核心AI大模型:ProteinMPNN、LigandMPNN与RFdiffusion2

生成式 AI 已经彻底重塑了酶设计的范式。RFdiffusion2 能够从零生成具有特定折叠结构的酶骨架,而 ProteinMPNN 及其支持非氨基酸残基的进阶版 LigandMPNN 则负责为这些骨架“填入”最优的氨基酸序列。这三套工具共同构成了从头酶设计的“黄金三角”。

这些模型均基于 PyTorch 开发。在安装时,务必确保 PyTorch 的版本与 CUDA 12.1 匹配。同时,部分模型(如 LigandMPNN)依赖于特定的生化处理库,需要单独安装。

# 1. 安装支持 CUDA 12.1 的 PyTorch 2.1.0 pip install torch==2.1.0 torchvision==0.16.0 torchaudio==2.1.0 --index-url https://download.pytorch.org/whl/cu121  # 2. 克隆 ProteinMPNN 与 LigandMPNN 仓库 git clone https://github.com/dauparas/ProteinMPNN.git cd ProteinMPNN # 安装必要的依赖库 pip install biopython numpy matplotlib  # 3. 克隆 RFdiffusion2 并安装环境 cd ~ git clone https://github.com/RosettaCommons/RFdiffusion.git cd RFdiffusion # 安装其特有的 Python 依赖 pip install -e . pip install dgl==1.1.2 -f https://data.dgl.ai/wheels/cu121/repo.html  # 4. 下载 RFdiffusion 预训练模型权重 (约 3GB) mkdir weights && cd weights wget http://files.ipd.uw.edu/pub/RFdiffusion/6f5902ac237024bdd0c176cb93063dc4/Base_ckpt.pt 

辅助工具:ColabFold、PyMOL、AutoDock Vina与GROMACS

结构与动力学分析决定了设计成败。我们需要 ColabFold(AlphaFold2 的高效本地化版本)来快速预测设计序列的结构,用 AutoDock Vina 评估底物分子与酶口袋的结合亲和力,最后用 GROMACS 进行分子动力学模拟以验证酶在溶液体系中的热稳定性。

PyMOL 则是产业界标准的三维可视化引擎。通过 conda,我们可以一键部署这套复杂的分析工具链,避免了繁琐的依赖编译。

# 1. 安装图形化分析工具 PyMOL (教育版/开源版) conda install -c schrodinger pymol -y  # 2. 安装 AutoDock Vina (分子对接核心引擎) conda install -c bioconda autodock-vina -y  # 3. 安装 GROMACS (分子动力学模拟,推荐 2023.x 版本) conda install -c bioconda gromacs=2023.3 -y  # 4. 安装 ColabFold (本地部署 AlphaFold2) pip install colabfold[alphafold]

常见安装问题与排查指南

版本地狱是每一个踏入 AIDD 领域的研究者必经的考验。当面对满屏飘红的报错信息时,盲目重装系统往往无济于事。我们需要掌握结构化的排查逻辑。

库链接冲突是最常见的问题。例如,GROMACS 依赖特定版本的 libstdc++,而 PyTorch 可能会覆盖系统的环境变量,导致 GROMACS 运行时抛出 GLIBCXX_… not found 的致命错误。解决这类问题的核心在于隔离环境。

常见报错类型
根本原因分析
推荐解决方案
CUDA Out of Memory
GPU 显存不足,模型推理参数量过大
减小 batch_size,或使用 CPU 模式进行调试
GLIBCXX not found
系统底层 C++ 动态链接库版本不匹配
在 conda 环境中强制安装 conda install -c conda-forge gxx
DGL Backend Error
RFdiffusion 依赖的图神经网络库与 CUDA 不匹配
卸载当前 dgl,严格按官方文档安装 cu121 专用 wheel 包

环境验证是排查的最后一步。当所有软件包报告安装成功后,切勿直接投入正式计算任务。应当使用一个极小的测试用例(例如包含 10 个氨基酸的短肽)跑通 AI 序列设计、结构预测对接的全流程,以确保算力管线没有“断点”。

小结与下一篇预告

工欲善其事,必先利其器。本篇详细梳理了 AIDD 酶设计的底层硬件逻辑与全套软件环境部署方案。通过 Conda 这一强大的环境管理工具,我们将传统计算生物学软件(Rosetta、GROMACS)与前沿深度学习框架(PyTorch、RFdiffusion2)完美融合在一个服务器节点中。这标志着我们的 AIDD 实验室已经打好了地基。

下一篇的文章中,我们将正式进入酶设计的微观世界,探讨“酶结构、活性位点和设计区域准备”。你将学会如何从庞大的 PDB 数据库中提取目标结构,如何使用 PyMOL 进行底物对接位点的精准界定,以及如何为 AI 模型准备输入文件。