Cell最新药物AI筛选工具 | 药物扰动后的转录组直接有了,不用湿实验也能筛先导化合物
⭐ 设为星标 · 第一时间获取生信前沿
💡 日常好的生信代码已放入免💰共享服务器中(人人皆可用):https://vip.r-py.com/

Novel compound screening portal http://apps.octad.org/GPS/.
Drug repurposing web portal is available http://octad.org/ and the R package octad is available in Bioconductor.
🔥 核心突破
该研究将这一平台命名为GPS(Gene expression profile predictor on chemical structures),核心逻辑是通过已有的药物-转录组扰动数据训练模型,学习化学结构与基因表达改变之间的对应关系,进而对任何未做过转录组测序的化合物,直接预测其处理后会带来哪些基因的上调、下调或无影响。在此基础上,研究者通过匹配疾病的转录组特征,筛选出能够逆转疾病异常表达的候选化合物,还可以通过树搜索算法完成多目标优化,得到活性更好的衍生物。
为了验证平台的有效性,研究者选择了两种缺乏有效治疗药物的疾病——肝细胞癌(HCC)和特发性肺纤维化(IPF)完成功能验证。在HCC中,GPS从化合物库中筛选得到了两个全新的化合物系列,体外实验验证显示其对HCC细胞具有良好的选择性,体内实验也证实了显著的抑癌效果;在IPF中,研究者结合单细胞转录组数据,同时靶向多个疾病相关细胞类型的异常转录组,不仅发现了一个可用于重定位的候选药物,还得到了一个全新的抗纤维化化合物。这项研究打通了从转录组特征到全新候选药物的全流程,为转录组导向的AI药物发现提供了可落地的完整方案。

文章摘要:该研究开发了基于深度学习的GPS药物发现平台,仅通过化合物结构预测转录组扰动特征,支持大规模筛选和先导优化,并在肝细胞癌和特发性肺纤维化中验证得到了有效的候选治疗化合物
📚 研究背景
近年来虽然已经有研究尝试用机器学习模型从化学结构预测基因表达变化,但这些研究仅针对小范围的已知化合物库,没有探索全新化合物筛选,更没有覆盖早期药物发现必需的先导化合物优化环节,也没有经过体内外功能验证,无法落地应用。因此,领域迫切需要一套完整的方法学框架,实现转录组导向的AI从头药物发现。
🔬 技术创新
-
提出鲁棒协作学习(RCL)框架解决转录组数据噪声问题:针对公共转录组扰动数据重复性差的问题,没有直接丢弃低质量数据,而是通过多专家知识融合对数据点重新加权,最终利用了约80%的全部数据完成模型训练,相比传统基线模型预测性能显著提升。
-
结合树搜索算法实现多目标先导优化:在筛选得到活性苗头化合物后,能够基于结构-基因-活性关系分析,通过树搜索对化合物结构进行优化,同时满足“逆转疾病转录组”“高选择性”“合适的成药性”多个目标,直接得到可进入验证的先导化合物。
-
支持单细胞转录组导向的药物筛选:能够整合单细胞测序得到的不同细胞类型的疾病特征,筛选可以同时逆转多个疾病相关细胞类型异常表达的化合物,更适合复杂疾病的药物开发。
📊 实验结果
Figure 1 结果
实验结果显示,在内部随机拆分验证和外部新化合物验证中,GPS的预测性能都显著优于所有基线模型,包括单基因随机森林模型、普通多任务学习模型、仅用高质量数据训练的随机森林模型等。比如在外部验证中,GPS的预测AUC达到0.78,比次优的基线模型高出超过5%,证实了算法设计的有效性。同时,GPS在不同细胞系间的泛化性能也优于对比方法,说明模型学习到了化学结构与基因表达之间的通用关联规律。

Figure 1:GPS模型设计和预测性能验证,显示GPS相比基线模型显著提升了化合物诱导转录组变化的预测准确率
Figure 2 结果
SGAR分析结果显示,GPS能够准确学习到不同化学结构基团对基因表达的影响:特定的结构修饰会带来可预测的基因表达改变,对应的改变方向和幅度和实验验证结果一致,说明SGAR可以用来解释化合物结构和活性之间的关系,指导后续的结构优化。这部分结果证实,GPS不仅可以完成虚拟筛选,还能为后续的先导优化提供可靠的方向。

Figure 2:GPS大规模虚拟筛选性能和SGAR分析验证,显示GPS可以有效富集活性化合物,SGAR能准确反映结构修饰对基因表达的影响
Figure 3 结果
体外细胞实验结果显示,18个化合物中有7个对HepG2细胞的抑制活性达到微摩尔级别,其中化合物GPS-001和GPS-034两个分子对HCC细胞的选择性显著优于对正常肝细胞的毒性,被选作核心苗头化合物进一步优化。进一步的机制验证显示,GPS预测这两个化合物对HCC差异基因的调控方向和实际实验测得的表达变化一致性很高,相关性分别达到0.62和0.58,再次证实了GPS预测的准确性。

Figure 3:GPS针对肝细胞癌的苗头化合物筛选和体外验证,得到了两个对HCC细胞有选择性抑制活性的苗头化合物
Figure 4 结果
进一步的机制分析显示,GPS-001-oa可以显著抑制HCC细胞的周期进展和上皮间质转化(EMT)过程,这和GPS预测的转录组调控特征完全一致:GPS预测该化合物会下调细胞周期和EMT相关的上调疾病基因,实验结果也证实了这一调控效应。这部分结果证实,基于GPS的SGAR指导的结构优化确实可以有效提升化合物活性,实现从苗头到先导的推进。

Figure 4:基于GPS的肝细胞癌先导化合物优化,优化后的先导化合物活性相比原型提升6倍,且保持良好选择性
Figure 5 结果
免疫组化结果显示,处理组肿瘤的增殖标志物Ki67阳性率显著下降,凋亡标志物cleaved caspase-3阳性率显著上升,和体外实验的结论一致,证实化合物通过抑制肿瘤增殖、促进凋亡发挥抑癌作用。这是首次通过转录组导向的AI从头筛选得到的具有体内活性的抗肿瘤化合物,证实了GPS平台的实际应用价值。

Figure 5:优化后的肝细胞癌先导化合物体内抑癌活性验证,显示化合物显著抑制移植瘤生长且无明显毒性
💡 应用前景和未来展望
未来该框架可以进一步和大语言模型结合,提升对复杂化学结构的特征提取能力,也可以拓展到更多组学维度,比如结合蛋白质组、代谢组特征进行多组学导向的药物筛选,进一步提升筛选的准确性。随着单细胞测序数据的积累,该框架还可以用于针对肿瘤微环境中特定细胞亚群的药物筛选,开发更精准的疾病治疗药物。
🔍 生信视角解读
其次,这项研究的方法设计非常务实,针对实际数据存在的噪声问题,没有简单地丢弃低质量数据,而是用鲁棒协作学习的思路充分利用已有数据,这一点非常值得我们借鉴。我们在做生信分析的时候,经常会遇到数据质量参差不齐的情况,很多人会直接扔掉低质量数据,导致样本量大幅减少,而这项研究告诉我们,通过合理的算法设计,可以在保留大部分数据的同时控制噪声,得到更好的模型效果。
当然,这个方法也存在一定的局限性:目前GPS只能预测978个 landmark 基因中的307个,大部分基因还无法实现稳定预测,这会影响对一些特定疾病相关通路的预测准确性;另外,目前模型是基于LINCS数据在四种细胞系中训练的,对于原代细胞或者组织特异性的转录组反应预测,准确性可能会下降。不过这些局限性也给后续的研究留下了空间:我们可以用更多细胞类型、更多样本的转录组扰动数据重新训练模型,进一步提升预测的覆盖度和准确性。
对于普通生信研究者来说,这个平台的开放使用也给我们提供了很多机会:如果你有感兴趣疾病的转录组差异特征,不需要自己搭模型、不需要湿实验,就可以直接用GPS完成虚拟筛选,得到候选化合物,直接推进后续验证,大大缩短了从课题设计到出结果的时间,对于赶毕业的同学来说非常友好,这也是为什么说这项研究值得我们收藏备用。
你做过转录组导向的药物筛选研究吗?你会用这个平台来分析自己的数据吗?欢迎在评论区留下你的看法~
👇 关注「公众号」,每日获取前沿生信研究解读
📚 文献引用:Deep-learning-based de novo discovery and design of therapeutics that reverse disease-associated transcriptional phenotypes. Cell, 2026.
夜雨聆风