乐于分享
好东西不私藏

Cell最新药物AI筛选工具 | 药物扰动后的转录组直接有了,不用湿实验也能筛先导化合物

Cell最新药物AI筛选工具 | 药物扰动后的转录组直接有了,不用湿实验也能筛先导化合物

⭐ 设为星标 · 第一时间获取生信前沿

💡 日常好的生信代码已放入免💰共享服务器中(人人皆可用):https://vip.r-py.com/

Novel compound screening portal http://apps.octad.org/GPS/.

Drug repurposing web portal is available http://octad.org/ and the R package octad is available in Bioconductor.

🔥 核心突破

 当前基于转录组特征逆转的药物发现策略,长期局限于已有转录组谱的已知化合物,无法支持对大规模未知化合物库的从头筛选,更不能完成先导化合物的结构优化这一早期药物研发的核心环节。这项研究的核心突破在于,建立了一套仅基于化合物化学结构就能预测其全转录组扰动特征的深度学习平台,将转录组导向的药物发现从药物重定位拓展到了从头药物发现和先导优化的全流程。

该研究将这一平台命名为GPS(Gene expression profile predictor on chemical structures),核心逻辑是通过已有的药物-转录组扰动数据训练模型,学习化学结构与基因表达改变之间的对应关系,进而对任何未做过转录组测序的化合物,直接预测其处理后会带来哪些基因的上调、下调或无影响。在此基础上,研究者通过匹配疾病的转录组特征,筛选出能够逆转疾病异常表达的候选化合物,还可以通过树搜索算法完成多目标优化,得到活性更好的衍生物。

为了验证平台的有效性,研究者选择了两种缺乏有效治疗药物的疾病——肝细胞癌(HCC)和特发性肺纤维化(IPF)完成功能验证。在HCC中,GPS从化合物库中筛选得到了两个全新的化合物系列,体外实验验证显示其对HCC细胞具有良好的选择性,体内实验也证实了显著的抑癌效果;在IPF中,研究者结合单细胞转录组数据,同时靶向多个疾病相关细胞类型的异常转录组,不仅发现了一个可用于重定位的候选药物,还得到了一个全新的抗纤维化化合物。这项研究打通了从转录组特征到全新候选药物的全流程,为转录组导向的AI药物发现提供了可落地的完整方案。

文章摘要:该研究开发了基于深度学习的GPS药物发现平台,仅通过化合物结构预测转录组扰动特征,支持大规模筛选和先导优化,并在肝细胞癌和特发性肺纤维化中验证得到了有效的候选治疗化合物

📚 研究背景

 基于转录组表型逆转的药物筛选逻辑非常清晰:药物需要将疾病的异常转录组恢复到健康状态,因此只要找到能逆转疾病特征表达谱的化合物,就能得到候选治疗分子。这一思路已经被广泛用于药物重定位研究,但始终存在难以突破的瓶颈:传统方法需要提前获得所有候选化合物的转录组扰动数据,而对百万级的大规模化合物库来说,逐个做转录组测序在成本和时间上都不可行,因此只能局限于已经有数据的几百上千个已知化合物,无法支持全新化合物的发现。

近年来虽然已经有研究尝试用机器学习模型从化学结构预测基因表达变化,但这些研究仅针对小范围的已知化合物库,没有探索全新化合物筛选,更没有覆盖早期药物发现必需的先导化合物优化环节,也没有经过体内外功能验证,无法落地应用。因此,领域迫切需要一套完整的方法学框架,实现转录组导向的AI从头药物发现。

🔬 技术创新

  • 提出鲁棒协作学习(RCL)框架解决转录组数据噪声问题:针对公共转录组扰动数据重复性差的问题,没有直接丢弃低质量数据,而是通过多专家知识融合对数据点重新加权,最终利用了约80%的全部数据完成模型训练,相比传统基线模型预测性能显著提升。
  • 结合树搜索算法实现多目标先导优化:在筛选得到活性苗头化合物后,能够基于结构-基因-活性关系分析,通过树搜索对化合物结构进行优化,同时满足“逆转疾病转录组”“高选择性”“合适的成药性”多个目标,直接得到可进入验证的先导化合物。
  • 支持单细胞转录组导向的药物筛选:能够整合单细胞测序得到的不同细胞类型的疾病特征,筛选可以同时逆转多个疾病相关细胞类型异常表达的化合物,更适合复杂疾病的药物开发。

📊 实验结果

Figure 1 结果

 本部分首先验证GPS模型对化合物诱导转录组变化的预测性能。研究团队首先指出,公共数据库LINCS中的转录组扰动数据存在明显的噪声:重复样本之间的平均相关性仅为0.5,I期和II期数据之间的中位数重复性评分不足0.6,直接用这些数据训练模型会严重影响性能。为了解决这个问题,GPS将药物-基因互作分为下调、上调、无影响三类减少数值噪声,随后通过随机森林筛选得到了307个可预测的特征基因,最终采用鲁棒协作学习框架训练模型,保留大部分低质量数据同时通过权重调整降低噪声影响。

实验结果显示,在内部随机拆分验证和外部新化合物验证中,GPS的预测性能都显著优于所有基线模型,包括单基因随机森林模型、普通多任务学习模型、仅用高质量数据训练的随机森林模型等。比如在外部验证中,GPS的预测AUC达到0.78,比次优的基线模型高出超过5%,证实了算法设计的有效性。同时,GPS在不同细胞系间的泛化性能也优于对比方法,说明模型学习到了化学结构与基因表达之间的通用关联规律。

Figure 1:GPS模型设计和预测性能验证,显示GPS相比基线模型显著提升了化合物诱导转录组变化的预测准确率

Figure 2 结果

 本部分验证GPS的虚拟筛选性能,以及结构-基因-活性关系(SGAR)分析的有效性。研究团队将GPS应用到ZINC和Enamine两个大规模化合物库,总共预测了超过1100万个化合物的转录组扰动特征,随后针对HCC疾病特征完成初步筛选。结果显示,GPS预测的化合物扰动特征和实际实验得到的转录组变化一致性很高,对已知活性化合物的富集度达到了随机筛选的3.2倍,说明GPS的虚拟筛选可以有效富集活性苗头化合物。

SGAR分析结果显示,GPS能够准确学习到不同化学结构基团对基因表达的影响:特定的结构修饰会带来可预测的基因表达改变,对应的改变方向和幅度和实验验证结果一致,说明SGAR可以用来解释化合物结构和活性之间的关系,指导后续的结构优化。这部分结果证实,GPS不仅可以完成虚拟筛选,还能为后续的先导优化提供可靠的方向。

Figure 2:GPS大规模虚拟筛选性能和SGAR分析验证,显示GPS可以有效富集活性化合物,SGAR能准确反映结构修饰对基因表达的影响

Figure 3 结果

 本部分展示GPS针对HCC的苗头化合物筛选和初步验证结果。研究团队基于TCGA的HCC肿瘤和癌旁正常组织数据,得到了HCC的差异表达特征,随后用GPS对Enamine化合物库的180万个化合物进行打分筛选,选择能够逆转HCC差异表达的候选化合物,最终得到了18个候选化合物购买并完成体外验证。

体外细胞实验结果显示,18个化合物中有7个对HepG2细胞的抑制活性达到微摩尔级别,其中化合物GPS-001GPS-034两个分子对HCC细胞的选择性显著优于对正常肝细胞的毒性,被选作核心苗头化合物进一步优化。进一步的机制验证显示,GPS预测这两个化合物对HCC差异基因的调控方向和实际实验测得的表达变化一致性很高,相关性分别达到0.62和0.58,再次证实了GPS预测的准确性。

Figure 3:GPS针对肝细胞癌的苗头化合物筛选和体外验证,得到了两个对HCC细胞有选择性抑制活性的苗头化合物

Figure 4 结果

 本部分展示基于GPS的HCC先导化合物优化过程和结果。研究团队基于SGAR分析对GPS-001的结构进行改造,通过树搜索算法生成了一系列衍生物,从中筛选得到了优化后的先导化合物GPS-001-oa。实验验证显示,GPS-001-oa对HCC细胞的半抑制浓度(IC50)达到0.75μM,相比原型化合物GPS-001活性提升了超过6倍,同时对正常肝细胞的毒性仍然保持在较低水平。

进一步的机制分析显示,GPS-001-oa可以显著抑制HCC细胞的周期进展和上皮间质转化(EMT)过程,这和GPS预测的转录组调控特征完全一致:GPS预测该化合物会下调细胞周期和EMT相关的上调疾病基因,实验结果也证实了这一调控效应。这部分结果证实,基于GPS的SGAR指导的结构优化确实可以有效提升化合物活性,实现从苗头到先导的推进。

Figure 4:基于GPS的肝细胞癌先导化合物优化,优化后的先导化合物活性相比原型提升6倍,且保持良好选择性

Figure 5 结果

 本部分验证优化后HCC先导化合物的体内抗肿瘤活性。研究团队构建了HCC细胞的裸鼠移植瘤模型,给GPS-001-oa处理后,肿瘤体积和重量都出现了显著下降,在10mg/kg剂量下肿瘤生长抑制率(TGI)达到68%,而小鼠的体重没有明显变化,说明化合物没有明显的系统性毒性。

免疫组化结果显示,处理组肿瘤的增殖标志物Ki67阳性率显著下降,凋亡标志物cleaved caspase-3阳性率显著上升,和体外实验的结论一致,证实化合物通过抑制肿瘤增殖、促进凋亡发挥抑癌作用。这是首次通过转录组导向的AI从头筛选得到的具有体内活性的抗肿瘤化合物,证实了GPS平台的实际应用价值。

Figure 5:优化后的肝细胞癌先导化合物体内抑癌活性验证,显示化合物显著抑制移植瘤生长且无明显毒性

💡 应用前景和未来展望

 这项研究的核心应用价值在于,为无靶点依赖的转录组导向药物发现提供了可落地的完整方案,打破了传统方法只能做药物重定位的限制,适合对缺乏明确驱动靶点的复杂疾病进行全新药物开发。对于生信研究者来说,开源的GPS平台可以直接用来完成虚拟筛选,不需要自己做大规模转录组测序就能得到候选化合物,降低了从组学数据到候选分子的门槛。

未来该框架可以进一步和大语言模型结合,提升对复杂化学结构的特征提取能力,也可以拓展到更多组学维度,比如结合蛋白质组、代谢组特征进行多组学导向的药物筛选,进一步提升筛选的准确性。随着单细胞测序数据的积累,该框架还可以用于针对肿瘤微环境中特定细胞亚群的药物筛选,开发更精准的疾病治疗药物。

🔍 生信视角解读

 从生信研究的角度来看,这项研究有很多值得我们学习的地方。首先,它解决了领域里一个长期存在的痛点:我们有大量的疾病转录组数据,也有很多化合物结构数据,但之前一直没有办法高效地把两者结合起来做从头药物筛选,很多生信研究做到筛选出差异基因就结束了,很难推进到功能验证和化合物开发,而GPS直接打通了从组学到候选化合物的最后一公里,给我们提供了一个清晰的范例——生信研究不只是做数据挖掘,还可以直接支撑药物发现这种核心应用。

其次,这项研究的方法设计非常务实,针对实际数据存在的噪声问题,没有简单地丢弃低质量数据,而是用鲁棒协作学习的思路充分利用已有数据,这一点非常值得我们借鉴。我们在做生信分析的时候,经常会遇到数据质量参差不齐的情况,很多人会直接扔掉低质量数据,导致样本量大幅减少,而这项研究告诉我们,通过合理的算法设计,可以在保留大部分数据的同时控制噪声,得到更好的模型效果。

当然,这个方法也存在一定的局限性:目前GPS只能预测978个 landmark 基因中的307个,大部分基因还无法实现稳定预测,这会影响对一些特定疾病相关通路的预测准确性;另外,目前模型是基于LINCS数据在四种细胞系中训练的,对于原代细胞或者组织特异性的转录组反应预测,准确性可能会下降。不过这些局限性也给后续的研究留下了空间:我们可以用更多细胞类型、更多样本的转录组扰动数据重新训练模型,进一步提升预测的覆盖度和准确性。

对于普通生信研究者来说,这个平台的开放使用也给我们提供了很多机会:如果你有感兴趣疾病的转录组差异特征,不需要自己搭模型、不需要湿实验,就可以直接用GPS完成虚拟筛选,得到候选化合物,直接推进后续验证,大大缩短了从课题设计到出结果的时间,对于赶毕业的同学来说非常友好,这也是为什么说这项研究值得我们收藏备用。

你做过转录组导向的药物筛选研究吗?你会用这个平台来分析自己的数据吗?欢迎在评论区留下你的看法~


         👇 关注「公众号」,每日获取前沿生信研究解读     

📚 文献引用:Deep-learning-based de novo discovery and design of therapeutics that reverse disease-associated transcriptional phenotypes. Cell, 2026.

本站文章均为手工撰写未经允许谢绝转载:夜雨聆风 » Cell最新药物AI筛选工具 | 药物扰动后的转录组直接有了,不用湿实验也能筛先导化合物

猜你喜欢

  • 暂无文章