乐于分享
好东西不私藏

AI肽段语言模型HELM-BERT:小语料如何打败大规模SMILES模型

AI肽段语言模型HELM-BERT:小语料如何打败大规模SMILES模型

治疗性多肽已经成为现代药物发现中的关键分子模态,占据着一个化学和拓扑意义上都十分丰富的空间,但既有的分子语言大模型所依赖的表示方式,无法充分捕捉这种复杂性——原子级别的SMILES记法会产生冗长的词元序列并掩盖环状拓扑结构,氨基酸级别的表示则无法编码现代多肽设计中普遍存在的多样化化学修饰。京都大学医学研究科的Seungeon Lee、Yasushi Okuno等人提出HELM-BERT,首个基于HELM(大分子层级化编辑语言)记法训练的编码器型多肽语言模型。在包含39079个化学多样性多肽的精选语料上预训练后,HELM-BERT在环肽膜通透性预测任务上,全量微调设置下取得R²=0.7172,大幅超越MoLFormer-XL的0.5776和PeptideCLM的0.5360,且这一优势是在预训练语料规模远小于SMILES基础模型的情况下取得的。

SMILES和氨基酸表示,为什么都配不上现代多肽的复杂性?

多肽治疗药物是一类日益重要的药物模态,目前已有超过80个多肽药物获批,超过200个正处于临床开发阶段。治疗性多肽横跨约500到5000道尔顿这一广阔的分子量范围,通过其多样化的化学空间和庞大的相互作用表面,弥合了小分子和生物制剂之间的鸿沟。开发多肽治疗药物需要满足一个多参数目标画像:除了对靶点的高亲和力之外,候选分子还必须展现出良好的理化性质,比如代谢稳定性和膜通透性,才能确保体内疗效。为实现这些性质,化学家们通常采用N-甲基化、酰胺到酯的替换、大环化策略,以及引入非经典残基这类复杂策略,来刚化骨架并屏蔽极性基团。然而,随着结构复杂度的提升,对最优候选分子的经验性搜索成为一大瓶颈,这类复杂化合物库的合成和实验表征成本高昂、耗时耗力。SMILES记法被设计用来提供原子级别的分子描述,但对于环肽这类拓扑结构复杂的多肽而言,SMILES会产生冗长的词元序列,并且难以显式表达环状连接方式;而残基级别的表示方法(如ESM-2)虽然擅长处理天然氨基酸序列,却无法编码现代多肽设计中越来越普遍的非天然化学修饰。

▲ 图1:Overview of HELM-BERT architecture. Input peptides are converted to HELM notatio

HELM记法这一"折中方案",是怎么被改造成语言模型的?

为弥合这一表示层面的鸿沟,大分子层级化编辑语言(HELM)提供了一个统一框架,能够精确描述单体组成和连接方式,这使其成为多肽语言建模颇具前景的基础。团队提出HELM-BERT,首个基于HELM记法训练的编码器型多肽语言模型。基于DeBERTa架构,HELM-BERT专门设计用来捕捉HELM序列内部的层级化依赖关系。这一设计选择的合理性在于,HELM记法本身就具备天然的层级结构——先描述单体组成,再描述单体之间的连接方式,这与DeBERTa这类擅长建模相对位置和层级依赖关系的架构天然契合。模型在一个涵盖线性和环状结构、包含39079个化学多样性多肽的精选语料上做预训练。这种"选用一种专为大分子设计、天然携带层级和拓扑信息的记法,再匹配一个擅长捕捉层级依赖的Transformer架构"的组合思路,正是HELM-BERT能够在远小于SMILES基础模型的预训练语料规模下,依然取得显著性能优势的核心原因——记法本身携带的结构先验信息,大幅降低了模型仅从海量数据中隐式学习这些结构规律的负担。

环肽膜通透性预测,HELM-BERT赢了SMILES模型多少?

下表汇总了HELM-BERT与代表性SMILES基础语言模型,在CycPeptMPDB环肽膜通透性数据集上、全量微调设置下的性能对比。

模型
R²(决定系数)
皮尔逊相关系数r
PeptideCLM
0.5360 ± 0.0245
0.7413 ± 0.0127
MoLFormer-XL
0.5776 ± 0.0434
0.7673 ± 0.0247
HELM-BERT(本方法)
0.7172 ± 0.0345
0.8493 ± 0.0207

这张表最重要的信息,是HELM-BERT相较MoLFormer-XL这一SMILES基础模型中的最优基线,把R²从0.5776大幅提升到0.7172,提升幅度接近0.14,且统计检验显示这一差距具备极强的统计显著性(p<0.001,效应量d=3.40,属于极大效应)。团队还特别强调,即便在线性探测这一最直接衡量表示质量本身(消除下游任务头架构差异这一混杂因素)的设置下,HELM-BERT相较两个SMILES基线依然保持ΔR²超过0.08的显著优势,这说明HELM记法本身编码通透性相关结构特征的效率,确实比原子级别的SMILES表示更高,而非仅仅是下游任务头设计上的差异所致。更值得注意的是,这些改进是在HELM-BERT预训练语料规模远小于SMILES基础模型的情况下取得的,这一"以小博大"的结果有力地证明了,针对多肽这一特定分子模态选择恰当的表示方式(而非直接照搬小分子领域行之有效的SMILES范式),能够带来远超单纯扩大数据规模所能实现的性能收益。

▲ 图2:

从"膜通透性"到"蛋白质相互作用",这一优势具备普遍性吗?

团队没有止步于膜通透性这一单一任务,还在多肽-蛋白质相互作用预测这一同样至关重要的下游任务上验证了HELM-BERT,结果同样显示HELM-BERT显著超越了当前最先进的SMILES基础语言模型。这种跨任务的一致性优势,进一步巩固了团队"HELM记法本身编码了更丰富、更贴合多肽特性的结构信息"这一核心论点——如果HELM-BERT的优势仅仅局限于膜通透性这一单一任务,那么这种优势就有可能只是某种任务特定的巧合;但当同样的优势模式,在膜通透性预测和蛋白质相互作用预测这两类性质迥异的下游任务上都得到复现时,这就为HELM记法作为多肽建模基础表示的普遍价值,提供了更具说服力的证据支撑。

这一发现,会如何弥合小分子与蛋白质语言模型之间的鸿沟?

这项工作最重要的价值,在于它证明了HELM这一此前主要用于化学信息学领域大分子精确描述的记法体系,同样能够被成功改造为一套具备强大语言建模能力的分子表示基础,为治疗性多肽这一长期缺乏专属高质量语言模型的分子模态,提供了一套数据高效的建模方案。团队指出,这些结果表明HELM显式的单体和拓扑感知表示,为建模治疗性多肽提供了实质性的数据效率优势,弥合了小分子语言模型与蛋白质语言模型之间长期存在的鸿沟——多肽这一分子模态,长期以来处在小分子(SMILES为主流表示)和蛋白质(残基序列为主流表示)这两大成熟建模范式的夹缝之中,既无法完全套用为小分子优化的表示方式(因为多肽的化学修饰和环状拓扑过于复杂),也无法直接套用蛋白质残基级表示(因为无法编码非天然修饰),而HELM-BERT展示的这套"选择恰当中间层级表示、匹配层级感知架构"的方法论,为解决这一长期悬而未决的表示难题,提供了一条具备实证支撑的可行路径。

arXiv 链接:https://arxiv.org/abs/2512.23175论文标题:HELM-BERT: A Transformer for Medium-Sized Peptide Property Prediction作者:Seungeon Lee, Takuto Koyama, Shigeyuki Matsumoto, Itsuki Maeda, Yasushi Okuno机构:京都大学医学研究科