ARTICLE · 1095086
8亿张AI预测MS2谱图,一个神经符号框架如何破解质谱结构解析
质谱能检测到生物样本中数百万种小分子,但其中超过80%的结构无法鉴定。参考谱库只覆盖了不到1%的已知化合物,而小分子的结构多样性远超DNA和蛋白质——同一个分子式可能对应数千种不同的结构。
有没有一种方法,不依赖实验谱库,就能预测任意化合物的质谱图,并像BLAST搜索基因序列一样,在广阔的化学空间中定位未知分子?
这篇发表在bioRxiv上的工作提出了AIMe(AI Molecule Explorer)——一个多智能体神经符号AI框架,将质谱解析从“谱库匹配”转变为“全化学空间探索”。它的核心是一个叫DeepMS² Reasoner的模型,能像化学家一样逐步推理碎裂路径,预测质谱图并给出可解释的碎裂机制。

01. 核心问题:质谱解析的“参考库困境”
高分辨串联质谱(MS²)已成为代谢组学的标准工具,但结构解析面临根本性瓶颈:
参考谱库覆盖严重不足。可用谱库仅包含不到1%已知化合物的谱图。对于任何复杂生物样本,超过80%的检测代谢物无法鉴定。
小分子结构多样性近乎无限。DNA和蛋白质由有限构建块约束,而小分子多样性仅受元素基本化学性质限制。一个分子式可能对应数千种不同结构。
因此,扩展实验谱库无法从根本上解决结构解析问题。
AIMe的替代方案是:大规模、高保真地预测任意化合物的MS²谱图,并将这些预测组织成一个可快速查询的谱图空间。
02. DeepMS² Reasoner:从结构到谱图的神经符号推理
AIMe的核心是一个神经符号AI模型,它把碎裂建模为一个动作序列——就像化学家在质谱仪中逐步断开化学键。
符号部分:定义三种碎裂算子
神经部分:ALEA(Action Likelihood Estimator Advisor) 是一个结构信息图Transformer,为每个候选碎裂动作分配概率,包括“停止碎裂”的概率。
关键设计:DeepMS² Reasoner不直接预测碎片强度。相反,碎片强度从转移概率和停止概率通过概率质量传播中涌现。模型学习的是碎裂过程,而不是在给定前体条件下回归峰强度。
与已有方法的区别:
不设固定最大碎裂深度
包含切除算子,可表示前体中不存在的产物离子键
氢转移作为演化碎裂状态的一部分,而非事后评分步骤
通过规范图哈希合并重复片段,在DAG大小的多项式时间内推理指数级碎裂路径

03. 预测精度:全面超越现有方法
在NIST 2020数据集上,DeepMS² Reasoner达到平均余弦相似度0.83,50%的预测谱图余弦相似度超过0.89。其他评估模型平均余弦相似度在0.61-0.75之间。
在结构检索任务中(从候选谱图中检索正确结构),DeepMS² Reasoner在所有基准数据集上超越所有其他工具。
特别值得注意:在CASMI数据集上,作者设计了更困难的诱饵集——包含每个目标化合物在PubChem中的所有异构体(近250万候选谱图)。DeepMS² Reasoner仍达到Top-1 35.6%、Top-10 64.4%、Top-50 79.8%的准确率。

04. MS²KOSMOS:一个可搜索的化学空间
AIMe的第二个核心贡献是构建了MS²KOSMOS——一个包含超过8亿预测谱图的资源,覆盖PubChem中超过1亿个小分子,涵盖正负电离模式、四种碰撞能量。
关键设计:每个谱图被编码在一个Formula Coordinate System中——一个由预测碎裂路径衍生的离散碎片分子式坐标系统,正离子模式约3000万维,负离子模式约2600万维。
为什么这很重要? 这个表示支持基于向量的相似性搜索,类似于BLAST搜索基因序列。共享碎片分子式的谱图在空间中彼此靠近,使得大规模相似性查询在计算上可行。
MS²KOSMOSMapper:粗到精的工作流
将实验谱图的每个峰分配分子式
在反向索引中检索共享碎片分子式的候选分子
用DeepMS² Reasoner在查询的精确实验条件下重新预测和排序
结果在几秒内返回,包括每个候选的完整碎裂DAG注释。

05. 应用案例:发现肠道微生物依赖的新多胺
作者将AIMe应用于小鼠肠道微生物依赖代谢物的研究。比较无菌小鼠和SPF小鼠粪便代谢组,发现数千个差异特征,其中大多数无法用现有标准品和参考谱库鉴定。
将111个最丰富的未鉴定微生物依赖特征的MS²谱图映射到MS²KOSMOS:
约三分之一与已知化合物或密切相关异构体有高度相似谱图
其余代表未描述代谢物
两个成功案例:
Query #1(m/z 385.2115):推断为腐胺衍生物。组合组装6个候选结构,预测MS²谱图排序,合成参考品验证——保留时间和MS²谱图与查询代谢物完全一致。
Query #2(m/z 541.3394):推断为精胺衍生物。初始18个线性候选均缺失关键碎片(m/z 100.0757和151.0754)。扩大搜索考虑环化变体后,发现一个大环精胺衍生物能预测产生这些关键碎片。合成验证确认了结构。
这个发现的意义:这些大环多胺衍生物在结构上不同于任何先前从小鼠或人类中鉴定的化合物,但存在于人类样本中。多胺正日益被认为是饮食、微生物群、上皮生物学和免疫信号的交汇点。

06. 仓库级注释:将GNPS注释率提升数倍
作者将AIMe应用于GNPS仓库的710万共识谱图(来自854万谱图簇)。
| 2,687,253 | ||
| 1,276,371 | ||
| 379,856 |
限制在20 ppm或0.01 Da前体质量窗口内,AIMe新增272,142个可能异构体注释。
这意味着:AIMe将GNPS中可注释的谱图数量提升了数倍,为大规模代谢组学数据的解释和情境化提供了可扩展路径。

07. 对科研人员的启示
✅ 启示一:神经符号结合是科学AI的有效范式
DeepMS² Reasoner将符号化学推理(碎裂算子、可行性约束)与神经学习(动作似然估计)耦合。如果你的领域有明确的规则系统,神经网络不需要从零学习一切——让符号系统处理结构,神经网络处理不确定性。
✅ 启示二:从“匹配已知”到“预测未知”
传统代谢组学依赖谱库匹配,覆盖不足1%。AIMe通过预测超过8亿谱图,将可搜索空间扩大约三个数量级。如果你在做代谢组学或质谱分析,考虑用预测谱图空间替代/补充谱库匹配。
✅ 启示三:可解释性来自机制建模
AIMe为每个预测谱图提供完整碎裂DAG,每个碎片都有分子式、结构和碎裂路径。这不仅仅是“黑箱评分”——它给出了候选结构的机制性理由。
✅ 启示四:大规模预计算+按需精排是实用架构
MS²KOSMOSGenerator一次性预计算所有PubChem化合物的谱图,MS²KOSMOSMapper在查询时快速检索+精排。这种分离设计使大规模查询在几秒内完成,而不是每次从头计算。
✅ 启示五:公式坐标系统实现高效相似性搜索
将谱图编码为碎片分子式向量,使得共享碎片的谱图在空间中邻近。如果你的数据有组合结构,考虑用离散符号表示替代连续数值,可能带来搜索效率的数量级提升。
✅ 启示六:组合假设生成+预测排序是发现新结构的实用路径
对于未知物,AIMe不是直接给出答案,而是:检索相似谱图→推断碎片结构→组合组装候选→预测谱图→排序→合成验证。这个迭代工作流可以迁移到其他结构解析问题。
08. 局限与未来
训练数据化学多样性和分子量覆盖不均,大分子性能下降
评估对谱图比较指标的选择敏感
当前输出对应MSI三级注释,需正交信息提升置信度
未来可整合色谱保留时间、NMR、生化知识库、科学文献
可作为MS³和MSⁿ实验的测试平台
09. 总结
AIMe的核心贡献是一个神经符号框架:用符号化学推理约束碎裂路径构建,用神经网络估计动作似然,联合预测谱图和可解释的碎裂机制。它构建了超过8亿预测谱图的MS²KOSMOS,将质谱解析从“谱库匹配”转变为“全化学空间探索”。
对于质谱和代谢组学研究者,这意味着:不再受限于参考谱库的覆盖,而是可以在整个已知小分子宇宙中搜索和定位未知物。
参考文献:Acikalin, U. U., Feng, D., Ferber, A. M., et al. "AIMe: A multi-agent neuro-symbolic AI framework for MS² prediction, interpretation, and annotation at omics scale." bioRxiv, 2026. DOI: 10.64898/2026.08.05.743095.