AI 凭一张质谱图"写出"分子结构:MetGenX 让未知代谢物注释率冲到 89%
**核心结论**:中科院朱正江团队推出 **MetGenX**——一个"结构感知"的深度学习生成模型,能**直接从一张二级质谱(MS2)图生成代谢物的分子结构**。在真实生物样本上,它对已知化学空间内的代谢物做到了 **top-1 准确率 68.5%、top-3 高达 89.2%**,覆盖 97.7% 的谱图;更关键的是,它把"已知未知(库里没谱图)"和"未知未知(全新结构)"两类难题,第一次用同一套生成框架统一解决,还在小鼠肝脏里**实打实发现了 2 个主流数据库里都没有的新代谢物**。对做非靶向代谢组学的人来说,这可能是近几年最值得关注的注释工具。
一、为什么这件事难:代谢组学的"最后一公里"
做 LC–MS 非靶向代谢组学,大家最熟的流程是:定性定量 → 拿到一堆峰 → 比对标准谱库(NIST、MoNA、GNPS)做注释。但现实很骨感:
- 谱库只覆盖"已知代谢物"。海量峰里,能配上网标准谱的往往只有一小部分;剩下的大多是"已知未知"(结构在数据库里、但没参考谱)和"未知未知"(结构本身就没被表征过)。 - 传统 *in silico* 工具(CFM-ID、MS-FINDER、MetFrag 等)靠"碎裂规则"反推,遇到没见过的碎裂模式就歇菜;深度生成模型(如 MSNovelist)又往往"漫无目的"地生成,准确率上不去。
这篇文章的核心主张是:与其让模型从零猜结构,不如让它"看着相似的结构模板"来生成——这就是"结构感知(structure-informed)"的由来。
二、MetGenX 长什么样:四步走

▲ 图1 MetGenX 的整体框架。a 模板检索:用查询 MS2 谱做谱相似度搜索,从参考谱库里捞出结构相似的"模板";b 模板编码:每个模板被编码成一个 3898 维特征向量(3878 位结构指纹 + 10 位分子式 + 10 位分子式差值);c 结构生成:一个支持"库受限"和"库自由"两种模式的编码器–解码器网络,最后用一个机器学习模型对候选结构按"与模板的结构相似度"重排序。
整套流程可以拆成四步:
模板检索(Template search)
。给一张查询 MS2 谱,先在参考谱库里按谱相似度捞出一批结构相似的模板分子。平均每个谱能捞到至少一个高相关模板(平均最大相似度 0.65)。 模板编码(Template encoding)
。把模板编码成 3898 维向量——结构指纹管"长相",分子式管和查询谱的质量差(ΔFormula),相当于给模型一个"大致范围"。 结构生成(Structure generation)
。一个 Transformer 编码器–解码器,把"谱 + 模板"翻译成 SMILES 结构。它支持两种模式:
- 库受限(database-restricted):答案在已知化学空间里,适合绝大多数"已有数据库收录"的代谢物; - 库自由(database-free):完全开脑洞生成,专门对付全新结构。
重排序(Re-ranking)
。用一个 LightGBM 模型,拿 12 个特征(谱相似度、结构相似度、分子复杂度、NP 分数、SMILES 长度等)给候选打分。这一步是提分关键:在 NIST 独立测试集上,重排把 top-1 从 48.9% 拉到 55.9%,top-3 从 71.8% 拉到 76.1%。
模型底子也不小:预训练用了 217 万个生物相关结构(52 万来自 COCONUT/HMDB/NIST20/GNPS,176 万来自 PubChem),再用 NIST 的 2.3 万张谱微调。
三、性能到底有多强:和五款主流工具正面对决

▲ 图2 在真实生物样本上的注释表现与跨工具基准对比(论文 Fig.4)。上排:跨 5 类样本(细胞、脑、肝、血浆、尿液)的注释流程与按样本类型、加合离子、化学亚类的准确率分层;下排 f/g:MetGenX 与 CFM-ID、MSNovelist、MetFrag、MS-FINDER、ICEBERG 在注释覆盖率(f)和 top-3 准确率(g)上的全面对比,MetGenX 双双领先。
作者拿了 5 类真实生物样本(细胞、脑、肝、血浆、尿液)的 LC–MS 数据,先用标准品库做 level-1 金标准验证,再用 MetGenX 注释:
- 共 1720 张谱,MetGenX 成功注释 1681 张(覆盖率 97.7%); - top-1 准确率 68.5%,top-3 准确率 89.2%,top-5 更是到 94.5%; - 按加合离子分:\[M+H\]⁺ 最准(90.5%),\[M−H₂O+H\]⁺ 76.8%,\[M+Na\]⁺ 60.0%; - 按化学亚类分:脂质类尤其好——结构规整、模板多,这正是代谢组学日常大头。
和五款主流工具同台比(同一背景库、同一批谱):MetGenX 的 top-3 准确率 89.2%,把 CFM-ID(81.0%)、ICEBERG(81.0%)、MSNovelist、MetFrag(57.4%)全压了下去;覆盖率 97.7%,和 ICEBERG(97.8%)基本打平,但显著高于其他工具。作者点出的关键在于:MetGenX 不像 CFM-ID 那类方法依赖"每个碎片都能解释",也不像纯生成模型那样大海捞针——模板把搜索空间收窄了,准和全才兼得。
四、最实用的亮点:正负离子模式"通吃",不用重训
负离子模式一直是非靶向代谢组学的软肋——参考谱少、训练数据不足,多数工具在负模式下准确率断崖式下跌。MetGenX 的"结构到结构"设计恰好绕开了这个坑:模型学的是"结构生成",离子模式只是输入谱不同,所以正模式训好的模型,负模式直接拿来用,无需重训。
实测:
- NIST 负模式独立集(n=653):库受限 top-1 49.7%、top-3 75.4%,和正模式几乎一个水平; - 真实样本(2417 张谱):覆盖率 95.9%,top-1 60.7%、top-3 82.5%,同样显著优于 CFM-ID、MetFrag、MS-FINDER、ICEBERG。 - 还做了"加标回收"硬验证:往小鼠肝脏和 NIST 1950 血浆里掺 200 个标准品,MetGenX 在肝脏 top-3 达 92.1%、血浆 89.2%,和标准品内源结果高度吻合。
对一线实验员来说,这意味着一套流程、两种模式、不用为切换离子源重新建模——省下的时间和算力都是真金白银。
五、不只是注释,它真能"发现新东西"

▲ 图3 小鼠肝脏非靶向代谢组学中的新代谢物发现(论文 Fig.6)。a 多步注释工作流:6564 个带 MS2 的特征 → SIRIUS 定分子式(2979 个)→ 库匹配(516,level-1)→ 库受限生成(541 高质量候选)→ 库自由生成(426 高质量);b–d 展示全新代谢物 adenosyl-cysteine(HMDB/KEGG 均无,合成标准品验证,肾、肝富集最高);e–g 展示另一个全新二核苷多磷酸 Ap2I(PubChem 均无,合成标准品验证,脾、肝富集最高)。
这才是这篇文章最"性感"的部分。作者把 MetGenX 用到小鼠肝脏非靶向数据上,跑了一套多步流程:
- 6564 个带 MS2 的特征,2979 个用 SIRIUS 定了分子式; - 516 个走库匹配拿到 level-1;剩下用 MetGenX 的库受限 + 库自由两轮生成。
结果挖出 2 个主流数据库里根本不存在的代谢物,而且都用合成标准品验证了:
Adenosyl-cysteine(腺苷半胱氨酸,C₁₃H₁₈N₆O₅S)
——HMDB、KEGG 里都没有。MetGenX 在库受限模式下把它排到 top-1(候选分 2.0),作者手动解谱 + 合成标准品双重确认,在肾、肝中富集最高。 Ap2I(adenosine 5′-diphosphate 5′-inosine,C₂₀H₂₅N₉O₁₄P₂)
——连 PubChem 里都没有的二核苷多磷酸。库自由模式生成、候选分 2.6,同样合成标准品确认,在脾、肝中富集最高。
还顺手定量了浓度:腺苷半胱氨酸约 10.80 pmol/mg 组织,Ap2I 约 2.97 pmol/mg。从"算法生成"到"合成验证"再到"浓度定量",这条证据链对非靶向代谢组学做新化学实体发现是很有示范意义的。
六、给"做代谢组学"的几点实在启发(开泰视角)
作为天天跟 LC–MS 数据打交道的团队,我们读这篇有几点可以直接借鉴:
"模板"比"蛮力生成"靠谱
。MetGenX 的核心不是模型多花哨,而是"先用相似结构把搜索空间收窄"。这和我们给用户做注释时强调"结合本地标准库 + 已知代谢物库"的思路一致——先验知识用得好,注释才稳。 库受限 vs 库自由,要分场景用
。日常已知物种/组织的注释,库受限又快又准;真要找新结构、新标志物,才上库自由模式,并配合标准品验证——别指望一步到位。 正负模式都要覆盖
。很多项目只做正模式,漏掉一大批酸类、酚类代谢物。MetGenX 证明"一套模型通吃两种模式"可行,我们在建流程时也应把负模式当成标配。 新代谢物发现的闭环不能省
。算法给候选只是起点,像作者这样"手动解谱 + 合成标准品 + 多组织验证"才是把"预测"变成"发现"的关键。对外送检测服务来说,能帮客户挖到数据库外的新标志物,才是差异化的核心价值。
文献信息
- 标题:Structure-informed deep generation enables de novo metabolite annotation in untargeted metabolomics - 期刊:*Nature Communications* 2026, 17:5426 - DOI:10.1038/s41467-026-72149-6



English

