《Acta Pharmaceutica Sinica B》:Deep MDRB: An integrated platform enabling high-coverage in vivo metabolite annotation in natural medicines
编辑推荐:
研究人员开发了深度质量数据集相关性桥接(Deep MDRB),一种用于天然药物(NMs)体内代谢物鉴定和父-代谢物相关性分析的系统性平台。该平台具有以下特点:1)“知识-数据”双驱动鉴定范式,整合质谱(MS)数据库与生物合成和代谢反应规则,将代谢物注释从严格依
研究人员开发了深度质量数据集相关性桥接(Deep MDRB),一种用于天然药物(NMs)体内代谢物鉴定和父-代谢物相关性分析的系统性平台。该平台具有以下特点:1)“知识-数据”双驱动鉴定范式,整合质谱(MS)数据库与生物合成和代谢反应规则,将代谢物注释从严格依赖库的匹配转变为规则引导的推测性鉴定,从而扩展未知代谢物的覆盖范围;2)采用诊断加权余弦相似度(DWCS)算法,通过强调关键碎片离子增强对结构类似物的区分能力,实现更准确的共有亚结构化合物分类;3)完全自动化的工作流程,将色谱峰提取、动态背景校正、多模态数据对齐、多级谱数据库匹配和父-代谢物网络桥接整合到单一平台中,生成全景父-代谢物相关性网络,提高效率和可重复性。作为概念验证,研究人员使用维拉帕米和黄连素的体外肝微粒体模型,以及涉及混合参考标准品(MRS)和通心络(TXL)胶囊的大鼠体内代谢谱分析,验证了Deep MDRB的性能,证明了其在复杂天然药物代谢物分析中的广泛适用性。
**研究背景与意义**
天然药物(NMs)的药理活性在很大程度上依赖于原型成分经体内生物转化后生成的代谢物。全面识别这些代谢物并阐明其与原型成分的转化关系,对于理解NMs的整体作用机制至关重要。然而,NMs的极端化学复杂性,加上广泛的代谢多样性,使得可靠的代谢物注释面临持续挑战。现有策略,如全球天然产物社会分子网络(GNPS)、质谱树相似性过滤(MTSF)、药物代谢物寻找器(DMetFinder)和从头鉴定工具(SIRIUS)等,大多依赖直接的串联质谱(MS/MS)谱库匹配,受限于谱库覆盖范围不足、仪器间谱图差异以及碰撞能量变化,导致大量检测信号无法注释。此外,代谢网络的高度复杂性(涉及多相反应和“一对多”或“多对一”转化模式)使得现有方法难以建立可靠的父-代谢物关联。为解决这些问题,研究人员先前开发了质量数据集相关性桥接(MDRB)工具,将代谢物注释率从31%(手动)提升至65%,但MDRB仍依赖人工组分鉴定,且其父-代谢物关联算法基于单一特征离子,限制了其关联显著变化代谢物的能力。为此,本研究开发了Deep MDRB,一个系统性平台,旨在实现NMs体内代谢物的自动化鉴定与父-代谢物相关性分析。该平台融合了“知识-数据”双驱动范式、诊断加权余弦相似度(DWCS)算法以及全自动化工作流程,显著提升了未知代谢物的注释覆盖率和关联可靠性。作为概念验证,研究通过体外肝微粒体模型和体内大鼠模型(包括混合参考标准品(MRS)和通心络(TXL)胶囊)验证了其性能,证明了其在复杂NMs代谢物分析中的广泛适用性。论文发表在《Acta Pharmaceutica Sinica B》。
**主要关键技术方法**
Deep MDRB平台整合了五个核心模块:1)色谱峰提取(基于优化XCMS算法),实现从质谱(MS)数据集中自动提取化合物特征峰,并去除同位素、加合物和源内碎片冗余信号;2)动态背景校正(通过比较样品与空白对照的保留时间(t
R)和质荷比(m/z)容差),去除背景和基质信号;3)多模态数据对齐(以精确质量为锚点),实现不同样本(血浆、尿液、粪便)间特征峰的合并与校正;4)多级谱数据库匹配,采用DWCS算法进行相似度评分,并结合生物合成/代谢反应规则库(包含1710条生源反应和6785条体内代谢反应规则)进行“已知到未知”的推测性鉴定;5)父-代谢物网络桥接,基于代谢反应规则库自动关联代谢物与可能的父化合物,并生成可视化网络。样本来源包括:Sprague-Dawley(SD)大鼠肝微粒体(体外)和SD大鼠(体内,分为MRS组和TXL胶囊组)。
**研究结果**
**3.1 Deep MDRB框架概述**
Deep MDRB是一个自动化非靶向分析工作流的技术工具,整合5个模块,实现从原始数据(.mzML或.mzXML)到代谢网络可视化的全自动化流程。该平台仅基于MS信息自动关联代谢物与潜在父化合物,无需依赖数据库匹配。
**3.2 DWCS算法开发与阈值优化**
通过引入权重系数(k)为高丰度诊断离子赋予更高权重,开发了DWCS算法,相比传统余弦相似度(CS)和改进余弦相似度(MCS),能更好区分结构类似物。基于MassSpecGym子集优化参数:诊断离子范围限定为前3个碎片离子(覆盖度>90%),k设为2.0,默认相似度阈值设为0.6(平衡灵敏度和特异性),对不可预测代谢产物阈值提高至0.7以降低假阳性。
**3.3 基准数据集算法性能评估**
在MassSpecGym子集上,DWCS与CS、MCS在精确率、召回率、准确率和假发现率(FDR)上表现相当(召回率约44%),但DWCS在不增加FDR的情况下提升了鉴定能力,且与Spec2Vec和MS2DeepScore性能相当。在MRS体内代谢物数据集上,DWCS鉴定率比CS和MCS分别高约30.1%和16.9%;在TXL胶囊真实测试集上,对Level 1父化合物,DWCS鉴定率比CS和MCS高约10.5%和1.5%,对Level 2和Level 3代谢物,鉴定率高21.4%和3.4%。
**3.4 体外代谢物注释**
在维拉帕米-黄连素混合物的体外肝微粒体模型中,从275个初始峰中经背景校正保留31个有效特征,其中29个被鉴定为Phase I代谢物(14个与维拉帕米相关,15个与黄连素相关),构建了体外父-代谢物关联网络,验证了Deep MDRB在代谢物鉴定和父-代谢物关联方面的可靠性。
**3.5 使用MRS的体内代谢物注释**
将6种代表性化合物(红景天苷、绿原酸、断氧化马钱子苷、甘草素、大黄素、荷叶碱)混合后灌胃大鼠,从血浆、尿液、粪便中经多模态对齐和背景扣除后获得83个代谢物特征,其中77个(92.8%)被纳入关联网络(11个Level 1、42个Level 2、19个Level 3、5个Level 4),注释结果与已发表文献高度一致,并发现可能的新代谢物。
**3.6 使用TXL胶囊的体内原型成分及其代谢物注释**
对TXL胶囊原型成分,经峰提取和背景校正后获得1657个独特特征,多级谱数据库匹配鉴定出1565个父化合物(整体鉴定率94.4%),包括823个Level 1、547个Level 2、195个Level 3。对TXL胶囊给药后大鼠血浆、尿液、粪便的体内代谢物分析,经多模态对齐后获得2279个代谢物特征,其中2069个(90.7%)被成功关联到网络,包括183个Level 1、563个Level 2、576个Level 3、747个Level 4。示例中,父化合物H172(L-苯丙氨酸)通过父-代谢物网络桥接模块关联到9个代谢物。
**3.7 与其他代表性软件的对比分析**
- **峰提取对比**:Deep MDRB与MZmine 3和MS-DIAL 4相比,提取峰总数相当,但能显著减少假阳性(通过系统合并加合物和同位素峰)。
- **鉴定与关联对比**:与商业软件Compound Discoverer(CD)3.0和开源工具metDNA 3相比,Deep MDRB在TXL胶囊原型成分鉴定中鉴定出1565个化合物(CD 956个,metDNA 672个),且独特鉴定数最高(998个)。体内代谢物鉴定中,Deep MDRB的父-代谢物关联率达到90.7%,远高于CD的69.6%和metDNA的61.8%。与GNPS-FBMN相比,Deep MDRB在父-代谢物关联率上显著更优,并提供结构转化信息。
- **与深度学习方法的对比**:Deep MDRB通过显式反应规则确保可解释性,支持代谢通路分析,且可通过自定义添加/删除谱图和反应规则实现实时扩展,而深度学习方法的“黑箱”特性使代谢转化追踪复杂,且泛化需重新训练,成本高。
**总结讨论与结论**
研究结论部分原文翻译如下:本研究开发了Deep MDRB,一种针对复杂天然药物(NMs)系统的代谢物鉴定智能工具。将其应用于通心络(TXL)胶囊的体内分析,实现了包括父化合物库构建、代谢物鉴定和父-代谢物网络关联的全自动化工作流。方法学验证表明,核心诊断加权余弦相似度(DWCS)算法在结构类似物分类中优于传统谱图相似度方法,有效解决了药物代谢领域父-代谢物关联的挑战。此外,色谱峰提取模块在复杂生物基质中表现出增强的灵敏度和分辨率。与主流工具相比,Deep MDRB在精确代谢物追踪方面具有显著优势,同时满足复杂NMs系统的注释要求。总之,本研究建立了代谢物注释的知识-算法融合范式,为分析复杂系统中的“化学暗物质”提供了有力的技术支撑。尽管性能出色,Deep MDRB仍存在一定局限性:其鉴定结果很大程度上依赖于底层数据库和反应规则库的覆盖范围和质量,需要持续更新以适应NMs的化学多样性;此外,处理超大规模数据集时的计算效率有待进一步优化。未来工作将集中于开发并整合深度学习驱动的质谱(MS)预测模型,首先预测可能的结构骨架,然后利用规则库约束生物转化途径;同时整合多维数据(如保留指数和碰撞横截面积值),并优化算法架构和并行计算策略,以提升大规模数据处理效率。