面向可重复、脚本化非靶向LC-MS/MS代谢组学学习的开放教育资源:Metabonaut

《Metabolomics》:Metabonaut: an open educational resource for learning reproducible, script-based untargeted LC-MS/MS metabolomics

【字体: 大 中 小 】 时间:2026年10月05日 来源:Metabolomics 3.5

编辑推荐:

  摘要专业翻译 背景:在代谢组学标准倡议(Metabolomics Standards Initiative, MSI)提出二十年之后,将原始LC-MS/MS数据公开存入MetaboLights、Metabolomics Workbench、GNPS和MassB

摘要专业翻译 背景:在代谢组学标准倡议(Metabolomics Standards Initiative, MSI)提出二十年之后,将原始LC-MS/MS数据公开存入MetaboLights、Metabolomics Workbench、GNPS和MassBank等数据库的做法已日趋成熟,但将原始文件转化为所报告特征表的分析过程仍然难以共享、审计和重用。FAIR原则最初为数据而制定,随后扩展至科研软件和工作流程,有力地说明了这一差距的重要性;研究人员采纳这一观点,并探讨教育资源如何帮助研究者跨越这一鸿沟。 综述目的:这是一篇教育性综述,研究人员阐述了FAIR原则和可重复分析在非靶向LC-MS代谢组学中的应用,并展示了这些原则如何在Metabonaut中得到实现——这是一个基于R for Mass Spectrometry/Bioconductor生态系统构建的开放教育资源。Metabonaut提供从原始mzML文件到注释特征表的可执行示例工作流程,展示了跨编程语言的互操作性,并由社区共建、为社区服务。 综述的关键科学概念:在简要介绍底层软件生态系统和文学化编程(literate programming)之后,本综述围绕三个主题展开讨论,每个主题通过一个或多个Metabonaut vignette(示例文档)加以阐述:可视化检查与质量控制、大规模公共数据仓库重用,以及跨语言互操作性。三者共同传授如何将FAIR实践从数据延伸到分析:使分析本身——而不仅仅是其所消费的数据——变得可共享、可审计和可重用。Metabonaut的源代码及预渲染工作流文档的链接可在https://github.com/RforMassSpectrometry/Metabonaut获取。

论文主体内容总结

1 引言

1.1 非靶向代谢组学数据分析中的可重复性差距

在代谢组学标准倡议(Metabolomics Standards Initiative, MSI)发布最低报告建议二十年后,该领域的数据方面已趋于成熟。MetaboLights已收录3,080项研究,Metabolomics Workbench收录4,379项公开研究,GNPS/MassIVE涵盖19,734个质谱数据集(截至2026年7月6日)。然而,仅凭数量并不能说明可重用性。对四个代谢组学数据库中399项公开研究的评估发现,没有一项研究完全满足MSI的所有生物学背景报告标准,单项标准的符合率从0%到97%不等。元数据不佳的研究即使原始文件开放也难以重用。原始数据存储(开放数据)日益成为发表的条件,但数据分析方面(开放分析)并未跟上步伐。读者下载一组mzML文件后,很少能重新计算论文中报告的特征表:参数值仅部分记录,手动排除和过滤步骤最多以文字描述,重现下游统计分析所需的元数据往往缺失。不可重复数据分析的后果并非假设性的:在一个有据可查的案例中,电子表格中未记录的基因组预测因子错误直到法医式重新分析时才被发现,而此时有缺陷的模型已被用于临床试验中的患者分组。脚本化、透明的分析能使此类错误在传播之前就被发现和纠正。Stanstrup等人和Mendez等人也指出,开源软件的可用性本身并不能保证可重复分析,代码公开与分析可重新执行之间的差距很大。

1.2 FAIR分析,而不仅仅是FAIR数据

可查找、可访问、可互操作、可重用原则(FAIR)最初为数据制定,后扩展至科研软件并日益应用于工作流程。当数据分析的代码、计算环境、叙述性描述和中间输出本身可查找(以持久标识符存储)、可访问(在明确定义的条件下可检索)、可互操作(基于开放标准和共享表示,如mzML、mzTab-M和HDF5)且可重用(文档化、授权许可并充分描述以供他人改编)时,该分析即为FAIR。开放涉及资源能否自由访问和重用,而FAIR可访问性明确允许在资源需要时进行身份验证和授权,因此资源可以FAIR而不必匿名开放。可重复性涉及重建或重新执行分析并获得预期结果的能力。Metabonaut旨在同时实现三者,但它们可以独立满足。

1.3 培训差距

大多数进入代谢组学领域的分析化学家和生物学家首先通过厂商软件或图形界面工具学习数据分析。一些图形工具直接支持可重复性,如mzmine可导出记录并重放完整处理序列的批处理文件,MetaboAnalyst允许用户下载网页会话的R命令历史并通过其配套包在本地重新运行。但总体而言,图形会话留下的产物不如脚本那样便于逐行检查、版本控制和重用。对于没有计算背景的从业者,从图形工作流到完全脚本化的步骤仍然很大。现有教学资源往往以工具为中心或平台为中心,而非以工作流程为中心,很少有用一个真实数据集从原始文件到可解释结果走完全程的资源。Metabonaut正是为弥合这一差距而构建的社区资源。

1.4 工作数据集

本综述引用两个公开数据集:第一个是来自心血管疾病患者和健康对照血浆样本的小型LC-MS/MS数据集,存入MetaboLights编号MTBLS8735,称为Metabonaut血浆示例,其使用严格限于教学目的,子集较小且合并QC样本来自不同样本采集。第二个是MetaboLights研究MTBLS93(瑞典TwinGene病例队列的人群规模非靶向血清代谢组学数据集),称为大规模研究。工作流程从mzML文件开始,从厂商原始格式到该开放标准的转换假定已通过msconvert等开源工具完成。

2 Bioconductor与R for Mass Spectrometry生态系统作为基础

2.1 架构

Bioconductor项目为当前和新兴生物检测数据的严谨可重复分析提供免费开源软件。R for Mass Spectrometry倡议采用相同约定,即严格包审查、共享基类、定期发布周期,并将其应用于质谱数据分析。最底层,Spectra抽象了质谱数据的表示,无论数据存储于内存、磁盘文件、数据库还是公共仓库,都暴露相同的R接口。Chromatograms对色谱数据扮演类似角色。MsExperiment将谱图、色谱图和样本元数据整合到单一实验级容器中。在此基础上,xcms 4已重构到该基础设施上,其结果与生态系统其余部分原生集成。MetaboAnnotation和CompoundDb在内部和公共参考数据(如MassBank、HMDB或GNPS)之间暴露统一注释接口。MsStash系列包标准化质谱分析对象的导入导出,RmzTabM包提供mzTab-M的R对象导入导出。SpectriPy将Bioconductor Spectra桥接到Python的matchms和spectrum_utils,RuSirius将RforMassSpectrometry接口连接到SIRIUS,将分子式和结构注释带入同一R会话。

2.2 为何这在教学上很重要

Bioconductor对共享数据结构的承诺不仅是软件工程选择,更是使生态系统可教的保证。学习者掌握一个Spectra对象、一个MsExperiment对象和更广泛的Bioconductor数据模型后,可将这种掌握贯穿预处理、注释和统计。LC-MS数据不是二维的:强度同时跨保留时间和m/z记录,因此数据不适合平面表格。单个研究可包含数十万谱图和数十GB数据,超出会话内存容量。Spectra对象在该结构之上保持表格接口,同时将数据留在磁盘或档案中而非加载到内存,因此同一代码在三个文件或数千个文件上不变地运行。这种模块化也使连贯的教学资源成为可能:Metabonaut演示如何封装生态系统而非重新实现它,每个vignette可从上一个结束处继续。R for Mass Spectrometry项目是非靶向LC-MS代谢组学的几个开源选项之一,其他选项如MetaboAnalystR、notame、patRoon和Workflow4Metabolomics等各有侧重,这些是互补而非竞争的选择。

3 文学化编程作为统一媒介

分析的书写方式与所用软件同样重要。文学化分析(prose、代码和输出编织成单一可执行文档)是使代谢组学分析同时可查找、可重用和可教的媒介。Donald Knuth引入文学化编程作为优先级反转:源代码主要为人阅读而写,机器指令从连贯叙述中产生。科学计算后来通过Sweave、R Markdown和现在的Quarto改编了这一原则。在传统模式中,非靶向代谢组学研究通过不同产物报告:方法部分以散文描述分析,图表呈现输出,补充材料保存参数值和临时步骤,代码仓库保存脚本。这些可能彼此脱节。Quarto vignette将四者合并为一:因为文档会执行,分析的描述和分析本身是同一文件。以纯文本书写分析也使其适用于版本控制。Git可逐行跟踪Quarto文件,任何两个版本可直接比较。版本控制还将分析变成可引用对象:在Zenodo等档案中存储的标记版本获得DOI并可原样检索。然而,可查找性和版本控制不能保证持久性:vignette随R、Bioconductor和Python演化而退化。容器化弥合了这一差距:容器镜像是整个计算栈的自包含快照,在发布时冻结。文本分析对学习者还有实际优势:脚本是纯文本,大语言模型可读取、解释和提出修复建议,这进一步降低了入门门槛。

4 Metabonaut:设计与教学法

4.1 起源、动机与教学原则

Metabonaut的动机是现有培训材料的空白。单个包vignette记录单个工具,但很少有资源引导新手在真实数据集上使用单一连贯工具链完成从原始文件到注释和统计评估特征的完整非靶向LC-MS/MS分析。四项原则塑造该资源:第一,它是可执行的而非说明性的:vignette中每个代码块都可执行。第二,它是版本化且可引用的:每个版本在GitHub上标记并在Zenodo上以概念DOI归档。第三,它是容器化的:提供包含vignette所依赖完整软件栈的归档Docker镜像。第四,它是模块化的:自包含vignette共享序列化中间对象,学习者可在任何vignette进入而无需重跑之前的。运行vignette有三条途径:浏览器中作为Bioconductor Workshop Platform上的Curated Workshop,无需安装;本地从已发布容器镜像运行;或从本地R安装运行。

4.2 九个vignette

Metabonaut 1.6.2版本包含九个vignette。基石是(1)完整端到端LC-MS/MS代谢组学数据分析,将Metabonaut血浆示例(MTBLS8735)从预处理经统计分析到注释,使用xcms、MetaboAnnotation、SummarizedExperiment和limma等包。其他七个vignette扩展或提供该工作流步骤的替代方案。三个覆盖预处理:(2)数据集调查、(3)使用notame的质量控制与特征选择、(4)使用xcms的大规模处理(在标准硬件上处理4,063个样本)。三个覆盖注释:(5)使用和创建代谢组学数据注释资源、(6)使用R和Python的LC-MS/MS数据注释、(7)使用RuSirius的高级特征注释。最后,(8)无缝对齐将新数据与已处理参考数据集合并。第九个vignette mzTab-M文件格式:从SummarizedExperiment导入导出mzTab-M 2.1文件覆盖标准化报告格式。所有9个vignette的代码均可执行,其中2个包含预计算输出以允许通过GitHub actions自动渲染:vignette (4)需要从MetaboLights下载约600GB质谱数据文件且总执行时间超过17小时,vignette (7)需要注册的SIRIUS用户账户。所有其他vignette在10分钟内执行完毕并可交互式评估。

4.3 可用性、许可与贡献

Metabonaut源代码可在GitHub仓库获取,Docker镜像通过docker hub提供,版本在Zenodo上以概念DOI跟踪和归档。预渲染分析报告文档可在项目GitHub pages站点浏览。自2026年7月起,Metabonaut的交互式云实例作为Bioconductor Workshop Platform上的Curated Workshop提供。Metabonaut通过GitHub拉取请求开放开发,内容以CC BY-SA 4.0发布。多个vignette由非维护者撰写:notame vignette由核心团队外作者贡献,SpectriPy vignette由该包自身开发者撰写。贡献不仅限于编写vignette,还包括基础设施(如Galaxy部署)和针对湿实验背景研究者的工作流审查。这种开放模式本身就是教学法的一部分。

5 可视化检查与质量控制

对脚本分析的一个常见反对意见是它牺牲了图形工具提供的视觉直觉。事实恰恰相反:因为图由代码生成,它们可被重现、参数化并统一应用于整个数据集。数据集调查vignette引导学习者检查峰检测前应检查的内容:按样本组的基峰色谱图、按进样顺序的总离子色谱图、按研究组的背景信号和质量精度诊断。其框架刻意实用,鼓励分析者批判性思考数据并尽早标记或移除问题样本。质量控制与特征选择vignette演示使用notame进行质量控制驱动的归一化和特征选择,处理漂移校正、批次效应、基于QC的过滤和缺失值插补。notame在SummarizedExperiment数据模型上的Bioconductor重构使预处理直接流入质量控制、归一化和特征选择,无需步骤间数据交接。该vignette实施QC样本的社区既定标准并使用随机森林插补。脚本化绘图还以手动检查无法做到的方式扩展:同一绘图代码可应用于数据集中每个样本,单条命令即可跨数百个样本产生色谱图网格。

6 重用公共数据并扩展到大规模队列

公共数据可从图形工具和脚本下载重用。脚本化、程序化连接到档案所增加的是检索本身成为可重复分析的一部分:数据集在代码中由其登录号标识,每次运行以相同方式获取,无需手动下载或文件处理。注释资源vignette演示从GNPS和MassBank拉取公共谱图并将其打包为版本化的CompoundDb资源。所得库随分析一起发布,下游用户不仅重现特征表还重现其背后的鉴定。无缝对齐vignette在新队列与先前预处理的参考数据集之间在质荷比和保留时间空间中对齐特征。因为参考数据集可通过MsBackendMetaboLights直接加载的公共MetaboLights研究,公共数据成为比较对象而不仅是存储目标。大规模处理vignette在4,063个样本的MetaboLights研究上演示,使用磁盘上的Spectra后端使标准计算基础设施也能处理。对学习者而言决定性的一点是连续性:端到端vignette中用于十几个文件的xcms惯用法在数千个文件上完全相同;只有存储后端改变。在脚本世界中,扩展是配置变更而非工作流重写。

7 互操作性以扩展分析能力

没有单一语言或生态系统拥有非靶向代谢组学工作流每一步的最佳工具。SpectriPy包装Python的matchms,使R工作流可在同一Quarto文档中调用Python原生算法。R和Python注释vignette使用matchms中的ModifiedCosine算法过滤和评分MS2谱图,然后将结果带回R进行解释。RuSirius提供对SIRIUS的程序化访问,使同一文档可驱动SIRIUS分子式分配、CSI:FingerID和COSMIC结构排序以及MSNovelist从头结构生成。高级特征注释vignette教授清晰的注释逻辑:先库搜索,COSMIC用于正交确认或库中无匹配的特征,MSNovelist用于真正新颖的结构。

7.1 标准化输出:使结果FAIR

互操作性也涉及工作流产生的结果。mzTab-M是HUPO-PSI代谢组学标准报告格式,设计使定量结果及其证据一起传播。专门vignette演示使用RmzTabM包将完成的分析导入导出为mzTab-M文件。以定义明确、工具无关的格式书写结果具有实用价值:特征表、其鉴定及其支持证据可被其他软件读取而无需专门解析,可与原始数据一起存储,并独立于产生它们的R会话保持可解释。该vignette逐步教授导出,逐节讲解结果文件,使导出被理解而非视为黑箱。

8 讨论与结论

Metabonaut是教学资源而非全面软件套件。两个边界随之而来:R是真正的学习投资;该资源仅覆盖LC-MS和LC-MS/MS,NMR和离子迁移质谱不在当前版本范围内。然而,该流程的底层逻辑可适用于其他质谱联用分离技术的数据。开发类似教育资源需要大量长期承诺和资金。非靶向代谢组学的瓶颈不再是工具可用性;开源软件现已覆盖从原始数据到注释的几乎每一步。瓶颈是培训。存储原始数据对可重复性必要但不充分:没有产生所报告特征表的分析,存储的数据集无法重新计算。脚本化、容器固定、文学化的工作流使数据分析以他人可检查和可重新执行的形式可用。

8.1 展望

社区策划、开放共享的CompoundDb参考库将增加注释资源vignette的价值。此重用基础设施与MetaboLights和Metabolomics Workbench存储标准之间更紧密的联系是自然的下一步。如果本综述鼓励其他生态系统中的类似资源,且审稿人将代谢组学论文的分析作为可引用、可重新执行的产物存储视为默认实践,则视为成功。数据方面的FAIR进展来自义务而非善意:期刊和资助者现在常规要求原始数据存储作为发表或资助报告的条件。预计分析方面将走相同路径,存储可重新执行的分析成为发表的期望而非个人勤勉行为。

订阅生物通快讯

订阅快讯:

最新文章

限时促销

会展信息

关注订阅号/掌握最新资讯

今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

版权所有 生物通

Copyright© eBiotrade.com, All Rights Reserved

联系信箱:

粤ICP备09063491号