《Nature Methods》:Times are changing but order matters: transferable prediction of small-molecule liquid chromatography retention times
编辑推荐:
液相色谱(LC)是分离小分子的主导技术。过去数十年已发表数百个保留时间预测模型,但真正可迁移的预测(无需目标色谱系统训练数据)仍是开放难题。即便名义相同的色谱条件,保留时间也可能发生巨大变化;保留顺序保守性更强,但在色谱条件变化时也可能改变。研究人员提出2-s
液相色谱(LC)是分离小分子的主导技术。过去数十年已发表数百个保留时间预测模型,但真正可迁移的预测(无需目标色谱系统训练数据)仍是开放难题。即便名义相同的色谱条件,保留时间也可能发生巨大变化;保留顺序保守性更强,但在色谱条件变化时也可能改变。研究人员提出2-step方法:第一步用机器学习模型预测保留顺序指数(ROI),并纳入色谱条件;第二步将预测指数映射到绝对保留时间。将两项任务解耦,最终实现跨色谱条件与化合物类的可迁移保留时间预测,且不需要目标系统训练数据。该方法优于在目标数据集上训练的现状方法。研究人员还系统研究了哪些色谱条件会导致保留顺序明显改变。
论文《Times are changing but order matters: transferable prediction of small-molecule liquid chromatography retention times》发表于《Nature Methods》。研究背景方面,液相色谱(LC)结合质谱(MS/MS)广泛用于代谢组学、天然产物和环境分析中的小分子注释。保留时间(RT)携带分子极性等身份信息,但小分子(<1500 Da)保留时间预测长期困难:保留时间不是化合物单独属性,而是色谱柱、流动相、梯度、温度、流速和仪器等共同决定。现有方法多在单一固定平台采集数百个标准品后训练,无法迁移到新色谱条件或结构差异大的分子;当前最佳方法采用预训练/微调(pretrain/fine-tune),仍须在目标系统测定数百个标准品后再微调,且微调后模型不能用于其他系统。保留指数可用标准品归一化条件差异,但不同条件下洗脱顺序可能改变,使通用标准归一化失效。保留顺序比保留时间更保守,但现有保留顺序方法隐式假设跨数据集顺序不变。
研究人员开展的研究是:在反相色谱(reversed-phase chromatography)场景下,提出2-step方法实现可迁移保留时间预测。结论为:先由色谱条件感知模型预测保留顺序指数(ROI),再用少量高置信注释化合物作为锚点(anchors),以低阶多项式将ROI映射到绝对保留时间;该方法在条件离散、甚至柱离散评估中优于需目标数据微调的图卷积或Transformer模型,且随训练数据增加性能提升。意义在于使公开谱库检索达到“近似level 1”注释,摆脱目标系统标准品训练依赖。
主要关键技术方法:研究人员使用RepoRT仓储中171个经整理的反相数据集,采用条件离散五折交叉验证;分子以分子图表示,用有向消息传递神经网络(D-MPNN)编码原子与键特征,色谱柱以疏水减除模型(HSM)与Tanaka参数共12维向量表示,流动相pH等为条件向量;训练期采用连体(Siamese)架构与排序边缘损失学习ROI;目标系统仅需约30个高置信注释锚点,以中位数回归加普通最小二乘建立二阶多项式映射ROI至RT;对比模型包括RankSVM、RankNet、无色谱条件图模型、one-hot柱编码,以及预训练/微调的DeepGCN-RT和RT-Transformer;评估还引入基于最大公共边子图的现实分子分裂(realistic split)。
研究结果如下。
预测保留顺序指数(ROI):研究人员训练色谱条件感知图神经网络,在常规条件离散分裂中错误率4.89%,优于忽略条件的图模型(5.61%)、RankNet(5.80%)和RankSVM(7.99%);one-hot柱编码为5.01%,说明HSM/Tanaka参数可跨柱泛化。将化合物对分为单调(monotonous)与信息性(informatory):平均93.8%为单调对,6.16%为信息性对;其中0.70%在相同HSM/Tanaka与pH下仍变序。对设置特征性(setup-characteristic)化合物对,条件感知模型准确率由40.1%升至60.5%(常规分裂),由29.7%升至44.6%(挑战分裂)。剔除HSM或Tanaka单组不降效,但剔除柱描述或pH则明显下降;训练数据由20%增至全量,错误率从6.43%降至4.89%。
将保留顺序指数映射到保留时间:研究人员用二阶多项式结合最小绝对偏差(LAD)中位数回归与普通最小二乘(OLS)建立映射,比广义加性模型(GAM)、SCAM、COBS更稳健;即使排除高ROI的25%化合物再取15个锚点,映射仍可外推。少数锚点即可定标,使目标系统无须大量标准品。
与直接预测模型比较:在均匀分裂(uniform split)中,2-step与DeepGCN-RT、RT-Transformer相当;在现实分裂(realistic split)中,预训练/微调模型性能大幅下降,而2-step几乎不降,在六套数据中的五套更优。消融研究表明,即使移除相似色谱设置、移除目标化合物或最大挑战设置,2-step仍优于微调模型;15个锚点已足够。
色谱条件对保留顺序的影响:柱名不同、USP代码不同、HSM/Tanaka距离大,均使冲突对比例升高;同柱时pH差增大、溶剂组分(甲醇/乙腈)或添加剂不同会增加顺序冲突;温度仅在很低RT差阈值下引起少数翻转,流速变化对顺序影响有限。名义相同条件下冲突对平均4.6%,全库不同设置为22.7%。
讨论与结论翻译:保留顺序在名义相似条件下保存良好,而保留时间可能大幅变化,因此直接预测保留时间是某种程度上的病态问题。研究人员改为预测保留顺序指数,使机器学习模型免于学习保留时间域中非线性但相对“无趣”的扭曲。2-step结合ROI预测与保留时间映射,最终实现可迁移保留时间预测;映射可用低阶多项式和少量锚点完成,对训练数据未出现的新柱也可预测,精度优于需目标系统标准品的预训练/微调方法。社区应公开参考LC–MS数据集及色谱条件元数据;可迁移预测需要柱的HSM或Tanaka参数,研究人员呼吁柱供应商提供这些参数。HILIC机制更复杂且缺乏通用选择性参数,是可迁移保留时间预测的下一个大挑战。
结论部分翻译:保留顺序在名义相似条件下保存良好,而保留时间可能大幅变化。因此,直接预测保留时间的任务在某种程度上是不适定的。本文建议转而关注保留顺序指数的预测。这样做将机器学习模型从预测保留时间域中非线性但相对“无趣”的扭曲中“解放”出来。通过2-step方法将ROI预测与保留时间映射相结合,最终实现了可迁移的保留时间预测。该映射可通过低阶多项式和少量锚点实现,使方法具有高鲁棒性。特别是,即使对于训练数据中未出现的新型色谱柱,也可以进行ROI和保留时间预测。研究人员证明,纳入色谱参数显著提高了模型精度;其预测精度优于最先进的预训练/微调方法,且不需要在目标系统上测量参比物。将2-step与谱库检索、in silico方法和从头结构生成方法整合,是重要的未来工作。为实现社区利益,研究人员呼吁公开参考LC–MS数据集及上述色谱条件元数据。可迁移预测需要色谱柱的HSM或Tanaka参数;研究人员呼吁柱供应商提供这些参数。实验中,超越多项式的回归未能改善结果,但这显然取决于目标数据集。更好的ROI预测精度将使更复杂映射可用于特殊梯度下的保留时间预测。因此,研究人员推测,可迁移保留时间预测在不久的将来会有巨大改进。HILIC分离机制比反相更复杂,且缺乏描述柱选择性的通用参数,使HILIC可迁移保留时间预测成为下一个重大挑战。