准确的保留时间(RT)预测可以大大提高液相色谱(LC)方法开发的效率 1, 2。它已被学术界和工业界用于固定相和流动相优化 3, 4、未知结构鉴定 5, 6, 7 以及LC条件协调 8, 9, 10, 11。当LC固定相和流动相组分已确定且化学标准品可用时,可以借助线性溶剂强度理论等复杂的色谱理论准确预测不同pH、温度、梯度及其他相关因素下的保留时间,并通过实验验证。基于这些原理的商业软件工具(如Molnar Institute的DryLab、ACD/Labs的LC Simulator、S-Matrix Fusion QbD)已得到广泛认可。然而,当需要高通量预测具有多种可能结构的分析物的保留时间,而参考标准品耗时获取或无法获取,或者分子层面的LC分离机理研究是关注重点时(这在快节奏的药物或生物标志物发现中经常出现),基于定量结构保留关系(QSRR)的预测是更可行的策略。这是因为QSRR基于这样的原理:色谱保留是分析物理化性质及其与固定相和流动相相互作用的功能函数。
构建QSRR模型涉及几个关键步骤,通常包括描述符计算、特征选择、机器学习(ML)模型开发和验证。模型精度取决于以下因素:(1) 色谱数据的大小、质量和划分;(2) 分子描述符的相关性、计算精度和选择;以及 (3) 建模框架的预测适用性。根据预期适用范围,模型设计可以是广泛范围的或局部的。广泛范围模型旨在预测多种化学结构和/或色谱方法的保留时间。它通常在包含数百至数万条不同LC条件下的保留时间测量值的大型数据集上进行训练 12。人工神经网络(ANNs)等机器学习方法特别适合大型和多样化数据集,并且一些研究表明,它们在训练数据所覆盖的化学空间内具有良好的泛化能力 13。然而,整理这样的大型数据集需要专门资源,在重视快速决策的工业环境中往往不可行。更重要的是,这些在化学多样性化合物上使用不同LC方法训练得到的广泛范围模型,在应用于具体分析问题时常产生有限精度。
相比之下,局部模型旨在预测使用同一LC方法分析的化学结构相似化合物的保留时间。它通常在一个小的、经过整理的、由单一LC方法分析的化学相似化合物集合上训练。这种聚焦设计可以部分绕过在不同LC条件下预测复杂相互作用机制的挑战,因此在特定分析背景下能够实现更准确的预测。
已发表的局部模型方法通常使用各种过滤器从更大的数据集中选择具有相似化学或色谱性质的化合物子集。对于化学相似性,常用的过滤器包括基于分子指纹的Tanimoto相似系数(Tc)以捕捉结构差异,以及分布系数(logD)或分配系数(logP)以反映极性差异。对于色谱相似性,常用保留因子和疏水性减法模型(HSM)相互作用项。在过滤数据上训练的局部模型,尤其是使用双重过滤器选择的模型,可以显著优于广泛范围模型 14, 15, 16, 17, 18, 19。
对于广泛范围或局部模型而言,恰当的描述符选择和稳健的建模框架对准确预测保留时间至关重要 20。合适的描述符应捕捉与分析物色谱分离相关的关物理化性质 21, 22, 23。它们通常根据所需结构信息的维度分类为零维至四维描述符。零维至2D描述符可由Dragon等化学信息学软件包快速计算 24。3D描述符源自分子结构的三维表示,通常通过几何优化获得,即确定使构象能最小化的3D分子几何构型。近似3D构象空间可以通过相对便宜的方法(如分子力学或半经验方法)定义。基于量子力学方法(如密度泛函理论DFT)的更高级几何计算能带来更高的精度,但计算成本大幅增加 25, 26, 27, 28, 29。4D描述符进一步考虑多个构象体的集合平均,也可考虑分子与其环境的相互作用。例如,可使用DFT方法结合适当的溶剂化模型计算溶剂化自由能,它与LC保留高度相关 30, 31。此外,4D描述符也可能包括所谓分子相互作用场描述符,这些描述符表征分子与代表固定相或流动相的近端化学探针的相互作用方式。信息更丰富的3D和4D描述符是否能证明其额外计算成本是合理的,仍是一个活跃的研究领域。尽管其单独收益尚未得到一致证明,但已显示结合多维度描述符可以提高预测性能 16, 20, 35。
虽然结合不同类型和维度的描述符可以提高预测精度,但使用大型描述符集也会增加过拟合风险,尤其是在小型数据集上训练的局部模型中。因此,仔细选择ML算法和适当的特征预处理至关重要。虽然基于ANN的模型近年来流行起来,但它们通常涉及大量参数,因此需要大量训练数据才能实现稳健性能。结果是,基于ANN的方法应用于小型数据集时容易发生对训练数据的过拟合。在这种情况下,支持向量回归(SVR)、高斯过程回归(GPR)、随机森林(RF)和岭回归(RR)等传统ML模型往往更合适,因为它们较低的模型复杂度使它们在有限数据下表现更可靠。模型泛化以及过拟合与欠拟合之间的平衡通常使用交叉验证(CV)策略评估 36, 37。除了模型性能外,计算成本和周转时间是描述符计算和ML建模的另一个重要考量因素。
在本工作中,我们开发了一个实用的QSRR框架,结合描述符融合和稳健的ML框架,以解决使用未经过滤的、代表药物原药(DS)和药物制剂(DP)杂质谱的微型RPLC数据集进行保留时间预测的挑战。与先前已发表的局部模型不同,项目特定的QSRR模型直接由完整的DS或DP相关杂质集开发,无需基于结构相似性的预选。为展示该框架可覆盖的广泛化学空间,我们选择了三个辉瑞晚期小分子项目作为建模对象。据我们最佳了解,本工作是首个准确应用于多个活性药物项目并显示一致验证性能的项目特定QSRR模型的演示之一。