《Nature Computational Science》:Robust out-of-distribution prediction of Buchwald–Hartwig reactions
编辑推荐:
Buchwald–Hartwig交叉偶联反应是现代药物合成的基石,但其结果预测模型仍受限于数据质量和化学空间覆盖度。电子实验室笔记本包含异质性、有噪声的记录,而开源高通量实验(HTE)数据集碎片化且范围狭窄,导致模型在未见底物和条件下的性能较差。研究人员在此引
Buchwald–Hartwig交叉偶联反应是现代药物合成的基石,但其结果预测模型仍受限于数据质量和化学空间覆盖度。电子实验室笔记本包含异质性、有噪声的记录,而开源高通量实验(HTE)数据集碎片化且范围狭窄,导致模型在未见底物和条件下的性能较差。研究人员在此引入一个框架,该框架系统性地标准化并整合多个反应数据集,形成一个高质量、每个实体具有唯一结构的数据集,并结合主动学习以策略性扩展化学空间。通过将已发表的Buchwald–Hartwig HTE数据与新实验结果合并,研究人员获得了一个在新型底物和条件下具有预测能力的模型,相较于先前方法,其分布外预测性能得到提升。关键在于,模型引导的试剂推荐经实验验证,证实了该框架在发现未探索反应性方面的实用性。这项工作为合成化学中的鲁棒机器学习建立了蓝图,并实现了前瞻性的计算机试剂筛选,以加速药物发现。
**Buchwald–Hartwig反应的鲁棒分布外预测:数据多样性驱动的机器学习框架**
**研究背景与问题**
Buchwald–Hartwig(BH)交叉偶联反应是现代药物合成中不可或缺的工具,用于构建结构多样的(杂)芳基胺化合物。可靠预测BH反应结果对加速药物发现至关重要,机器学习(ML)方法为此提供了途径。然而,传统预测模型面临两大挑战:第一,电子实验室笔记本(ELN)和文献挖掘数据存在异质性、噪声和矛盾表征,且缺乏负例,导致模型性能受限;第二,开源高通量实验(HTE)数据集虽质量较高,但碎片化且范围狭窄,导致模型在未见底物和条件(分布外,OOD)下表现不佳。当前研究认为,解决这些复杂性不仅需要大量数据,还需要数据生成的一致性和精确性,而这因数据源异质性而难以实现。因此,本研究旨在开发一种具有广泛OOD预测能力的BH反应模型,通过整合新生成的HTE数据集与现有开源HTE数据,并采用主动学习策略,系统性地扩展化学空间。
**研究内容与结论**
研究人员开发了一个统一的、主动策展的ML框架,通过系统标准化异构数据集、策略性扩展反应空间并实验验证预测,证明数据多样性(而非数据集规模或模型复杂性)是泛化性能的关键驱动因素。该模型在BH反应中实现了>90%的受试者工作特征曲线下面积(ROC AUC)的高置信度OOD预测,并成功通过实验验证:一是对11个历史上失败底物对中的10个(91%)找到有效反应条件;二是在包含约2.46×10
11种可能反应的新化学空间中,高置信度预测(>0.85)的成功率(33%)较基线(19%)富集1.64倍。该工作发表于《Nature Computational Science》,为关键反应类型推进了预测化学,并建立了可推广至其他转化的原则。
**主要技术方法**
研究人员采用自动化工作流(96孔和384孔板)执行HTE设计,产物定量使用超高效液相色谱-质谱-电晕荷电检测器(UPLC-MS-CAD)。数据生成分两个阶段:第一阶段构建初始ML模型,第二阶段采用主动学习(Active Learning)迭代选择高不确定性反应以扩展化学空间。特征表示采用差分反应指纹(DRFP)和物理化学属性向量,以及基于SMILES的人工智能模型。模型训练涉及随机森林(RF)、直方图梯度提升(XGB)和多层感知机(MLP)。OOD测试集通过k-means聚类(k=12)构建,排除训练集底物。引入新指标化合物-反应多样性得分(CRDS)评估数据集OOD潜力。数据来源包括Johnson & Johnson(JnJ)内部生成数据集(11.3k反应)及所有公开BH HTE数据集(总计~27.5k反应)。
**研究结果**
- **数据整合与多样性**:JnJ25数据集在底物对和试剂组合多样性上超越先前研究,合并后数据集‘All w JnJ25’总量最大。
- **CRDS与OOD性能关联**:CRDS与OOD测试的ROC AUC呈0.79 Pearson相关,表明底物多样性数量是OOD性能的关键,而非数据集规模。
- **模型性能基准测试**:训练RF模型,在严格OOD测试(排除训练集底物和试剂)中,CRDS高的数据集(如JnJ25)表现优于规模更大的数据集;合并‘All w JnJ25’后性能进一步提升。
- **特征表示优于模型选择**:超参数优化显示,特征表示(全文DRFP vs. 分离底物-产物DRFP与试剂理化描述符)对OOD性能影响大于模型家族选择,RF因树状分裂和集成子采样而适合。
- **不确定性校准**:模型在OOD预测中置信度与性能高度相关,高置信度bin(>0.85)的ROC AUC>90%。
- **实验验证结果**:
- 历史上失败底物挽救:对11个失败底物对,通过模型推荐前4个条件,44个反应中27个成功(>10%产率),挽救10/11个底物(91%)。
- 前瞻性验证:在新化学空间(~2.46×10
11反应)中,中等置信度(<0.85)反应成功率为21%(富集1.11倍),高置信度(>0.85)反应成功率为33%(富集1.64倍),基线为19%。
**讨论与结论**
研究人员讨论指出,该模型在训练覆盖的试剂空间(32种钯预催化剂、12种碱、12种溶剂)内有效,但全新试剂类别需谨慎解释。二元分类框架(10%产率阈值)反映药物化学中的go/no-go决策,但未捕捉定量产率信息。异质产率定量方法(CAD、分离产率、MisER、LCAP)通过二元阈值统一,仅11.9%反应位于5–15%边界区域。CRDS对BH化学的OOD性能强相关,但权重指数需针对其他反应类型重新校准。未来工作包括噪声异质反应数据的调和、全局条件纳入及跨反应类型扩展,可能借助化学人工智能代理和噪声检测技术。
研究结论部分翻译如下:开发了一个统一的、主动策展的ML框架,能够对BH交叉偶联反应进行鲁棒的OOD预测。通过系统标准化异构数据集、通过主动学习策略性扩展反应空间并实验验证预测,研究人员证明数据多样性(而非数据集规模或模型复杂性)是泛化性能的关键驱动因素。这一见解不仅推进了关键反应类型的预测化学,还建立了可广泛适用于其他转化的原则。