《Digital Discovery》:Large language models as proxies for human experts in synthesis optimizationOpen Access
编辑推荐:
加速化学发现需要高效优化复杂、多变量的反应空间。本文报道了一种先验引导的贝叶斯优化(Bayesian Optimization, BO)工作流,该工作流能够利用专家直觉或现成的大型语言模型(Large Language Models, LLMs)将文献中的化学
加速化学发现需要高效优化复杂、多变量的反应空间。本文报道了一种先验引导的贝叶斯优化(Bayesian Optimization, BO)工作流,该工作流能够利用专家直觉或现成的大型语言模型(Large Language Models, LLMs)将文献中的化学知识嵌入结构化先验。通过扩展底层BO框架以支持独热编码(one-hot encoded, OHE)分类变量,该方法直接支持实验化学家在优化反应时面临的实际选择,如溶剂、配体或催化剂的选择。该LLM衍生的先验加权采集函数的性能在三个有机化学数据集上得到了验证,并与标准BO、理想、误导和“模糊”先验变体进行了基准比较,以评估该方法在各种现实场景下的表现。此外,研究还调查了该方法的局限性,揭示了性能在约十篇源论文处出现饱和。这些结果表明,文献信息先验可以缩小更广泛的化学搜索空间。最终,这项工作为领域专家提供了一种可访问的数字工具,能够提高实验室效率并补充科学家的专业知识。
**一、研究背景与问题**
化学合成优化的核心挑战在于高效探索高维、非线性的反应空间。传统设计实验(Design of Experiments, DOE)在面对大规模化学搜索空间时,常因维数过高和目标函数非线性而力不从心。贝叶斯优化(Bayesian Optimization, BO)凭借高斯过程(Gaussian Processes, GPs)对探索与利用的平衡,已在光氧化还原催化、自动化流动合成等复杂体系中展现出可靠性能。然而,典型BO流程存在“冷启动”问题,算法作为无信息学习者,无法直接利用化学专家长期积累的深度先验知识。近年来,先验增强BO方法如πBO虽能在数学层面整合先验信念,但化学家在设计实验时通常依赖离散直觉(如特定配体类别或溶剂家族),而非连续概率分布;将定性化学直觉转化为概率先验需要深厚的编程和统计技能,形成阻碍方法普及的“翻译鸿沟”。大型语言模型(Large Language Models, LLMs)的出现,为将复杂化学推理转化为可计算格式提供了新途径。为此,研究人员系统探索了模拟人类直觉对优化景观的影响,并提出以LLM作为人类专家代理的先验引导BO框架。
**二、研究内容与意义**
研究人员报道了一种先验引导的BO工作流,可将专家直觉或现成LLM从文献中提取的化学知识嵌入结构化先验。通过扩展原有BO框架以支持独热编码(OHE)分类变量,该方法直接适用于反应优化中常见的溶剂、配体或催化剂等离散选择。研究在Buchwald–Hartwig胺化、Suzuki–Miyaura交叉偶联和直接芳基化三个已建立有机反应数据集上开展,并与标准BO、理想先验、误导先验及其“模糊”(sloppy)变体进行系统基准比较。结果显示,文献信息先验能有效缩小广阔化学搜索空间,LLM衍生先验在多数情况下可达到甚至超越理想先验的表现,并在约十篇源论文处出现性能饱和。这一工作为领域专家提供了易用的数字工具,可放大实验室效率并补充而非替代科学家专业知识。
**三、主要技术方法**
研究人员基于BayBE库修改πBO框架,将采集函数重构为支持离散OHE参数组合,使先验集内点被权重β缩放,集外点不受影响。对于LLM先验生成,默认使用Gemini 2.5-flash-lite,通过提示结构将多篇文献与候选反应条件一并提供给模型,要求模型对各组分(配体、碱、溶剂等)分别排名,再经评分函数转换为统一分数,取最高分N个点构成先验。人工基准包括理想、误导及其sloppy变体。先验大小N取1、3、5、10,每种配置进行30次独立采样;收敛标准为达到数据集前2%产率所需迭代次数。样本来源为上述三个已建立反应数据集。
**四、研究结果**
**(一)先验质量评估**
研究人员通过30次独立采样,计算了各先验集合在初始搜索空间中的平均产率及统计分布。理想先验和误导先验分别定义了先验信念的上下极限,为评估LLM提供了必要基准。LLM先验的平均产率稳定落于两者之间,表明模型能够成功从文献中提取化学知识,为BO提供信息充分的起始点。
**(二)BO收敛性能**
收敛性能以达到前2%产率目标所需的迭代次数衡量。标准BO(灰色)作为对照,同时比较了理想(深绿)、误导(深红)、sloppy变体(浅绿、浅红)及paper-informed LLM先验(蓝色)。结果显示,BO算法能够补偿低质量初始化:即使N=10,误导和sloppy误导先验的平均迭代次数仍与标准BO接近,证明错误先验不会严重破坏优化。引入噪声后性能边界收窄,理想先验优势略降,误导惩罚亦被削弱。LLM先验表现尤其突出,经常匹配或超越理想先验。当先验规模增至N=10,各数据集迭代次数显著下降;以Suzuki–Miyaura交叉偶联为例,LLM先验平均约需20次迭代,理想先验约10次,而标准BO约50次。跨所有数据集,N=10的LLM先验均能一致地收敛于理想先验水平或更优,表明LLM先验可有效加速化学优化。
**(三)文献数量饱和与模型变异性**
研究人员通过变化提供给LLM的论文数量从零到完整参考文献列表,发现在约十篇论文后,产率预测提升趋于平台期。表1对比了随机采样、零样本基础LLM、paper-informed LLM及直接给定来源论文的先验平均产率。对于直接芳基化,基础LLM平均产率仅6%,补充10篇领域论文后升至39%;而Buchwald–Hartwig胺化和Suzuki–Miyaura交叉偶联在补充论文后产率无提升或略有下降,反映基础LLM对这些常见反应类别已有较好知识覆盖。不同LLM模型(如Llama 3.3、Gemini 2.5 Pro)的先验平均产率变异性较大,但相应BO收敛在多数反应案例中仍优于标准BO。这些结果表明,文献选择与模型固有化学知识共同决定先验质量,且先验平均产率与BO收敛速度之间并非简单正相关。
**五、讨论与结论**
讨论部分指出,平均先验产率并不等同于BO收敛效率;直接芳基化虽先验平均产率低,但LLM先验驱动的BO收敛依然优异。将数据集来源的原始文章直接提供给模型也未显著提高先验平均产率,暗示当前数据提取方法仍有优化空间,也与真实场景中研究者往往缺乏包含ground-truth答案的数据集这一现实相符。结论部分总结为:本工作提出了一种简单而高效的方法,将离散化学直觉系统性地整合进贝叶斯优化流程,为将人类和机器衍生先验转化为高性能实验优化任务建立了通用路径。在缺乏明确领域知识时,LLM能够提供可靠的优化基线;但由于性能依赖于文献可获得性,在新型或报道不足的化学空间中,该工作流的效率预计会下降。因此,LLM适合作为已建立反应的稳健工具,而人类专家仍是开创全新化学发现的必要条件。