《ACS Organic & Inorganic Au》:Structured HTE Data and Integrated Bayesian Optimization Accelerate Scalable Amidation Process Development
编辑推荐:
研究人员描述了支撑商业路线开发的试剂介导酰胺化反应的早期命中识别工作流程的演变。在过去十年中,研究人员的策略从数据成熟度有限的广泛、穷举式高通量实验(HTE)发展到现代化的企业级数字平台,该平台将数据科学工具直接嵌入到实验工作流程中。通过定制Katalyst
研究人员描述了支撑商业路线开发的试剂介导酰胺化反应的早期命中识别工作流程的演变。在过去十年中,研究人员的策略从数据成熟度有限的广泛、穷举式高通量实验(HTE)发展到现代化的企业级数字平台,该平台将数据科学工具直接嵌入到实验工作流程中。通过定制Katalyst D2D(一款由ACD/Laboratories开发的用于HTE的商业电子实验室笔记本(ELN)),研究人员建立了结构化的机器可读数据架构,并实现了与EDBO+贝叶斯优化引擎的无缝集成。对历史酰胺化数据集的回顾性分析表明,尽管筛选了超过60种试剂,但只有一小部分持续转化为商业工艺。这一见解促使研究人员设计了简化的流程,其中化学家从基于经验性能和商业先例的六种反应条件的聚焦调查开始,然后在ELN内进行贝叶斯优化以确定最佳试剂/碱/溶剂组合。本研究强调了将反应数据视为数字资产(FAIR(可查找、可访问、可互操作和可重复使用)、可互操作且直接与优化工具关联)如何加速从反应筛选到稳健工艺开发的转变。
**研究背景与问题**
在药物化学工艺开发中,酰胺键形成是最广泛使用的转化之一,但耦合试剂、碱和溶剂的优化高度依赖底物,传统上依赖大量经验筛选。高通量实验(HTE)虽能高效生成大量数据,但历史数据以非结构化格式(如孤立电子表格)存储,缺乏统一机器可读架构,导致跨项目知识整合困难。尽管筛选了超过60种试剂,仅少数能持续转化为商业工艺,而大量低效或不可扩展条件浪费了实验资源。因此,需要一种将反应数据视为数字资产(遵循FAIR原则)并集成数据科学工具的方法,以加速从筛选到可规模化工艺开发的过程。
**研究内容与结论**
研究人员开发了基于Katalyst D2D电子实验室笔记本(ELN)和EDBO+贝叶斯优化引擎的集成数字平台,实现了结构化、机器可读的数据捕获与实时优化。通过回顾性分析超过十年的酰胺化HTE数据,发现仅少数试剂(如TCFH、DPPCl、EDC)表现稳定;基于此,他们设计了聚焦的六条件初始模板(三种试剂与两种碱在THF中),并利用贝叶斯优化在576种组合空间中快速迭代。最终,对四种代表性底物,仅需21次实验(比全因子枚举减少>95%实验负担)即可识别可规模化条件,且直接放大至5克规模,产率高达49%-88%。该研究发表于《ACS Organic》,展示了FAIR数据架构与贝叶斯优化如何显著提升工艺开发效率与知识复用。
**关键技术方法**(不超过250字)
研究人员采用以下关键技术方法:1) 定制Katalyst D2D ELN,建立结构化、机器可读的数据架构,直接连接至企业级PostgreSQL数据库,实现自动化数据捕获与跨实验实时聚合;2) 引入证据加权Z-score分析(基于历史数据,用Z=(x-μ_plate)/σ_plate标准化,再乘以观测次数n),量化试剂性能并筛选出高频次高表现试剂;3) 集成EDBO+贝叶斯优化引擎,通过ELN内递归预测,从六条件种子(TCFH、DPPCl、EDC各与DIPEA、NMI在THF中)出发,迭代优化试剂/碱/溶剂/浓度/胺当量组合;4) 实验数据来自Bristol Myers Squibb超过十年的酰胺化HTE项目,样本涵盖多种底物。
**研究结果**
(保留原文逻辑,但避免图示引用)
**历史HTE的局限性**:传统HTE采用穷举平行筛选(每板数十种试剂),虽获得可操作命中,但大量部分有希望的候选者因可规模化差、杂质或成本问题需二次实验,导致开发周期延长。
**回顾性Z-score分析**:通过整合历史数据并计算证据加权Z-score,发现仅6种试剂(如DPPCl、HBTU、TCFH)表现突出,超过60种试剂贡献有限,且HATU因安全风险(含HOAt的脲盐试剂,具致敏和能量隐患)被降权。
**结构化数据架构实施**:在Katalyst D2D中将实验操作映射为结构化模式,自动导出参数至PostgreSQL数据库,消除手动转录,实现跨实验实时聚合,形成过渡性工作流。
**聚焦模板与性能分析**:基于历史表现设计包含TCFH、DPPCl、EDC及稳健碱/溶剂的标准化模板,超过3000个数据点显示TCFH和HATU占优,但HATU因安全原因被排除。最终保留TCFH、DPPCl、EDC作为最优支架。
**贝叶斯优化集成**:将EDBO+引擎嵌入ELN,从六条件种子(TCFH/DPPCl/EDC各与DIPEA/NMI在THF中)开始,在576种组合空间内迭代。对四种底物,仅21次实验(三次迭代)即找到最优条件(多数为TCFH与NMI组合),且直接放大至5克,无需额外优化。
**结论总结**
本研究证明了将反应数据视为持久组织资产的变革性影响。回顾性聚合超过十年的酰胺化实验数据揭示,尽管评估了超过60种耦合试剂,仅少量子集持续转化为商业制造。这一认识推动从穷举经验筛选转向聚焦于数据驱动的工作流,其基础是结构化、机器可读的数据集。具体而言,该子集决定了聚焦工作流的设置:筛选模板中保留的试剂(TCFH、DPPCl和EDC)、用于启动每次贝叶斯优化活动的六种种子条件,以及扩展的576组合设计空间的分类型边界,均源自历史验证且可商业转化的试剂/碱/溶剂空间,而非穷举枚举。通过在Katalyst D2D中实施标准化数据架构,并将贝叶斯优化直接集成到ELN环境中,研究人员建立了一个统一的数字生态系统,其中反应设计、执行、数据捕获和优化无缝进行。由此产生的工作流显著减少了实验负担,同时使科学家在优化初期就能指向那些通常能经受住严格工艺开发的条件,从而避免了开发最终可规模化性和稳健性较差的条件。这种新的操作模式在数天而非数周内产生可规模化的工艺开发先导物,同时可能避免在无效路径上耗费数月努力。更广泛地说,这项工作说明了FAIR(可查找、可访问、可互操作、可重复使用)、可互操作的反应数据如何实现高级分析、机构学习以及从实验室实验到商业工艺开发的加速进程。尽管在酰胺化化学中展示,但本文描述的原理为不同反应类别的数字化工艺开发提供了可扩展的框架。