桥接CGR表示与语言模型的反应性质预测

《Digital Discovery》:Bridging CGR representations and language models for reaction property predictionOpen Access

【字体: 时间:2026年09月08日 来源:Digital Discovery 7.1

编辑推荐:

  反应性质(如活化能、焓、速率常数和产率)的准确预测是设计高效且可持续化学过程的关键。尽管基于凝聚反应图(CGR)的图模型表现出强大的性能,基于文本的Transformer模型在反应SMILES上训练,因可扩展性和性能而受到青睐。在本工作中,研究人员分析了一种现

  
反应性质(如活化能、焓、速率常数和产率)的准确预测是设计高效且可持续化学过程的关键。尽管基于凝聚反应图(CGR)的图模型表现出强大的性能,基于文本的Transformer模型在反应SMILES上训练,因可扩展性和性能而受到青睐。在本工作中,研究人员分析了一种现有的基于CGR的字符串表示——SMILES/CGR——用于反应性质预测的表现。与传统反应SMILES不同,该表示在统一的类似SMILES的序列中显式编码原子和键的变化。SMILES/CGR的一个关键局限性是它不编码立体化学。为克服此问题,研究人员引入了叠加反应SMILES(sr-SMILES),一种保留完整立体化学信息的紧凑型CGR表示。为评估这两种表示,研究人员通过掩码语言建模在200万USPTO反应上预训练了BERT transformer,然后在六个基准数据集上分别微调模型。研究人员与在标准反应SMILES上训练的模型、朴素基线及文献结果进行了比较。结果表明,sr-SMILES始终匹配或优于反应SMILES,尤其是在机制信息至关重要的基准测试以及低数据场景中。相比之下,SMILES/CGR往往表现不佳,突显了CGR编码细节的重要性。虽然sr-SMILES未缩小与基于图的CGR方法的性能差距,但它表明,当适当编码时,语言模型可以受益于显式机制信息。此外,通过比较具有不同原子映射的SMILES/CGR和sr-SMILES模型,研究人员强化了基于CGR的方法对映射质量高度敏感的观点。对字符串表示间表现相似的一个合理解释是,语言模型在(预)训练期间隐式学习了原子映射,使得在许多预测任务中显式映射变得不必要。
反应性质预测是化学过程设计的重要环节。传统计算方法与机器学习模型已被用于此任务,其中基于图的方法利用凝聚反应图(Condensed Graphs of Reaction, CGR)能够显式表示反应中的原子和键变化,在多个性质预测基准上取得优异性能;但这类模型依赖高质量的原子映射。语言模型则通过在大规模反应语料上预训练,直接从反应SMILES中学习化学模式,具有较好的可扩展性,却未显式编码反应机制信息。现有CGR字符串表示SMILES/CGR虽然以字符串形式显式编码原子/键变化,但缺乏立体化学信息,且为多对一映射。为此,研究人员提出叠加反应SMILES(superimposed reaction SMILES, sr-SMILES),在保留CGR显式变化编码的同时,完整保留立体化学信息(如手性反转、E/Z异构),并保证双射性。研究在约82万条经RXNMapper过滤的USPTO反应上预训练BERT模型,随后在六个基准数据集(E2/SN2、SNAr、Rad-6-RE、Lograte、Phosphatase、GDB)上微调,比较反应SMILES、SMILES/CGR与sr-SMILES,并对照图模型Chemprop-CGR、Chemprop-diff及RXNFP-FFN基线。主要结论为:sr-SMILES一致匹配或优于反应SMILES,尤其在机制信息关键与低数据场景;SMILES/CGR表现较弱;字符串模型整体未超越图模型,但sr-SMILES在E2/SN2上达到最优。此外,CGR字符串表示的性能受原子映射质量显著影响。该工作发表于《Digital Discovery》。

关键技术方法包括:使用RXNMapper为反应SMILES生成原子映射,经CGRtools转换为SMILES/CGR,用自开发的sr-SMILES库转换;基于BERT(隐层256,中间层512,4注意力头,15%掩码)进行掩码语言建模预训练,下游任务用FFN回归头微调;对比虚拟中位数、Morgan差分指纹FFN、Chemprop-diff、Chemprop-CGR和RXNFP-FFN。预训练数据为USPTO(经RXNMapper过滤至约82万);微调数据集来自Heid等的反应数据库,GDB来自van Gerwen等。

研究结果:
3.1 字符串表示比较:在六个数据集上,CGR字符串表示并未始终优于反应SMILES。GDB数据集上,SMILES/CGR和sr-SMILES均优于反应SMILES(平均绝对误差MAE分别为9.14和8.08 vs 10.56 kcal mol?1);E2/SN2上sr-SMILES取得所有模型最低MAE(2.42 kcal mol?1)。RXNFP-FFN在Lograte与Rad-6-RE上明显弱于反应SMILES BERT模型,原因可能与这些数据集中自由基反应中心有关。总体上,字符串模型未能超越图模型Chemprop-CGR,仅E2/SN2例外。

3.2 原子映射信息的影响:在GDB上,比较真实映射与RXNMapper重新映射。SMILES/CGR和sr-SMILES在真实映射下MAE(9.14±0.10和8.03±0.13)均低于重新映射(10.08±0.08和9.28±0.13
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号