利用分子模拟和机器学习筛选大型共价有机框架数据库以去除水中尿素

《Digital Discovery》:Screening of large covalent organic frameworks databases for urea removal from water using molecular simulations and machine learningOpen Access

【字体: 时间:2026年09月08日 来源:Digital Discovery 7.1

编辑推荐:

  从用过的透析液中高效去除尿素是实现可穿戴人工肾脏的关键一步。共价有机框架(Covalent Organic Frameworks, COFs)具有可调的孔隙率和化学多样性,是一类有前景的吸附剂。在本工作中,研究人员采用高通量分子Widom插入方法,对CORE-

  
从用过的透析液中高效去除尿素是实现可穿戴人工肾脏的关键一步。共价有机框架(Covalent Organic Frameworks, COFs)具有可调的孔隙率和化学多样性,是一类有前景的吸附剂。在本工作中,研究人员采用高通量分子Widom插入方法,对CORE-COF数据库中的993个COFs进行无限稀释尿素结合强度和理想尿素/水选择性的排序,结果表明COF–C6、EB-COF?:?Cl、COF–F6和OH-TPB-BPTA-COF是最佳候选材料。对CORE-COF描述符的分析揭示,氧碳比(O/C)、碳分数(Cfrac)和孔限直径(Pore Limiting Diameter, PLD)是尿素吸附的主要预测因子。研究人员利用模拟得到的尿素结合强度,通过嵌套交叉验证训练并基准测试了多个机器学习模型。随机森林(Random Forest, RF)模型表现最佳(Rtrain2 = 0.92, Rtest2 = 0.62),但其对数据集中代表性不足的高尿素吸附框架的预测精度尚不理想。在该区域提高性能可能需要针对这些稀有结构的额外训练数据和/或更具信息量的相互作用敏感特征,这对COF结构仍是一个挑战。研究人员使用性能最佳的RF模型快速筛选了一个包含69?840个假设COFs(hypothetical COFs, hCOFs)的更大数据集,该数据集与CORE-COFs的特征空间重叠有限,因此构成了一项严格测试。尽管该模型系统性地高估了由模拟计算的hCOFs尿素结合强度,但它能够识别出大多数排名靠前的hCOF候选材料所具有的清晰化学模式,例如酰胺连接基和dia/hcb拓扑。本文提出的模拟–机器学习联合策略提供了一种可扩展的工作流程,可加速发现用于可穿戴人工肾脏中尿素分离和透析液再生的最优COFs。
基于分子模拟与机器学习的COF尿素去除筛选研究解读

**1. 研究背景**

全球血液透析患者数量快速增长,2020年已超过250万,预计2030年将达540万。传统血液透析消耗大量水资源(280–500 L),且需住院治疗,严重限制患者行动能力和生活质量。可穿戴人工肾脏(Wearable Artificial Kidney, WAK)的实现依赖于对透析液的高效再生,其中尿素去除是核心挑战。尿素分子小、电中性、极性强,且化学性质与水相近,选择性分离极为困难。共价有机框架(Covalent Organic Frameworks, COFs)具有可调孔径、高比表面积和优异化学稳定性,是潜在的尿素吸附材料。然而,大型COF数据库的分子模拟筛选计算成本极高,机器学习(Machine Learning, ML)在该领域的应用尚不充分。因此,本研究旨在建立一种结合分子模拟与机器学习的可扩展筛选工作流,加速发现高效尿素吸附COFs。

**2. 研究方法概述**

研究人员从CORE-COF数据库(1242个实验报道结构)中筛选出993个COFs,排除孔限直径(Pore Limiting Diameter, PLD)小于3.8 ?、可用表面积为零、含硼或重金属的框架。利用Widom插入法在RASPA软件中计算310 K下尿素和水的过量化学势(μex),尿素结合强度以μexurea表示,能量型尿素/水选择性定义为μexureaexwater。模拟采用DREIDING力场,原子的部分电荷由PACMAN预测的密度衍生静电和化学(DDEC)电荷方案提供;水分子采用TIP5P模型,尿素参数来自Weerasinghe-Smith模型。从59个初始结构/化学描述符中,通过Pearson相关分析筛选出23个关键特征,训练了随机森林(Random Forest, RF)、梯度提升(Gradient Boosting, GB)、Extra Trees(ET)、HistGradientBoosting(HGB)、支持向量回归(Support Vector Regression, SVR)和神经网络(Neural Network, NN)六种回归模型,并采用嵌套交叉验证严格评估泛化性能。最终的最佳RF模型被用于快速筛选包含69?840个假设COFs的Berkeley-COFs数据库(hCOFs)。

**3. 结果与讨论**

**3.1 分子模拟**

对CORE-COF数据库的Widom插入模拟表明,93.6%的COFs的μexurea大于?40 kJ mol?1,96.8%的μexureaexwater大于?30 kJ mol?1。μexurea与选择性之间在中等结合区域近似线性相关,因此将μexurea作为机器学习预测的主要目标。最佳候选包括COF–C6、EB-COF?:?Cl、COF–F6和OH-TPB-BPTA-COF。

**3.2 结构-性能关系**

基于RF模型的特征重要性分析显示,氧碳比(O/C)是最重要的描述符(约20%),与μexurea呈负相关,说明含氧官能团通过氢键作用增强尿素亲和力。碳分数(Cfrac)次之(约18%),正相关,表明富碳非极性环境削弱吸附。PLD是最重要的结构描述符,存在最优孔径范围。通过组合筛选条件(孔隙率0.510–0.685,Cfrac 0.360–0.551,Cfrac×孔隙率2<0.188,PLD 6.0–17.8 ?,Cfrac/PLD>0.025,O/C 0.050–0.400),可有效富集μexurea低于?55 kJ mol?1的强尿素结合COFs。

**3.3 机器学习分析**

**3.3.1 Core-COFs**

六种回归模型中,集成树方法(ET和RF)表现最佳,外层交叉验证均方根误差(RMSE)约9.0 kJ mol?1;RF在独立测试集上取得Rtrain2=0.92、Rtest2=0.62。SVR和NN的性能较差。所有模型对极端负值区域(即强结合COFs)的预测偏差均较大,主要因该区域样本稀疏、目标分布不平衡。RF对选择性目标μexureaexwater的预测精度较低(Rtest2=0.45),因为选择性涉及两个化学势之差,误差会累积。

**3.3.2 Berkeley h-COFs**

UMAP降维显示CORE-COFs与Berkeley-COFs的特征空间重叠有限,表明存在分布偏移。RF预测的前十名hCOFs候选经Widom模拟验证,预测μexurea为?46至?48 kJ mol?1,而模拟值仅为?16至?31 kJ mol?1,即模型系统性高估了结合强度。适用域分析表明这些候选位于CORE-COF训练域边缘或外部,预测属于部分外推。尽管如此,排名靠前的hCOFs呈现清晰的化学模式:其连接基多含–NH和–CO官能团(酰胺型化学),并倾向于dia或hcb拓扑。这些特征与极性相互作用和孔道可及性一致,具有物理意义。

**4. 讨论与结论**

讨论指出,RF模型对CORE-COF测试集和Berkeley外部筛选表现出相反偏差:前者趋于低估强结合(向均值回归),后者则高估,原因包括分布偏移和选择偏差。尽管绝对数值不精确,但识别出的化学模式可作为优先筛选的定性准则。未来可通过补充极端区域训练数据、引入官能团级描述符、结合主动学习或DFT校验力场来进一步提高精度。本研究的结论可概括为:研究人员采用分子模拟与机器学习相结合的方法,筛选了993个CORE-COFs的尿素结合强度,RF模型表现最佳并用于快速筛选69?840个假设COFs。特征重要性分析表明O/C、Cfrac和PLD是控制尿素吸附的主要描述符。尽管对hCOFs的预测存在数值偏差,但排名靠前的候选材料具有酰胺连接基和dia/hcb拓扑等共同特征。这些发现为设计高效尿素分离COFs提供了规则,所提出的模拟–ML联合策略为加速COF发现和可穿戴人工肾脏透析液再生提供了可扩展工作流。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号