基于序列敏感多保真混合模型与教师-学生遗传算法的共聚酰胺逆向设计

《Materials Genome Engineering Advances》:Inverse Design of Copolyamides via Sequence-Sensitive Multifidelity Hybrid Models and Teacher–Student Genetic Algorithm

【字体: 时间:2026年09月09日 来源:Materials Genome Engineering Advances 13.9

编辑推荐:

  作为一种高性能聚合物材料,共聚酰胺(co-PAs)的热稳定性、机械强度和可加工性取决于二胺、二酸的结构设计及其化学计量比。劳动密集型的实验设计方法难以有效探索共聚酰胺的巨大结构空间。在此,研究人员开发了序列敏感多保真(SSMF)混合建模方法来预测共聚酰胺链的性

  
作为一种高性能聚合物材料,共聚酰胺(co-PAs)的热稳定性、机械强度和可加工性取决于二胺、二酸的结构设计及其化学计量比。劳动密集型的实验设计方法难以有效探索共聚酰胺的巨大结构空间。在此,研究人员开发了序列敏感多保真(SSMF)混合建模方法来预测共聚酰胺链的性质,并将遗传算法改进为教师-学生双模型策略,以实现共聚酰胺结构的逆向设计。基于共聚酰胺链序列的长SMILES表示,通过结合两个互补模型(即高序列敏感性模型和高效率模型)构建了SSMF混合模型,并通过知识蒸馏提高其准确性。在改进的遗传算法框架内,学生模型能够进行大规模种群迭代,而教师模型则对逆向设计结果进行最终优化。这种教师-学生双模型策略有效地从超过20亿个虚拟结构中识别出同时满足目标玻璃化转变温度(Tg)、熔点(Tm)和拉伸模量(E)的候选结构。所开发的SSMF建模方法和教师-学生协同逆向设计方法可以促进其他共聚物结构的设计,特别是其链序列,从而推进聚合物材料的AI辅助设计。
聚酰胺(PAs)是一类主链含重复酰胺键的高性能工程热塑性塑料,但传统脂肪族PA耐热性不足,全芳香PA加工性差,半芳香共聚酰胺(co-PAs)通过共聚可综合平衡热稳定性、力学性能和加工性。设计二胺/二酸单体结构及化学计量比是优化co-PAs综合性能的关键,然而实验试错法难以覆盖巨大的结构空间。机器学习(ML)虽已加速聚合物发现,但用于co-PA体系时面临链序列异质性数字化与建模的挑战。为此,研究人员构建了涵盖PA与聚酰亚胺(PI)的多源数据集,提出Long-Chain SMILES表示链序列,开发了序列敏感多保真(SSMF)混合模型,并结合教师-学生遗传算法实现co-PAs的逆向设计。该研究揭示了链序列是独立设计变量,为高性能共聚酰胺的理性设计提供了通用策略,论文发表在《Materials Genome Engineering Advances》。

研究人员采用的主要方法可概括为:从文献收集PA数据(568个Tg、933个Tm、134个E)并以PI数据(1367个Tg、141个Tm、420个E)作为结构类似补充;将聚合物结构转化为10重复单元的Long-Chain SMILES以表示序列与比例;计算Mordred描述符和Morgan指纹,分别训练GPR和XGBoost模型;以GPR-Mordred为教师模型,通过知识蒸馏训练XGBoost-Morgan学生模型,构成SSMF混合模型;采用两层遗传算法(学生模型快速迭代、教师模型精确验证)进行逆向设计。

### 2.1 数据集的构建与共聚酰胺的结构数字化
研究人员整合PA与PI数据,利用Mordred描述符和t-SNE分析化学空间覆盖度,确认PI补充数据与PA区域部分重叠,化学兼容。提出Long-Chain SMILES表示法:将单组分PA重复单元扩展为10单元长链,对二元共聚物则通过50次随机共聚生成特定比例的链序列,从而编码单体序列和组成比。

### 2.2 共聚酰胺ML预测模型的建立与验证
#### 2.2.1 多路线建模策略
采用描述符路线(Mordred+PCA,结合GPR、MLP、KAN)和指纹路线(Morgan+SHAP,结合RF、XGBoost、LightGBM),从计算成本、预测精度、序列敏感性和泛化能力四方面评估。

#### 2.2.2 特征工程与计算效率比较
对5000条随机链,Morgan指纹生成仅需3.6分钟,而Mordred描述符需318.4分钟,前者快两个数量级,适合高通量筛选。

#### 2.2.3 模型性能比较与序列敏感性验证
GPR-Mordred与XGBoost-Morgan表现最优(测试集R2>0.90)。在PA10T-co-PA56体系中,GPR-Mordred对Tg显示强序列敏感性,能预测出超出单组分界限的块状序列异常值;XGBoost-Morgan则几乎无序列区分。Tm对两者均无序列依赖,E完全由组成决定。提出分位数过滤方法(取排序前20个预测值的均值),有效抑制块状伪影,使预测值与实验值高度一致。该模型在PA10T-co-PA56、BFA/TERE-co-BFA/ISO、PAI-co-PA6三个不同化学体系上均验证了泛化能力。

#### 2.2.4 模型序列敏感性的机理解释
通过描述符方差分析,发现VR1_A和VR2_A两个特征值拓扑描述符方差远高于其他描述符。消融实验表明,移除VR1_A会大幅削弱序列感知,同时移除两者则完全丧失序列敏感性。这两个描述符源于分子邻接矩阵的特征向量,可表征局部刚性、自由体积分布等序列诱导的异质性,从而编码链序列信息。

### 2.3 基于教师-学生遗传算法的逆向设计
#### 2.3.1 序列敏感多保真混合模型
设计空间包含613种二酸和485种二胺,二元组合及9种比例共超过20亿候选,穷举不可行。GPR-Mordred精度高但计算昂贵,XGBoost-Morgan高效但组成分辨率粗。因此以GPR-Mordred为教师,用其预测5000条单组分链的Tg、Tm、E作为伪标签,重新训练XGBoost-Morgan学生模型,使其继承序列敏感性,构成SSMF混合模型。

#### 2.3.2 两层遗传算法逆向设计
第一层由学生模型快速评估100个初始候选的交叉与变异,按目标Tg≈320°C、Tm≈350°C、E≈3.5 GPa进行迭代优化;第二层由教师模型对学生确定的精英候选进行高精度验证,确定最终结构与比例。该方法成功设计出满足Tg>320°C、Tm>350°C、E>3.5 GPa的co-PAs。讨论指出,传统方法将序列视为统计噪声,而本研究证明序列是独立的性能设计变量;模型局限性在于Tm预测仅对接近统计随机的序列可靠,且未考虑加工条件和聚集态结构,未来需引入多模态信息。

研究结论:本工作提出了序列敏感多保真混合建模方法和教师-学生遗传算法用于共聚酰胺逆向设计。鉴于Tg比Tm和E对序列更敏感,发展了性质特定表示策略;GPR-Mordred模型通过VR1_A和VR2_A两个拓扑描述符捕获Tg变化,分位数过滤方法消除了块状序列伪影,并在多个体系中验证了泛化性。以GPR-Mordred为教师,训练XGBoost-Morgan为学生,形成序列敏感多保真模型;基于此的两层遗传算法从20亿个613种二酸与485种二胺的组合中高效识别出满足目标Tg、Tm和E的共聚酰胺结构与比例。这项工作推进了高性能共聚酰胺的设计,并为序列敏感的高分子信息学提供了通用策略,为复杂共聚物材料协同性能的理性设计开辟了新途径。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号