ChatXRD:一种基于大语言模型驱动的、用于X射线衍射的晶系分类与晶格参数预测的框架

《Materials Genome Engineering Advances》:ChatXRD: A LLM-Driven Framework for Crystal System Classification and Lattice Parameters Prediction Based on XRD

【字体: 时间:2026年09月09日 来源:Materials Genome Engineering Advances 13.9

编辑推荐:

  高通量X射线衍射(XRD)分析对加速材料发现至关重要,但传统方法常需要大量人工判读。研究人员提出ChatXRD,一种创新的大语言模型(LLM)驱动框架,将GPT-5驱动的智能体(agent)与定制工具集成,自主完成晶系分类与晶格参数预测。该框架设计两个工具:C

  
高通量X射线衍射(XRD)分析对加速材料发现至关重要,但传统方法常需要大量人工判读。研究人员提出ChatXRD,一种创新的大语言模型(LLM)驱动框架,将GPT-5驱动的智能体(agent)与定制工具集成,自主完成晶系分类与晶格参数预测。该框架设计两个工具:CrystalSystemClassifier与LatticeParametersPredictor,基于为XRD数据定制的自注意力衰减(self-attention-decayed)Transformer模型。方法在晶系分类上准确率超过97%,晶格参数预测的R2介于0.88与0.99之间,超越当前最优方法。采用基于决策树(decision tree)的推理进一步提升任务执行准确性与可靠性。结果表明,领域专用神经模型与LLM推理结合可用于自动化、可解释的XRD分析,支撑可扩展的高通量XRD分析,推动自动化材料研究与晶体学发展。
《Materials Genome Engineering Advances》刊发的该论文面向高通量材料合成与快速表征需求展开研究。X射线衍射(XRD)是表征晶体材料、获取晶系与晶格参数的关键手段,但现有人工智能方法多依赖支持向量机(SVM)、K近邻(KNN)、卷积神经网络(CNN)等模型,需要较多人工参与,难以大规模扩展;同时大语言模型(LLM)在XRD领域专用训练不足,晶系与晶格参数间强耦合关系难以由LLM单独解析,而CNN类方法对XRD峰位序列特性建模不足,少数Transformer方法又因粗粒度角度分箱造成信息损失。为此,研究人员开展LLM驱动XRD分析框架ChatXRD研究,由GPT-5驱动智能体协同专用预测工具与通用工具,以决策树深度优先搜索(DFS)推理组织工具调用,最终实现晶系分类准确率超97%、晶格参数预测R2为0.88至0.99,并提出这是LLM技术于XRD科学中的首批应用,可提升材料科学与晶体学分析效率。
作者为开展研究采用的关键技术方法包括:构建由Memory、Agent、ToolHub三部分组成的框架;ToolHub中XRD预测工具含CrystalSystemClassifier与LatticeParametersPredictor,通用工具含搜索引擎、绘图工具与XRD计算器。预测模型采用自注意力衰减Transformer即XRD Encoder,输入为XRD中θ的sin值序列,经掩码XRD模型(MXRDM)两阶段预训练与PCOD样本微调。样本队列来自Pymatgen合成数据及Predictive Crystallography Open Database(PCOD)真实库,训练集、验证集、测试集按8:1:1划分。
3 CrystalSystemClassifier
研究人员设计Classification7、ClassificationAngle、ClassificationSide三类策略,均基于XRD Encoder。通过直接七类分类、按晶胞角(α、β、γ)分层、按晶胞边长(a、b、c)分层,证明分层分类比直接七类更优,因子任务增加等效参数量并更好捕捉几何差异。
3.1 Three Classification Approaches
按角分类将七晶系归为四组再细分,按边分类将七晶系归为三组再细分,用于后续决策树多路径交叉验证。
3.2 Model
XRD Encoder由多层衰减自注意力模块与前馈神经网络组成。低角峰蕴含关键结构信息,故以初始化下三角矩阵作为注意力矩阵并实现多头加权衰减注意力,使模型更关注低角峰,提高序列依赖与可解释性。
3.3 Training Data
预训练用Pymatgen生成10K与50K合成XRD,2θ范围0至90°,sin θ取两位并截断或补零至700;微调用PCOD约6K与10K样本,七晶系分布不均,Trigonal样本极少。
3.4 Training Process
分三阶段:MXRDM掩码令牌预测、晶系分类预训练、PCOD数据微调。额外预训练任务弥补掩码预测与下游回归或分类目标差异,使特征更易迁移。
4 LatticeParametersPredictor
研究人员设Regression7、RegressionAngle、RegressionSide三种回归方式,基于XRD Encoder预测a、b、c。手造341368样本用于预训练,PCOD 49945样本用于微调,结果表明按角或按边分组的单一模型可有效预测对应晶系晶格参数。
5 Result
5.1 Crystal System Classification Result
在七随机种子下,Transformer方法显著优于KNN、决策树、SVM、CNN;50K预训练加10K微调时ClassificationAngle达97.3%、ClassificationSide达97.2%。150例独立测试上,ChatXRD通过搜索工具、LatticeParametersPredictor与多分类器一致性校验,修正单体分类器错误,准确率高于任一单管道。
5.2 Lattice Parameters Prediction Result
以R2与均方误差(MSE)评估,XRD Encoder优于直接以XRD图输入的1D CNN基线;按角与按边分组回归均取得0.88至0.99区间R2
5.3 Ablation Experiments
注意力矩阵初始化中下三角(LTri)最稳且最准,训练后注意力明显偏向低角峰。两阶段预训练联合MXRDM与晶格参数预测优于单任务。输入用sin θ比直接用强度或2θ变换更贴合布拉格方程(Bragg equation)。微调时更新全部参数优于仅更新多层感知机(MLP)层。
6 Conclusion
研究人员结论为:ChatXRD结合GPT-5驱动智能体与CrystalSystemClassifier、LatticeParametersPredictor,借决策树推理动态调度工具,在晶系分类与晶格参数预测上表现突出,为高通量材料发现提供可扩展可靠方案。局限是当前主要用模拟或精修峰位数据,真实粉末XRD含背景噪声、峰宽化、重叠峰、杂峰与弱峰缺失,直接用于原始实验数据仍需改进预处理并加入实验图案训练。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号