一种基于多模态数据工程与QLoRA微调的连续铸坯表面裂纹诊断领域专用大语言模型

《Progress in Natural Science-Materials International》:A domain-specific large language model for surface-crack diagnosis in continuous casting slabs via multimodal data engineering and QLoRA fine-tuning

【字体: 时间:2026年09月09日 来源:Progress in Natural Science-Materials International 7.4

编辑推荐:

   摘要连铸板坯表面裂纹涉及微观组织演化、热机械载荷及工艺波动的耦合效应,需要跨尺度整合异构证据的诊断推理。为支持基于证据的工业诊断,本研究开发了一种面向表面裂纹诊断的领域自适应大语言模型。利用多模态视觉-语言模型,将图表、表格、显微照片和公式等非文本冶金资产转换为以机理为导向的

  

摘要

连铸板坯表面裂纹涉及微观组织演化、热机械载荷及工艺波动的耦合效应,需要跨尺度整合异构证据的诊断推理。为支持基于证据的工业诊断,本研究开发了一种面向表面裂纹诊断的领域自适应大语言模型。利用多模态视觉-语言模型,将图表、表格、显微照片和公式等非文本冶金资产转换为以机理为导向的文本描述。随后采用实体锚定和思维链推理构建了具有跨尺度物理因果链的指令数据集。使用量化低秩适配对 Qwen2.5-7B-Instruct 进行微调,并建立了"三维九角度"评估框架,从工艺与操作可行性、材料科学与微观结构、人工智能质量与保真度三个维度进行评估。三轮专家评估在条目-指标层面进行中位数聚合,以降低评估者层面的变异性。在提供证据的开卷评估中,微调后的模型取得了最高综合得分 3.773,并将得分分布向中高区间推移,优于 Qwen2.5-7B-Instruct、Llama3.1-8B-Instruct 和 DeepSeek-R1-Distill-Qwen-7B。在移除上下文的闭卷评估中,其得分降至 2.553,表明该模型更适合证据支持下的诊断,而非无上下文条件下对详细冶金知识的记忆。这些结果证明了多模态文献工程与参数高效微调相结合,在构建连铸表面裂纹诊断垂直领域大语言模型方面的可行性。

引言

连铸板坯表面裂纹是钢铁生产中的核心缺陷,会降低金属收得率并增加加工成本[[1], [2], [3], [4], [5]]。裂纹的形成既涉及微观组织演化,也涉及热机械载荷。在冶金层面,包晶 δ-铁素体向奥氏体转变时的收缩、奥氏体晶粒粗化以及晶界上 S 和 P 的偏聚构成了微观尺度的失效路径 [1,[3], [4], [5], [6]]。宏观上,结晶器振动痕迹、非均匀热通量引起的热应力以及矫直载荷驱动裂纹萌生 [2,[7], [8], [9], [10], [11]]。这种多尺度耦合超出了传统物理模型捕捉现场随机波动的能力 [8,12]。因此,诊断模型需要融入机理感知推理,而不仅仅依赖经验关联。
现有诊断方法主要依赖数值模拟和传统机器学习。有限元方法(FEM)在裂纹损伤准则、收缩模拟和结晶器优化等离线分析方面表现出色 [8,10,[12], [13], [14], [15], [16], [17], [18], [19], [20]]。然而,高保真三维模型计算成本高昂,无法满足实时在线预警需求。此外,它们也难以将铸坯尺度变形与纳米尺度析出行为关联起来 [8,12,16,19]。数据驱动的机器学习改善了过程追踪和异常检测[[21], [22], [23], [24], [25]],但仍属"黑箱"模型,冶金可解释性差,且利用非结构化文献或专家知识的能力有限 [26]。
大语言模型(LLM)通过大规模预训练获得了广泛知识和跨领域推理能力 [27,28]。借助参数高效微调(PEFT)方法如 LoRA [29] 和 QLoRA [30,31]、思维链(CoT)数据合成 [32] 以及高效微调框架 [[33], [34], [35]],它们在材料科学和工业故障诊断领域展现出广阔前景 [[36], [37], [38]]。然而,将其迁移到冶金领域面临若干数据瓶颈。传统 PDF 解析会在冶金公式和图表中引入语义不连续性 [39]。冶金实体缺乏层次化标注,掩盖了微观非均质性精细特征 [40]。传统指令数据也无法支持将宏观工艺变量与微观相变相结合的多跳推理 [41]。
为解决上述问题,本研究开发了一种面向表面裂纹诊断的垂直领域大语言模型。基于多模态 VLM 的非替代式语义重注入管线解析非结构化资产 [39,42];实体锚定 [43] 结合思维链推理 [32] 重构了具有跨截面因果逻辑的指令集 [44];通过 QLoRA [30,45] 对 Qwen2.5-7B-Instruct 基座模型进行微调,使其响应模式适应冶金诊断推理。随后建立了"三维九角度(3D-9A)"专家评估框架,从工艺与操作可行性、材料科学与微观结构、人工智能质量与保真度三个维度量化运营价值。

章节片段

方法论

整体流程如图 1 所示,包含四个阶段:(1) 从 Web of Science 获取高质量 SCI 论文,经过版面重构和结构化处理;(2) 利用多模态 VLM 进行远距离标注,解析并语义重注入图表、表格和 SEM 显微照片等非文本资产;(3) 基于逻辑的多跳策略构建具备 CoT 能力的指令数据集;(4) 通过 QLoRA 进行参数高效微调,以

模型训练收敛性分析

学习率 1.0×10?5、2.0×10?5 和 3.0×10?5 以及训练轮次 3–5 的超参数扫描结果汇总于表 1。在测试的配置中,以学习率 3.0×10?5 训练四个 epoch 的模型验证性能最佳,被选为最终微调模型,记为 SFT 3-4。如图 4 所示,SFT 3-4 的训练损失从第 5 步的 1.4982 逐步下降至第 140 步的 0.7184,而验证损失

结论

本研究开发了一种面向连铸板坯表面裂纹诊断的领域专用大语言模型框架。该框架整合了基于文献的语料构建、非文本冶金资产的多模态语义转换、实体锚定的多跳问答生成、Qwen2.5-7B-Instruct 的 QLoRA 微调以及基于 3D-9A 框架的专家评估。主要结论总结如下:
  • (1)
    多模态数据工程使图表、微观组织

CRediT 作者贡献声明

王新昆:撰写——初稿,软件,方法论,调查,概念设计。张超杰:撰写——审阅与编辑,监督,项目管理,概念设计。丁佳坤:验证,调查,数据管理。张立强:撰写——审阅与编辑,监督,资源。王颖雪:可视化,验证,形式化分析。

数据和代码可用性

本研究支持的所有数据和代码将在论文接收后于公共仓库上发布。

生成式人工智能及人工智能辅助技术在论文撰写过程中的声明

在本工作撰写过程中,作者使用了生成式人工智能工具,具体用途如下:(1) Claude(Anthropic)和 ChatGPT(OpenAI)用于将手稿从中文翻译为英文、润色英文表达、提高可读性并协助手稿的编辑修订。(2) DeepSeek-V3(DeepSeek)在数据集构建阶段用于从精选冶金语料中生成多跳指令对,详见第 2.3 节。(3)

资金支持

本研究未获得公共、商业或非营利部门基金机构的任何专项资助。

利益冲突声明

作者声明不存在已知可能影响本论文所报告工作的竞争性经济利益或个人关系。
王新昆|张超杰|丁佳坤|张立强|王颖雪
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号