ALL-FEM:为有限元方法进行微调的智能大型语言模型

《COMPUTER METHODS IN APPLIED MECHANICS AND ENGINEERING》:ALL-FEM: Agentic Large Language Models fine-tuned for finite element methods

【字体: 时间:2026年04月24日 来源:COMPUTER METHODS IN APPLIED MECHANICS AND ENGINEERING 7.3

编辑推荐:

  ALL-FEM系统通过集成代理AI和领域微调的大型语言模型(LLMs),实现了有限元(FE)代码生成的自动化,覆盖固体力学、流体力学及多物理场问题。基于1000+验证的FEniCS代码语料库,通过数据增强和LoRA/QLoRA技术微调不同规模LLMs(3B-120B参数),构建多智能体工作流程完成问题建模、代码生成、调试及可视化。实验表明,最佳模型在39个基准测试中实现71.79%的代码级成功,优于非代理的GPT-5 Thinking。

  
Rushikesh Deotale|Adithya Srinivasan|Mahmoud Golestanian|Yuan Tian|Tianyi Zhang|Pavlos Vlachos|Hector Gomez
普渡大学机械工程学院,美国印第安纳州西拉斐特市Purdue Mall 585号,邮编47907

摘要

有限元(FE)分析几乎指导了所有制造对象的设计和验证过程。它是计算工程的核心,能够模拟从流体和固体到多物理系统的复杂物理系统。然而,实现FE代码和分析仿真结果需要跨数值分析、连续介质力学和编程的专业知识。传统的大型语言模型(LLMs)可以生成FE代码,但它们可能会出现幻觉性错误,缺乏对变分结构的理解,并且无法从问题陈述到验证解决方案的闭环。在这里,我们提出了ALL-FEM,这是一个自主仿真系统,它将智能AI与针对特定领域的微调LLMs相结合,用于生成适用于固体、流体和多物理应用的FEniCS代码。我们通过结合500多个精心策划的专家代码和一个检索增强型多LLM流程,构建了一个包含1000多个经过验证的FEniCS脚本的语料库,该流程可以生成和过滤适用于各种偏微分方程(PDEs)、几何形状和边界条件的代码。我们使用这个语料库对具有30亿到1200亿参数的LLMs进行了微调。我们的自主框架协调由微调LLMs驱动的专门代理,将问题表述为PDEs,生成和调试代码,并可视化结果。我们在39个基准测试中评估了该系统,这些测试涵盖了线性/非线性弹性、塑性、牛顿/非牛顿流动、热流体、流体-结构相互作用、相分离以及在移动域上的传输等问题。嵌入到具有运行时反馈的多代理工作流中,最佳微调模型(GPT OSS 120B)的代码级成功率达到了71.79%,优于非自主部署的GPT 5 Thinking。通过证明相对较小的、经过微调的LLMs可以通过自主框架自动化FE工作流,ALL-FEM为计算科学和工程中的自主仿真系统提供了一个蓝图。

引言

有限元分析是计算工程的基石,它使计算机能够模拟复杂物理系统的行为和响应[1]、[2]、[3]、[4]。例如流体、固体、它们的组合以及许多受多物理过程控制的系统。从飞机和桥梁到生物医学设备,几乎所有制造的对象都是使用有限元分析的信息进行设计的。尽管有限元非常普遍,但实现该算法并部署它仍然是一项耗时、重复且需要高技能的任务。即使有像FEniCS [2]、[5] 或Firedrake [6] 这样的高级库,编写、测试和验证高效代码仍然需要了解变分公式、时间积分和线性代数的知识。在学术研究中,内部开发和开源软件占主导地位。因此,人们花费了大量时间开发相似的代码,例如将可压缩弹性的代码修改为不可压缩弹性的代码。这导致了重复的工作,但附加值很小。在工业领域,商业软件占主导地位,因为它们通过黑盒操作提供了可靠性,从而减少了用户引起的数值或公式错误。然而,这带来了高昂的许可和运营成本,并且本质上限制了解决非标准问题的能力。
大型语言模型(LLMs)的出现为自动化计算力学工作流开辟了新的可能性,可以同时解决研究和工业生态系统中的效率低下问题[7]、[8]。然而,现成的LLMs经常生成的代码存在幻觉性错误[9]、[10]、[11],包括语法或语义错误,导致结果不正确。为了减少LLMs的这种不可靠性,一种策略是在特定领域的数据集上对它们进行微调。LLMs通常在互联网上的大量数据上进行预训练,微调有助于它们内化FEM代码的具体语法模式,使其响应局限于有效的公式,这些公式包含了变分公式和有限元技术的知识。另一种提高可靠性的方法是使用智能AI系统来替代每次提示只生成单一输出的零-shot LLMs,这些系统可以顺序推理、验证中间步骤并通过与外部工具交互来执行操作。
最近的研究[12]表明,每个代理都有特定角色的多代理AI系统可以提高问题表述、工具使用和仿真执行的可靠性。成功的自主系统示例包括在弹性[8]、[13]、蛋白质发现[14]和材料发现[15]中的应用。计算力学中的许多努力都集中在计算流体动力学(CFD)上。OpenFOAMGPT使用了检索增强生成(RAG)方法,在生成输出之前进行信息检索[16],以解决湍流、热传递和多相流动问题[17]、[18]。OpenFOAMGPT 2.0 [19]将这一框架扩展到多代理架构,改进了OpenFOAMGPT的结果。Foam-Agent探索了分层多索引RAG和依赖感知生成,以提高CFD工作流中的配置一致性[20]。AutoCFD旨在通过在大规模的语言到OpenFOAM配置对数据库上进行微调,实现从自然语言到可执行CFD设置的直接转换,并附有思维链注释[21]。类似的努力还包括MetaOpenFOAM,它将RAG增强的知识检索与自主框架结合,以分解复杂的CFD任务[22],以及ChatCFD,它使用迭代试验-反思-细化循环来处理文献中的仿真案例[23]。除了CFD之外,还有新的努力。AutoFEA结合了图卷积网络(GCN)-变压器模型和LLMs来自动化FE代码生成[24]。FeaGPT开发了一个用于结构FE分析的框架,试图自动化从几何生成到仿真结果的全部工作流[25]。此外,人们还对自动化科学发现感兴趣,超出了计算工作流的范畴。参考文献[26]介绍了turbulence.ai,这是一个用于流体力学的AI科学家,能够生成假设、进行仿真并起草手稿。AGENTICSCIML是一个用于科学机器学习发现的多代理系统。这些代理通过结构化推理和迭代进化合作提出、批判和完善科学机器学习解决方案[27]。ATHENA是一个自主框架,作为一个自主实验室管理整个研究生命周期[28]。Guo等人[7]提出了一个由LLM支持的CAE代理,其中LLMs作为自主协作者规划、执行和适应CAE工作流,并将其应用于无数据的侵入式模型降阶,以减少求解器重新开发的努力[29]。他们使用基于张量分解的A Priori Surrogates(TAPS)[30],展示了如何将参数化PDE的自然语言描述转换为产生降阶模型的求解器实现。
在这里,我们开发了ALL-FEM,这是一个使用智能AI和微调LLMs来自动化计算力学工作流大部分内容的自主仿真系统。我们的框架包括用于FEniCS代码生成的特定领域微调LLMs。我们在包含超过1000个条目的FEniCS代码数据集上,对规模从30亿到1200亿参数的开放权重LLMs进行了微调。为了解决数据稀缺问题,我们提出了一种数据增强流程,其中多个LLMs依次协作,将一个小型的专家策划的种子数据集扩展为一个更大、更多样化的、高质量的、正确的FEniCS代码数据库。ALL-FEM引入了一个新颖的端到端框架:(i) 创建一个经过验证的合成数据集,专门用于将PDE的边界值问题映射到FEniCS代码;该合成数据集流程为数据公开可用性有限的领域提供了一种生成验证代码数据集的新方法,其应用可能扩展到具有类似FEniCS代码数据约束的其他软件领域;(ii) 使用该数据集对开源LLMs进行微调,以生成可执行且可靠的FEniCS代码;(iii) 在自动化的多代理工作流中部署这个经过微调的FEM专用模型。在这个工作流中,系统完成了仿真的多个关键步骤,包括用适当的边界条件公式表达问题;生成问题的初始FEniCS实现;调试代码;检查公式和实现之间的一致性;以及绘制数值结果。ALL-FEM框架将数据生成、模型专门化和仿真工作流的自动化链接在一个端到端的流程中。我们自主系统的一个重要特点是,代理的选择和协调由LLM协调,从而在不同的计算力学挑战中实现了灵活性、适应性和鲁棒性。
我们使用一个包含39个问题的基准测试来评估我们的自主系统,这些问题涵盖了线性/非线性弹性、塑性、牛顿/非牛顿流动、热流体、流体-结构相互作用、简化的多相流动模型以及在移动域上的扩散-反应系统。当在多代理框架中使用时,我们最佳微调的LLM在71.79%的基准问题中产生了正确的代码,并且优于非自主部署的OpenAI模型GPT-5 Thinking。我们的结果表明,即使是在相对较小的模型上,通过适当的自主框架进行适度微调,也可以可靠地生成正确的有限元代码。我们的自主系统可以同时在研究和工业领域推进计算科学,并为自主仿真系统开辟了新的机会,在这些系统中,从问题陈述到验证解决方案的整个有限元工作流都由协调的、专门的LLM代理自动化。

部分摘录

LLM选择

近年来,基于变压器架构的LLMs发展迅速,已成为有用的通用工具[10]、[31]、[32]。现代模型针对不同的任务进行了专门化。长上下文变体现在支持非常大的输入,使得问题描述得以扩展[33]。此外,LLMs在代码合成方面表现出色;像Codex这样的代码调优模型在HumanEval数据集上展示了功能程序生成能力,该数据集包含人类创建的问题,用于测试LLMs的代码生成能力

评估方法

在本节中,我们将比较不同自主框架的性能。为了测试我们的自主框架,我们还将把它们与GPT-5 Thinking进行比较。为了模拟未接受过智能AI训练的计算机械师的行为,我们使用非自主设置部署GPT-5,并进行两次零-shot尝试。在这个框架中,首先用问题提示GPT-5,要求它生成一个FEniCS代码来解决这个问题。如果GPT-5生成了不可执行的代码

结论

我们开发了ALL-FEM,这是一个结合了智能AI和微调LLMs的自主仿真系统,用于自动化使用FEniCS的有限元工作流的大部分内容。从一个包含500多个专家生成的FEniCS代码的精心策划的种子数据集开始,并使用一种新的合成代码生成流程,我们开发了一个包含1000多个条目的数据集。我们利用这个数据集使用LoRA/QLoRA对参数范围在30亿到1200亿之间的LLMs进行了微调。我们嵌入了现成的LLMs和我们的

CRediT作者贡献声明

Rushikesh Deotale:写作——审阅与编辑、撰写原始草稿、软件、方法论、调查、数据策划。Adithya Srinivasan:写作——审阅与编辑、撰写原始草稿、方法论、调查。Mahmoud Golestanian:写作——审阅与编辑。Yuan Tian:软件、资源、方法论。Tianyi Zhang:写作——审阅与编辑、资源、方法论。Pavlos Vlachos:写作——审阅与编辑、资金获取、概念化。Hector Gomez:写作——

利益冲突声明

作者声明他们没有已知的可能会影响本文所述工作的竞争性财务利益。

致谢

这项工作部分得到了Eli Lilly and Company(美国)的支持。所表达的观点、发现和结论或建议仅代表作者本人,并不一定反映Eli Lilly and Company的观点。这项工作使用了匹兹堡超级计算中心(PSC)的Bridges-2系统,该系统通过高级网络基础设施协调生态系统:服务和支持(ACCESS)计划下的分配号MCH220014获得支持,该计划由国家科学
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号