大型语言模型驱动的基于提示策略的SysML-v2制品生成在基于模型的系统工程中的应用

《AI》:Prompt-Strategy-Driven SysML-v2 Artefact Generation Using Large Language Models for Model-Based Systems Engineering

【字体: 时间:2026年07月24日 来源:AI 6.5

编辑推荐:

  大型语言模型(Large Language Models,LLMs)在将自然语言工程信息转化为形式化基于模型制品方面展现出日益增长的潜力。然而,其在SysML-v2制品生成方面的可靠性仍未被充分理解,特别是在提示策略选择、模型依赖变异性和任务特定性能方面。本文

  
大型语言模型(Large Language Models,LLMs)在将自然语言工程信息转化为形式化基于模型制品方面展现出日益增长的潜力。然而,其在SysML-v2制品生成方面的可靠性仍未被充分理解,特别是在提示策略选择、模型依赖变异性和任务特定性能方面。本文提出了一种用于基于模型的系统工程(Model-Based Systems Engineering,MBSE)中LLM辅助SysML-v2制品生成的提示策略驱动方法。该方法基于系统的文献分析和基于Harvey-Balls的现有方法评估,揭示了在可重复性、提示评估和形式化建模支持方面的空白。所提出的工作流整合了输入准备、提示策略选择、LLM选择、制品生成、语法验证和质量评估。研究人员使用一个牵引电池系统案例研究,跨越三个代表性建模任务(需求生成、模块定义建模和状态机建模)对该方法进行了评估。研究人员使用F1-score分析和LLM-as-a-Judge评估,比较了四种LLMs和五种提示策略。在所研究的牵引电池案例研究中,观察到的制品分数因提示策略和建模任务而异,且没有单一策略在所有任务中都取得了最高观察分数。总体而言,研究结果表明,LLMs可以作为人在回路助手支持早期阶段的SysML-v2建模,同时仍需专家验证以确保句法正确性、语义一致性和领域有效性。
论文解读:《AI》期刊发表的研究——提示策略驱动的SysML-v2制品生成
研究背景与问题提出
现代工程系统日益融合机械、电气、电子和软件密集型子系统,其开发需要在动态环境中跨多学科一致地处理需求、架构、接口和行为模型。基于模型的系统工程(Model-Based Systems Engineering,MBSE)通过用形式化系统模型替代碎片化的基于文档的描述,来支持一致性、可追溯性、验证、确认和复用。SysML-v2通过提供更精确文本符号和改进的形式化系统表示语义基础,强化了这一基于模型的范式。然而,创建SysML-v2制品仍然困难且耗时,因为这需要领域知识和建模专业知识。大型语言模型(Large Language Models,LLMs)通过将自然语言输入处理并生成结构化文本或类代码输出的能力,为降低这一入门门槛提供了前景。但在MBSE背景下,生成的制品并非自动可靠,可能包含句法错误、不完整的模型元素、幻觉关系或语义不一致的结构。因此,使用LLMs进行SysML-v2制品生成需要系统的提示设计、语法验证和任务特定的质量评估。
现有研究虽然表明LLMs和相关人工智能技术可以支持选定的系统工程和MBSE活动,但现有方法仍然碎片化。许多研究聚焦于孤立用例,仅使用单一LLM或单一提示配置,并且关于提示策略如何影响生成模型制品质量的证据有限。SysML-v2也未被一致地解决,尽管其文本符号与基于LLM的模型生成尤为相关。研究人员通过系统的文献分析,初始检索确定了1207项研究,经过去重、标题和摘要筛选、全文评估和滚雪球法,最终保留八项主要研究进行详细分析。这些研究使用基于Harvey-Balls的评估方案进行评估,涵盖方法论清晰度、应用相关性、LLM集成、MBSE相关性、SysML-v2支持、提示工程、工具/API集成和可重用性。评估显示,现有工作提供了有价值的初步证据,但缺乏在可比实验条件下对多种LLMs、提示策略和SysML-v2制品类型的可重复比较。因此,目前尚不清楚提示策略选择如何影响SysML-v2制品质量,不同LLMs在需求、结构和行为建模任务中表现如何,以及哪些提示-模型配置最适合特定的建模目标。
研究目的与贡献
基于上述空白,研究人员提出了三个研究问题:RQ1,提示策略选择如何影响生成的SysML-v2制品的质量?RQ2,不同LLMs在需求、结构和行为建模任务中表现如何?RQ3,在牵引电池案例研究中,哪些提示-模型配置在所调查的SysML-v2制品类型中取得了最高的观察分数?本研究聚焦于提示策略、模型选择和制品类型之间的相互作用,从而对LLM辅助的SysML-v2生成进行任务特定评估,而不是将MBSE自动化视为一个通用问题。
研究人员做出了三项贡献。首先,提出了一种五阶段方法,用于提示策略驱动的SysML-v2制品生成,涵盖输入准备、提示策略选择、LLM选择、制品生成、语法验证和质量评估。其次,提供了四种LLMs和五种提示策略在三个代表性MBSE任务中的比较评估:需求生成、模块定义建模和状态机建模。第三,结合了语法验证、F1-score分析和LLM-as-a-Judge评估,以评估元素级正确性和语义模型质量。该设计每个建模任务包含20个核心模型-提示配置,外加针对需求生成的两个平台原生RAG Upload配置,总共62个配置。这提供了比仅评估一个模型或提示配置的先前研究更广泛的受控比较。
关键技术方法概述
研究人员采用了一个牵引电池系统作为案例研究,代表安全相关的跨学科工程系统,结合电气、热管理、机械和控制相关功能。实验设置包含三个建模任务:任务1需求生成,任务2模块定义建模,任务3状态机建模。选择了四种LLMs:ChatGPT-5.4 Pro、Gemini 3.1 Pro、Llama 4 Maverick和DeepSeek-v3,覆盖闭源和开源类别。每种模型结合了五种核心提示策略:Zero-Shot、Few-Shot、Chain-of-Thought、Chain-of-Verification和Retrieval-Augmented Generation,形成20个核心模型-提示配置。对于需求生成,额外评估了ChatGPT和Gemini的平台原生RAG Upload条件。生成过程遵循相同程序,包括任务特定自然语言输入准备、应用提示策略、提交给选定LLM、记录生成的SysML-v2制品、检查句法有效性和建模工具兼容性。若出现句法错误,则执行纠正迭代,限制为句法或结构修复,不手动改进语义内容。评估结合了定量和定性方法:对于任务1和任务2的选定方面,使用基于基础事实的评估,计算精确率、召回率和F1-score;对于任务2和任务3,额外使用LLM-as-a-Judge评估,考虑完整性、结构一致性、句法合理性、语义正确性和对建模任务的适用性。Claude Opus 4.6被单独用作LLM-as-a-Judge评估,而非用于制品生成的比较模型。ChatGPT-5.5仅用于手稿的语言修订、公式支持和翻译。所有LLM生成的输出均被记录、句法验证并根据参考制品或语义评估标准进行评估,同时专家评审对于确保建模正确性、一致性和领域有效性仍是必需的。
研究结果
5.1 评估概述
结果显示,在记录的生成序列中,观察到的制品分数因提示策略和建模任务而异。在案例研究中,上下文丰富的提示在需求生成中取得了最高观察分数,面向验证的提示在结构建模中取得了最高组合观察性能,面向推理的提示在行为建模中取得了最高平均评判者分数。
5.2 需求生成
需求生成显示出随着提示结构和上下文支持的增加而最明显的改善。Zero-Shot和Few-Shot提示提供了中等基线结果,而Chain-of-Thought和Chain-of-Verification通过引导模型产生更完整和一致的输出,提高了生成需求的质量。需求任务中最高的观察分数出现在使用Retrieval-Augmented Generation与文档上传时。在这一平台特定条件下,ChatGPT和Gemini各自实现了0.80的总体F1-score,代表了该任务中的最高观察值。ChatGPT从Zero-Shot设置的0.47提高到RAG Upload的0.80,而Gemini从0.45提高到0.80。DeepSeek也从结构化提示中受益,特别是CoT和CoVe,但未达到RAG Upload配置的水平。Llama表现出较弱且更多变的表现,表明对提示公式的更强依赖性。聚合结果显示,RAG Upload在需求任务中取得了最高平均分数,其次是CoVe和CoT。核心RAG条件在没有直接文档上传的情况下产生了较低的观察分数。
5.3 模块定义建模
模块定义建模任务揭示了比需求生成更复杂的性能模式。单独的F1-score分析表明,Gemini和Llama产生相对稳定的结构输出,而ChatGPT和DeepSeek在使用更结构化的提示策略时显示出更强的改进。然而,F1-score对命名差异、建模粒度和分解级别敏感。因此,F1-score评估辅以LLM-as-a-Judge评估。在预定义的评判标准下,ChatGPT获得了一些最高的完整性和语义细节评级,尽管由于过度建模和术语不匹配,其F1-score在多个配置中较低。CoVe在考虑基于F1和基于评判者的评估下,在该任务中实现了最高的组合观察性能。Chain-of-Thought和Chain-of-Verification获得了最高的平均归一化评判者分数,而RAG在BDD任务中得分较低。这一模式与结构建模受益于明确组织组件和关系的提示而非仅提供领域信息的解释一致。
5.4 状态机建模
状态机建模是实验中最具行为要求的任务。生成的制品必须包含合理的状态、转换、触发器和条件。Chain-of-Thought提示在该任务中取得了最高的平均归一化评判者分数。CoT达到了0.88的最高平均归一化提示策略分数,并且是所有四个模型都至少达到0.75的唯一策略。这一模式与显式逐步推理可以通过帮助模型在产生形式化SysML-v2输出之前识别相关状态和转换逻辑来支持行为建模的解释一致。ChatGPT获得了最高的平均归一化评判者分数0.95,并在五个提示策略中的四个中获得了最大分数。DeepSeek获得了0.85的平均评判者分数,Gemini获得了0.80,Llama获得了0.55。
5.5 跨任务比较
在案例研究中,没有单一提示策略在所有建模任务中都取得了最高观察分数。带有文档上传的RAG在需求生成中取得了最高观察分数,CoVe在模块定义建模中取得了最高组合观察性能,CoT在状态机建模中取得了最高平均评判者分数。模型比较也揭示了任务依赖的差异。在预定义的LLM-as-a-Judge标准下,ChatGPT在BDD和STM任务中获得了相对较高的评级。Gemini在几个调查的配置中获得了较高观察分数,特别是需求生成和状态机建模。DeepSeek在几种结构化提示条件下获得了较高的观察分数,这些策略提供显式推理或验证步骤。总体结果支持三个结论:首先,LLM辅助的SysML-v2生成对于早期建模是可行的,但生成的制品在用于工程工作流之前需要验证。其次,提示策略选择是在案例研究中与制品分数观察差异相关的重要实验因素。第三,评估必须适应制品类型:F1-score适用于需求和元素级比较,而结构和行为模型需要额外的语义评估。
讨论与结论
讨论部分指出,LLM辅助的SysML-v2制品生成是可行的,但强烈依赖于制品类型、提示策略和模型选择之间的相互作用。在案例研究中,最高的观察需求生成分数出现在平台特定的RAG Upload条件下,这一模式与任务特定文档支持需求识别和公式化一致;然而,该条件也依赖于平台特定的文档摄取和上下文处理,因此不能隔离检索增强的效果。对于模块定义建模,结构SysML-v2制品需要的不仅仅是识别正确的组件,还需要有意义的层次、关系和分解级别。因此,单独的F1-score不足以评估BDD质量。互补的LLM-as-a-Judge评估提供了更广泛的结构质量评估,但这些分数并未独立于多位MBSE专家进行校准,应解释为结构化比较指标而非工程有效性的最终度量。观察到的CoVe结果与验证导向的提示支持识别缺失元素和不一致结构的解释一致。状态机建模是最复杂的任务,因为需要关于状态、转换、触发器和条件的动态系统行为推理。CoT的强劲表现表明,当目标制品依赖于逻辑序列和动态系统行为时,逐步推理特别有用。模型比较进一步表明,行为建模对一般推理能力和提示公式敏感。总体而言,提示工程不应被视为次要的实现细节,而是直接影响制品质量的核心方法学因素。在案例研究中,没有单一提示策略在所有任务中都取得最高观察分数,因此观察结果表明提示选择应与预期的SysML-v2制品类型对齐,而更广泛的结论需要重复生成和额外的案例研究。研究结果证实,LLMs应被用作人在回路建模助手,而非自主模型生成器。它们可以支持早期建模并减少初始努力,但专家验证对于确保句法正确性、语义一致性和领域有效性仍是必需的。研究受限于单一工程案例研究和一组定义的LLMs和提示策略,F1-score评估依赖于所选参考制品,而LLM-as-a-Judge评估可能引入评估者偏差。
结论部分总结如下:本文提出并评估了一种用于MBSE中LLM辅助SysML-v2制品生成的提示策略驱动方法。该方法将生成过程结构化为输入准备、提示策略选择、LLM选择、制品生成、语法验证和质量评估。在牵引电池系统案例研究中,跨越三个代表性的早期MBSE任务进行了评估:需求生成、模块定义建模和状态机建模。研究因此在一个受控的实验设置中解决了文本、结构和行为制品的生成。对于RQ1,结果表明提示策略选择对生成的SysML-v2制品质量有实质性影响,提示不应被视为次要实现细节,而应作为LLM辅助MBSE中的核心方法学因素。观察到的效果是任务依赖的:上下文丰富的提示对需求生成最有益,面向验证的提示改进了结构建模,而面向推理的提示支持了行为建模。对于RQ2,评估的LLMs显示了任务依赖的性能差异。ChatGPT和Gemini在上下文丰富的需求生成中取得了高观察分数,而ChatGPT对结构和行为制品获得了特别高的比较评判者评级。DeepSeek从结构化提示中受益,特别是当包括推理或验证步骤时。Llama显示出更高的变异性,表明提示设计对于不太稳定的模型配置尤其重要。这些发现表明,模型选择应与预期制品类型和评估目标对齐,而非仅基于一般模型能力。对于RQ3,没有单一的提示-模型配置在所有调查的SysML-v2制品类型中取得最高观察分数。在牵引电池案例研究中,RAG Upload在需求生成中取得了最高观察分数,Chain-of-Verification在模块定义建模中取得了最高组合观察性能,Chain-of-Thought在状态机建模中取得了最高平均评判者分数。RAG Upload结果是平台特定的,因为该条件仅适用于ChatGPT和Gemini,并依赖于其各自平台的原生文档上传和上下文处理能力。由于每个配置仅生成一次,这些结果应被解释为案例研究的描述性发现,而非普遍最优的提示-模型配置。本研究的主要贡献是一个用于比较形式化SysML-v2制品生成中LLMs和提示策略的结构化评估框架。研究结果表明,LLMs可以通过加速初稿制品的创建并协助工程师将自然语言系统信息转化为形式化建模结构来支持早期建模。同时,结果表明生成的制品不能未经验证使用,语法检查、语义评估和专家评审对于确保正确性、一致性和领域有效性仍是必需的。本研究的结论应在实验范围内解释,评估基于一个工程案例研究、一组选定的LLMs和提示策略,以及为调查任务定义的参考制品。此外,F1-score评估依赖于所选基础事实,而LLM-as-a-Judge评估可能引入评估者偏差,并提供基于标准的比较指标而非工程有效性的最终度量。尽管如此,结果表明提示策略选择和模型选择在调查的案例研究中是相关的实验因素。LLMs应被理解为人在回路建模助手,而非自主MBSE工具。未来工作应将评估扩展到额外的工程领域、进一步的SysML-v2制品类型、工具集成的验证工作流和基于专家的评估,以增强泛化性和实际适用性。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号