面向施工安全管理中知识检索与安全措施生成的大语言模型开发与表征

《KSCE Journal of Civil Engineering》:Development and Characterization of Large Language Models for Knowledge Retrieval and Safety Measure Generation in Construction Safety Management

【字体: 时间:2026年09月09日 来源:KSCE Journal of Civil Engineering 2.4

编辑推荐:

  本研究调查了不同大语言模型(Large Language Model,LLM)微调(fine-tuning)策略在施工安全决策过程中两类LLM系统可直接支持的代表性认知功能上的表现:(1)检索相关法规安全指南;(2)生成定制化事故预防措施。研究人员基于来自安全

  
本研究调查了不同大语言模型(Large Language Model,LLM)微调(fine-tuning)策略在施工安全决策过程中两类LLM系统可直接支持的代表性认知功能上的表现:(1)检索相关法规安全指南;(2)生成定制化事故预防措施。研究人员基于来自安全指南文档的11,172条条目数据集,开发了三种领域适配LLM配置——基于LoRA(Low-Rank Adaptation)的LM1、全参数(full-parameter)的LM2、层交换(layer-swapped)的LM3),并与检索增强生成(Retrieval-Augmented Generation,RAG)系统及GPT-4进行比较。性能评估采用通用基准(Open Ko-LLM Leaderboard、多选题准确率)与任务特定相似度指标(余弦相似度、BLEU、ROUGE)。结果表明,RAG系统在知识检索准确率上最高(70.83%),而LM3生成出语境相关性与词汇对齐程度最高的预防措施。通过将评估置于这两类认知功能中,研究对施工安全领域LLM微调策略作出系统比较,并为不同方法如何在安全工作流中互补提供实证见解。
研究背景方面,施工安全管理对专业人员、行政与文档要求持续上升,法规与协议日趋复杂,但合格安全专业人员短缺,使安全管理人员在法规合规、危险辨识与风险缓释上的认知负担加重。既有LLM研究多关注广域应用或问答式任务,少有针对安全工作流中“检索法规指南”和“生成针对性预防措施”这类具体认知任务的系统比较,因此研究人员开展本研究,以填补领域适配LLM策略在安全决策支持任务上的评价空白。
研究人员以beomi/Llama-3-KoEn-8B-Instruct-preview为基模型(base model),用韩国职业安全健康局(KOSHA)86部施工安全指南构建11,172条训练数据,包含5,114组问答(QA)对与6,058条原始文本条目,分别训练LM1(LoRA微调)、LM2(全参数微调)、LM3(层交换微调:将LM2第1、31、32层恢复为基模型权重,保留第2至30层领域适配参数),并以向量库RAG系统与GPT-4作对照。论文发表于《KSCE Journal of Civil Engineering》。
关键技术方法上,数据来自KOSHA指南与韩国雇佣劳动部(MOEL)及KOSHA事故案例;采用监督微调(Supervised Fine-Tuning,SFT)重组QA与原始文本为system-user-assistant结构;LM1用LoRA低秩适配器冻结主干,LM2更新全部权重,LM3依层冗余文献启发交换边界层;评估用Open Ko-LLM Leaderboard测通用语言,120道多选测知识检索,42个事故案例用余弦相似度、BLEU、ROUGE及六位专家李克特量表评措辞合理性、可实施性与全面性。
研究结果如下。
通用语言基准结果:经Open Ko-LLM Leaderboard评估,LM1平均49.06、LM2为48.67、LM3为48.74,三者在113个模型中排23—25名;说明共享基模型与同语料下,三种适配策略未造成通用语言能力显著分化,LM3层交换后聚合分数接近,符合边界层保通用语言、中间层保领域知识的解释。
施工安全知识检索性能评估:在120项多选题中,RAG准确率70.83%(85题),GPT-4为49.17%(59题),LM1为37.5%(45题),LM2为35.8%(43题),LM3为34.17%(41题)。结论是检索增强在数值标准与程序性监管知识检索上最优,因推理时可取回向量化原文段落并溯源,微调模型无查询时直连原文机制。
预防措施生成性能评估:用BERT与OpenAI嵌入算余弦相似度,LM3为0.8012与0.6243,GPT-4为0.8070与0.6312;BLEU中LM3最高0.2676,ROUGE-1/2/L中LM3为0.1035、0.0104、0.0728亦最高。响应多样性热图中RAG与GPT-4平均相似度0.8712、0.8182,倾向通用建议;LM1—LM3更接近参考响应模式,能按坠落、坍塌、机械倾覆等情境差异化生成。专家评估里LM1全面性3.55、具体性与可实施性3.30,LM3合理性3.50;说明自动指标与专家判断互补,无单一模型横扫三维。
讨论部分总结:研究发现任务—架构匹配原则,即RAG适合作者化、可溯源法规检索,领域微调模型更适合起草情境化措施;LM3在语义与词汇对齐及合理性上占优,LM1在广度与现场细节占优,故可构人环(human-in-the-loop)混合架构:RAG取权威段落,领域模型转写为场景草案,安全经理核验后下发。局限为单基模型、单语种单监管域、无内部验证集与早停、专家面板小,结论属配置级而非因果隔离。
结论部分翻译:本研究评估了LLM应对施工安全管理中知识检索与预防措施生成挑战的潜力。结果显示RAG系统在检索精确可靠施工安全信息上达70.83%准确率;LM3在生成情境特定预防措施上表现突出,可给出应对独特安全场景的细致定制响应。这些互补系统说明AI如何在高风险施工安全任务中补充人类专长。研究通过对安全指南检索与定制措施生成两类任务的目标化评估,推进了LLM在施工安全管理的应用;相较既往通用模型研究,本文探索LM1—LM3与RAG专用配置,并凭领域数据集实现现实场景基准测试。研究指明RAG擅检索、LM3擅生成,二者可互补。虽存在绝对性能不足、超参固定、任务仅限两类、未做现场验证等限制,但结果为按任务选微调策略与设计LLM安全支撑系统提供依据,未来应做超参优化、近失(near-miss)检测、因果分析、现场数据与专家深度参与。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号