《Engineering Applications of Artificial Intelligence》:Method for identifying compliance of electrical construction safety equipment based on the collaboration of vision-language large models
编辑推荐:
摘要电气施工是一个高度复杂且动态的过程,风险往往源于人、机械和防护设备之间的相互作用。准确识别和评估潜在的合规风险需要广泛的语义知识和高级的视觉理解能力。为应对这一挑战,我们提出了一个用于识别电气施工中安全设备要求合规性的框架,分为四个阶段。首先,我们利用宏语义识别模块对电力
摘要
电气施工是一个高度复杂且动态的过程,风险往往源于人、机械和防护设备之间的相互作用。准确识别和评估潜在的合规风险需要广泛的语义知识和高级的视觉理解能力。为应对这一挑战,我们提出了一个用于识别电气施工中安全设备要求合规性的框架,分为四个阶段。首先,我们利用宏语义识别模块对电力施工作业环境进行场景理解和任务分类。其次,构建电力系统安全法规知识库,将特定操作场景动态映射到强制性安全设备配置要求。随后,我们引入基于“提示 - 检测”范式的开放词汇检测技术,以实现工人与复杂防护设备的精确关联和定位。最后,通过结合大语言模型的统一序列到序列 (Seq2Seq) 架构,对目标区域内安全设备的存在性、视觉属性和合规性进行细粒度的深入验证,以确定操作过程中是否存在风险。实验表明,该框架在识别复杂电力作业中的不安全设备使用方面优于传统模型,提供了一种高度可解释、零样本的通用风险检测方案。
引言
电气工作环境通常高度复杂、动态且极其危险。正确佩戴和使用个人防护装备 (PPE) (Xu et al., 2026; López et al., 2025) 是保障现场工人生命安全和防止事故的最后防线。根据数据 (Institute of Energy Security Strategy et al., 2026),2025 年 1 月至 8 月,中国发生了 40 起电力相关事故,造成 47 人死亡以及大量非致命性伤害。仅在 8 月份,就有六起此类事故造成六人死亡,事故数量和死亡人数较上年同期均呈上升趋势。深入调查发现,绝大多数事故的根本原因是工人不当使用安全装备和防护设备。例如,8 月 22 日,供电局一名工人在对被洪水淹没的公共变压器站进行绝缘检查和维修时,尽管尝试救援,仍因个人防护装备不足而触电身亡。为此,国家能源局发布了《2025 年电力安全监管重点任务》,明确要求消除重大及以上电力人身伤亡事故和较大及以上电力安全事故,努力减少事故数量和伤亡人数,确保电力系统安全稳定运行,保障电力可靠供应,确保工人不受危险侵害。
因此,传统的现场人工监督和基于视频抽查的模式 (Fang et al., 2018) 已无法满足现代电网大规模、高频次作业的安全监督需求。人力成本高、实时性差以及因操作员疲劳导致的漏报等问题日益突出。近年来,随着深度学习的兴起,基于计算机视觉的目标检测技术(特别是卷积神经网络 [CNN] 和 YOLO 系列算法)已被广泛应用于 PPE 合规性识别。尽管这些方法在一定程度上提高了检测效率,但在应用于实际电力施工作业时仍显示出明显的局限性。具体而言,传统模型受限于预定义的固定词汇表。面对不同作业任务(如停电维护、带电作业、攀登电杆)中高度多样化的 PPE 法规要求,这些模型被发现缺乏动态适应性,且需要昂贵的重新训练。虽然大多数现有安全方法只能进行粗粒度的存在性检测(例如是否佩戴安全带),但无法基于电力线作业的具体情境进行深入“认知推理”(例如安全带是否正确佩戴且下端固定,或绝缘手套的材料是否符合标准)。这使得它们在复杂环境(如严重遮挡或变化光照条件)中极易发生细粒度视觉特征丢失和误分类。
为克服上述跨模态语义对齐和基于场景推理的瓶颈,本文提出了一种电力施工背景下安全设备使用合规性识别的多模型协作框架。该框架摆脱了传统的静态检测范式,创新性地构建了一个集作业场景理解、安全要求自动推理和设备合规性细粒度验证于一体的闭环风险识别框架。我们首先开发了作业场景识别模块,然后利用大语言模型构建电力安全法规知识库,通过场景语义提取实现安全法规的动态映射。随后,引入基于 YOLO-World 架构的“提示 - 检测”范式作为前端视觉感知引擎,在不产生额外计算开销的情况下实现开放词汇术语的精确定位;最后,采用基于统一序列范式的大型基础模型,对感兴趣区域 (ROIs) 内的材料和佩戴合规性进行细粒度的深度验证。本文的主要贡献总结如下:
- 1.
现有研究局限于电力施工中单个设备的识别,难以满足不同类型作业中动态变化的安全保护要求。为了解决这些局限性,我们提出了一个集场景理解、安全法规推理和设备合规性验证于一体的电力施工合规性验证框架。该框架实现了从静态存在检测到动态跨模态认知推理的范式转变,并实现了联合决策。
- 2.
现场操作员的不安全行为、安全工器具的缺陷以及电力施工背景噪声的耦合相互作用,阻碍了底层风险特征的有效提取。为了解决这个问题,本文提出了一种跨空间层次和语义粒度的统一多模态感知方法,实现了在严重遮挡等工作条件下细微违规特征的跨层次解析和准确识别。
- 3.
大型模型在电力施工通用合规性识别中存在着风险,包括复杂环境干扰导致的目标关联错误和安全法规不匹配。为了解决这个问题,我们提出了一种基于序列到序列 (Seq2Seq) 架构的安全法规执行对齐机制。这将合规性验证转化为结构化提示约束下的特征锚定任务,从根本上抑制了误报违规。
- 4.
传统检测模型受限于预定义的训练类别,缺乏动态适应性,且训练成本高。本文引入了一种基于“提示 - 检测”架构的前端视觉感知引擎。通过与“电力安全知识库”集成,实现了任务无关、高效的零样本泛化,为监测未知风险场景提供了高度可扩展的解决方案。
章节摘要
电气作业安全设备识别
传统监测方法主要依赖人工现场检查或人工监控视频监视画面,存在漏检、实时性差和人力成本高等问题。随着深度学习技术的快速发展,基于计算机视觉的自动识别技术逐渐取代了传统方法,并成为国内外研究的主流焦点。
目前,此类研究
研究方法
本文提出了一种基于多模型协作的电力施工安全设备合规性识别框架。针对电力施工场景中作业类型多样和安全要求差异大的挑战,该框架实现了对作业场景、作业行为和安全设备合规性的联合识别和风险评估。该方法以视觉文本大语言模型为中心,构建了一个风险
数据集
由于目前缺乏专门针对复杂电力施工安全合规性的公开数据集,本研究从真实工业生产环境中构建了一个专用的多模态安全感知数据集。数据来源于部署在变电站建设和运营现场上的移动巡检终端和可穿戴摄像头设备。与传统基准数据集相比,该数据集保留了真实工作的复杂因素
结论
在本研究中,我们提出了一种面向复杂电力施工环境的场景感知多模态安全设备合规性验证框架。该框架构建了一个集作业场景理解、电力安全知识推理、开放词汇设备定位和细粒度多模态合规性验证于一体的协作推理链路。与传统固定词汇检测方法不同,该框架可以将识别出的作业场景动态映射到
CRediT 作者贡献声明
马福奇:写作 – 审阅与编辑,监督,项目管理,方法论。 林一鸣:写作 – 原稿,方法论。 贾荣:项目管理,方法论。 王博:构思。 阿卜杜拉·M·阿尔哈比:监督。
竞争利益声明
作者声明,他们没有已知的竞争财务利益或个人关系,可能会影响本文报告的工作。
致谢
这项工作得到了 国家自然科学基金 (项目编号:52407143) 的支持。
马福奇 | 林一鸣 | 贾荣 | 王博 | 阿卜杜拉·M·阿尔哈比
西安工业大学电气工程学院,中国陕西省西安市,710054