
-
生物通官微
陪你抓住生命科技
跳动的脉搏
一种结合自然语言处理、本体论与机器学习的框架,用于石化行业职业安全信息学中的基于语言和知识的事故分析
《Scientific Reports》:A hybrid natural language processing-ontology and machine learning framework for linguistic and knowledge-driven accident analysis in petrochemical occupational safety informatics
【字体: 大 中 小 】 时间:2026年08月14日 来源:Scientific Reports 4.9
编辑推荐:
摘要传统上,职业事故报告的分析仍依赖手工操作,耗时且受专家判断的限制。本研究采用混合自然语言处理与机器学习框架,通过分析某石化企业15年来527份波斯语表述的事故记录,解决了上述问题。在经过针对该领域的特定预处理步骤后——包括字符标准化、领域专属停用词去除以及形态学词干提取——再
传统上,职业事故报告的分析仍依赖手工操作,耗时且受专家判断的限制。本研究采用混合自然语言处理与机器学习框架,通过分析某石化企业15年来527份波斯语表述的事故记录,解决了上述问题。在经过针对该领域的特定预处理步骤后——包括字符标准化、领域专属停用词去除以及形态学词干提取——再利用TF-IDF向量(200个特征,n-gram范围为1–2)并通过截断SVD算法(10个分量)进行降维处理。最终,通过结合领域知识的多标准序贯规则确定最优聚类数量:该规则考虑了领域最低要求(K≥4)、共识稳定性阈值(≥0.70)以及轮廓系数提升幅度(>5%)。经比较,K均值聚类法(K=4)为最优选择(轮廓系数为0.267,戴维斯-鲍尔丁指数为2.007,卡林斯基-哈拉巴兹指数为74.3;自举法计算的平均ARI值为0.880,95%置信区间为[0.546, 0.981],属于稳定状态)。借助这种融合文本特征与结构化特征的混合框架,我们从包含波斯语事故描述对应的TF-IDF向量以及非因果结构化描述信息(如事故类型、事故后果和误工天数)的特征矩阵中,识别出了四个语义上不同的事故类别:高处坠落事故群组(C1,共134起,占比26.0%,平均误工天数184.4天,相对参考值的IRR值为239.6,P值<0.001);下肢跌倒及身体碰撞事故群组(C0,共172起,占比33.4%,平均误工天数1.0天);滑倒事故群组(C2,共99起,占比19.2%,平均误工天数1.1天);以及地面湿滑/表面危险事故群组(C3,共110起,占比21.4%,平均误工天数0.8天)。通过官方事故原因标签进行的外部验证表明,这些事故群组与事故原因之间存在显著关联(克拉默V值为0.354,卡方值为78.5,样本量为209,P值<0.001),而且聚类模型并未使用任何事故原因相关的标签信息。不同事故群组的严重程度存在显著差异(克鲁斯卡尔-沃利斯H值为62.003,自由度为3,P值约为2.19×10?13,ε2值为0.115);但由于聚类特征中已包含事故后果和误工天数等信息,这类分析仅能用于描述各事故群组的特征,无法作为独立的验证手段。研究结果表明,无需预先标记的训练数据,通过将波斯语事故描述与非因果结构化事故描述相结合,即可发现有意义的职业事故类型。混合聚类结果与官方事故原因标签之间的关联,体现了所提出框架在基于证据的职业安全管理中的实用价值。事故描述对应的聚类模式与官方事故原因代码之间的差异,可能源于报告内容及编码方法的差异,而非真正的因果分类错误,因此有必要在后续前瞻性研究中进一步探究。