基于MFCC与深度音频嵌入的焊条电弧焊(SMAW)工艺参数弧声多输出分类(Multi-Output Classification of SMAW Process Parameters from Arc Sound Using MFCC and Deep Audio Embeddings)
《Signals》:Multi-Output Classification of SMAW Process Parameters from Arc Sound Using MFCC and Deep Audio Embeddings
编辑推荐:
摘要:手工电弧焊(Shielded Metal Arc Welding, SMAW)高度依赖操作者技能,导致焊缝质量波动及缺陷风险增加,因此需要可靠的SMAW监测方法,尤其在工艺可变性和环境噪声固有的手工操作环境中。本研究提出一种利用焊接电弧产生的空气传导声学
摘要:手工电弧焊(Shielded Metal Arc Welding, SMAW)高度依赖操作者技能,导致焊缝质量波动及缺陷风险增加,因此需要可靠的SMAW监测方法,尤其在工艺可变性和环境噪声固有的手工操作环境中。本研究提出一种利用焊接电弧产生的空气传导声学信号对SMAW工艺参数进行分类的监测方法。在不同厚度(3、6和12 mm)碳钢板上,采用E6010、E6011、E6013和E7018焊条,于交流(Alternating Current, AC)和直流(Direct Current, DC)配置下进行焊接实验;实时记录声学信号,提取梅尔频率倒谱系数(Mel-Frequency Cepstral Coefficients, MFCCs)及预训练VGGish和YAMNet模型输出的深度音频嵌入(Deep Audio Embeddings)作为人工神经网络分类器的输入,对焊接工艺参数进行多输出分类(Multi-Output Classification)。模型性能通过单目标指标(准确率Accuracy和宏F1值Macro F1-score)及联合多输出指标(完全匹配率Exact Match和汉明准确率Hamming Accuracy)评估。基于MFCC的模型显著优于基于嵌入的方法,最高达到94.51%的完全匹配率(Exact Match)和97.88%的汉明准确率(Hamming Accuracy),且计算成本更低。结果表明利用弧声进行SMAW监测的可行性,证实频谱特征是基于声学的焊接过程监测的有效解决方案,并为未来焊缝质量监测系统奠定基础。
论文解读:基于MFCC与深度音频嵌入的焊条电弧焊工艺参数弧声多输出分类研究
手工金属弧焊(Shielded Metal Arc Welding, SMAW)因设备简单、便携性强而在建筑、维修及制造业中广泛应用,尤其拉丁美洲地区。根据美国焊接学会(American Welding Society, AWS)标准,SMAW焊缝质量受母材厚度、焊接电流类型及焊条牌号等工艺参数影响显著,参数选取或控制不当易引发未熔合、气孔等不连续缺陷。现有焊接过程监测技术主要包括电信号监测、基于视觉的传感和声发射传感。电信号可反映电弧稳定性与热输入,但无法直接表征物理现象;视觉系统可观测熔池几何形状,却需复杂图像处理算法及受控光照条件;声发射及声学传感因被动、非侵入、低成本且与电弧行为、熔滴过渡及焊缝质量直接相关而受到关注。已有声学监测多聚焦单一任务(如熔深状态、过程稳定性或缺陷分析独立进行),且传统方法依赖专家知识提取时域/频域手工特征(如快速傅里叶变换FFT、小波、梅尔频率倒谱系数Mel-Frequency Cepstral Coefficients, MFCC),虽有一定效果但未必能完全捕捉手工SMAW中非平稳复杂声学模式;近期深度学习发展的深度音频嵌入(Deep Audio Embeddings)(如VGGish、YAMNet预训练模型)可从原始音频提取高层表征,但在焊接工艺参数识别中与MFCC的比较及实时实施可行性尚缺乏充分研究。因此,研究人员将SMAW声学监测构建为多输出分类(Multi-Output Classification)问题,即同时从弧声推断板厚、焊条类型和电流类型,并在统一框架下比较手工频谱特征与通用深度音频嵌入的性能、计算成本及适用性,以期为现场手工SMAW监测提供实用依据。该论文发表于《Signals》。
研究人员采用的主要关键技术方法如下:构建SMAW焊接实验平台,使用Xiris WeldMIC麦克风(<0.8 m距焊道)采集真实车间环境下的电弧空气声信号,373组连续焊接会话按板厚(3/6/12 mm)、焊条类型(E6010/E6011/E6013/E7018)及电流类型(AC/DC,其中E6010与E7018仅DC,E6011与E6013兼容AC/DC)分层并按会话级划分为训练/验证/测试集以防止数据泄漏;原始16 kHz单声道音频经固定时长窗口(基线5 s,50%重叠)分段;分别提取三种声学表征——MFCC(40阶基系数+一阶Δ+二阶ΔΔ,帧级统计均值方差聚合为240维向量)、VGGish嵌入(128维/0.96 s窗,时序平均池化)及YAMNet嵌入(1024维/1 s窗,时序平均池化);采用三种分类器架构——前馈神经网络(Feedforward NN)、X-Vector(含统计池化的时延神经网络Time Delay Neural Network, TDNN)及ECAPA-TDNN(强调通道注意力与改进特征聚合的TDNN变体),均具共享骨干与三个任务专属输出头(分别对应三目标类别数);通过分层组感知k折交叉验证(k=10)训练集成模型,推理时集成平均对数几率取最大;以单目标指标(各类准确率Accuracy、宏F1值Macro F1-score)与联合指标(完全匹配率Exact Match即子集准确率Subset Accuracy、汉明准确率Hamming Accuracy)并结合训练/推理时间评估。
研究结果
3.1 单目标指标(Individual Metrics)
通过准确率及宏F1值随分段时长(1~50 s)变化评估发现,MFCC模型在所有分段时长下对各目标(板厚、焊条类型、电流类型)均保持最高性能,5 s基线时MFCC+ECAPA-TDNN最优;VGGish与YAMNet整体较低,随分段增长有所提升但仍低于MFCC;电流类型(AC/DC)分类最容易接近完美,板厚居中,焊条类型最难(尤其E6010与E6011互混)。表明MFCC比深度嵌入提供更稳定、判别性的手工SMAW声学特征。
3.1.3 混淆矩阵(Confusion Matrix)
最佳模型(MFCC+ECAPA-TDNN, 5 s)测试集归一化混淆矩阵显示:板厚各类对角占优但3 mm与6 mm偶互混;焊条类型E6010与E6011混淆最多(相似纤维素药皮及电弧特性),E6013与E7018分离好;电流类型AC/DC近完美分离,印证物理差异(AC具周期熄弧重燃致特征性声学模式)。
3.2 时域信号检查(Time-Domain Signal Inspection)
典型200 ms原始波形显示:同焊条同板厚下AC较DC呈更明显低频调幅与瞬态;同电流同板厚下E6010(纤维素型)波形不规则脉冲密集,E7018(低氢型)较平滑稳定,说明部分工况可在时域初判但不足以鲁棒分类,需特征提取。
3.3 特征空间分析(Feature Space Analysis)
t-SNE降维可视化及轮廓系数、Davies-Bouldin指数显示MFCC特征按类别形成紧凑且分离良好的簇(尤电流类型),VGGish与YAMNet嵌入类内分散大、类间重叠多;即使换用线性或浅层非线性分类器MFCC仍优于嵌入,性能差距随ECAPA-TDNN增大,证明MFCC优势源于表征本身适配焊接域而非分类器复杂度。
3.4 联合指标(Joint Metrics)
在基线配置下,MFCC+ECAPA-TDNN达最高完全匹配率94.51%、汉明准确率97.88%;VGGish最高分别为69.30%、85.31%,YAMNet为65.19%、81.63%,MFCC较最佳嵌入法高出逾25个百分点完全匹配率;同类征下不同分类器架构差异小(如MFCC各架构Exact Match相差仅约3.6%),说明声学表征选择比分类器架构影响更大。
3.4.2 分层联合性能分析(Stratified Joint Performance Analysis)
按仅DC会话(E6010/E7018)与双模式会话(E6011/E6013含AC/DC)分层评估,MFCC在各子组均最优(仅DC组Exact Match 95.71%,双模式组93.91%);嵌入法在仅DC组性能明显下降(降约20个百分点),表明其对E6010/E7018特定弧声捕捉能力弱。
3.4.3 会话级聚合(Session-Level Aggregation)
对同一焊接会话内重叠分段预测结果多数投票后,MFCC+ECAPA-TDNN会话级完全匹配率与汉明准确率均达100%(段级分别为94.51%与97.88%),说明段级误判多为暂态局部性,可通过会话级时间一致性消除,适合按焊道决策的实际监测场景。
3.5 计算性能(Computational Performance)
训练时间随分段缩短(样本量剧增)及集成折数k增大而上升;基线(5 s, k=10)MFCC模型训练时间最短,YAMNet最长;推理延迟所有配置均低(MFCC前馈网络约10 ms/段,X-Vector约25 ms/段),满足近实时监测;嵌入法尤其YAMNet引入额外计算开销。MFCC在性能与效率上均具更优权衡。
讨论与结论翻译
讨论指出:电流类型易分归因于AC特有周期熄弧重燃声特征;焊条类型最难系药皮成分类似致声学差异细微;板厚混淆多发生于相邻厚度,受热输入及熔池动力学等次级效应影响。车间背景含稳态通风噪及非稳态邻位打磨锤击噪,未做显式滤波而靠会话划分防泄漏,MFCC对环境变量抑制较好,通用嵌入因域失配(domain mismatch)对噪声敏感。嵌入法逊色主因为AudioSet预训练域与SMAW弧声统计特性不符且未微调(fine-tune),MFCC借Mel尺度显式保留弧调制及AC振荡的低频谱包络信息;若未来有焊接域预训练或足量微调数据嵌入法或可追平甚至超越。研究局限含固定麦克风位、单操作者、未系统量化信噪比(SNR)、未涵盖缺陷检测及未用多任务损失平衡或跨任务注意力机制,建议后续拓展多操作者/跨车间、受控噪化实验、开发焊接专用音频嵌入模型及融合电信号与视觉的多模态监测。
结论部分翻译:本研究评估了利用焊接过程中产生的空气传导弧声对SMAW工艺参数进行多输出分类的可行性。在统一实验框架下比较了三种声学表征方法(MFCC、VGGish和YAMNet)与三种人工神经网络(ANN)、X-Vector及ECAPA-TDNN分类器,以同时预测板厚、焊条类型和电流类型。结果表明MFCC表征在各分类及计算性能指标上均持续优于深度音频嵌入,其中MFCC+ECAPA-TDNN配置取得最高性能,段级完全匹配率(Exact Match)达94.51%、汉明准确率(Hamming Accuracy)达97.88%。除较最佳嵌入法高出逾25个百分点的完全匹配率分类优势外,MFCC基模型还表现出更短的训练与推理时间。即便在较短分析窗口下亦维持强分类性能,支持SMAW应用低延迟声学监测之可行性。分析显示MFCC之优越性主要归因于其对手工SMAW特有声学现象的适配性而非深度音频嵌入之固有局限;特征空间可视化揭示MFCC表征在分类器训练前即展现显著更佳可分性,而VGGish与YAMNet呈现较大类内散布与类间交叠,符合AudioSet预训练与SMAW弧声间表征域失配。于所评估目标中,电流类型(AC/DC)在所有特征表征下均具最高分类可分离性,与交变电流操作伴有的特征性振荡声学行为一致。会话级聚合分析进一步证实焊接过程中具强时间一致性,多数投票推断大幅提升所有特征表征的预测稳定性。综上,结果支持在真实车间环境下基于声学的SMAW工艺条件多输出表征监测具可行性;本研究应被理解为过程监测框架而非直接焊缝不连续(缺陷)检测系统。未来工作应聚焦于开发焊接专用音频嵌入模型、于更广泛操作变异(多操作者及异质车间条件)下评估并扩展所提框架至面向多模态及缺陷事件感知的焊接监测系统。