《Sensors》:FBENet: A Highway Road Debris Detection Network Based on Frequency-Aware Bidirectional Feature Fusion and Efficient Attention Enhancement
编辑推荐:
高速公路路障通常尺寸较小、形状不规则、纹理较弱,且与复杂背景对比度较低,同时真实样本有限制约了模型的泛化能力。本研究通过将三类具有代表性的路障类别——砖块、纸箱和岩石——合成到高速公路场景中,构建了Synthetic-Debris数据集,以支持小目标与低对比度
高速公路路障通常尺寸较小、形状不规则、纹理较弱,且与复杂背景对比度较低,同时真实样本有限制约了模型的泛化能力。本研究通过将三类具有代表性的路障类别——砖块、纸箱和岩石——合成到高速公路场景中,构建了Synthetic-Debris数据集,以支持小目标与低对比度检测。FBENet(频率感知双向特征融合与高效注意力增强网络)基于YOLO11n开发,采用面向任务、阶段耦合的设计:在两处自顶向下跨尺度融合阶段嵌入FreqFusion(频率感知特征融合),以在BiFPN(双向特征金字塔网络)执行可学习双向聚合之前保留边界细节并提升跨分辨率一致性,同时仅在检测前的最终高分辨率P3特征上应用EMA(高效多尺度注意力)。其贡献在于对既有操作的阶段特异性组织,而非提出新的基础模块。在Synthetic-Debris数据集上,FBENet实现了mAP@0.5为0.862、mAP@0.5:0.95为0.664、F1分数为0.811,参数量为2.43 M,计算量为6.8 GFLOPs。在固定的合成到真实划分中,FBENet在mAP@0.5和mAP@0.5:0.95上分别超过YOLO11n达5.0和2.8个百分点。五折交叉验证显示平均AP有所提升且整体AP方差更低,但迁移行为仍呈现类别依赖性。运行时间评估表明,FBENet相比YOLO11n引入了额外延迟。在PyTorch FP32下,网络推理延迟从8.07 ms增加至12.79 ms,端到端吞吐量从79.15 FPS降至53.97 FPS。在TensorRT FP16下,FBENet达到126.59 FPS,而YOLO11n为137.64 FPS。这些结果表明,FBENet以提高检测精度为代价增加了额外运行时间,体现的是精度-延迟权衡而非推理效率的提升。总体而言,频率感知双向融合与选择性高分辨率注意力在有限真实数据条件下对提升高速公路路障检测具有实用价值。
论文解读:面向高速公路路障检测的频率感知双向特征融合与高效注意力增强网络
一、研究背景与问题提出
随着智能交通系统与自动驾驶技术的快速发展,可靠的道路环境感知已成为安全决策的关键支撑。在高速公路场景中,车辆行驶速度快、交通密度大、制动距离长,路面出现的岩石、纸箱、砖块等路障可能引发紧急制动、突然变道、车辆失稳甚至二次碰撞等严重后果。对于自动驾驶车辆而言,对这些偶发但高危目标的延迟检测或漏检将直接影响障碍物规避与轨迹规划能力。然而,与车辆、行人、交通标志等常规目标相比,高速公路路障的检测面临独特挑战:目标尺寸小、形状不规则、外观变化大、纹理弱且对比度低。在远距离成像条件下,目标仅占据少量像素,边缘与轮廓信息不完整,容易被阴影、裂缝、污渍、车道磨损和非均匀路面混淆。同时,高速行驶对响应时间提出严格要求,模型需在精度、鲁棒性、效率与部署可行性之间取得平衡。此外,路障事件具有偶发性且采集危险,真实样本在规模、类别平衡、视角、光照、天气、遮挡和背景多样性方面均存在显著局限,容易导致过拟合并削弱泛化能力。
已有研究虽发展了多种针对路障与遗弃物检测的专用模型,如基于残差网络与选择性搜索的车辆抛掷物识别、结合轻量骨干网络与知识蒸馏的高速公路碎片检测、CIEFRNet的情境建模与空间金字塔池化、基于注意力机制的双向特征金字塔等,但现有方法多将数据稀缺、特征表示与真实场景迁移等关键问题割裂考察,鲜有研究系统探索频率感知细节保持、双向跨尺度融合与选择性空间注意力三者协同用于小尺寸、低对比度路障检测的可行性。合成数据可在一定程度上缓解样本稀缺与标注成本问题,已有研究证实目标尺度、视角、背景构成与环境参数显著影响合成到真实的迁移效果,但光照、纹理、边界、成像噪声与场景真实感的差异可能导致仅用合成数据训练的模型学习到领域特定伪影而非可迁移的路障特征。因此,当前的核心问题并非缺乏单一增强策略,而是缺乏将数据稀缺、特征表示与真实场景迁移相联系的协同研究。
二、研究内容与主要发现
针对上述问题,研究人员构建了Synthetic-Debris数据集,将砖块、纸箱和岩石三类典型低频但高风险路障合成至高速公路背景中,经过直方图匹配、高斯边界平滑、亮度与对比度扰动、人工筛选与数据增强,最终获得8433张合成图像。在此基础上,以YOLO11n为基线开发了FBENet(频率感知双向特征融合与高效注意力增强网络),其设计原则是将不同特征增强机制分配至与高速公路路障检测最相关的阶段:在颈部网络的两处自顶向下跨尺度融合节点引入FreqFusion以恢复弱边界细节并降低语义上采样过程中的特征不一致性;BiFPN随后对频率增强特征执行可学习的加权双向聚合;颈部融合完成后,仅在P3检测头前插入EMA以精炼最终高分辨率特征表示。在Synthetic-Debris数据集上,FBENet取得了mAP@0.5为0.862、mAP@0.5:0.95为0.664、F1分数为0.811的检测精度,参数量为2.43 M,计算量为6.8 GFLOPs。在固定合成到真实划分中,FBENet在mAP@0.5和mAP@0.5:0.95上分别超过YOLO11n达5.0和2.8个百分点;五折交叉验证显示整体AP略有提升且方差降低,但迁移增益呈类别依赖性。运行时间评估表明,FBENet在PyTorch FP32下网络推理延迟从8.07 ms增至12.79 ms,端到端吞吐量从79.15 FPS降至53.97 FPS;在TensorRT FP16下达到126.59 FPS,仍低于YOLO11n的137.64 FPS。该论文发表于《Sensors》。
三、主要关键技术方法
研究人员主要采用了以下关键技术方法:其一,合成数据构建方法,以真实高速公路图像为背景,通过缩放、重定位、直方图匹配、高斯边界平滑与亮度对比度扰动实现前景目标的逼真合成,并经人工筛选保证质量;其二,频率感知特征融合模块(FreqFusion),利用空间自适应低通滤波器(ALPF)与自适应高通滤波器(AHPF)分别平滑高层语义特征中的背景高频干扰和恢复低层特征中下采样丢失的高频细节,并通过偏移生成器动态生成局部相似性掩码引导滤波过程;其三,双向特征金字塔网络(BiFPN),通过可学习权重对各层输入进行加权融合,实现自上而下语义传递与自下而上空间细节反馈的双向信息传播;其四,高效多尺度注意力模块(EMA),沿通道维度将特征分组后通过1×1分支编码方向位置信息与3×3分支提取局部纹理特征,经跨空间交互生成像素级空间注意力图。真实路障数据集包含110张图像和329个标注实例,来源于Google和百度等公共图像平台的关键词检索。
四、实验结果与分析
模块级消融实验:在YOLO11n基线(精度0.851、召回率0.719、F1为0.779、mAP@0.5为0.834、mAP@0.5:0.95为0.637)上,单独引入FreqFusion-BiFPN使召回率提升至0.803、F1提升至0.813、mAP@0.5提升至0.858,表明增强的多尺度特征融合改善了小尺寸与低对比度路障的特征表示,减少了漏检;单独使用EMA使召回率与F1分别提升至0.772与0.803、mAP@0.5达0.855,表明EMA强化了对显著路障区域的响应并抑制了背景干扰;两者联合获得最高mAP@0.5(0.862)与mAP@0.5:0.95(0.664),但F1略降至0.811,表明完整模型在召回率与精度之间取得权衡而非所有指标同步提升。
FreqFusion-BiFPN组件级消融:单独应用FreqFusion或BiFPN分别将mAP@0.5从0.834提升至0.849和0.840,联合集成达到峰值性能(召回率0.803、F1为0.813、mAP@0.5为0.858),证明两个模块通过增强局部频率感知与跨尺度特征聚合提供互补增益。
类别不平衡与类别感知采样:在原始采样策略下,FBENet在全部三个类别上一致优于YOLO11n,少数类砖块的AP@0.5从0.440提升至0.516;采用类别感知采样后,FBENet进一步将砖块AP@0.5提升至0.530、AR@100提升至0.497,同时总体宏平均AP@0.5达0.725,仍显著高于YOLO11n的0.689,表明FBENet的优势不依赖于原始类别分布。
运行时间与部署性能:在PyTorch FP32下,FBENet相较YOLO11n将网络推理延迟从8.07 ms增至12.79 ms(+58.5%),端到端吞吐量从79.15 FPS降至53.97 FPS(?31.8%);在TensorRT FP16优化下,FBENet达到126.59 FPS,仍低于YOLO11n的137.64 FPS,但其mAP@0.5从0.834提升至0.862。
注意力机制对比与放置消融:在P3位置将EMA替换为ECA(高效通道注意力)与SimAM(无参数注意力模块)时,mAP@0.5分别为0.841与0.826,均低于EMA的0.855;EMA放置在P3、P4、P5、P3+P4、P3+P4+P5五种策略中,仅在P3放置取得最高mAP@0.5(0.855)与mAP@0.5:0.95(0.653),扩展至更多层级反而导致性能下降。
不同模型对比实验:FBENet在Synthetic-Debris数据集上取得mAP@0.5(0.862)、mAP@0.5:0.95(0.664)与F1分数(0.811)三项最优,相比YOLOv8n、YOLOv10n、YOLO11n和YOLO12n分别将mAP@0.5提升3.7、3.3、2.8和2.5个百分点;相比CIEFRNet,mAP@0.5和F1分别提升3.4和2.3个百分点,同时参数量大幅减少。P-R曲线分析表明,FBENet的曲线更靠近坐标系右上角,在中高召回率区间下降更为平缓,实现了更稳定的精度-召回率权衡。
可视化结果分析:在黎明、白天、黄昏和夜间四种光照条件下,FBENet相比YOLO11n表现出更强的类别判别能力与置信度校准性能。在白天场景中,YOLO11n将砖块误判为纸箱且置信度仅0.34,FBENet则正确分类且置信度达0.84;在黄昏场景中,YOLO11n对左侧纸箱目标产生重叠检测框,FBENet仅输出单一边界框,表明改进的特征提取与融合机制增强了目标区域响应的集中性。
合成到真实迁移评估:固定90/20划分中,FBENet将mAP@0.5从0.598提升至0.648、mAP@0.5:0.95从0.259提升至0.287;五折交叉验证中,FBENet整体AP@0.5为0.420±0.077、AP@0.5:0.95为0.226±0.049,略高于YOLO11n的0.412±0.089与0.213±0.055,整体AP方差从0.0080降至0.0059(AP@0.5)和从0.0030降至0.0024(AP@0.5:0.95);类别层面砖块改善最显著(AP@0.5从0.414提升至0.465),但岩石的AP@0.5略低。固定验证集上的类别分析显示,FBENet将整体漏检率从31.3%降至23.4%,召回率从68.8%提升至76.6%,归一化误报率从15.6%降至7.8%。
五、讨论与结论
讨论部分指出,FBENet的技术贡献在于对既有模块的面向任务的组织方式而非提出新的基础算子。消融实验表明FreqFusion-BiFPN主要提升对小尺寸和低对比度路障的敏感性,EMA则将精度-召回率平衡推向更高精度与最优AP精度。合成到真实实验提供了初步证据表明所提出的特征通路可迁移至真实域,但类别间效果不均匀,且真实数据集仅含110张图像与329个标注实例,局限性与精度-召回率权衡的阈值依赖性需在更大规模数据上进一步验证。研究结论可概括为:其一,FBENet通过FreqFusion、BiFPN与EMA的阶段特异性组织,实现了对小尺寸、低对比度路障的有效检测;其二,FBENet在Synthetic-Debris上取得最优检测精度但推理速度低于YOLO11n,体现了精度-延迟权衡而非推理效率提升;其三,合成到真实迁移提供了初步证据表明平均迁移性能改善,但由于收益随类别变化且真实数据有限,尚不能得出广泛真实性鲁棒性的结论,未来需扩展真实场景数据与路障类别、缩小域差距并在代表性嵌入式硬件与完整高速公路感知系统上评估模型性能。