基于声源发现与对比分离的弱监督环境声源归因声源分离

《Pattern Recognition Letters》:Weakly Supervised Sound Source Separation For Environmental Sound Source Attribution via Source Discovery and Contrastive Separation

【字体: 大 中 小 】 时间:2026年09月25日 来源:Pattern Recognition Letters 3.5

编辑推荐:

   •在无需孤立标注的条件下进行弱监督时频定位,用于声源归因。•声源发现与对比学习提升了分离性能。•面向时频定位与分离的弱监督频谱数据集。引言环境声音管理是环境保护的一个重要方面。随着社会的发展,其挑战已从简单的噪声水平控制,转变为更复杂的综合环境声音管理。过高的噪声水平不仅令居

  
  • •
    在无需孤立标注的条件下进行弱监督时频定位,用于声源归因。
  • •
    声源发现与对比学习提升了分离性能。
  • •
    面向时频定位与分离的弱监督频谱数据集。

引言

环境声音管理是环境保护的一个重要方面。随着社会的发展,其挑战已从简单的噪声水平控制,转变为更复杂的综合环境声音管理。过高的噪声水平不仅令居民感到烦恼,还会带来健康风险,尤其是对心脏和大脑健康的危害 [1]。环保主管机构通常采取城市分区隔离噪声、增强城市绿化以吸收声音 [2],以及部署声级监测网络以监管超标声源等措施。然而,随着城市声源日益多样化,特别是绿化引入了大量自然声音,仅关注声级的传统方法面临新的需求:我们如何判断超标是由自然声源还是工业声源造成,从而在环境声源管理归因中建立可靠的基准?
为应对这一问题,不仅需要识别混合环境声音中存在的声源,还需要将各个声源分离出来,以便其能量能够支撑归因。声源分离的广泛应用证明了这条路径的可行性。它通常用于分离音乐中的伴奏与人声 [3],在环境保护中则用于分离物种声音以评估种群与分布 [4]。因此,从混合声音中分离出单个声源并测量其能量,是环境声源归因的一种可行方法。
目前大多数声源分离方法依赖全监督学习。代表性方法包括:利用一维卷积提取时间特征,再通过 U-Net 进行分离,最后通过转置卷积重建波形的时域网络 [5];以及通过短时傅里叶变换对音频进行变换,用序列模型预测掩码,再通过逆变换恢复声源的时频流水线 [6]。在这两种情况下,都需要孤立的声源作为 ground truth 来进行全监督训练。
然而,获取孤立声源标注非常耗时。因此在归因场景中,弱监督方法有助于数据集的构建。不过,现有的弱监督分离方法要么基于时间特征上的 U-Net,要么基于频谱图上的时频掩码,而且二者通常同时输出固定数量的声源,这在混合声音中活跃声源数量变化时显得不够灵活。为解决该问题,我们提出一种弱监督时频定位框架,该框架整合声源发现与弱监督对比学习(WSCL),以支撑下游的区域式分离。每个混合声音被视为一幅对数梅尔频谱图图像;在录音级多标签监督下,通过多示例学习与迭代细化定位发声区域,而声源发现与 WSCL 则在嵌入空间中扩展类内监督并解耦各类。在推理时,预测出的时频框驱动频谱掩蔽与波形重建,用于 SI-SDR 评估,而无需预先固定声源数量。归因是研究动机,而非监管性主张。
本工作的主要贡献有三点:
  • •
    我们将环境声源归因形式化为区域式分离问题,并提出一种弱监督时频定位框架,从而在构建面向分离的数据集时缓解了对昂贵孤立声源标注的依赖。
  • •
    我们引入了嵌入空间声源发现(而非基于 IoU 的种子挖掘)以及 WSCL,通过扩展类内实例监督与嵌入空间中的类解耦,在多源共存的情况下提升由弱监督定位驱动的分离性能。
  • •
    我们构建了一个面向时频定位与分离评估的弱监督环境频谱数据集,并采用基于 SI-SDR 的协议来评估分离质量,如 4.1 节所述。
本文其余部分组织如下。第 2 节回顾了基于传统方法和深度学习的分离、弱监督分离、频谱图时频定位,以及计算机视觉中弱监督检测的相关工作。第 3 节阐述了所提出的框架,包括 MIL、迭代细化、特征增强、声源发现以及 WSCL。如第 4 节所述,我们在 4.1 节介绍数据集,将 SI-SDR 与弱监督分离器及频谱定位检测器进行对比,报告部署成本与推理延迟,并开展消融研究。第 5 节总结主要发现并提出未来工作方向。

章节摘要

相关工作

在介绍所提框架之前,本节回顾了传统与深度全监督分离、弱监督分离以及频谱图时频定位。此外,我们还将 MIL 与 Argmax-seed 流水线与计算机视觉中的弱监督目标检测进行对照定位。传统方法以及深度全监督分离器往往难以处理复杂的环境混合声音,或者需要孤立声源标注。弱监督与半监督方法降低了标注成本,然而

方法

本工作针对环境声源归因问题。输入是被视为二维图像的对数梅尔频谱图,监督仅限于录音级多标签标记,用于指示混合声音中出现哪些声源类别,训练期间不提供区域级框。如图 1 所示,该框架遵循两阶段检测流水线,由四个耦合模块组成:多示例学习(MIL)、时频框迭代细化、特征

实验

本节评估所提出的用于环境声源归因的弱监督时频定位框架。我们引入了专用的频谱数据集,将 SI-SDR 与弱监督及频谱定位基线进行对比,并与 SuDORMRF [9] 对比部署成本,在 4.3 节中详细说明推理延迟性能分析,并对声源发现、RoI DropBlock 以及三条特征增强路径进行消融研究。

结论

我们提出了一个弱监督时频定位框架,将声源发现与 WSCL 和区域式分离相结合,而无需固定活跃声源的数量。在录音级标签条件下,相比 SuDORMRF 以及对齐的弱监督分离器,其实现了 SI-SDR 的相对提升。与 SuDORMRF 相比,它仅在检测器前向时间上占优,而在端到端监测延迟上落后。
其局限性如下。绝对 SI-SDR 仍低于 2 dB,因此残余干扰

CRediT 作者贡献声明

胡睿:撰写——原稿、软件、方法学、概念设计。白玉婷:撰写——审阅与编辑、可视化、调查研究。林煜鑫:撰写——审阅与编辑、可视化、调查研究。徐勇:撰写——审阅与编辑、监督、项目管理、资金获取。

利益冲突声明

作者声明不存在可能对本研究产生影响,或在本论文中报告的工作中被认为构成利益冲突的财务利益或个人关系。
胡睿|白玉婷|林煜鑫|徐勇
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号