SANE:用于陆地生态系统野生动物研究的人为噪声水平指数

《Methods in Ecology and Evolution》:SANE: An index of anthropogenic noise levels for wildlife research in terrestrial ecosystems

【字体: 时间:2026年07月08日 来源:Methods in Ecology and Evolution 5.7

编辑推荐:

  由于将人为成分从声景(soundscape)中分离出来本身具有复杂性,理解噪声污染对野生动物的影响一直面临挑战。声景研究通常采用声学指数(acoustic indices),通过设置阈值将人为声(anthrophony)与自然声音隔离。然而,自然声音与人为声音

  
由于将人为成分从声景(soundscape)中分离出来本身具有复杂性,理解噪声污染对野生动物的影响一直面临挑战。声景研究通常采用声学指数(acoustic indices),通过设置阈值将人为声(anthrophony)与自然声音隔离。然而,自然声音与人为声音并不总是符合这些阈值界限,从而削弱了所得指数的准确性与可比性。尽管基于人工智能(Artificial Intelligence, AI)分类器的声学事件自动识别已经取得显著进展,但目前仍缺乏一种能够有效量化人为声学压力的方法。

研究人员提出了一种新的指数——选择性人为噪声暴露指数(Selective Anthropogenic Noise Exposure, SANE),该指数利用 BirdNET 深度神经网络(deep neural network)从录音中分离与人类活动相关的声音。该指数由所有人为噪声类别的中位振幅指数(Median Amplitude Index)之和构成,因此既能够表征多种干扰事件的强度,也能够反映其累积影响,同时还可将总体噪声水平拆分为不同干扰类别的贡献(例如交通、人声)。

研究人员在真实城市环境和声景模拟条件下测试了 SANE 的性能,并将其与两种基于频率的指数及另一种基于人工智能的声学指数 CityAnthroNet 进行了比较。结果表明,SANE 能够有效描述不同城市化水平区域中的人为噪声,并弥补其他指数存在的不足。此外,SANE 在极精细的时间尺度上也具有稳健性,能够对单次录音中的人为声水平进行精确量化。在所比较的各类指数中,SANE 是唯一一种对低频生物声(biophony)不敏感的指标,而低频生物声会对基于频率和基于人工智能的其他度量造成混淆。

通过利用基于人工智能的分类器检测多类人造声音,SANE 指数能够捕捉人为噪声的强度。同时,落在传统人为声频段范围内的自然声音会被忽略。此外,SANE 还有潜力评估不同噪声类型对总体声学污染的相对贡献,从而为探索声学污染对野生动物影响开辟新的研究方向。
该研究发表于《Methods in Ecology and Evolution》,围绕生态声学中一个关键而长期存在的问题展开:如何在复杂声景中准确、稳健且可比较地量化人为噪声对野生动物的暴露水平。既有研究已表明,人为噪声(anthrophony)可对野生动物产生从行为到生理层面的多重负面影响,包括干扰捕食—被捕食关系、削弱交流效率,并进一步影响个体适合度。随着人口增长及基础设施扩张,陆地生态系统中的人为噪声预计将持续增加,因此亟需建立可靠工具,用于监测和比较不同空间与时间尺度上的噪声干扰。

当前被动声学监测(passive acoustic monitoring)已广泛应用于生态学研究,随之发展出的多种声学指数,试图将复杂声景特征压缩为可分析的数值指标。其中,归一化声景差异指数(Normalized Difference Soundscape Index, NDSI)与 1–2?kHz 功率谱密度(Power Spectral Density, PSD)常被用来估计人为声。然而,这类方法依赖预设频率边界,将 1–2?kHz 视为人为声范围、2–11?kHz 视为生物声(biophony)范围。问题在于,真实声景中的人为声、生物声及地球物理声(geophony)并不稳定地受限于这些频带,导致不同声源之间存在显著频谱重叠。例如某些鸟类或野猪等动物发声可落入所谓“人为声频段”,而车辆喇叭或高转速发动机等人为噪声也可能在“生物声频段”内具有明显能量。因此,仅凭固定频率阈值识别人为噪声,往往会引入混淆并损害结果解释力。

人工智能(Artificial Intelligence, AI)尤其是神经网络分类器的发展,为解决这一问题提供了新路径。现有工具如 CityAnthroNet 可估计录音中人为声音占据的时间比例,但其并不量化声音强度,也无法区分不同人为干扰类型。研究人员据此提出 SANE(Selective Anthropogenic Noise Exposure)指数,将 AI 分类与传统声学能量表征相结合,目标是实现对人为噪声“类型+强度+累积暴露”的综合刻画,同时降低自然声音造成的误判。研究目的包括:展示 SANE 的构建流程;评估其沿人为干扰梯度捕捉时空变化的能力;验证其在不同人为噪声类别上的可分解性;并与现有方法进行系统比较。

研究所用的关键技术方法主要包括以下几类。第一,基于 BirdNET V2.4 深度神经网络对录音进行 3?s 片段级分类,以识别人声、引擎、警笛、犬吠等多类人为相关声音,并通过本地验证选择高精确率阈值。第二,对被识别出的目标声段进行 20–20,000?Hz 带通滤波,再计算中位振幅指数(Median Amplitude Index),并在录音内按类别求和,生成全局及分类别 SANE 值。第三,使用来自意大利罗马市 2024 年 3–6 月的 75 个监听点、共 13,100 段 5 分钟录音开展真实声景分析。第四,构建 100 个受控模拟声景,在不同阶段操控人为声与鸟类鸣声比例,以比较 SANE、CityAnthroNet、NDSI 和 PSD 的响应与稳健性。

3.1 BirdNET classifier's performance
研究人员首先评估了 BirdNET 识别人为噪声的分类表现。在全部音频中,BirdNET 共识别出 434′865 个含有人为噪声的片段,其中“Engine”占比最高,达到 73%。验证结果显示,BirdNET 在区分自然声与人为声方面具有很高精确率(precision),整体平均精确率达到 0.99,在 0.1 置信度阈值下最低也有 0.97。对总体人为声而言,使精确率达到最大值的最小置信度阈值为 0.5。不同人为噪声类别之间召回率(recall)存在差异,但总体人为声在低阈值条件下即可维持较高 F1 值。该结果说明 BirdNET 作为 SANE 前端分类器,能够以较高可靠性从复杂城市录音中筛出目标人为声音。

3.2 Real soundscape temporal patterns of anthrophony
在真实城市声景分析中,研究人员比较了 SANE、CityAnthroNet、invNDSI 与 PSD 随城市化梯度和昼夜时间变化的模式。结果显示,两种基于频率的指数彼此高度相关,但在不同城市化水平上的变化趋势相似且存在局限,未能像预期那样随城市化增强而清晰升高。相比之下,两种 AI 基指数表现出明显不同,其中 SANE 随城市化升高而均值增加,更符合人为活动增强的现实背景。时间序列分析还表明,SANE 是唯一能够在高城市化区域晚间识别出噪声强度上升的指数,这与傍晚及夜间人类活动增强的情景一致。CityAnthroNet 在低和中等城市化区域晚间反而较高,研究人员认为这可能与日落前后生物声活动增加有关。清晨时段,CityAnthroNet 在低城市化区域也明显升高,而 SANE 未出现同样现象,提示前者可能更容易受到非目标生物声干扰。

进一步地,SANE 的可分解性分析展示了不同城市化等级下人为噪声构成的差异。低城市化区域以人声贡献较突出,可能反映休闲活动;低和中等城市化区域以交通噪声和犬吠较显著;中高城市化区域中警笛贡献增加。这一结果说明,SANE 不仅能给出总体人为噪声暴露水平,还能揭示驱动该暴露的具体噪声类型,为生态学解释提供更细粒度信息。

3.3 Simulated soundscape acoustic indices patterns and consistency
在受控模拟声景中,研究人员测试了各指数在不同鸟类鸣声与人为声组合下的响应。SANE 在前 3 个场景中均随着人为噪声片段比例增加而近似成比例上升,而在第 4 个仅含鸟声、完全无人为声的阶段保持低且平坦。相比之下,频率型指数在含有“落入人为声频段”的鸟类鸣声时表现偏高,在无人为声但该类鸟声逐渐增多时仍持续上升,显示其受到频谱重叠的明显干扰。值得注意的是,CityAnthroNet 的模式也与频率型指数相似:在含有此类鸟声的场景中偏高,并在最后无人为声阶段继续升高,表明其同样会将部分鸟声误识为人为声。

一致性分析进一步显示,SANE 在 100 个模拟声景重复中表现最稳定,能够在 30?s 的精细时间尺度上可靠追踪人为噪声变化。频率型指数则在所有场景下波动较大,说明其对单条录音或短时段估计不够稳健。研究人员据此指出,SANE 具有用于单次录音和高时间分辨率监测的潜力,而这恰是许多传统指数难以胜任的。

讨论部分强调,SANE 的优势主要体现在四个方面。第一,借助 BirdNET 对目标声音类别的识别,SANE 能有效摆脱固定频率边界带来的系统性混淆,对低频生物声尤其稳健。第二,SANE 通过对中位振幅求和,表征的是累积强度,而非仅仅是“人为声音出现的时间比例”,因此在高噪声环境中不易像 CityAnthroNet 那样达到饱和上限。第三,SANE 支持按噪声类型分解,这对于研究不同噪声源引发的差异化行为和生理效应具有重要价值。第四,随着 AI 分类器性能提升,SANE 的应用潜力还将继续扩大。

同时,研究人员也谨慎指出了该方法的限制。SANE 的计算本身较快,但前期音频分类可能具有较高计算开销;不同分类器版本之间的绝对值可比性需要谨慎对待;在高物种丰富度、声景极其复杂的环境中,分类性能可能下降,从而影响指数表现。此外,强风、暴雨等强地球物理声会遮蔽目标信号,录音设备过于接近稳定且极响的噪声源也可能造成偏差。因此,研究人员建议在使用 SANE 时,应明确报告采样设计、录音设备参数以及 AI 分类器的型号与版本,并尽量避免受强烈气象噪声影响的录音。

研究结论部分可译为:人工智能分类器(AI-classifiers)是生物声学研究中具有高度潜力的强大工具,但其只是生态研究过程中的一部分。该研究提出了通过新型 SANE 指数实现人工智能与声学指数协同的方法,并证明与 CityAnthroNet 及传统声学指数相比,SANE 能够提高人为噪声量化的质量。这种提升源于 SANE 不仅能够估计声景中人为声音的数量,还能够量化噪声暴露的幅度。通过利用 AI 分类器识别多类人造声音的能力,SANE 能够捕捉人为噪声的强度,并有潜力评估不同噪声类型对总体声学污染的相对贡献。识别噪声来源的性质有助于提升其生态效应解释,因为不同人为声源可能引发不同的行为和生理反应。此外,SANE 不受限于特定频率范围,因此也可以仅在某一特定频谱窗口内计算,例如人类可听频段或超声频段。这一特性可能为未来研究开辟新方向,例如探索超声人为噪声对蝙蝠的影响。该研究虽然将 SANE 应用于 BirdNET 分类器,但其工作流程也可方便地适配其他分类器。随着 BirdNET 更新版本或新分类算法的发布,SANE 在描绘人为声学干扰水平方面的准确性有望进一步提高。因此,无论采用何种分类器,该研究都强调了将人工智能工具与声学指数整合起来,以更好评估人为噪声的强度和性质,从而为声学研究提供可靠且灵活的解决方案。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号