使用共享权重的双分支CNN进行音频深度伪造检测

《AI》:Audio Deepfake Detection Using Dual-Branch CNN with Shared Weights

【字体: 时间:2026年09月09日 来源:AI 6.5

编辑推荐:

  音频深度伪造检测已成为语音生物特征识别系统领域中的一个重要问题,其目标是区分真实人声与人工智能(AI)生成的声音。随着合成语音质量日益提高,此类语音更有可能被滥用于身份盗窃和冒充等非法目的。本文提出的具有共享权重的双分支CNN架构结合了自注意力模块,以更高效地

  
音频深度伪造检测已成为语音生物特征识别系统领域中的一个重要问题,其目标是区分真实人声与人工智能(AI)生成的声音。随着合成语音质量日益提高,此类语音更有可能被滥用于身份盗窃和冒充等非法目的。本文提出的具有共享权重的双分支CNN架构结合了自注意力模块,以更高效地检测音频深度伪造。在该模块中,研究人员使用卷积运算和双分支从原始音频信号中提取复杂特征,以便直接比较未处理的原始音频与修改后的音频。随后,残差连接改善了网络性能。与这些基础层一同设计的自注意力模块以分层方式训练,以检测音频帧内的多头注意力。这一特性帮助网络区分原始音频和修改后的音频,并相比标准方法提高了特征提取能力。研究人员分析了一系列音频修改以评估该方法的有效性,并在受控歌唱语音深度伪造检测挑战赛(CtrSVDD)数据集上进行了涵盖所有可能音频操纵情况的综合测试,以评估其鲁棒性。所提出的具有共享权重的双分支CNN优于深度学习(DL)和机器学习(ML)模型。该模型准确率达到97.26%,精确率为99%,召回率为99.27%,F1分数为98.88%,取得了显著性能。
**使用共享权重的双分支CNN音频深度伪造检测研究解读**

**一、研究背景与问题**
深度伪造技术已在娱乐、社交媒体和金融等领域带来显著进步与挑战。合成媒体(synthetic media)利用人工智能创建或操纵音频、视频或图像,不仅操纵公众舆论,还加剧了战争的心理和社会后果。音频深度伪造尤为突出,攻击者曾模仿公司CEO语音骗取约22万欧元,凸显了语音驱动系统的脆弱性。随着语音克隆服务仅需数秒输入即可生成可信合成语音,深度伪造工具无需技术知识即可广泛使用,增加了网络钓鱼、虚假访谈和欺诈客服等风险。传统的音频深度伪造检测方法涵盖机器学习和深度学习,但存在预处理耗时、特征工程复杂、泛化能力差等缺陷。常见模型如长短期记忆网络(LSTM)和卷积神经网络(CNN)虽然有效,但仍难以应对多种合成操纵。为此,研究人员旨在开发一种减少预处理需求、提高准确率且保持可扩展性的检测模型。

**二、研究内容与结论**
研究人员提出了一种具有共享权重的双分支CNN架构,结合自注意力模块和残差连接,用于检测音频深度伪造。该方法直接从原始音频中提取复杂特征,通过双分支比较未处理的原始音频与修改后的音频,并利用自注意力捕获音频帧内的多头注意力,增强特征提取。在受控歌唱语音深度伪造检测挑战赛(CtrSVDD)数据集上进行了全面测试,结果表明该模型在准确率(97.26%)、精确率(99%)、召回率(99.27%)和F1分数(98.88%)上均优于深度学习(DL)和机器学习(ML)模型,ROC-AUC达到98%。该研究为音频深度伪造提供了可靠的早期检测工具,适用于安全、媒体完整性和欺诈预防。论文发表在《AI》期刊。

**三、主要技术方法**
研究人员使用的数据来自CtrSVDD基准数据集,包含188,486个深度伪造歌曲片段(260.34小时)和32,312个真实歌曲片段(47.64小时),共164位歌手,采样率16 kHz。关键技术方法包括:(1)MFCC(Mel频率倒谱系数)特征提取,将音频转换为紧凑的频谱包络表示,模拟人耳非线性频率感知;(2)双分支CNN共享权重架构,两个相同CNN分支无全连接层,同时训练并输出同维嵌入向量,拼接后输入后续模块;(3)自注意力机制,以分层方式训练多头注意力,聚焦关键时频区域;(4)残差连接,促进梯度流动,稳定训练;(5)特征选择,以等错误率(EER)和t-DCF为指标,从多种特征中选出最优的MFCC;(6)正则化,采用L2正则化、批归一化和dropout(0.3)防止过拟合。训练使用Adam优化器,学习率1×10?3,批大小64,验证损失10轮无改善时提前停止。

**四、研究结果**
- **技术需求**:研究人员在Macintosh平台(2 GHz四核Intel Core i5,16 GB内存)上实现系统,使用VS Code,预处理平均45秒,MFCC特征计算20分钟,模型训练和测试各150分钟。
- **数据集**:CtrSVDD数据集包含188,486个深度伪造歌曲片段和32,312个真实歌曲片段,来自164位歌手,涵盖7种歌唱语音合成(SVS)和7种歌唱语音转换(SVC)共14种深度伪造系统,所有数据以CC BY-NC-ND 4.0许可发布。
- **预处理**:通过让模型直接处理原始音频信号,减少了预处理和特征工程需求,简化了检测流程。
- **特征选择**:以EER和t-DCF为主要指标,比较多种特征后确定MFCC在CtrSVDD上EER最低(0.045),t-DCF值亦较低,表明其实际应用中检测误差更小。
- **模式发现**:使用40个MFCC系数作为特征,能够紧凑表示频谱包络,计算高效且抗噪,有利于检测合成语音。
- **学习算法**:将MFCC特征输入双分支CNN共享权重模型。消融实验显示,移除自注意力模块后EER升至3.87%,移除Sigmoid后EER升至3.45%,证明两者均不可或缺。最终模型在CtrSVDD上达到97.26%准确率、99%精确率、99.27%召回率、F1分数98.88%。

**五、总结讨论与结论**
讨论部分指出,传统特征(如CQCC)和简单模型(如高斯混合模型,GMM)误差率高;深度学习模型(如ResNet、CNN、RNN)虽能捕捉更复杂模式,但效果仍不及所提模型。t-DCF作为辅助指标,所提模型(0.043)在真实应用中的检测误差更低。与Transformer、BiLSTM-CNN混合模型、集成模型等相比,所提模型在准确率上最高,且兼具计算效率和泛化能力,能够处理多种音频操纵类型。

研究结论翻译如下:由于社交媒体日益普及,越来越多的人通过社交媒体而非传统媒体获取新闻。此外,社交媒体被用来传播深度伪造音频,可能对个人用户和社会产生负面影响。在这项研究中,研究人员回顾了关于假音频特征描述和检测的现有文献。研究人员尝试了不同方法,利用机器学习和深度学习方法构建音频深度伪造检测系统。本研究聚焦于使用CtrSVDD数据集的竞争性研究。此外,还强调了这些工作的优缺点。通过研究现有工作,可以得出结论:现有方法未能构建一个能够有效检测深度伪造音频的系统。研究人员提出了一种采用增强型双分支共享权重CNN模型的音频深度伪造检测技术。该方法通过最小化预处理需求和改进特征提取,实现了优越的检测性能,解决了现有技术的若干局限。凭借在时域和频域处理音频数据的能力,该模型相比传统和现代深度学习模型获得了显著的准确率提升。因此,它为研究人员和实践者提供了可靠的音频深度伪造早期检测工具。双分支共享权重CNN架构提供了许多优势,包括提高检测准确率、高效特征提取和减少预处理需求。该模型的另一个优势是其良好的泛化能力,能够处理多种不同类型的音频操纵,甚至包括从未见过的操纵类型。因此,该方法在安全、保护媒体完整性和防止欺诈等需要快速准确检测深度伪造的实际应用中具有广阔前景。未来,提高模型的鲁棒性并测试其对其他类型深度伪造(如视频)的适应性将非常重要。模型还应在更大更多样化的数据集上进行测试,以验证其可扩展性。在投入实际应用前,需要检查其运行复杂度。随着合成媒体技术的快速变化,这些步骤对于保持深度伪造检测系统的有效性是必要的。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号