在计算似然比之前对深度神经网络嵌入值应用高斯变换的影响

《Science & Justice》:Effects of applying Gaussianising transformations to DNN embeddings before calculating likelihood ratios

【字体: 时间:2026年07月19日 来源:Science & Justice 1.8

编辑推荐:

  •DNN嵌入是高维向量,可用于计算似然比。•在计算似然比之前,我们对DNN嵌入进行了高斯化处理。•我们测试了不同变换序列对以下方面的影响:•DNN嵌入的分布特性;•法医评估系统的性能。引言似然比可以通过深度神经网络嵌入来计算。DNN嵌入(如[1]、[2]、[3]所示)是从各类数据

  •DNN嵌入是高维向量,可用于计算似然比。•在计算似然比之前,我们对DNN嵌入进行了高斯化处理。•我们测试了不同变换序列对以下方面的影响:•DNN嵌入的分布特性;•法医评估系统的性能。引言似然比可以通过深度神经网络嵌入来计算。DNN嵌入(如[1]、[2]、[3]所示)是从各类数据中提取的高维向量,包括音频记录和照片图像。本文研究了在使用DNN嵌入计算似然比之前对其施加各种高斯化变换的效果。我们探讨了这些变换对DNN嵌入的实证分布以及所计算出的似然比值的影响。我们所研究的变换包括那些常用于法医语音比对的变换,并将其应用于从语音记录中提取的DNN嵌入。我们不仅关注这些变换在法医语音比对中的效果,还希望更深入地了解这些变换在应用于其他法医科学领域的数据时的影响。在后续的文章中,我们计划将这类变换应用于从面部图像中提取的DNN嵌入。图1展示了一个基于最先进的自动说话人识别技术[4]、[5]、[6]的法医语音比对系统示意图。该系统包含多个阶段。第1阶段和第2阶段涉及语音记录的预处理以及特征提取(详情见[4])。我们重点研究后面的阶段,因为它们不受比较对象类型的限制,因此可推广到其他类型的数据。在第3阶段,从每段语音记录中提取一个DNN嵌入。关于第4阶段的内容,我们将在下一段中讨论。在第5阶段,DNN嵌入被用作模型的输入,该模型用于计算未校准的似然比。这是一种生成模型,在自动说话人识别领域被称为“双协方差模型”,用于“概率线性判别分析”(PLDA;[7]、[8]、[9]、[10]),而在[11]、[12]中则被称为“多变量正态过程”。此后,我们将该模型称为PLDA。PLDA用于计算共同来源的似然比[13]、[14]、[15]。第6阶段则对似然比进行校准[16]、[17]、[18]。在第4阶段,即在DNN嵌入被输入PLDA之前,它们会经过一系列变换[6]、[19]、[20]。这些变换旨在降低维度数,并使数据的分布更接近PLDA的假设条件。PLDA假设DNN嵌入的源间分布和源内分布均为多变量高斯分布,且所有来源的源内协方差矩阵相同。PLDA的公式如方程(1)所示,其中Λ为(未校准的)似然比值,xq和xk分别为从待验证源和已知源提取的特征向量(即DNN嵌入),μ是从训练数据中学习得到的均值向量,Σb和Σw分别是从训练数据中学习得到的源间和源内协方差矩阵,fxμ,Σ表示多变量高斯分布。Λ=fxqxkμμ,Σb+ΣwΣbΣbΣb+Σwfxqμ,Σb+Σwfxkμ,Σb+Σw这些变换最初是为自动说话人识别的非法医应用而开发的,其目的是做出分类决策,即“同一来源”或“不同来源”。而在法医应用中,其目的是提供一个似然比值,以帮助法律决策者在案件背景下作出判断。为了对法律决策者有用,似然比必须是对由两个相互竞争的假设构成的特定于案件的问题的有意义的回答,例如,这两段语音是否来自同一位说话人,或者是否来自相关人群中的两位不同说话人。相关人群是指如果该数据不是来自已知来源,那么它可能来自的人群[21]第31–33页。相关人群因案件而异,例如,在某个法医语音比对案件中,它可能是说带有加拿大口音的英语的男性,而在另一个案件中,则可能是说巴西葡萄牙语的女性。我们在三组不同的案例条件下探讨了这些变换的影响:•男性不匹配组:澳大利亚英语的成年男性说话者的录音,其中待验证源和已知源的录音条件存在差异。这些人群和条件反映了实际案件的情况,即待验证说话者的录音是在呼叫中心通过电话录制的,而已知说话者的录音则是警方访谈的录音。•男性匹配组:澳大利亚英语的成年男性说话者的录音,其中待验证说话者和已知说话者的录音都是在呼叫中心通过电话录制的。•女性匹配组:澳大利亚英语的成年女性说话者的录音,其中待验证说话者和已知说话者的录音都是在呼叫中心通过电话录制的。这些人群和条件同样反映了实际案件的情况。本文的其余部分结构如下:•第2节描述了高维高斯分布的特性。•随后,在第3.3节“变换”中,我们将通过模拟数据展示每种变换的效果。在应用每种变换之前和之后,我们都会将模拟数据的分布特性与高维高斯分布的特性进行比较。•之后,在第4节“结果”中,我们同样会在应用每种变换之前和之后,将真实DNN嵌入的分布特性与高维高斯分布的特性进行比较。•第3节介绍了所采用的方法,包括:•使用的数据(第3.1节)、•预处理、特征提取以及DNN嵌入的提取(第3.2节)、•应用的变换(第3.3节)、•未校准似然比的计算(第3.4节)、•校准过程(第3.5节),以及•结果评估方法(第3.6节)。•第4节呈现研究结果。•第5节进行讨论。•第6节为结论。我们的实验基于E3FS3法医语音比对系统,该系统结构如图1所示。有关E3FS3的详细信息,请参见[20]。本文中用于实验的数据及Python代码可在https://forensic-data-science.net/likelihood-ratio-calculation/#DNN_embedding_transformation获取。片段内容非层次化高维高斯分布DNN嵌入是高维向量。与一维、二维或三维高斯分布相比,高维高斯分布的分布特性并不直观,后者更容易通过视觉概念来理解。如[22]第2节和[23]中所理论阐述的,来自高维多变量高斯分布N0σ2I的数据(其中0为均值向量μ,是一个d维的全零向量,σ2为方差,各维度数值相同,I为单位矩阵)对于男性不匹配条件,数据来自forensic_eval_01数据集[24]中的录音。每段录音仅包含一名说话者的讲话内容。待验证说话者对应的录音为一段时长46秒的固定电话通话录音,背景中有杂音,且是以有损压缩方式保存的。已知说话者对应的录音为一段在混响房间中录制的时长126秒的访谈录音,背景中有通风系统产生的噪音。训练数据经过变换后的DNN嵌入的分布与高维高斯分布的预期特性的比较根据第3.6.1节的要求对分布结果进行了评估。对于每一组变换序列,图13、图14和图15分别展示了DNN嵌入长度的实证分布直方图以及DNN嵌入之间成对角度的直方图。对于长度的图表,区间宽度为0.5个单位;对于角度的图表,区间宽度为3度。为了便于直观评估经过变换后的DNN嵌入的分布是否符合第3.6.1节中所述的特性,在讨论部分虽然xdnfml、ldf以及包含白化处理的变换序列所得到的DNN嵌入成对角度的分布与假设为具有两级层次化高维多变量高斯分布N0σb2INμiσw2I的DNN嵌入的预期分布最为接近,但这些分布仍与预期值存在一定差距。其原因可能是,尽管经过了变换,变换后的DNN嵌入仍然存在……结论本文研究了在用DNN嵌入计算似然比之前,对其施加不同变换序列以使其分布趋于高斯分布的效果。我们用于计算未校准似然比(PLDA)的模型假设DNN嵌入的源间分布和源内分布均为多变量高斯分布。我们评估了这些变换对DNN嵌入实证分布的影响。CRediT作者贡献声明拉斐尔·奥利维拉·里贝罗:写作——审阅与编辑、写作——初稿撰写、软件、方法论、形式分析、概念设计。菲利普·韦伯:监督、软件、概念设计。杰弗里·斯图尔特·莫里森:写作——审阅与编辑、监督、概念设计。伦理声明本手稿中描述的研究并未使用任何可识别的人类材料或数据。我们使用的DNN嵌入是从已有论文中使用的语音记录中提取的。免责声明本文中表达的所有观点均为作者个人观点,除非另有明确说明,否则不应被视为代表作者所在机构的政策或立场。未引用参考文献[31]、[41]、[42]利益冲突声明莫里森是《科学与正义》杂志的副主编。他未参与本文的同行评审工作,也无法获取有关同行评审的信息。本文的编辑工作完全由另一位期刊编辑负责。除此之外,作者声明自己没有已知的可能影响本文研究的财务利益或个人关系。致谢里贝罗的工作得到了阿斯顿大学提供的奖学金以及巴西联邦警察局给予的带薪休假支持。拉斐尔·奥利维拉·里贝罗|菲利普·韦伯|杰弗里·斯图尔特·莫里森
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号