《Speech Communication》:Human perception of audio deepfakes: the role of language and speaking style
编辑推荐:
音频深度伪造(deepfakes)已达到高度逼真的水平,使得区分人声与人工声音日益困难,从而带来身份盗窃或虚假信息传播等风险。尽管存在这些担忧,关于人类识别深度伪造能力的研究仍然有限,大多数研究集中于英语,且极少探讨听者感知决策背后的原因。本研究通过一项感知实
音频深度伪造(deepfakes)已达到高度逼真的水平,使得区分人声与人工声音日益困难,从而带来身份盗窃或虚假信息传播等风险。尽管存在这些担忧,关于人类识别深度伪造能力的研究仍然有限,大多数研究集中于英语,且极少探讨听者感知决策背后的原因。本研究通过一项感知实验填补了这一空白,实验中54名听者(28名西班牙语母语者和26名日语母语者)将声音分类为自然或合成,并说明其选择理由。实验包含80个刺激(50%为人工生成),并依据三个变量进行组织:语言(西班牙语/日语)、说话风格(有声书/访谈)以及声音熟悉度(熟悉/不熟悉)。研究旨在考察这些变量如何影响检测,并定性分析听者感知决策背后的推理。结果表明,平均准确率为59.11%,对真实样本的识别表现更高。对声音自然度的判断依赖于语言和非语言线索的结合。比较日语和西班牙语听者,研究人员的定性分析进一步揭示了听者在概念化语音的“人性化”特征时所采用的共享线索和显著的跨语言差异。总体而言,参与者主要依赖超音段特征以及更高层或语言外特征——如语调、节奏、流畅度、停顿、语速、呼吸和笑声——而非音段特征。这些发现强调了人类在区分自然语音与人工语音时所采用感知策略的复杂性,并与先前强调韵律及自发言语中典型现象(如言语不流畅)重要性的研究部分一致。
**人类对音频深度伪造感知的语言与说话风格效应:基于西语与日语听者的实验证据**
近年来,深度伪造(deepfakes)被定义为利用人工智能(AI)技术制作、看似真实但实际由算法生成的合成媒体。其中,纯音频深度伪造可高度模仿特定说话人的声音,带来身份盗窃、欺诈、虚假信息传播等多重风险。尽管此类技术可能用于影视制作、人机交互、医学语音康复等积极用途,但其滥用可能对个体心理、金融安全和社会信任造成严重威胁。因此,了解人类听者能否以及如何识别合成语音具有理论和应用双重意义。然而,现有关于人类深度伪造感知的研究多集中于英语,且很少系统考察听者做出判断时所依赖的语音线索。本研究旨在通过感知实验,探究语言熟悉度、说话风格和声音熟悉度三个变量对西语和日语听者识别自然/人工语音的影响,并对听者的自由文本解释进行定性主题分析。
研究人员招募54名参与者(28名西班牙语母语者,26名日语母语者),他们需对80条时长10秒的语音刺激进行“自然/人工”二选一判断,并给出书面理由与置信度评分。刺激包含西语和日语、有声书和访谈两种说话风格,自然与人工样本各半;人工样本由ElevenLabs的Text-to-Speech(TTS)系统克隆生成。结果显示,参与者总体平均正确率为59.11%,自然音频的识别正确率高于人工音频。该结果介于既有研究之间(约70%与53.7%之间),表明受控环境下听者对深度伪造检测的能力有限,且对社会中的实际检测可能更不乐观。统计分析还发现,语言熟悉度在一定程度上提升识别准确率;说话风格的影响因听者母语和刺激真实性而异;声音熟悉度未产生显著效应。定性分析显示,听者主要依赖超音段特征(如语调、节奏、音高)和高层/非语言特征(如停顿、呼吸、笑声、流畅度)来区分自然与人工语音,而非音段特征;西语听者还使用了音段线索和方言知识。
在关键技术与方法方面,实验采用开放性软件PsychoPy设计,并上传至Pavlovia平台在线实施。真实有声书样本取自LibriVox和YouTube,访谈样本取自VoxCeleb-ESP(西语名人)和EACELEB(日语名人)语料库;所有样本经Praat截取10秒片段。语音克隆使用ElevenLabs的“Eleven Multilingual v2”模型,并以Whisper自动转写后进行人工校正获得文本。54名参与者来自Pavlovia招募,其中西语组39.29%具有语言学专业知识,日语组无语言学背景。统计部分使用RStudio中的广义线性混合模型(generalized linear mixed model, GLMM)分别对西语和日语听者建模,固定效应包括真实性、语言、说话风格、置信度,以及访谈子集中的熟悉度;随机效应为听者和音频片段。定性分析采用Voyant工具生成词云,并将自由文本还原为语音学术语,根据Leemann等的分类框架分为音段、超音段和高层/非语言特征,同时依据TOFFA不流畅分类标注。
在研究结果部分,首先,参与者表现方面:54位听者平均正确率59.11%,西语组(60.52%)略高于日语组(57.60%)。两组对自然样本识别均优于人工样本,但日语组对西语人工音频识别率很低(有声书36.92%,访谈38.85%)。最高准确率出现在母语自然访谈中(西语组77.5%,日语组80.38%),但标准差较大,个体差异明显。
在假设检验部分,通过四个广义线性混合模型检验假设。日语听者方面,当刺激为人工有声书和自然访谈时,母语刺激的正确率显著高于外语,支持假设1;说话风格的作用依赖于真实性:自然日语访谈识别更好,人工日语有声书识别更好;真实性多数条件下显著,自然样本容易识别;置信度高水平时准确率更高。西语听者方面,语言效应仅对人工访谈显著,母语访谈识别优于外语;说话风格对西语刺激显著,访谈比有声书更容易识别;真实性仅对日语访谈显著;置信度同样呈正向关联。声音熟悉度对所有参与者均不显著,因此假设3未获支持。
在定性反应部分,日语听者最常用词汇为inflection、intonation、fluency、tone等,均属超音段或高层/非语言特征,无人提及单个音段。他们用“机械”“不自然”等形容人工声,将呼吸、停顿、犹豫等视为自然人声的标志。西语听者除超音段和高层特征外,有13次明确提及某个辅音(如/s/、/r/),其中84.62%的判断正确,这一特点与西语组中39.29%参与者具有语言学训练的背景相符;他们还使用prosody、timbre等技术术语,并利用安达卢西亚或加泰罗尼亚西班牙语等地理方言线索。两组均以呼吸、笑声等非语言特征作为自然声的强线索,但日语听者更关注音高重音(pitch accent)相关的inflection,西语听者更依赖音段和方言知识。
在讨论与结论部分,研究人员指出,整体准确率低于部分先前研究,说明人类感知并非可靠屏障,尤其在不完全受控的真实情境中。语言熟悉度的促进效应与先前证据一致,且日语听者受影响更大,这可能与非母语者对犹豫等不流畅现象的感知能力较弱有关。说话风格效应仅限于母语刺激,表明TTS系统在即兴语流中仍难以模拟自然的不流畅特征。声音熟悉度无显著效果,这与Wenger等(2021)的结果不同,可能需进一步探究熟悉度的类型和程度。定性部分显示,超音段和非语言线索具有跨语言普遍性,可作为自动化检测系统的补充特征;同时,语言特异的音系线索(如日语声调重音)和听者的语言专业知识会影响其判断策略。研究结论为:音频深度伪造已成为超越安全领域的社会威胁。本研究通过在线实验证明,人类平均只能正确分类约59%的TTS克隆语音,且对真实样本的识别更好。声音自然度判断依赖于语言与非语言线索的整合,其中非语言线索可能具有普遍性,而语言学知识和语言特异音系信息可支持额外依赖音段或结构线索。这些发现凸显了人类感知策略的复杂性,但结果仅限于所测试的合成系统,未来需扩展到语音转换(voice conversion, VC)及混合VC-TTS系统,以验证其普适性。