《Speech Communication》:Acoustic features underlying internal representation of vocal smile in children
编辑推荐:
微笑是发展中的一个关键特征,也可以在声音中被听到。在发展过程中,声音情绪识别能力的提高伴随着听觉皮层的整体神经解剖学成熟。虽然预测编码框架(predictive coding framework)表明内部表征(internal representation)在
微笑是发展中的一个关键特征,也可以在声音中被听到。在发展过程中,声音情绪识别能力的提高伴随着听觉皮层的整体神经解剖学成熟。虽然预测编码框架(predictive coding framework)表明内部表征(internal representation)在发展过程中随年龄增长而精细化,但声音微笑(vocal smile)的内部表征尚未在该特定年龄范围内的儿童中进行描述。本研究旨在通过调查儿童声音微笑的内部表征以及该表征的稳健性(robustness)来弥合这一知识空白。研究人员在46名8至12岁儿童和42名成年人中评估了声音微笑模型。采用反向相关方法(reverse correlation approach),允许区分声音微笑模型的两个组成部分:声音微笑的声学特征(acoustic features)和内部表征稳健性,量化为内部噪声(Internal Noise)。作为一个群体,儿童表现出与成年人相同的声音微笑内部表征。然而,当将儿童的个体表征与成年人的表征进行比较时,研究人员证明,在儿童群体内,随着年龄增长,他们的表征逐渐更接近成年人的模板。此外,内部噪声估计允许区分两个儿童亚组,其中一个亚组在获取该内部表征方面表现出延迟。本研究为学龄儿童情绪声音处理的发展和变异性提供了关键见解。
**研究背景与问题**
情绪识别是人类发展中的关键技能,尤其在儿童早期,它影响学业表现、自信心和社会适应。声音情绪(emotional prosody)通过调节音高、强度、语速和音色等声学线索传递情感,是社交和认知发展的重要基础。儿童从胎儿期开始接触声音,出生后对情绪语音的感知能力逐步发展。然而,尽管已有研究描述了儿童在情绪声音识别中的年龄相关改善,并指出听觉皮层(auditory cortex)的神经解剖学成熟在这一过程中起关键作用,但关于儿童内部表征(internal representation)的具体构建尚不明确。预测编码框架(predictive coding framework)提出,内部表征随年龄增长通过经验精细化,但声音微笑(vocal smile)——即说话时微笑导致的声音变化——在学龄儿童(8-12岁)中的内部表征尚未被系统研究。现有研究多聚焦于成人,而儿童在这一关键发育窗口中的内部表征及其稳健性(robustness)存在空白。为此,本研究旨在探究儿童声音微笑的内部表征,并评估其与成人模板的相似性及表征稳健性,以揭示发展轨迹和个体差异。
**研究内容与结论**
研究人员对46名8-12岁儿童(平均10.5±1.5岁)和42名成人(平均25.2±8.9岁)进行了实验,所有参与者均为法语母语者,无神经或精神疾病史。通过反向相关(reverse correlation)任务,研究人员提取了儿童的声音微笑内部表征(即声学滤波器)和内部噪声(internal noise)。结果发现:作为群体,儿童与成人共享相同的内部表征;但个体分析显示,儿童的表征随年龄增长逐渐接近成人模板,且存在一个亚组(IN+组)表现出内部噪声较高、表征获取延迟的发育轨迹。该研究发表于《Speech Communication》,首次揭示了学龄儿童情感声音内部表征的发展可塑性,为理解情绪感知的神经发育机制提供了关键证据。
**主要技术方法**
研究人员采用改编的反向相关范式(reverse correlation paradigm),基于CLEESE工具箱生成随机光谱滤波器(25个带通滤波器,频率范围100-10000 Hz),儿童接受150对刺激(成人250对),并添加50对重复刺激用于双程程序(double-pass procedure)估计内部噪声。通过分类图像技术(classification image technique)计算个体内部表征,并从成人模板的距离导出典型性(typicality);内部噪声基于响应一致性(response consistency)和响应偏差(response bias)通过模拟观测者模型估计。
**研究结果**
3.1 儿童声音微笑的内部表征
对44名儿童和42名成人的平均滤波器分析显示,儿童的内部表征与成人无显著差异(经Bonferroni校正的t检验,所有频率点p>0.05)。该表征以低频能量减少和第一共振峰(F
1)频率升高为特征(儿童F
1:644±42 Hz,与原始音555 Hz相比,t(43)=14.03,p<0.001,d=2.11),而第二、三、四共振峰(F
2、F
3、F
4)无显著变化。这表明儿童已具备成人般的声学模板,能通过F
1调制识别微笑声音。
3.2 表征典型性
典型性(typicality)定义为儿童滤波器与成人平均滤波器之间的归一化距离(0-1)。Pearson相关分析显示,典型性与儿童年龄(月龄)呈中等正相关(t(42)=3.1,p<0.005,R=0.43),表明随年龄增长,儿童的表征更接近成人模板。典型性与情绪商数(EQ)无显著相关(t(39)=0.43,p=0.67,R=0.07)。进一步将频率分段分析,未发现不同频段发育动态的差异。
3.3 表征稳健性:内部噪声分析
通过双程程序估计内部噪声(IN),儿童IN呈现双峰分布,据此分为IN+组(IN>3,n=14)和IN-组(IN<3,n=30)。两组在年龄、EQ、言语和非言语发育年龄上无显著差异,但IN-组的平均IN与成人无统计差异(W=559,p=0.52),IN+组则显著更高(W=420,p<0.0001)。Spearman相关分析显示,在IN+组中,归一化F
1变化(norm(ΔF
1))与年龄呈正相关(S=176,p
corr=0.045,R=0.61),表明IN+儿童随年龄增长逐渐增加F
1调制;而IN-组无此相关(S=4816,p
corr=1.415,R=-0.07),两组相关性显著不同(Zou’s CI [0.07, 1.1])。此外,IN+组中典型性与norm(ΔF
1)呈显著正相关(S=110,p
corr=0.005,R=0.76),即典型性越高,F
1调制越强;IN-组无此相关(S=2824,p
corr=0.880,R=0.37),两组相关性差异不显著(Zou’s CI [-0.08, 0.78])。
**讨论与结论**
讨论部分指出,本研究首次将反向相关法应用于儿童,揭示了声音微笑内部表征在8-12岁期间的精细化过程。儿童作为整体已具备成人模板,但个体差异显著,典型性随年龄增长,支持预测编码框架中经验驱动的内部模型优化。内部噪声的分离发现,IN-组儿童已达到成人般的F
1调制,其典型性不再依赖F
1变化,可能依赖更细微的声学线索;而IN+组则仍在发育中,随年龄增长逐步利用F
1作为关键线索,甚至可能超过成人模板。这一差异可能源于颞上回(STG)等听觉皮层的持续成熟,或与决策加工阶段的变异性有关。研究结论翻译如下:据研究人员所知,本研究首次实施了一种简单有效的方法,用于评估学龄儿童的声音情绪内部表征及相关内部噪声。基于44名8-12岁儿童的样本,研究结果揭示,随着年龄增长,儿童逐步精细化其声音微笑内部表征,逐渐趋近于成人感知模板。虽然年幼儿童表现出较不精确的表征,但有一个子集似乎遵循另一种发育轨迹,其特征是表征稳健性降低,干扰了表征准确性。这些结果凸显了情绪声音处理在发展过程中的异质性,并为识别非典型社会情绪感知的早期标志开辟了新途径。