优化分类准确和误发音的美国英语卷舌音用于游戏化实时超声生物反馈治疗

《Speech Communication》:Optimized Classification of Accurate and Misarticulated American English Rhotic Speech Sounds for Use in Gamified Real-Time Ultrasound Biofeedback Therapy

【字体: 时间:2026年07月21日 来源:Speech Communication 2.9

编辑推荐:

  游戏化生物反馈具有帮助个体改善言语运动模式的潜力。对于此类系统,针对尝试性改变所提供的反馈必须直接表征性能提升。这一点对于超声生物反馈治疗(UBT)尤为突出,该治疗越来越多地被用于可视化舌运动以治疗言语声的误发音(例如,美国英语 /?/)。先前关于误发音 /?

  
游戏化生物反馈具有帮助个体改善言语运动模式的潜力。对于此类系统,针对尝试性改变所提供的反馈必须直接表征性能提升。这一点对于超声生物反馈治疗(UBT)尤为突出,该治疗越来越多地被用于可视化舌运动以治疗言语声的误发音(例如,美国英语 /?/)。先前关于误发音 /?/ 声的超声成像研究已确定,一个单一的时间依赖测量参数 δ(标准化舌背与舌叶位移之间的相对差异)能够对发音准确性进行分类,与人类判断的吻合度约为85%。因此,δ参数是实时游戏化UBT的理想基础。然而,在言语产生的超声成像过程中,存在多个可能的图像帧,可以从中自动评估δ以代表产生准确性。因此,为了确定δ评估的最佳帧选择,研究人员分析了描绘2,944次产生(15个不同的卷舌短语)的超声图像序列,同时由训练有素的听者判断感知准确性。比较了四种不同的选择标准,并使用接收者操作特征曲线(ROC)分析结合8折交叉验证评估了分类性能和最佳阈值。对于元音前和元音后卷舌音节,在产生结束时评估δ获得了最高的分类成功率。对于以载词短语“a”开头的元音前单词,在估计的 /?/ 时间中点评估δ获得了最佳分类。结果为基于实时超声测量舌运动的游戏化超声生物反馈治疗提供了可行基础。
**研究背景与问题**
残余言语声障碍(RSSD)是一种在8-9岁后仍持续存在的发音错误,常阻碍儿童发展里程碑的达成。美国英语卷舌音/?/是最常见的误发音音素,其产生涉及复杂的舌运动模式。超声生物反馈治疗(UBT)通过可视化舌轮廓辅助治疗,但传统UBT对临床医生实时分析舌运动并提出反馈的认知要求高,对患者尤其是注意力或认知障碍儿童不友好。游戏化UBT通过将舌运动转化为游戏对象运动,可降低认知负荷,但需要实时、自动的准确性分类参数。先前研究提出的δ参数(舌叶与舌背标准化位移差)能以约85%的准确率分类发音准确性,但其评估依赖于手动选择的超声图像帧,不适用于实时场景。因此,本研究旨在优化δ参数的实时帧选择,以实现游戏化UBT中的自动分类。

**研究人员开展的研究**
研究人员分析了来自49名受试者(7-17岁,包括典型发育和RSSD儿童,来自辛辛那提大学言语诊所和社区)的2,944次产生,涵盖15个卷舌短语(5个元音前、5个元音后、5个带载词短语“a”的元音前)。通过超声成像和TonguePART软件追踪舌轮廓,计算δ参数,并比较四种帧选择策略(平均帧、结束帧、最大幅度帧、中间帧)。使用ROC分析结合8折交叉验证评估分类性能,确定最佳阈值,并基于此设计游戏化UBT系统GoGoGoat的渐进难度级别。论文发表在《Speech Communication》。

**主要关键技术方法**
样本来源:49名受试者(25男,24女,年龄7-17岁),来自辛辛那提大学言语诊所和社区,包括典型发育和RSSD群体。主要方法:使用TonguePART软件从超声视频中自动追踪舌轮廓,将舌分为根、背、叶三部分,计算时间依赖的δ参数(相对舌叶与舌背位移差)。比较四种帧选择(平均帧、结束帧、最大幅度帧、中间帧),通过ROC分析及8折交叉验证评估分类性能,确定最佳阈值,并基于δ参数标准差建立游戏难度级别。

**研究结果**
3.1 感知评分
通过组内相关系数(ICC)评估评分者间信度,验证集ICC为0.995(95% CI: 0.991-0.998),总数据集ICC为0.89(95% CI: 0.88-0.90),表明良好的信度。感知评分显示数据平衡:47.3%的后元音前产生、55.9%的无载词元音前产生、51.4%的有载词元音前产生被判定为准确。

3.2 分类分析
通过ROC分析,结束帧δ参数在无载词短语的元音前和元音后单词中均获得最高平均AUC(例如后元音前“or”为0.931,元音前“ray”为0.771)和最高分类准确率(例如后元音前“or”为0.865,元音前“ray”为0.739)。中间帧δ参数在有载词短语“a”的元音前单词中表现最佳,平均AUC最高(如“a row”为0.767),平均分类准确率最高(如“a row”为0.771)。线性混合模型证实,结束帧在无载词语境中显著优于其他帧类型(p<10-5),中间帧在有载词语境中显著优于结束帧(p<10-5)。后元音前单词的分类准确率显著高于元音前单词(p<10-5),而元音效应不显著。

3.3 线性混合模型
模型1(排除有载词语境)显示结束帧显著优于其他,后元音前准确率高于元音前。模型2(仅含载词语境)显示中间帧分类成功率最高,显著高于结束帧。模型3(含所有语境)未发现载词引入显著影响。无元音主效应。

3.4 示例应用
基于最佳阈值,设计GoGoGoat游戏难度级别:Level 1(OCT-1σ,σ为δ标准差)、Level 2(OCT-0.5σ)、Level 3(OCT)、Level 4(OCT+1σ),上边界为OCT+3σ。系统通过实时δ参数控制山羊跳跃高度,达到目标区域(红色)则变为绿色(正反馈),难度通过调整阈值实现。

**总结讨论与结论**
讨论部分指出,δ参数通过量化舌叶与舌背相对运动,分类准确性受准备动作不一致影响,但整体有效。结束帧对无载词语境最佳,因能稳定捕获/?/舌形;中间帧对有载词语境最佳,因/?/位于产生中间点。分类结果受感知评分不确定性影响,但适用于治疗而非诊断。游戏化UBT可基于挑战点框架设计渐进难度,提升患者动机。结论:优化后,可在实时UBT中基于δ参数分类准确与误发音的/?/,最佳帧选择为无载词语境使用结束帧,有载词语境使用中间帧。该系统为临床治疗残余/?/错误提供可行基础,需进一步验证。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号