面向语音障碍辅助沟通的级联语音转图像翻译框架
《Scientific Reports》:Adaptive speech-to-image translation for impaired speech using parameter-efficient ASR and diffusion-based image generation
【字体:
大
中
小
】
时间:2026年09月25日
来源:Scientific Reports 4.9
编辑推荐:
## 摘要
由于发音扭曲和不受控的重复,语音障碍持续给自动语音处理和人与计算机之间的多模态交互带来挑战。将语音障碍转化为视觉形式,可以为患有语音障碍的个体提供一种辅助的沟通方式;尤其是在文本输入往往是唯一可用的表达方式且难以被解读的情况下。本研究提出了一种级联语音转图像翻译
## 摘要由于发音扭曲和不受控的重复,语音障碍持续给自动语音处理和人与计算机之间的多模态交互带来挑战。将语音障碍转化为视觉形式,可以为患有语音障碍的个体提供一种辅助的沟通方式;尤其是在文本输入往往是唯一可用的表达方式且难以被解读的情况下。本研究提出了一种级联语音转图像翻译框架,该框架将自适应语音识别与基于扩散的图像生成相结合。在语音识别部分,基于Silero的语音活动检测进行了改进,并使用AdaLoRA进行了参数高效微调,同时采用大语言模型进行浅层融合,以在构音障碍条件下提高转录的鲁棒性;随后将精细化的文本输出用于条件化一个为受控图像合成而优化的潜在扩散模型。实验在公开可用的TORGO构音障碍语音语料库上开展。所提出的配置取得了0.125的词错误率(WER)和0.050的字错误率(CER),大幅优于基线Whisper模型。使用CLIPScore对生成图像与其条件文本提示之间的语义对应关系进行了量化评估,所提出系统的得分为30.18,表明相较于非自适应基线,该框架在多模态一致性方面表现更佳。定性结果进一步表明,该框架在自然场景、人物肖像和行动导向布局等多种提示类别中均能保持重要的语义特征。这些结果表明,语音识别的自适应在稳定下游视觉生成中起着关键作用,并支持了语音转图像翻译作为一种辅助沟通方式在语音障碍领域的可行性。
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号