《Scientific Reports》:Hybrid vision transformer framework for congenital heart disease diagnosis
编辑推荐:
针对传统先天性心脏病诊断成本高、依赖专家经验及抗噪性不足等问题,本研究提出基于心音信号的混合视觉Transformer(H_ViTs)模型,融合卷积神经网络局部特征提取与视觉Transformer全局建模优势。在ZCHSound儿科心音数据集上,该模型多项指标优于既往报道,为自动化辅助诊断提供新思路,但仍需优化类别不平衡与噪声鲁棒性。
先天性心脏病是最常见的出生缺陷之一,也是导致婴幼儿发病和死亡的重要原因。想象一下,如果能在婴儿出生后第一时间,通过一种低成本、自动化的方式快速筛查出潜在的心脏问题,就能为后续的干预治疗争取宝贵的时间,显著改善患儿预后。然而,传统的诊断方法虽然有效,却面临着诸多挑战:检查费用高昂,诊断结果高度依赖心脏科专家的经验判断,而且容易受到环境噪音的干扰,这些都限制了其在大规模筛查中的普及。近年来,深度学习技术的飞速发展为解决这些痛点带来了曙光,它有望突破传统方法的局限,实现高精度、自动化的疾病诊断。正是在这样的背景下,一项聚焦于利用人工智能技术革新先天性心脏病诊断的研究应运而生,相关成果已发表在《Scientific Reports》上。
为了探索更高效的诊断路径,研究人员将目光投向了混合视觉Transformer(Hybrid Vision Transformer, H_ViTs)模型,并尝试将其应用于基于心音信号的先天性心脏病诊断中。他们提出的这一创新架构,巧妙地结合了卷积神经网络(Convolutional Neural Networks, CNNs)在局部特征提取上的优势,以及视觉Transformer(Vision Transformer, ViT)在捕捉全局模式方面的特长。通过将心音信号转换为频谱图表示,模型能够同时捕捉到频谱图中局部的细微特征和全局的依赖关系。研究团队使用了近期发布的开源ZCHSound数据集,该数据集包含了大量儿童儿科心音录音,为模型的训练和评估提供了坚实的数据基础。在评估环节,他们采用了准确率(accuracy)、精确率(precision)、召回率(recall)、F-1分数(F-1 measure)以及混淆矩阵(confusion matrix)等一系列标准评价指标。实验结果显示,与之前在同一数据集上报道的结果相比,他们所提出的混合模型取得了更优的性能表现。不过,研究也发现,在多分类任务中,尤其是对于那些数据量有限的类别,模型的诊断效果仍有待提升。总体而言,这项研究表明,所提出的混合模型能够有效检测先天性心脏病,但要进一步提升其应对类别不平衡和噪声干扰的稳健性,还需要更多的努力。
关键技术方法
研究采用混合视觉Transformer(H_ViTs)架构,融合卷积神经网络(CNNs)的局部特征提取能力与视觉Transformer(ViT)的全局模式建模优势,处理心音信号的频谱图表示。实验基于开源ZCHSound儿童儿科心音数据集开展,通过准确率、精确率、召回率、F-1分数及混淆矩阵等指标评估模型性能,并与既往同数据集研究结果进行对比分析。
研究结果
Abstract
研究提出基于心音信号的混合视觉Transformer(H_ViTs)模型用于先天性心脏病诊断,该架构结合卷积神经网络局部特征提取与视觉Transformer全局模式建模能力,可同时捕捉心音频谱图的局部依赖与全局依赖。使用ZCHSound儿科心音数据集评估,模型性能优于既往同数据集报道结果,但多分类任务中数据量有限类别的表现相对较差。结论表明混合模型可有效检测先天性心脏病,仍需优化以提升对类别不平衡和噪声的稳健性。
研究结论和讨论
本研究成功构建了融合卷积神经网络与视觉Transformer的混合模型(H_ViTs),并将其应用于基于心音信号的先天性心脏病自动化诊断。通过在ZCHSound数据集上的验证,证明了该方法相较于传统方法及既往报道模型的有效性,为先天性心脏病的早期筛查提供了一种新的技术路径。研究的核心价值在于,它不仅验证了混合架构在心音信号处理中的潜力,也为解决传统诊断方法中成本高、依赖专家经验及抗噪性不足等问题提供了切实可行的方案。然而,研究也客观地指出了当前模型的局限性,即在多分类任务中,对于样本量较少的疾病类别,诊断精度仍有待提高。这表明,未来的研究需要重点关注如何通过数据增强、损失函数优化等手段缓解类别不平衡问题,并进一步提升模型在复杂噪声环境下的鲁棒性。总体而言,这项工作为人工智能辅助心血管疾病诊断领域增添了新的证据,具有重要的临床应用前景和科研参考价值。