基于多光谱特征驱动与深度神经网络架构的呼吸疾病分类人工智能框架

《AI》:Artificial Intelligence Framework for Respiratory Disease Classification Using Multi-Spectral-Feature-Driven and Deep Neural Architectures

【字体: 时间:2026年08月20日 来源:AI 6.5

编辑推荐:

  在全球范围内,呼吸疾病如哮喘(Asthma)、慢性阻塞性肺疾病(COPD)和肺炎(Pneumonia)显著影响人群,需要早期准确诊断以进行有效临床管理。传统诊断方法中,人工听诊和专家解读存在常见缺陷,导致耗时长且分析不一致。为解决这些局限,研究人员提出了一种基

  
在全球范围内,呼吸疾病如哮喘(Asthma)、慢性阻塞性肺疾病(COPD)和肺炎(Pneumonia)显著影响人群,需要早期准确诊断以进行有效临床管理。传统诊断方法中,人工听诊和专家解读存在常见缺陷,导致耗时长且分析不一致。为解决这些局限,研究人员提出了一种基于人工智能(AI)驱动的呼吸疾病分类框架,利用多光谱特征提取和深度学习架构,对四种呼吸状态(哮喘、COPD、肺炎和健康)进行分类。数据集来自Kaggle的呼吸声音数据库和COUGHVID V3数据库,共包含322个哮喘信号、746个COPD信号、323个肺炎信号和174个健康信号。随后,使用四种特征提取技术——常数Q变换(CQT)、伽马通声谱图(Gammatone spectrogram)、梅尔频率倒谱系数(MFCC)和感知线性预测(PLP)提取特征,并将这些提取的频谱表示作为输入提供给多种深度学习模型,如深度卷积神经网络(Deep CNN)、时间注意力网络(TAN)和自编码器(Autoencoder),用于自动特征学习和疾病分类。所提出的框架使用多种性能指标进行评估,实验结果表明,所提出的分类框架的性能强烈依赖于频谱特征提取技术和深度学习模型的选择。在所有评估的组合中,自编码器模型与CQT特征结合表现出最佳分类性能,准确率为98.72%,精确率为98.74%,召回率为98.72%,马修斯相关系数(MCC)为98.11%,Cohen's Kappa值为98.10%,对数损失最小为0.025。所提出的人工智能(AI)驱动的呼吸疾病分类框架已证明能够产生可靠的计算辅助诊断系统,适用于智慧医疗应用和自动化肺部疾病筛查。
论文解读文章

研究背景:呼吸疾病(如哮喘、慢性阻塞性肺疾病(COPD)和肺炎)在全球范围内严重影响人群健康,早期准确诊断对有效临床管理至关重要。传统诊断方法依赖人工听诊和专家解读,存在耗时长、分析不一致等缺点。此外,基于影像(如胸部X光片、CT)的诊断方法虽有一定效果,但需要专业放射科医生、昂贵基础设施,并涉及辐射暴露,限制了连续监测。现有基于机器学习的音频分析方法虽具潜力,但传统机器学习模型高度依赖手动特征工程,且分类范围有限,限制了其实用性和可扩展性。同时,感知线性预测(PLP)和伽马通滤波器组等高级感知特征在呼吸声音分类中尚未充分探索,因此需要多光谱特征方法。为此,研究人员提出了一种基于人工智能(AI)的呼吸疾病分类框架,利用多光谱特征提取和深度学习架构,旨在提高分类准确性,为智慧医疗提供可靠的计算辅助诊断系统。该论文发表在《AI》期刊。

主要关键技术方法:研究人员使用了四种多光谱特征提取技术:常数Q变换(CQT)、伽马通声谱图、梅尔频率倒谱系数(MFCC)和感知线性预测(PLP)。这些特征被输入到三种深度学习模型中:深度卷积神经网络(Deep CNN)、时间注意力网络(TAN)和自编码器(Autoencoder)。数据集来自Kaggle的呼吸声音数据库和COUGHVID V3数据库,共包含322个哮喘信号、746个COPD信号、323个肺炎信号和174个健康信号。预处理包括修剪和归一化。模型在Google Colab环境中使用Python 3.12.13实现,性能评估指标包括准确率、精确率、召回率、马修斯相关系数(MCC)、Cohen's Kappa、对数损失和ROC-AUC。

研究结果:
- **4.1 预处理与特征提取方法**:原始呼吸信号存在幅度波动和背景噪声,经修剪和归一化后,信号幅度分布更稳定。CQT声谱图以对数间隔频率表示,增强了低频呼吸事件(如喘息和爆裂音)分析;伽马通声谱图模拟人耳听觉系统,抑制噪声并突出感知显著的频率区域;MFCC特征捕获紧凑的倒谱信息;PLP声谱图增强感知重要声学成分,减少冗余频谱变化。多光谱特征提取技术有效捕获了呼吸声音的附加信息。
- **4.2 性能评估**:Deep CNN模型与伽马通特征结合,在热图分析中显示高分类性能,准确率96.81%,精确率95.12%,召回率96.81%,Kappa值95.1%。TAN模型与CQT特征结合,准确率88.49%,精确率88.27%,召回率88.50%,MCC 83%,Kappa 82.57%,但健康类和肺炎类误分类较高。自编码器模型与CQT特征结合实现最佳性能,准确率98.72%,精确率98.74%,召回率98.72%,MCC 98.11%,Kappa 98.10%,对数损失0.025。与其他特征组合相比,CQT结合自编码器表现出最一致和可靠的结果。
- **4.3 四分位距与离群值分析**:箱线图显示,Deep CNN模型与伽马通特征中位数准确率96-97%;TAN模型与CQT特征中位数准确率88%,方差低;自编码器模型与CQT特征中位数准确率99%,四分位距窄,表明稳定性最高。综合比较,自编码器-CQT框架在准确性和稳定性上优于其他模型。ROC曲线分析显示,自编码器-CQT模型对所有四类呼吸状况的AUC值均较高(COPD和肺炎为0.998,哮喘为0.991,健康为0.998)。精确率-召回率曲线分析显示,COPD的平均精确率(AP)为0.997,肺炎为0.992,哮喘为0.980,健康为0.951。
- **4.4 与现有先进架构比较**:与文献中1D-CNN、CNN-LSTM和Transformer架构相比,所提出的自编码器-CQT框架准确率98.72%,优于CNN-LSTM(73.69%),与1D-CNN(98%)和Transformer(97%)性能相当,且计算复杂度较低。

总结讨论:研究结论部分指出,所提出的框架证明了将适当的频谱表示与深度学习架构相结合,能够显著提高基于声学信号的呼吸疾病自动分类性能。在评估的方法中,自编码器与CQT特征结合表现出最一致的最强性能,表明同时保留呼吸声音的频域和时间属性对于区分哮喘、COPD、肺炎和健康状况有效。ROC分析验证了自编码器-CQT框架的优越判别能力,AUC值高,显示出色的灵敏度和特异性。TAN架构因呼吸类别间声学特征重叠而表现较差。Deep CNN与伽马通声谱图特征结合提供良好的分类能力。箱线图分析确认了框架的一致性、鲁棒性和稳定性。未来工作将包括患者级数据划分与k折交叉验证、多中心临床数据集评估以及外部合作验证,以增强框架的鲁棒性和临床意义。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号