基于BiLSTM注意力机制与Transformer模型的临床文本数据肺癌检测增强方法

《Scientific Reports》:Enhanced lung cancer detection using BiLSTM attention and transformer models on clinical text data

【字体: 时间:2026年09月04日 来源:Scientific Reports 4.9

编辑推荐:

  摘要 肺癌仍然是全球主要的死亡原因,早期精准检测对于改善患者预后至关重要。在本研究中,研究人员提出了一种增强的肺癌预测与检测方法,通过结合双向长短期记忆网络(Bidirectional Long Short-Term Memory, BiLSTM)、注意力

  
摘要
肺癌仍然是全球主要的死亡原因,早期精准检测对于改善患者预后至关重要。在本研究中,研究人员提出了一种增强的肺癌预测与检测方法,通过结合双向长短期记忆网络(Bidirectional Long Short-Term Memory, BiLSTM)、注意力机制(attention mechanism)以及基于变换器(transformer)的模型。该混合模型有效解决了临床文本数据中常见的过拟合(overfitting)、数据不平衡(data imbalance)以及长序列依赖(long-sequence dependencies)等问题。研究采用了一个精心整理的患者医疗记录数据集,包括人口统计学信息、症状、放射学报告及其他临床信息,以评估模型性能。实验结果显示,所提模型的预测准确率显著提升,达到了99.8%的准确率,并将验证损失显著降低至0.3112,优于现有系统。注意力机制与BiLSTM及Transformer模型的融合增强了模型聚焦关键临床特征的能力,从而提升了其泛化性能。此外,该模型更快的训练时间(13.99秒)证明了其在临床应用中的实用性,特别是在资源受限的环境中。尽管结果令人鼓舞,但小数据集可能带来的过拟合风险提示需要更大规模的数据集和更先进的正则化方法进行进一步研究。本研究凸显了先进深度学习技术在肺癌检测中的潜力,提供了一种稳健、高效且准确的工具,可整合至临床决策流程中,以实现及时准确的诊断。
**基于BiLSTM-Attention与Transformer混合模型的临床文本肺癌检测研究解读**

**一、研究背景与问题**

肺癌是全球癌症相关死亡的首要原因,每年约导致180万人死亡,占所有癌症死亡总数的近18%。高死亡率主要归因于晚期诊断,此时治疗选择有限且生存率较低。在加拿大,肺癌导致的死亡人数超过乳腺癌、结直肠癌和前列腺癌死亡人数的总和,给个人、家庭和医疗系统带来了巨大的情感和经济负担。早期检测肺癌可大幅降低死亡率,因为早期诊断时治疗效果更为有效。然而,早期肺癌检测面临的主要障碍之一是早期阶段缺乏特异性症状,以及临床数据的复杂性。患者常表现出咳嗽、体重减轻和呼吸急促等常见于多种呼吸系统疾病的非特异性症状。此外,临床记录、放射学报告和诊断结果的大量积累进一步增加了准确识别高风险患者的难度。

传统机器学习模型在处理大规模基于文本的临床数据集方面面临挑战。决策树、支持向量机和基础神经网络等经典算法难以应对非结构化临床文本的复杂性,这些文本通常包含细微的医学语言和不断变化的患者状况。这些模型严重依赖人工特征提取和浅层学习方法,限制了其捕捉医学叙述中更广泛上下文的能力,可能导致重要肺癌指标被遗漏,造成诊断延迟或不准确。传统模型的另一个关键局限是无法随数据集规模有效扩展。随着数据集增大,传统模型因无法捕捉序列文本数据中的长期依赖或上下文关系而出现性能退化。

尽管机器学习已有进展,循环神经网络(RNN)和Transformer等模型在应用于医疗文本数据时仍存在挑战。过拟合是突出问题之一,模型在训练数据上表现良好但无法泛化至未见数据,这在隐私问题和数据收集困难导致的有限临床数据集中尤为常见。此外,临床记录中的长序列依赖管理也是一项挑战,传统RNN和基础LSTM因梯度消失问题难以捕捉这些长期依赖,导致文本早期重要上下文信息丢失,负面影响预测准确性。

**二、研究目标与创新**

本研究的主要目标是通过使用先进深度学习技术,特别是带注意力机制的BiLSTM和基于Transformer的模型(如BERT),提高肺癌预测和检测的准确性与可靠性。这些模型旨在通过高效处理大型文本数据集和捕捉临床叙述中的复杂关系,解决传统机器学习技术的局限性。BiLSTM网络能够双向处理文本,确保模型同时捕捉过去和未来的上下文,这对理解临床报告的复杂性质至关重要。基于Transformer的模型(如BERT)引入自注意力机制,擅长捕捉文本中的长距离依赖,使其在处理非结构化数据(如临床报告)方面高效。该混合模型采用并行架构设计:BiLSTM+Attention分支捕捉局部序列依赖并强调关键临床特征;Transformer(BERT)分支提取长距离语义上下文;输出通过拼接融合后进行最终分类。这种晚期融合策略使模型能够结合时间模式与全局上下文语义。

**三、关键技术方法**

研究采用了包含960份匿名临床记录的数据集,来自私人机构来源,其中恶性病例370例、良性病例590例,此外还使用了Kaggle上由MD. Arif Ahmed开发的肺癌结构化临床数据集(约30万条患者记录、约60个临床和人口统计学特征)。针对数据不平衡问题,研究人员应用合成少数类过采样技术(SMOTE)生成合成少数类样本,实现了384比384的平衡分布。预处理流程包括小写化、词形还原(lemmatization)、停用词移除以及使用统一医学语言系统(UMLS)词库进行缩写扩展。模型架构由BiLSTM注意力分支和BERT变换器分支组成,采用晚期融合策略,并使用类别加权二元交叉熵损失函数、L2正则化、早停机制和五折交叉验证。评估指标包括准确率、精确率、召回率、F1-score、马修斯相关系数(MCC)、AUC-ROC和Brier分数。

**四、研究结果**

**模型性能**
BiLSTM注意力模型有效捕捉了临床文本数据中的序列模式,实现了100%的准确率和0.3112的验证损失。注意力机制通过聚焦医学叙述中最关键的特征提升了两种模型的性能。模型展现出高精确率和召回率,F1-score达到1.0,AUC-ROC值接近1.0,反映了优异的分类能力。五折交叉验证的平均准确率为96.7%,证实混合模型对未见数据具有良好的泛化能力。

**过拟合与不平衡处理**
研究通过正则化、dropout(比率0.3)和早停技术解决了过拟合问题。采用过采样少数类(肺癌患者)和欠采样多数类来平衡数据,确保模型不会偏向预测多数类。L2正则化和早停机制进一步防止过拟合。SMOTE仅应用于训练折,验证集和测试集不被改变。

**关键发现**
基于Transformer的模型(如BERT)在处理长临床文本序列方面优于BiLSTM模型,这归因于其自注意力机制能够保留文本中的长距离依赖。BiLSTM模型中的注意力机制通过聚焦输入数据中最相关的部分,显著提高了预测准确性并有助于降低验证损失。模型的快速训练时间(13.99秒)强调了其在计算资源有限的临床环境中的实用性。

**现有系统与所提系统的比较**
与独立模型相比,所提出的混合模型在所有评估指标上均表现优异。BiLSTM和BERT模型的准确率分别为91.20%和93.80%,而混合模型达到100%的准确率、F1-score和AUC。消融研究显示,完整混合模型结合所有三个组件(BiLSTM、注意力机制和BERT)取得最佳性能,移除任一组件都会导致明显性能下降,凸显了各架构元素在实现稳健肺癌预测中的重要性。

**五、讨论与结论**

研究表明,BiLSTM与注意力机制及Transformer模型的整合为肺癌预测和检测提供了实用且有效的方案。与先前研究相比,混合BiLSTM-Transformer模型在处理长序列依赖和不平衡数据集方面表现优越。传统机器学习模型难以处理非结构化临床文本数据,而本研究的模型通过BiLSTM处理短期依赖、Transformer模型处理长期依赖,注意力机制增强对关键特征的聚焦,有效克服了这些挑战。

研究的局限性包括数据集规模相对较小,可能贡献过拟合风险,以及Transformer模型的计算资源需求较高。未来研究方向包括使用更多样化和更大规模的数据集提高模型泛化能力,探索联邦学习以实现隐私保护的数据共享,以及优化模型在不同硬件配置上的性能。

研究结论表明,该混合模型有效捕捉临床文本数据中的短期和长期依赖,实现了高度准确的预测。通过实现100%的准确率并将验证损失显著降低至0.3112,该模型解决了医学数据集中的常见挑战,如过拟合和类别不平衡。其混合设计提高了肺癌检测系统的可解释性和性能,为临床使用提供了实用解决方案。本研究的主要贡献在于克服了早期模型在管理长文本序列、非结构化数据和不平衡数据集方面的局限性,为肺癌检测提供了超越传统机器学习技术的强大框架。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号