《Advances in Biomarker Sciences and Technology》:AN IN-DEPTH EXPLORATION OF CNN-BASED DEEP LEARNING MODELS IN CERVICAL CARCINOMA ANALYSIS
编辑推荐:
宫颈癌对全球女性健康具有严重影响,被确认为女性癌症死亡的第4大主要原因。世界卫生组织(WHO)指出,每年约有660,000例新报告和350,000例死亡。早期检测疾病可使死亡率显著降低高达80%。目前,医生通过巴氏涂片(Pap smear)和阴道镜(colpo
宫颈癌对全球女性健康具有严重影响,被确认为女性癌症死亡的第4大主要原因。世界卫生组织(WHO)指出,每年约有660,000例新报告和350,000例死亡。早期检测疾病可使死亡率显著降低高达80%。目前,医生通过巴氏涂片(Pap smear)和阴道镜(colposcopy)图像检查宫颈活检来诊断宫颈癌。然而,该技术耗时较长,每例病例需数小时,且易出现误诊,诊断错误率在10-30%之间。深度学习在解决生物医学挑战方面展示了显著潜力,例如医学图像分析、疾病预测和图像分割。利用深度学习模型(如CNN、DenseNet和U-Net)的AI驱动诊断方法,在Herlev和SIPaKMeD等数据集上实现了超过95%的分类准确率。本文综述了用于宫颈癌识别和分析的各种深度学习策略,重点介绍了其性能指标、数据集和临床适用性。
论文主体部分总结如下:
**1. 引言**
**1.1 宫颈癌(Cervical Cancer)**:癌症是导致全球发病和死亡的主要原因,对公共卫生和医疗系统造成沉重负担。其多因素性质(由遗传、环境和生活方式影响)使预防和治疗高度复杂。尽管治疗方法不断进步,但全球癌症负担持续增加,每年有数百万新诊断病例。及时检测和准确诊断在改善患者生存率和降低医疗费用中起关键作用。在女性癌症中,宫颈癌仍是重大关切,尤其在筛查不足和诊断延迟的发展中地区,导致更高死亡率。生物标志物(Biomarkers)是早期检测癌症、确认诊断和追踪疾病进展或治疗反应的重要工具,可作为可测量的生物活动指标,揭示体内正常和异常过程。在癌症研究中,生物标志物可采取多种形式,包括基因突变、蛋白质水平、代谢变异或成像特征,帮助分类疾病类型并指导个性化治疗。深度学习模型,尤其是CNN,可提取基于图像的模式,作为数字或放射组学生物标志物,捕捉与疾病进展相关的细微结构和纹理变化。宫颈癌由子宫颈内异常细胞增殖引起,异常细胞称为发育不良(dysplasia),随时间逐渐发展。人乳头瘤病毒(HPV)感染是常见原因,超过90%的HPV感染无症状且自行消退。高危型HPV-16和18是导致高级病变和癌的主要因素。宫颈癌分为鳞状细胞癌和腺癌,鳞状细胞癌占90%病例。宫颈上皮内瘤变(CIN)是鳞状细胞的病理变化,分为CIN 1(轻度)、CIN 2(中度)和CIN 3(重度),其中CIN 1为低度鳞状上皮内病变(LSIL),CIN 2&3为高度鳞状上皮内病变(HSIL)。
**1.2 宫颈癌筛查和诊断方法(Cervical Cancer Screening and Diagnosis Methods)**:美国预防服务工作组(USPSTF)建议21岁开始进行巴氏涂片(Pap test),此后每3年筛查一次。世界卫生组织(WHO)建议女性30岁开始宫颈癌检测,每5-10年重复一次。HIV阳性女性应从25岁开始每3年筛查一次。全球战略建议终生至少进行两次高性能HPV检测,一次在35岁,另一次在45岁。检测方法包括:巴氏涂片(Pap smear)、HPV筛查、双重检测(Pap+HPV)、醋酸宫颈筛查(VIA)、薄层液基细胞学(ThinPrep Cytology)。巴氏涂片从宫颈采集细胞并显微镜检查,HPV筛查检测高危型HPV的DNA或RNA,双重检测结合两者提供更全面评估。阴道镜(colposcopy)使用放大镜观察宫颈、阴道和外阴,可疑区域可进行活检。醋酸宫颈筛查将稀释醋酸溶液涂抹于宫颈,异常区域变白(醋白病变)。薄层液基细胞学提供更清洁的样本,提高异常细胞检测率。表2总结了这些方法的有效性、频率、成本、敏感性(Sensitivity)、特异性(Specificity)以及所需培训和舒适度,并指出预测模型包括预训练CNN、深度CNN、深度特征提取+近邻成分分析(NCA)+三次支持向量机(Cubic SVM)、深度学习+多模型融合、深度CNN+集成、决策树和马尔可夫模型等。
**1.3 基于人工智能的模型(Artificial Intelligence (AI) based models)**:宫颈癌通常通过巴氏涂片、阴道镜和组织显微镜检查筛查和诊断。这些方法可靠但耗时,且结果因解读人员而异。研究人员开始寻找基于计算机的技术以辅助医生做出更快更准确的决策。人工智能(AI)使机器能够执行通常需要人类思维的任务,如学习、推理和决策。机器学习(ML)和深度学习(DL)是AI的主要分支,深度学习通过分层网络学习复杂数据模式,在计算机视觉和医学成像中超越传统方法。人工神经网络(ANN)类似人脑,从经验中学习。ML算法如K-means和模糊K-means用于检测和分割肿瘤区域。较新模型如RCNN、YOLO和CNN使图像检测更快更可靠。本文与以往综述不同,更针对性地考察基于CNN的深度学习方法在宫颈癌成像中的应用,包括关键架构(如ResNet、DenseNet、VGGNet和U-Net)在标准数据集(Herlev、SIPaKMeD、ISBI)上的比较,评估指标包括准确率、精确率、召回率和F1分数。还关注了最新进展,如混合模型和可解释AI(XAI)技术,并指出剩余研究挑战,最后概述了未来方向,旨在开发实时、临床可适应的宫颈癌诊断系统。
**2. 公共数据集描述(Public Dataset Description)**:该部分探讨了宫颈癌研究中广泛使用的数据集,来自多项研究。表3显示了数据集的详细分析。a) Herlev数据库:由丹麦Herlev大学医院开发,包含917张单细胞图像,分为7个类别:表层鳞状上皮、中层鳞状上皮、柱状上皮、早期非角化鳞状发育不良、中度非角化鳞状发育不良、重度非角化鳞状异常和鳞状细胞恶性肿瘤。前三类为健康细胞,其余为异常细胞。b) SIPaKMed数据库:包含4,049张标记图像,由细胞病理学专家手工编辑自966张簇细胞图像,分为5类:两种健康细胞(外层和中间细胞层)、两种发育不良细胞(挖空细胞型和角化不良型)和一种非恶性细胞(化生细胞)。c) ISBI 2014和2015挑战数据集:针对生物医学成像国际研讨会(ISBI)挑战设计,用于宫颈细胞图像分割。2014数据集包含16张真实宫颈细胞学EDF图像和945张生成图像,细胞重叠数2-5个。2015数据集包含9个系列的真实EDF宫颈细胞学图像,重叠细胞数2-10个。d) Intel & Mobile ODT宫颈癌检查数据集:来自Kaggle,包含6,734张标记图像,代表宫颈发育不良1、2、3型(CIN1、CIN2、CIN3)。e) UCI数据图书馆数据集:来自委内瑞拉中央大学,包含858名女性患者的36个特征记录,其中32个输入特征和4个目标属性(Hinselmann、Schiller试验、细胞学、活检)。f) 液基细胞学信息库:来自印度东北部三个医疗诊断中心,包含963张宫颈涂片样本图像,其中613张为阴性,350张为异常(包括113张重度鳞状发育不良、163张早期发育不良鳞状病变、74张鳞状上皮癌)。
**2.1 搜索方法论(Search Methodology)**:从IEEE Xplore、PubMed、Scopus、ScienceDirect和Google Scholar收集了2011年至2025年间发表的研究,使用关键词如“宫颈癌”、“深度学习”、“CNN”、“图像生物标志物”、“分割”和“分类”。根据定义的纳入和排除标准,选择了62篇同行评审论文,以提供广泛可靠的现有研究概述。
**3. 相关工作(Related Works)**:多项研究探讨了深度学习在宫颈癌诊断和分类中的应用。Ming Fang等人引入了融合块(Deep Synergistic Feature Fusion,DSFF),结合CNN和Transformer模块提取局部和整体特征,在SIPaKMeD、CRIC和Herlev数据集上进行了评估。Siyi Chai等人提出了双路径判别检测网络,用于识别宫颈涂片显微镜图像中的非典型细胞,在液基细胞学数据集和CRIC数据集上表现优越。Anousouyadevei等人提出了改进的图割(Graph Cut)驱动分割方法,使用改进的条件随机场和超像素语义分割,在Herlev数据集上实现了15%的平均准确率提升。Nina Youneszade等人设计了基于卷积网络的架构,使用阴道镜数字图像识别宫颈病变,在Intel & Mobile ODT数据集上达到98%的准确率和灵敏度。DeepLabv3+模型使用扩展的全卷积网络,从1042名阳性筛查女性中收集数据,用于识别严重宫颈异常和浸润性癌。随机投影的基于双线性CNN(RP-BCNN)方法在Herlev数据集上实现了二分类99%和七分类95%的准确率。Mohammed等人评估了十种深度卷积神经网络,使用迁移学习在单细胞细胞学图像上分类。Liu等人收集了薄层诊断细胞学数据集,构建了基于VGG16的自引导分类系统,达到98%的准确率。Orhan Yaman等人使用DarkNet-19或DarkNet-53的迁移学习,结合近邻成分分析(NCA)和SVM,在SIPaKMeD和Mendeley LBC数据集上分别达到98.26%和99.47%的准确率。混合深度特征融合策略在SIPaKMeD数据集上实现了2类、3类和5类分类任务99.85%、99.38%和99.14%的准确率,在Herlev数据集上达到98.32%(2类)和90.32%(7类)的准确率。表4总结了文献综述的关键发现,包括各研究的作者、年份、数据集、结果、主要发现和局限性。
**4. 神经网络在医疗成像中的应用(Neural Network Applications in Healthcare Imaging)**:在医学成像中,分割是重要且广泛研究的领域,旨在将图像分割成不同区域以促进细胞分析。由于每张玻片细胞数高达300,000,且方向各异、重叠,加上流体、炎症、血液、细菌和灰尘颗粒,需要AI驱动的分割。精确分割细胞核和细胞基质至关重要,因为细胞核为癌症诊断提供关键证据。工作流程包括图像获取、图像预处理、神经网络特征表示技术、图像分割和深度学习图像分类。图像获取指从各种来源捕获图像,大多来自公共数据库或医疗中心。图像预处理去除噪声,常用技术包括自适应维纳滤波、中值滤波和均值滤波。神经网络特征表示可通过结构化、非结构化和混合特征学习实现,其中监督学习常用CNN或专用CNN。图像分割方法包括基于模型的分割(如参数化可变形模型)、基于区域的分割(如统计区域生长)、基于阈值的分割(如Otsu算法)和基于像素的分割(如马尔可夫模型、神经网络、模糊聚类)。在细胞学中,准确分割细胞及其成分是诊断的关键步骤。深度学习图像分类常用迁移学习,包括预配置模型和修改现有网络,特征提取器包括VGGNet、AlexNet、ResNet和多层感知机神经网络(MLPNN),分类模型包括SVM、决策树(DT)、深度ANN和softmax回归。
**5. 应用于宫颈图像的深度学习架构(Deep Learning Architecture applied to cervical images)**:ResNet、VGG Net、Google Net/Inception和U-Net是宫颈癌图像分析中常用的深度学习网络模型。a) ResNet:残差网络,使用残差学习和跳跃连接,版本包括ResNet-18、34、50、101和152,具有瓶颈架构,每个残差块内嵌入三个卷积层以降低维度。b) VGG Net:VGG-16由牛津大学视觉几何组设计,包含13个卷积层和3个全连接层,使用3x3卷积滤波器和2x2池化,ReLU激活函数。c) Google Net/Inception:基于Inception模块,在同一层使用不同尺寸的滤波器(1x1、2x2、3x3)和池化操作,以减少参数和计算成本,版本1到4,解决了梯度消失问题。d) U-Net:U形架构,包含收缩路径(编码器)和扩展路径(解码器),编码器通过卷积和最大池化降低空间维度并增加特征通道,解码器通过上采样恢复空间维度,跳跃连接保留空间信息,用于精确分割。
**6. AI模型评估(Evaluation of AI Models)**:该部分概述了分割和分类算法的评估方法,包括相关公式。选择适当的性能指标可最小化算法比较中的失真。分割可靠性评估包括检测性能和分割精度,检测性能衡量定位目标区域的能力,分割精度衡量自动分割结果与真实图像的相似性。检测准确率通过精确率、召回率和F1分数评估。精确率是真正像素占所有阳性预测像素的比例,召回率是正确识别像素占真实像素的比例,F1分数是两者的调和平均。Dice系数有时纳入损失函数以直接优化分割重叠。分类评估指标包括准确率、精确率、召回率、灵敏度、特异性和F1分数,以及ROC-AUC曲线。表5列出了评估指标及其公式,包括准确率、精确率、召回率、F1分数、灵敏度、特异性、交并比(IoU)、Dice系数和曲线下面积(AUC)。使用K折交叉验证确保模型泛化能力。近期AI模型如ResNet-50、DenseNet-121和MobileNet-V2在分类任务中表现强劲,DenseNet-121达到99.75%的峰值准确率。U-Net在分割任务中达到约93%的准确率。与传统筛查方法相比,AI系统提供更高精度和一致性。表6总结了深度学习模型与性能指标的详细信息,包括ResNet-50、Cervical U-Net、A2SDenseNet-121、Faster R-CNN、AlexNet、EfficientNet-B0和MobileNetV2,列出了各自的数据集、大小、预处理、性能指标、验证和局限性。
**7. 结论(Conclusion)**:对评估的深度学习模型进行比较分析表明,尽管基于CNN的框架(如VGGNet、ResNet和DenseNet)实现了高精度和有效特征提取,但面临过拟合和高计算成本等挑战。轻量级和混合模型提供了更快的收敛和可扩展性,但可能损失复杂特征细节。数据集差异和评估方法不一致也影响模型可比性。解决这些问题,以及偏差和可重复性问题,对于确保AI驱动的宫颈癌诊断系统可靠临床实施至关重要。本文定量总结了基于CNN的深度学习方法在宫颈癌识别中的应用,强调了关键架构及其在标准数据集上的有效性,并识别了数据不足、类别不平衡和缺乏标准化等问题,提出了混合、可解释和偏差意识的方法以改进模型泛化和临床相关性。未来方向:未来工作应侧重于开发标准化和多样化的数据集,整合多模态临床信息,并利用可解释和隐私保护的AI模型。临床验证和获得监管批准的努力对于AI驱动的宫颈癌诊断系统的实际实施至关重要。