《PLOS One》:Colorectal Lesion diagnosis using transformer and deep learning with multiscale feature interface
编辑推荐:
大肠癌是全球第三大常见恶性肿瘤。人工筛查需要专业知识和资源。然而,人工智能(artificial intelligence,AI)的进步降低了计算负担和时间。机器学习和深度学习近期已被用于诊断大肠病变。手工特征的需求使机器学习模型依赖专业知识。同时,经典卷积神
大肠癌是全球第三大常见恶性肿瘤。人工筛查需要专业知识和资源。然而,人工智能(artificial intelligence,AI)的进步降低了计算负担和时间。机器学习和深度学习近期已被用于诊断大肠病变。手工特征的需求使机器学习模型依赖专业知识。同时,经典卷积神经网络(convolutional neural network,CNN)忽略了特征的全局注意力。研究人员提出了CDCTNet(colorectal diagnosis convolution transformer network,大肠癌诊断卷积Transformer网络),一种用于大肠疾病检测的分层模型。该模型利用两个卷积块提取病变的局部高维空间特征。此外,ViT编码器与CNN块并行使用,以提供特征图的全局关联。进一步,研究人员设计了IEM块用于卷积块与ViT编码器之间的特征交互,以增强对特征的注意力。CDCTNet在Kather和Kvasir数据集上评估,获得精确率(precision)96.60%和Kappa分数95.02%。同时,CDCTNet的召回率(recall)和F1分数分别为98.08%和97.94%。
研究背景方面,大肠癌(colorectal cancer,CRC)为全球第三大常见恶性肿瘤,年新增超190万例、死亡近90万例,早期筛查可显著降低死亡率,但结肠镜、粪便免疫化学检测(FIT)、CT结肠成像及分子检测(如错配修复缺陷dMMR、微卫星不稳定MSI)等手段在低收入地区覆盖不足,导致晚期确诊比例高。传统机器学习依赖手工特征且需专家经验,经典卷积神经网络(convolutional neural network,CNN)缺乏全局上下文建模能力,单纯Vision Transformer(ViT)对局部纹理感知弱,因此亟需融合局部空间与全局语义的轻量可解释架构。研究人员开展CDCTNet研究,在Kather(HE染色组织病理图,8类5000张150×150)与KvasirV2(内镜图,8类8000张)上验证,取得精确率96.60%、Kappa 95.02%、召回率98.08%、F1 97.94%,AUC达0.9785(Kather)与0.9918(KvasirV2),跨域测试EBHI数据集精确率93.58%,证明CNN-ViT协同与IEM交互可有效提升大肠病变分类性能,对辅助病理与内镜筛查具临床转化意义。论文发表于《PLOS One》。
关键技术方法上,研究人员采用双分支并行架构:CNN支路由Conv1(32核+2×2最大池化)与Conv2(64核+2×2最大池化)提取多尺度局部高维空间特征;ViT支路将图像切为16×16块并加位置嵌入,经多头自注意力(multi-head self-attention,MHSA)捕获全局关联;设计信息交换模块(information exchange module,IEM)将CNN特征图扁平化后经稠密层对齐至ViT令牌维度(Kather:N=361,D=384;KvasirV2:N=1444,D=384),以可学习标量平衡贡献后融合并回注MHSA;分类头用全局平均池化(global average pooling,GAP)与softmax(K=8类)。损失函数采用分类交叉熵与各向同性损失(余弦相似度+欧氏距离)加权混合。训练于NVIDIA Quadro RTX 4000,Adam初始学习率1e-4、batch=32、140 epoch,KvasirV2按患者级拆分、Kather按类别分层随机拆分(8:2)。
研究结果部分,第4节结果显示:在Kather与KvasirV2验证集上混淆矩阵假阳性分别20与21、假阴性24与14;CDCTNet在KvasirV2精确率96.60%、Kappa 95.02%、F1 97.94%、召回98.08%。第5.1节SOTA对比中,CDCTNet在Kather的F1 96.10%、召回95.60%优于ResNet50、InceptionV3、MobileNetV3、YOLOV9、MnasNet、CellViT;KvasirV2上F1 97.94%、召回98.08%居首。第5.2节损失曲线表明Kather验证损失60 epoch后降至0.1附近,KvasirV2 40 epoch后趋零。第5.3节ROC显示Kather的AUC 0.9785、KvasirV2的AUC 0.9918均最高。第5.4节消融证明CNN+ViT较单CNN精确率提升约5.48%(Kather),加IEM后再升至95.02%(Kather)/97.81%(Kvasir)。第5.5节patch尺寸实验中8×8最优(Kather精确率96.60%),4×4计算贵、32×32退化。第5.6节跨传感器测试以Kather训练、EBHI(6类组织病理)测试,精确率93.58%、F1 94.21%、AUC最高腺管腺癌0.9812。第5.7节Grad-CAM热区与病理标注区域重合,证实模型聚焦病变实质。第5.8节损失超参中各项向同性权重0.10、余弦0.7/欧氏0.3组合最优(精确96.01%)。
讨论部分指出,CNN-ViT并行配合IEM双向交互解决了局部细节与全局语义割裂问题,混合损失约束特征空间几何提升小样本泛化;但注意力计算成本仍高,且Kather/KvasirV2缺患者级标识未能做严格患者级划分,跨中心真实队列待补。结论部分翻译:本研究提出CDCTNet分层模型,利用双卷积块提取病变局部高维空间特征,ViT编码器提供空间特征图全局关联,IEM块实现卷积与ViT间特征交互;在Kather与Kvasir数据集较SOTA取得精确率96.60%、Kappa 95.02%、召回98.08%、F1 97.94%;未来将探索轻量注意力机制与特征优化算法,并在多样实时大肠疾病数据集验证,同时需引入患者标识以支持患者级训练测试。