摘要
在内镜检查过程中早期发现胃和结直肠息肉对于预防癌症进展至关重要;然而,由于病变外观细微、大小差异以及临床工作流程的快速推进,人工识别仍然具有挑战性。基于YOLO的目标检测模型在实时计算机辅助检测方面展现出强大潜力,但在多尺度表征、小息肉检测以及在未增加计算成本的情况下维持精度方面仍存在局限。为解决这些挑战,我们开发了一种基于增强型YOLOv12s的内镜息肉检测专用成像框架。该系统整合了三项关键创新:(1)RouteHead,一种自适应多尺度特征路由机制,能够动态融合来自多个特征金字塔层级(P2-P5)的特征,从而实现对小病灶和细粒度病变的改进检测;(2)在训练期间使用的辅助检测头,用于自蒸馏,在不影响推理性能的前提下增强表征学习;以及(3)任务特定的损失函数,包括用于精确定位的α-CIoU、用于边界精细化的边缘感知损失和用于更深特征一致性的自蒸馏损失。该模型在一个由四个公开基准测试集(Kvasir-SEG、CVC-ClinicDB、CVC-ColonDB和ETIS-LaribPolypDB)汇总的2188张图像组成的多中心结肠镜数据集上进行了评估。对于缺乏边界框标注的数据集,系统性地将分割掩膜转换为YOLO格式的标签,以确保各数据集之间标注的一致性。训练采用分层数据划分策略,保留独立测试集并进行五折交叉验证,以获得稳健的性能估计。增强后的模型取得了mAP@50–95为0.6976、精确度为0.9300、召回率为0.9069、F1得分为0.9182的成绩,在各验证折中始终达到或超过基准YOLOv12s架构的性能,并在计算成本仅为大模型的一小部分时实现了与大得多的检测器统计上相当的检测精度。尽管精度有所提高,所提出的框架在计算效率方面仍然表现优异,参数量为881万,计算量为7.92 GFLOPs。通过将自适应多尺度特征路由与基于自蒸馏的训练相结合,所提出的成像系统有效地克服了现有实时内镜检测方法的关键局限。检测精度、跨多数据集的鲁棒性与计算效率之间的良好平衡使得该框架适用于实用的计算机辅助内镜系统,有望提高早期检出率并减轻临床医生在常规检查中的认知负担。
利益冲突声明
作者声明不存在利益冲突。
数据可用性声明
本研究使用的数据集为开源且公开可用的。主要数据集为Kvasir-SEG数据集(https://datasets.simula.no/kvasir-seg/)。本研究还汇总了三个公开可用的息肉检测基准测试集:CVC-ClinicDB(https://polyp.grand-challenge.org/CVCClinicDB/)、CVC-ColonDB(http://mv.cvc.uab.es/projects/colon-qa/cvccolondb)和ETIS-LaribPolypDB(https://polyp.grand-challenge.org/ETISLarib/)。训练后的模型权重、推理和视频处理脚本、预处理及掩膜至YOLO标注生成代码、自定义模型定义和数据划分描述文件,可通过合理请求向通讯作者获取。


