摘要
背景
深度学习在宫颈细胞学检测中展现出良好的性能,但许多研究使用的是预分割的单细胞图像,而非实际检测中出现的更为复杂的形态结构。本研究将散在细胞定义为孤立或分离、互不重叠的单细胞。研究探讨了基于这类细胞训练的人工智能模型应用于高色素密集细胞群时的性能下降情况。
方法
研究人员利用来自机构和公共机构的液基细胞学图像构建了二值卷积神经网络模型,通过散在细胞数据集区分无上皮内病变或恶性肿瘤病例与高级别鳞状上皮内病变病例。该散在细胞数据集包含101个病例的1062张图像;而独立的高色素密集细胞群数据集则包含48个病例的330张图像。ResNet-50、ResNeXt-50、ConvNeXt-Tiny、EfficientNet-B3、VGG-19和GoogLeNet这些模型都在散在细胞图像上完成训练后,直接应用于高色素密集细胞群,无需重新训练或调整阈值。
结果
所有模型在散在细胞数据集上的表现都很优异,接收者操作特征曲线下面积在0.950到0.996之间。而直接应用于高色素密集细胞群时,所有模型的性能都有所下降,AUC值在0.385到0.683之间。其中ConvNeXt-Tiny在高色素密集细胞群上的AUC值最高,为0.683,但仍远低于其在散在细胞数据集上的表现(0.996)。对于所有模型而言,高色素密集细胞群上的AUC值都显著低于散在细胞数据集。
结论
基于散在细胞图像训练的二值人工智能模型在原始应用场景中具有出色的区分能力,但直接应用于高色素密集细胞群时性能会下降。这些研究结果强调了在宫颈细胞学人工智能研究中进行直接验证以及设计针对高色素密集细胞群的模型的必要性。
利益冲突声明
作者声明不存在任何利益冲突。
数据可用性声明
相关图像取自“用于宫颈癌多类诊断的液基细胞学巴氏涂片图像”(Mendeley Data,版本4;doi:10.17632/zddtpgzv63.4),该数据遵循CC BY 4.0许可协议。我们在这些图像上添加了自己的标注层。本研究的相关数据可在合理请求下从对应作者处获取。


