《Optics & Laser Technology》:OpViT-CMchaCSop: Transformer encoder vision transformer based eye disease detection with Chebyshev map enhanced Chaotic cuckoo search optimization
编辑推荐:
摘要导致视力障碍的主要疾病包括青光眼、糖尿病视网膜病变以及年龄相关性白内障,全球约有2120万人受到影响。现有研究中已有多种学习模型被用于预测眼疾,比如决策树和随机森林。但这些模型存在诸多问题,包括计算复杂度高、准确率低、效率低、处理时间长等。为解决这些难题,本文设计了一种经过优
摘要
导致视力障碍的主要疾病包括青光眼、糖尿病视网膜病变以及年龄相关性白内障,全球约有2120万人受到影响。现有研究中已有多种学习模型被用于预测眼疾,比如决策树和随机森林。但这些模型存在诸多问题,包括计算复杂度高、准确率低、效率低、处理时间长等。为解决这些难题,本文设计了一种经过优化的视觉变换器编码器模型,并采用了有效的特征提取技术。该研究分为三个阶段:预处理、特征提取和分类。首先,ODIR数据集是一个开源数据集,用于收集图像样本;接着通过自适应双边萨维茨基-戈莱滤波器去除图像中的高斯噪声和椒盐噪声等干扰;之后再利用基于注意力机制的密集辅助双向长短时记忆模型进一步筛选重要特征。最终这些特征会被送入分类阶段,由优化的基于布谷鸟算法的视觉变换器编码器模型进行分类,可将眼疾分为正常、白内障、糖尿病、青光眼、高血压、近视及年龄相关问题几类。研究通过ODIR数据集对所提方法的性能进行了评估,结果显示该模型的F1分数为94.86%,卡帕值为93.98%,召回率为95.32%,精确率为94.87%。此外,还通过消融实验进一步证明了该模型的有效性。
引言
良好的生活品质以及避免失明,都依赖于对眼病的早期发现和及时治疗。白内障、糖尿病视网膜病变、青光眼、近视以及与高血压相关的视网膜病变等眼疾是导致视力障碍的主要原因,因此需要准确的早期诊断才能实现有效治疗。使用传统诊断方法时,由于医生临床经验和诊断能力的差异,往往容易出现误诊。眼部的液体积聚会引发青光眼,这种病症会损害视神经并导致眼压升高[1],受影响的视神经会使杯盘比上升,同时还会使视盘及视网膜层功能受损。另一种眼部疾病也会使视盘变大,颜色从粉红色变为淡色[2]。青光眼的筛查非常重要,不过这项工作既繁琐又耗时,通常由眼科医生借助计算机辅助诊断系统来完成[3]。位于眼睛后方的感光组织视网膜如果其血管受到损伤,就会引发糖尿病视网膜病变。在非增殖性糖尿病视网膜病变阶段,眼睛内无法形成新的血管。糖尿病视网膜病变又可分为急性型和晚期型两种。增殖性糖尿病视网膜病变是晚期型的另一种说法,它会引发视网膜异常血流,破坏血管,导致玻璃体从眼球中心渗出。眼部区域的血管若阻碍液体正常流动,还会损害视神经,进而引发青光眼[4]。
视网膜中分布着血管,通过扩张卷积技术可以对这些血管进行分割,再结合高斯导数滤波器和中值滤波器这两种过滤方法,就能更精准地定位血管分支点[5]。如今,为了更高效地检测视网膜异常,人们开始使用更为先进的成像技术——最佳相干断层扫描,该技术能为眼疾的评估和治疗带来极大便利[6]。这是一种非侵入性的成像技术,能够利用光波生成高分辨率的视网膜图像[7],在二维或三维的OCT图像中可以清晰看到视网膜的结构和厚度[8]。OCT技术还被用于评估和诊断黄斑疾病,比如年龄相关性黄斑变性和糖尿病性黄斑水肿,这类疾病都会导致失明和视力障碍[9]。
OCT图像是由DL网络模型生成的[10]。在基于CNN的架构中,还出现了用于从OCT图像中分割视网膜囊肿的RF网络[11]。深度学习也被用来预测OCT图像中的视力状况[12]。深度学习方法无需进行特征识别、计算和病灶分割,因此能更高效地构建计算机辅助诊断系统。卷积神经网络在眼疾的分类和分割领域也表现出了巨大潜力,这类技术在计算机视觉和图像处理领域应用广泛[13]。深度学习算法的核心目标是生成尽可能接近真实值的预测结果,从而提升疾病检测的准确性和可靠性。在训练过程中,神经网络会借助优化技术实现正向和反向传播,从而找到最佳参数并加快训练速度[14]。该深度学习方法通过密集神经网络将视网膜图像分为糖尿病视网膜病变阳性组和阴性组,实验结果显示其验证准确率为66.8%,训练准确率为96.68%[15]。
章节要点
相关研究
以下部分汇总了近期一些与眼疾检测相关的研究成果:
Minija等人[16]提出了一种优化的卷积神经网络OpCoNet,用于分析视网膜图像,判断糖尿病视网膜病变的严重程度。该网络提升了分类和特征提取的性能,整个流程包括特征提取、分类和预处理等多个步骤,用于糖尿病视网膜病变的检测时,该测试模型还与
提出的方法
本研究旨在通过一种新型优化的视觉变换器模型来预测眼疾。图1展示了该模型的结构示意图。
首先从开源数据集ODIR中获取输入图像,在预处理阶段通过自适应双边萨维茨基-戈莱滤波器去除图像中的噪声,随后将提取出的关键特征送入分类阶段,利用这些特征识别不同类型的眼疾
结果与讨论
本研究采用了改进的深度学习技术来识别眼疾,所提出的眼疾检测方法也是基于ODIR数据集实现的。
结论
本文采用了一种全新的基于视觉的优化方法来分类眼疾。以往的研究中,这类任务的分类多依靠CNN、FRCNN、DeepDR、DRCNN和OpConet等单一深度学习模型,这些模型的准确率较低,且使用的图像数据来源也各不相同。而在本文提出的模型中,会先使用AD-BiSGF模型去除不必要的噪声,再通过Att-Den-BiLSTM模型提取特征,最后通过相应方法对不同类型的眼疾进行分类
CRediT作者贡献说明
Nisha Ramesh Wankhade:撰写——审阅与编辑,撰写——初稿,项目管理。Kishor K. Bhoyar:撰写——审阅与编辑,撰写——初稿,指导监督,项目管理。
资金支持
本手稿的撰写没有获得任何资金支持。
伦理审批
本文不存在任何由作者参与的人体或动物实验相关内容。
参与同意书
所有参与研究的作者均同意将本文投稿发表。
发表同意书
参与本手稿撰写的所有作者均完全同意发表这篇文章。
利益冲突声明
作者声明,他们不存在任何可能影响本文研究结果的已知财务利益关系或个人关系。
Nisha Ramesh Wankhade|Kishor K. Bhoyar