《Journal of Eye Movement Research》:Participant-Independent Classification of Autism-Related Visual Attention Patterns from Eye-Tracking Scanpath Images Using a Global–Local Fusion Network
编辑推荐:
自闭症谱系障碍(Autism Spectrum Disorder, ASD)儿童常表现出视觉注意分配和社会线索加工的非典型模式。眼动追踪扫描路径(Eye-Tracking Scanpath, ETSP)以图像形式保留注视点、扫视路径及其时间变化信息,为分析AS
自闭症谱系障碍(Autism Spectrum Disorder, ASD)儿童常表现出视觉注意分配和社会线索加工的非典型模式。眼动追踪扫描路径(Eye-Tracking Scanpath, ETSP)以图像形式保留注视点、扫视路径及其时间变化信息,为分析ASD相关视觉注意模式提供了直观且可计算的数据表征。然而,在ASD辅助识别研究中,同一参与者常产生多次眼动记录或多个视觉表征样本。若在模型评估过程中未充分考虑参与者独立性,训练集和测试集可能共享同一儿童的个体化眼动模式。在此情况下,模型可能学习到受试者特异性特征,而非稳定可迁移的ASD相关视觉注意特征,导致其对未见参与者的识别能力被高估。为解决该问题,研究人员在严格的参与者独立划分协议下提出了一种全局-局部协作融合网络(Global-Local Collaborative Fusion Network, GLCF-Net)。具体而言,该方法首先通过共享的补丁嵌入层(Patch Embedding layer)将ETSP图像映射为补丁令牌序列;随后,基于卷积神经网络(Convolutional Neural Network, CNN)的局部分支提取局部轨迹形态、路径密度和空间邻域结构,而基于视觉变换器(Vision Transformer, ViT)的全局分支则建模跨区域注视转移和整体注意分布;最后,门控自适应融合模块动态整合局部与全局信息,以增强稳定视觉注意特征的表征能力。在主要的重复分层五折参与者级评估中,对每位参与者的两次折外概率取平均后,准确率(Accuracy)达87.0%,受试者工作特征曲线下面积(ROC-AUC)达93.7%;保留的原始参与者划分作为次要分析,Accuracy为83.52%,ROC-AUC为90.27%。在所报告的冻结主干配置下,模型在Accuracy、召回率(Recall)和F1分数上也表现出均衡的模式。这些结果表征了在同一数据集和采集条件下对未见参与者的分类性能。
基于全局-局部融合网络的参与者独立自闭症相关视觉注意模式分类研究解读
一、研究背景与问题
自闭症谱系障碍(Autism Spectrum Disorder, ASD)是一种以社交沟通障碍、兴趣受限和重复刻板行为为主要特征的神经发育障碍性疾病,具有显著的个体异质性和复杂的病因机制。流行病学研究表明,近年来ASD的全球患病率和疾病负担普遍上升,其中幼年儿童的负担尤为突出,凸显了早期筛查和干预的迫切需求。传统的ASD筛查方法主要依赖照护者填写问卷或临床观察,存在主观性强、识别滞后和耗时长等局限。因此,开发客观、及时且高效的ASD辅助筛查方法对早期识别和改善预后具有重要意义。
近年来,随着眼动追踪技术、计算机视觉和人工智能的快速发展,基于客观行为信号的ASD辅助筛查成为日益活跃的研究方向。眼动追踪扫描路径(Eye-Tracking Scanpath, ETSP)图像将注视点和扫视路径转化为视觉图像,包含局部轨迹形态、纹理分布等细粒度信息,同时编码整体注视模式、空间布局和跨区域依赖等全局语义信息。然而,现有研究存在两个关键问题:一是样本级泄漏,即在数据增强后对整个增强数据集进行随机交叉验证,导致同一原始图像的增强副本被分配到不同的训练和验证折中;二是跨受试者泛化问题,即未按参与者进行数据划分时,同一参与者的不同原始图像可能随机出现在训练集和测试集中,模型在训练阶段已"见过"该参与者的眼动模式,从而高估了跨个体泛化能力。已有研究表明,在严格的参与者独立划分下,模型准确率会显著下降,例如Cilia等人的研究从90%降至71%。因此,如何在参与者独立划分条件下提高模型对未见参与者的泛化能力,是当前亟待解决的关键问题。
二、研究内容与结论
针对上述问题,研究人员提出了一种全局-局部协作融合网络(Global-Local Collaborative Fusion Network, GLCF-Net)。该方法通过共享的补丁嵌入层(Patch Embedding layer)将ETSP图像映射为补丁令牌序列,同时输入CNN局部分支和ViT全局分支。CNN局部分支通过残差卷积块提取局部轨迹形态、路径密度和空间邻域结构;ViT全局分支通过自注意力机制建模跨区域注视转移和整体注意分布。最后,门控自适应融合模块动态整合局部与全局信息。
研究在包含59名学龄儿童(29名ASD儿童和30名典型发育儿童)的公共ETSP数据集上进行了严格参与者独立划分的评估。主要结果包括:在固定的参与者独立划分下,GLCF-Net在测试集上达到83.52%的准确率(Accuracy)、82.68%的宏F1分数(Macro F1-score)和90.27%的ROC-AUC;在重复分层五折参与者级评估中,对每位参与者的两次折外概率取平均后,Accuracy达87.0%,ROC-AUC达93.7%。与基线模型(VGG19、ResNet-50、DenseNet和ViT)相比,GLCF-Net在所有评估指标上均取得了最优性能。该研究发表在《Journal of Eye Movement Research》。
三、主要关键技术方法
研究人员采用了以下关键技术方法:第一,严格的参与者独立数据划分协议,将52名参与者按约7:1:2比例随机划分为训练、验证和测试集,确保同一参与者的所有图像仅出现在一个子集中;第二,仅对训练集应用旋转数据增强(角度从-10°到+10°均匀采样,概率为0.5),避免颜色扰动和样本混合策略以保留ETSP图像的运动学信息编码;第三,共享补丁嵌入层将图像划分为16×16像素的补丁并映射为768维令牌序列;第四,轻量级残差卷积块(两个3×3卷积层,768通道)作为局部分支;第五,采用ViT-Base/16作为全局分支(加载ImageNet-21k预训练权重并冻结);第六,门控自适应融合模块通过Sigmoid函数生成逐令牌、逐通道的门控权重。训练采用AdamW优化器,初始学习率0.0001,权重衰减0.0001,20个epoch,批次大小16,使用交叉熵损失函数。数据来源为Figshare公共数据仓库(https://figshare.com/s/5d4f93395cc49d01e2bd)。
四、研究结果
4.1 GLCF-Net在参与者独立划分下的分类性能
在严格的参与者独立划分下,GLCF-Net在测试集上达到83.52%的Accuracy、82.68%的Macro F1-score和90.27%的ROC-AUC。TD类别的Precision、Recall和F1-score分别为82.76%、90.57%和86.49%;ASD类别的Precision、Recall和F1-score分别为84.85%、73.68%和78.87%。模型对TD类别的Recall高于ASD类别,表明其对典型发育儿童的视觉注意模式识别更为一致。
4.2 帧级预测概率的参与者分布
通过分析每个测试参与者的帧级预测概率分布,发现TD参与者的概率主要分布在0.5阈值以下,而ASD参与者的概率总体上分布在阈值以上。大多数参与者的预测结果与其真实标签一致,但TD-46被误分类为ASD,ASD-05和ASD-10的部分帧级预测概率接近或低于阈值,显示出一定的不稳定性。
4.3 ROC曲线与混淆矩阵分析
在91个测试样本中,模型正确分类了76个样本。53个TD样本中48个被正确识别(TD Recall为90.57%),38个ASD样本中28个被正确识别(ASD Recall为73.68%)。ROC曲线的AUC为90.27%。
4.4 与基线模型的性能比较
GLCF-Net在Accuracy、Precision、Recall、F1-score和AUC五项指标上均优于VGG19、ResNet-50、DenseNet和ViT基线模型。具体而言,GLCF-Net的Accuracy为83.52%,分别超过ResNet-50、VGG19、DenseNet和ViT达6.15、9.34、8.34和6.60个百分点;ROC-AUC达90.27%,分别超过上述模型7.63、9.85、7.59和7.35个百分点。
4.5 消融研究
消融实验表明:(1)仅保留ViT全局分支时,Accuracy降至76.92%,Macro F1-score降至75.49%,ROC-AUC降至82.92%,ASD Recall降至63.16%,说明CNN局部分支对捕捉局部轨迹形态和细粒度空间结构具有重要作用;(2)移除门控自适应融合模块后,Accuracy为80.22%,Macro F1-score为79.51%,ROC-AUC为85.65%,说明门控机制能动态平衡全局与局部特征的贡献,进一步提升分类性能。
4.6 重复参与者级性能
在两次重复的五折交叉验证中,GLCF-Net在10个外折上的平均Accuracy为0.870(标准差0.049),F1-score为0.859(标准差0.045),ROC-AUC为0.936(标准差0.028)。参与者级汇总估计显示Accuracy为87.0%、Precision为88.0%、Sensitivity为84.6%、Specificity为89.3%、F1-score为86.3%、ROC-AUC为93.7%。参与者自助法95%置信区间为Accuracy 0.778-0.944、F1-score 0.756-0.945、ROC-AUC 0.866-0.995。
4.7 重复折模型比较
在重复外折比较中,GLCF-Net在Accuracy上超过最强基线模型均值0.046,在ROC-AUC上超过0.035。配对参与者级分析显示,相对于VGG19、ResNet-50、DenseNet-121和ViT-B/16的Accuracy差异分别为4/54、6/54、5/54和2/54,各配对置信区间均包含零,经Holm校正后四项精确McNemar检验均不显著。
4.8 模型组件、分类错误与推理时间
参与者级消融分析显示,完整GLCF-Net在相同五折上Accuracy为0.869、F1-score为0.864、ROC-AUC为0.932;无门控等权融合为0.842、0.834和0.910;移除CLS向量为0.831、0.818和0.902;旋转增强为0.851、0.843和0.919。门控分析显示,TD组ViT权重的参与者均值为0.312(SD 0.038),ASD组为0.283(SD 0.036),两组均值均低于0.5,表明模型平均更侧重局部分支。54名参与者中7名在重复平均后被误分类。在线推理的平均模型仅耗时6.782毫秒,预处理加推理平均10.905毫秒,batch-16吞吐量为780.36图像/秒。
五、总结讨论与结论
讨论部分指出,GLCF-Net在严格的参与者独立划分下取得了较好的分类性能,优于选定的CNN基线模型和单分支ViT模型。参与者独立划分避免了同一儿童的扫描路径图像同时出现在训练和测试集中,降低了参与者级信息重叠导致的性能高估风险。全局-局部协作建模的消融实验表明,CNN局部分支能弥补ViT在局部轨迹结构建模上的不足,而门控自适应融合模块能动态调整全局与局部特征的贡献。然而,ASD类别的Recall(73.68%)低于TD类别(90.57%),提示某些ASD参与者的视觉注意模式与TD参与者存在部分重叠,这与ASD相关注视行为的显著异质性一致。门控模块虽提升了整体性能和ASD Precision,但未改善ASD Recall,未来可引入类别敏感损失函数、参与者级概率聚合或原始时间眼动特征以进一步提高ASD识别敏感性。
研究结论表明,GLCF-Net在参与者独立划分下学习了基于ETSP的视觉注意表征,为分析ASD儿童的视觉注意模式提供了辅助价值。重复平均后参与者级Accuracy为87.0%,F1-score为86.3%,ROC-AUC为93.7%,对应的折标准差分别为0.049、0.045和0.028。但研究仍受限于公共数据集规模较小,且ETSP图像压缩了部分原始时间眼动信息。未来工作可纳入更大规模和多中心数据集,以及原始眼动序列、基于兴趣区(Area of Interest, AOI)的特征和多模态行为信息,以进一步验证模型的泛化能力、稳定性和可解释性。独立的、基于序列的、前瞻性和临床验证对于确立跨采集设置和人群的性能仍然是必要的。