C2DSSL: 上下文一致性增强的协同自监督学习用于遥感图像理解

《Mathematics》:C2DSSL: Context-Consistency Enhanced Collaborative Self-Supervised Learning for Remote Sensing Image Understanding

【字体: 时间:2026年08月05日 来源:Mathematics 2.3

编辑推荐:

  自监督学习(Self-Supervised Learning, SSL)在遥感图像理解中引起了越来越多的关注,因为它能够从未标记图像中学习可迁移的表征。然而,在遥感领域的协同自监督学习(collaborative SSL)中,有两个问题尚未得到充分研究。首先,

  
自监督学习(Self-Supervised Learning, SSL)在遥感图像理解中引起了越来越多的关注,因为它能够从未标记图像中学习可迁移的表征。然而,在遥感领域的协同自监督学习(collaborative SSL)中,有两个问题尚未得到充分研究。首先,当高比例掩码(high-ratio masking)移除整个小目标或结构信息丰富的区域时,剩余的可见块可能无法为语义连贯的重建提供足够证据。其次,异质自监督目标(heterogeneous self-supervised objectives)可能表现出不同的损失尺度、梯度幅度和收敛行为,以至于固定系数在训练过程中会产生不均匀的分支贡献。为了解决这些问题,本文提出了上下文一致性增强的协同自监督学习(Context-Consistency Enhanced Collaborative Self-Supervised Learning, C2DSSL)用于遥感图像理解。C2DSSL引入了一种教师-学生上下文一致性约束(teacher–student context-consistency constraint),其中,来自完整教师观测(complete teacher observation)的多尺度重建特征在学生网络重建相应掩码观测时充当上下文目标。此外,梯度敏感动态加权(gradient-sensitive dynamic weighting)使用时间平滑的损失梯度幅度(temporally smoothed loss-gradient magnitudes)作为经验信号,以调整异质自监督目标的相对贡献。在评估的设置下,添加上下文一致性约束在KNN表征评估、UCMerced分类、Potsdam语义分割和DOTA定向目标检测上均取得改进,同时在Million-AID子集上保持了基线性能。动态加权表现出任务依赖的效果,包括在与CCL结合时在Million-AID子集分类任务上获得性能提升。
遥感图像提供了地球表面的空间显式观测,支持环境监测、土地覆盖制图、农业评估、城市分析和灾害管理等地理科学应用。与常规自然图像不同,遥感图像在多种空间分辨率、传感器特性、地理区域和环境条件下从高空平台获取。单一场景可能包含异质土地覆盖类别、密集分布的目标、重复的空间模式、任意目标朝向以及目标尺度上的显著变化。此外,局部区域的语义解释不仅依赖于其视觉外观,还依赖于其与周围地理结构的空间关系。地理科学分析可能需要整合多个空间变量和专题层来全面刻画一个地理区域。这些特点使得上下文和多尺度空间建模对遥感图像理解尤为重要。

深度学习在场景分类、目标检测、语义分割和变化检测中取得了显著进展,但其性能通常依赖于足够大且准确标注的数据集。生成场景标签、像素级分割掩码和定向边界框成本高昂,且通常需要领域专业知识。同时,卫星、航空和无人机平台持续产生大量无任务特定标注的图像。因此,自监督表征学习(Self-Supervised Learning, SSL)为利用这些无标注数据并减少标注依赖提供了一种有前景的策略,尤其是在仅有有限标注样本可用时。从无标注地理空间图像中学习鲁棒且可迁移的表征仍然是遥感图像理解中的一个重要问题。

现有研究存在两个不足:第一,当高比例掩码(如随机掩码)移除整个小目标或结构信息丰富的区域时,剩余可见块可能无法提供足够证据进行语义连贯的重建,而仅最小化像素或令牌级重建误差并不显式要求恢复区域与完整场景语义兼容。第二,在协同自监督学习中,不同目标(如重建、全局对比学习和局部语义对齐)可能具有不同的数值尺度、梯度幅度和收敛行为,固定系数会导致训练期间分支贡献不均匀。为此,研究人员提出了上下文一致性增强的协同自监督学习(C2DSSL)框架,旨在通过教师-学生架构引入重建级上下文转移,并采用梯度敏感动态加权来调整异质目标的贡献。该研究发表于《Mathematics》。

在技术方法方面,C2DSSL框架包含三个主要关键模块:首先,教师-学生上下文一致性约束(Context-Consistency Constraint, CCL),其中教师网络处理完整图像视图并生成多尺度重建特征作为学生网络的上下文目标,学生网络处理掩码视图并从可见块重建缺失区域,通过一致性损失对齐特征以保持语义兼容性。其次,多分支自监督目标包括掩码重建(masked reconstruction)、全局对比学习(Global Contrastive Learning)和局部语义对齐(Local Semantic Alignment),分别以焦点L1损失和频域FFT损失、对比损失(InfoNCE)以及基于原型(prototype)的分布匹配损失来实现。最后,梯度敏感动态加权(Gradient-Sensitive Dynamic Weighting, DW)机制基于时间平滑的损失梯度幅度(通过指数移动平均)为每个分支分配自适应权重,以调整其相对贡献。实验使用UCMerced数据集(21类,100张/类)作为无标注预训练语料,并在Million-AID子集(51类,20000张图像)、ISPRS Potsdam(语义分割)和DOTA v1.0(定向目标检测)上进行下游评估。

研究结果如下:

4.1 实验设置:采用ResNet-50骨干网络,在UCMerced上进行30轮自监督预训练,下游任务使用相同微调协议。

4.2 实验配置和指标:设计了四种配置:Config A(基线,无动态加权DW和上下文一致性损失CCL)、Config B(仅引入DW)、Config C(仅引入CCL)、Config D(同时引入DW和CCL)。评估指标包括KNN Top-1准确率、总体精度(OA)、平均交并比(mIoU)和平均精度(mAP)。

4.3 自监督表征评估:在UCMerced上的KNN评估中,Config C取得65.16%的Top-1准确率,比基线(60.31%)提升4.85个百分点,表明上下文一致性约束改善了预训练特征空间的语义组织。Config B仅提升0.94个百分点,而Config D低于基线。

4.4 图像分类结果:在UCMerced微调中,Config C达到100.00% OA,比基线提升1.04个百分点;Config B和Config D均为99.48%。在Million-AID子集细粒度分类中,Config D取得最高94.48% OA,比基线提升0.63个百分点,表明DW与CCL在细粒度任务中产生互补效果。

4.5 语义分割和定向目标检测:在Potsdam语义分割中,Config C取得35.82% mIoU,比基线(33.39%)提升2.43个百分点;在DOTA定向目标检测中,Config C取得45.24% mAP,比基线(43.62%)提升1.62个百分点。CCL在密集预测任务中一致优于基线,而DW未带来额外增益。

4.6 相对于基线的性能变化:CCL在所有下游任务上均产生正向收益,而DW效果依赖任务,仅在Million-AID分类中表现积极,在KNN和密集预测中未超越CCL单独配置。

4.7 与代表性遥感SSL方法的比较:C2DSSL(Config C)在UCMerced分类和Potsdam语义分割上达到或并列最佳,在Million-AID分类上Config D超过GASSL(94.48% vs 94.40%),在DOTA检测上接近最优。

4.8 掩码比率敏感性分析:在Config C下,掩码比率0.60取得最佳KNN(65.16%)和UCMerced OA(100.00%),0.40和0.80分别导致性能下降。

4.9 两阶段迁移分析(使用Million-AID微调骨干):Million-AID微调骨干在UCMerced分类上降低性能,在Potsdam语义分割上提升(如Config D从34.25%增至39.44%),但在DOTA检测上下降约3.5-3.9个百分点,表明分类微调可能削弱定位敏感特征。

4.10 特征聚类可视化:Config C在UCMerced直接微调中产生更紧凑可分的聚类,与100% OA一致;两阶段迁移后分布更分散,与定量结果吻合。

在讨论部分,研究人员指出上下文一致性约束在多数任务中有效,而动态加权效果任务依赖,其梯度幅度代理可能受损失尺度、参数化和噪声影响,导致配置D未超越CCL单独配置。外部比较显示C2DSSL在多个任务上具有竞争力,但需注意预训练数据差异。掩码比率分析表明0.60是平衡点。两阶段迁移揭示了分类微调对密集检测任务的负面影响。研究结论部分翻译如下:本文研究了在高比例掩码可能留下不足可见证据以重建小或结构信息丰富区域的条件下,遥感图像的协同自监督表征学习。为了在统一框架中考察上下文重建和异质目标协调,研究人员提出了C2DSSL,一个上下文一致性增强的协同自监督学习框架。该框架结合了重建级上下文监督与全局和局部表征学习目标,并评估了梯度敏感动态加权作为调整其相对贡献的辅助策略。在当前的实验设置下,Config C在UCMerced KNN评估、UCMerced分类、Potsdam语义分割和DOTA定向目标检测上分别比基线提升4.85、1.04、2.43和1.62个百分点,表明重建级上下文监督有利于下游任务的表征迁移。外部迁移比较显示C2DSSL在UCMerced分类、Million-AID分类和Potsdam语义分割上达到或并列最佳,在KNN和DOTA检测上保持竞争力。掩码比率分析表明0.60在有限数据设置下表现最佳。关于目标协调,梯度敏感动态加权根据平滑梯度幅度调整异质目标贡献,其效果任务依赖:在Million-AID子集分类上获得增益,而在其他任务上DW+CCL配置未一致优于CCL单独配置。因此,DW被视为辅助经验策略,而非普遍有益的优化机制。两阶段迁移实验进一步表明,在Million-AID子集上的监督微调能一定程度提升Potsdam语义分割,但可能降低DOTA定向目标检测性能。特征聚类可视化支持定量结果。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号