SALiT:用于多任务遥感解译的结构感知轻量级Transformer
《Pattern Recognition》:SALiT: A structure-aware lightweight Transformer for multi-task remote sensing interpretation
【字体:
大
中
小
】
时间:2026年09月25日
来源:Pattern Recognition 9.1
编辑推荐:
•开发了一种结构感知的轻量级 Transformer,用于高效的遥感(RS)处理。
•SAD2C 在 Transformer 冗余分析的指导下,执行结构感知的双驱动压缩。
•GHKD 提供全局层次蒸馏,以保留结构建模能力。
•SALiT 在 10.5M 参数和 4.0G FL
•开发了一种结构感知的轻量级 Transformer,用于高效的遥感(RS)处理。
•SAD2C 在 Transformer 冗余分析的指导下,执行结构感知的双驱动压缩。
•GHKD 提供全局层次蒸馏,以保留结构建模能力。
•SALiT 在 10.5M 参数和 4.0G FLOPs 下提供了具有竞争力的多任务遥感结果。
引言
基于深度学习的遥感(RS)光学解译已成为理解和监测地球系统过程的关键 [1]。得益于卫星通信和传感技术的进步,光学遥感图像在质量上显著提高,数量急剧增长,导致传统范式(将数据下载到地面站进行多任务处理)出现严重的传输瓶颈。因此,高性能且轻量的星载遥感解译变得越来越必要。然而,现有的深度学习模型通常具有大量参数和密集的计算需求,给在资源受限的卫星平台上部署带来了挑战。因此,开发在严格效率约束下保持强表征能力的轻量级视觉骨干网络,仍然是遥感解译面临的关键挑战。
复杂的遥感场景由于类间分布高度纠缠、对象尺度变化明显以及广泛的长程空间依赖性 [2], [3],对多种任务提出了不同的建模要求。像场景分类这样的粗粒度任务需要全局连贯的语义,而包括检测和安全在内的细粒度任务则依赖于局部判别性细节和精确的空间轮廓。虽然数据生成和增强可以扩大遥感训练数据中的类别和尺度变化 [4], [5],但对复杂遥感场景的有效建模仍然关键依赖于视觉骨干网络的表征能力。尽管卷积神经网络(CNN)取得了成功,但其固有的局部感受野限制了捕获长程空间依赖的能力。相比之下,ViT 利用自注意力建模全局上下文依赖,更好地适应遥感图像中普遍存在的复杂形态和多尺度关系 [6]。
然而,ViT 的巨大参数成本和计算开销限制了其在高效遥感处理中的实际部署 [7]。因此,人们探索了各种压缩策略。一些方法通过架构优化来提高效率,例如将不同类型的神经网络集成到 ViT 中 [8] 或设计轻量级定制模块如高效注意力机制 [9]。另一个方向强调参数级压缩,包括剪枝和量化 [10], [11], [12]。虽然这些方法在不同程度上提高了效率,但它们往往专注于局部结构修改或参数压缩,可能无法充分利用 Transformer 内部的结构性冗余,限制了为遥感解译提供可靠轻量级解决方案的能力。
为了解决准确性与效率之间的权衡,知识蒸馏(KD)已成为一种有前途的解决方案。现有方法主要关注蒸馏目标和监督策略的设计。例如,最近的面向遥感的方法通过引入目标感知监督和多尺度一致性约束来改善学生网络的学习,如 TAKD [13] 和 MKDA [14] 所示。最近的 ViT 蒸馏研究,如 ViTKD [15] 和 FSKD [16],进一步探索了逐层特征目标和定制监督策略以增强知识转移。尽管有了这些进展,现有方案主要强调蒸馏目标和局部监督信号,这可能无法完全保留复杂遥感解译所需的结构建模能力。此外,最近的基于 ViT 的蒸馏方法很大程度上沿用了通用设计,对遥感特定属性(如异构类分布、共存的多尺度目标以及强烈的空间连续性)考虑有限。在实践中,这种忽视往往导致相似物体之间的类别混淆,各种尺度目标的漏检,以及在杂乱背景下的模糊或不准确定位。因此,这些观察结果表明需要一种蒸馏框架,能够将鲁棒的结构先验转移到用于遥感解译的轻量级模型中。
为了解决上述问题,我们提出了 SALiT,这是一个基于结构感知双驱动压缩(SAD2C)策略和全局层次知识蒸馏(GHKD)框架的轻量级 Transformer。SALiT 的核心思想是利用 Transformer 中的结构冗余进行高效压缩和知识转移,其中识别相似模式以减少模型复杂度,并采用层次蒸馏来增强遥感场景的表征能力。具体来说,SAD2C 利用块级相似性推导阶段性权重共享,利用 Q 和 K 之间相关的投影模式来激励 Integrated Attention 公式。在此过程中,每个阶段内的主导多头自注意力(MSA)和多层感知机(MLP)参数是共享的,同时保留轻量级变换模块以维持块特定灵活性和训练稳定性。同时,通过集成公式简化了注意力匹配过程,进一步减少了参数开销和计算量。为了增强表征能力并应对遥感场景中的挑战,GHKD 以全局和层次的方式从高容量教师网络向 SALiT 转移结构知识。该框架集成了基于逻辑值关系的类别关系协作蒸馏(CCD)、基于注意力头分布的跨头蒸馏(CHD)以及基于值 (V) 特征空间令牌关系的多级蒸馏(MLD),共同转移互补的结构知识以应对复杂遥感解译。值得注意的是,通过将 GHKD 嵌入预训练阶段,SALiT 有助于缓解 ViT 有限的归纳偏置,并强化骨干网络级别的结构先验编码,以适应多种遥感下游任务。
本文的主要贡献总结如下。
(1) 提出了一种用于高效遥感解译的轻量级 Transformer 骨干网络 SALiT。通过结合结构感知双驱动压缩策略与全局层次知识蒸馏框架,SALiT 利用 Transformer 的结构特性进行模型压缩,并转移结构知识以增强遥感图像的表征能力。这种统一设计在多种遥感任务上实现了模型效率与性能之间的良好权衡。
(2) 开发了 SAD2C 策略,用于遥感解译中的高效 Transformer 压缩。在 Transformer 内在结构特性的指导下,SAD2C 利用块级相似性和相关的 Q-K 投影模式设计了阶段性权重共享和集成注意力公式。通过这种结构引导的设计,SAD2C 在保持遥感场景所需基本表征能力的同时,大幅减少了参数和计算成本。
(3) 提出了 GHKD 框架,以促进 SALiT 在复杂遥感场景下的多级结构知识转移。通过对类别关系、注意力分布和基于 V 的空间依赖进行协作监督,GHKD 显式地将层次结构先验转移到压缩骨干网络中,从而增强遥感图像的结构表征能力。
在涵盖场景分类(RSSC)、目标检测(RSOD)和语义分割(RSSS)的公共遥感基准上的综合实验验证了 SALiT 作为有效且高效骨干网络的有效性,在显著降低复杂度的同时取得了具有竞争力的性能。进一步的消融分析验证了 SAD2C 和 GHKD 的贡献,确认了所提设计的有效性。
章节片段
轻量级视觉 Transformer 和遥感骨干网络
在压缩技术中,剪枝和量化已在 ViT 中得到广泛探索。最近的剪枝方法使用块旁路和动态令牌传播 [10], [17],而训练后量化通过领域感知对齐和自适应精度分配来解决极端激活分布 [11], [12],主要通过选择性计算或数值近似来提高效率。架构优化探索了混合设计和高效注意力机制。
所提方法
本节介绍了用于遥感解译的所提结构感知轻量级框架。通过结合冗余驱动压缩和层次结构蒸馏,这种协作设计优化了精度 - 效率权衡,并增强了多种遥感下游任务的泛化能力。
实验设置
SALiT 被评估为多任务遥感解译的轻量级骨干网络。复杂度指标,包括参数量(Param)和浮点运算次数(FLOPs),是为 SALiT 骨干网络和整合了额外组件的完整任务特定模型计算的。所有下游实验均以在 ImageNet-1K 上预训练的 SALiT 初始化。采用 AdamW 优化器,并在每个任务部分中指定了任务特定的学习率和训练计划。
数据集与实施细节
结论
在本文中,我们介绍了 SALiT,这是一种适应于严格计算和内存约束下多任务遥感解译的结构感知轻量级 Transformer。该模型生成自一个混合框架,结合了结构感知双驱动压缩策略和全局层次知识蒸馏框架。首先,我们提出了 SAD2C,它通过基于结构冗余的权重共享和 Q-K 集成参数化产生紧凑的 Transformer。
CRediting 作者贡献声明
Jingchi Yu: 审阅与编辑,初稿撰写,可视化,验证,软件,方法论,调查,形式分析,数据策划,概念化。Yizhuang Xie: 监督,项目管理,资金获取。He Chen: 监督,项目管理,资金获取,概念化。Shuo Ni: 审阅与编辑,调查。Ning Zhang: 审阅与编辑,监督,项目管理,资金获取。
关于在稿件准备过程中使用生成式 AI 和 AI 辅助技术的声明
在本工作准备期间,作者仅使用 ChatGPT 进行英语语言润色。作者根据需要审阅和编辑了输出,并对已发表文章的内容承担全部责任。
利益冲突声明
作者声明他们不存在已知的影响本论文报告工作的竞争财务利益或个人关系。
致谢
本研究由中国青年科学基金项目(批准号 62501050)和中国国家自然科学基金项目(批准号 62341130)资助。
Jingchi Yu|Yizhuang Xie|He Chen|Shuo Ni|Ning Zhang
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号