RSFG-MoE:一种面向细粒度高分辨率遥感图像解译的混合专家视觉语言模型

《Scientific Reports》:RSFG-MoE: a mixture-of-experts vision-language model oriented to fine-grained high-resolution remote sensing image interpretation

【字体: 时间:2026年09月14日 来源:Scientific Reports 4.9

编辑推荐:

   摘要 高分辨率遥感图像(HRSIs)包含丰富的空间细节和细粒度语义信息。然而,其固有特性——包括多尺度目标外观、小目标高密度分布以及类间视觉可区分性低——严重阻碍了通用领域视觉-语言模型(VLMs)在细粒度遥感解译中的表现。为应对这些挑战,我们提出了RSFG-MoE,一种专

  

摘要

高分辨率遥感图像(HRSIs)包含丰富的空间细节和细粒度语义信息。然而,其固有特性——包括多尺度目标外观、小目标高密度分布以及类间视觉可区分性低——严重阻碍了通用领域视觉-语言模型(VLMs)在细粒度遥感解译中的表现。为应对这些挑战,我们提出了RSFG-MoE,一种专为HRSIs细粒度解译而设计的混合专家视觉-语言模型。基于通用领域混合专家(MoE)架构,我们引入了自适应语义感知分块(ASAT)策略,将视觉计算资源分配给语义信息丰富的区域,同时保留细粒度局部特征。此外,我们引入了专用的细粒度视觉编码器FG-CLIP以及分层特征融合模块,以共同捕捉全局语义和局部结构细节。为提升计算效率,我们整合了DeepSeekMoE稀疏语言模型;同时,我们采用两阶段渐进微调范式,将通用领域视觉-语言知识适配到遥感场景中。在CHOICE、RSVQA-HR、RSICD、FAIR1M、NWPU-VHR-10和MAR20上的实验表明,RSFG-MoE在多个细粒度感知任务中取得了任务相关的优势,包括图像级分类、场景-实例识别、属性识别、基于比较的视觉问答以及基于mAcc@0.5的细粒度识别与定位。实验结果验证了所提出架构在选定细粒度遥感解译任务中的有效性。

相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号