OSM-CLIP:利用OpenStreetMap数据增强遥感图像-文本表示学习

《Applied Sciences》:OSM-CLIP: Enhancing Remote Sensing Image–Text Representation Learning with OpenStreetMap Data

【字体: 时间:2026年07月14日 来源:Applied Sciences 2.5

编辑推荐:

  遥感视觉-语言模型(Vision-Language Model,VLM),如RemoteCLIP和GeoRSCLIP,推动了图像-文本表示学习的发展。然而,这些模型依赖于人工策划的标题数据集,这些数据集扩展成本高昂,且仅提供全局图像级监督。在本文中,研究人员介

  
遥感视觉-语言模型(Vision-Language Model,VLM),如RemoteCLIP和GeoRSCLIP,推动了图像-文本表示学习的发展。然而,这些模型依赖于人工策划的标题数据集,这些数据集扩展成本高昂,且仅提供全局图像级监督。在本文中,研究人员介绍了OSM-CLIP,一个利用免费可用且持续增长的OpenStreetMap(OSM)注释为遥感图像-文本学习提供区域可扩展的补丁级监督的框架。研究人员构建了一个包含超过265,000张覆盖美国本土(contiguous United States)卫星图像的大规模数据集,每张图像自动与从OSM抓取并映射到单个图像补丁(image patches)的细粒度地理注释配对。在补丁级别操作的对比损失(contrastive loss)将每个图像区域与其对应的OSM文本描述关联起来,使模型无需任何手动标注工作即可学习空间接地表示(spatially grounded representations)。在标准遥感标题数据集上进行微调后,OSM-CLIP在13个分类基准和4个检索基准上,相比现有方法在零样本分类中平均提升10.81%,在文本到图像检索(R@1)中提升5.06%,在图像到文本检索(R@1)中提升3.87%。研究人员的实验结果表明,在具有高质量OSM覆盖的地区,免费可用的地理注释可以作为遥感视觉-语言模型强大的监督源。
**研究背景与问题**

遥感图像分析在地球观测(Earth Observation)中至关重要,涵盖土地利用制图、城市监测、灾害响应和环境变化检测等领域。传统方法依赖大量人工标注,成本高昂且难以扩展。最近,基于对比语言-图像预训练(Contrastive Language–Image Pretraining,CLIP)的视觉-语言模型(VLM)在自然图像领域取得了突破,并催生了针对遥感领域的专用模型,如RemoteCLIP和GeoRSCLIP。这些模型通过在大规模遥感图像-标题数据集上微调,显著提升了分类和检索性能。然而,它们存在两个根本性局限:第一,依赖人工策划的标题数据集,规模化扩展成本极高;第二,仅提供全局图像级监督(global image-level supervision),将整张图像视为单一实体,丢失了场景解析、地理特征定位等多任务所需的细粒度空间理解。

OpenStreetMap(OSM)作为一个免费、社区维护的地理特征数据库,提供了道路、建筑物、土地利用区域等丰富的语义注释,并具有精确的空间范围,覆盖全球大部分区域。OSM数据可自动与卫星图像关联,但此前在视觉-语言表示学习中作为监督信号的应用尚不充分。针对上述问题,研究人员提出了OSM-CLIP框架,旨在利用OSM作为补丁级地理监督源,以无标注方式学习空间接地的视觉-语言表示。

**研究内容与结论**

研究人员构建了覆盖美国本土(contiguous United States)的超过265,000张卫星图像的大规模数据集,每张图像自动与从OSM抓取的细粒度地理注释配对,并映射到ViT(Vision Transformer)补丁网格。通过设计补丁级对比损失,将图像区域与对应的OSM文本描述对齐,无需任何人工标注。在标准遥感标题数据集上微调后,OSM-CLIP在13个分类基准和4个检索基准上,相比RemoteCLIP平均提升零样本分类10.81%,文本到图像检索(R@1)5.06%,图像到文本检索(R@1)3.87%。

**重要意义**

该研究证明了免费可用的地理注释(如OSM)可作为遥感视觉-语言模型的强大监督源,为区域可扩展的补丁级空间接地学习提供了一条可行路径。论文发表在《Applied Sciences》。

**关键技术与方法**

研究人员采用以下主要技术方法:(1)**自动化数据集构建管道**:在美国本土范围内均匀采样位置,通过Mapbox Satellite v9 API下载固定空间范围的卫星图像,同时利用Overpass API查询OSM节点、线要素和面要素,并进行多阶段标签过滤(排除不可见或非语义标签)和几何处理(投影到像素坐标、合并开放路径);(2)**补丁掩码生成**:将图像划分为与ViT-B/32补丁网格匹配的7×7个单元,根据几何类型(点、多边形、线)确定每个OSM特征对应的补丁索引;(3)**补丁级对比学习**:在批处理中识别所有唯一OSM标签,聚合共享同一标签的所有补丁特征(平均池化),并与文本编码器输出的对应标签嵌入计算对比损失;对多标签补丁冲突采用稀有标签优先策略(按出现频次升序排序,优先分配给更罕见的标签);(4)**两阶段训练**:先以OSM补丁级对比损失进行预训练,再在标准遥感标题数据集(NWPU-RESISC45、RSICD、UCM、SYDNEY)上以标准CLIP损失微调。

**研究结果**

**零样本分类**:OSM-PT+FT在13个数据集的平均零样本准确率达74.95%,相比RemoteCLIP提升10.81%。最大提升出现在OPTIMAL_31(+27.15%)、RSSCN7(+23.57%)和MLRSNet(+18.02%)等数据集上,这些数据集的类别与OSM语义(如机场、工业设施、农田)直接对应。在RSI_CB256和PatternNet等包含高度专业化视觉类别(如特定飞机模型)的数据集上,OSM监督引入语义噪声导致分数略有下降。

**线性探针分类**:OSM-PT+FT平均性能为97.96%,分别超过RemoteCLIP的97.04%和GeoRSCLIP的97.75%,提升0.92%。零样本上的较大增益表明补丁级OSM监督主要改善了图像-文本对齐质量,而线性探针允许分类器补偿较弱表示。

**跨模态检索**:OSM-PT+FT在文本到图像检索R@1平均达20.47,图像到文本检索R@1平均达25.23,均优于所有对比方法。最大增益出现在RSITMD数据集上,其中文本到图像R@1提升12.21个百分点,图像到文本R@1提升13.28个百分点,归因于OSM监督有助于解析多目标场景中区域与描述的对应关系。

**消融实验**:通过对比FT(仅微调)、RS-PT+FT(使用通用标题“a satellite image”在相同图像上预训练后微调)和OSM-PT+FT,确认OSM监督的贡献。RS-PT+FT的零样本准确率(71.29%)低于FT(74.21%),而OSM-PT+FT在所有指标上均优于FT,证明性能提升来自地理监督信号的质量而非额外训练数据量。95% bootstrap置信区间均不重叠,统计显著。

**空间接地定性分析**:通过激活图可视化,OSM-PT+FT成功将“highway=primary”等标签定位到对应补丁,并能区分共现的多属性地理特征(如铺装道路与未铺装支路)。在罕见标签(如barrier=gate)上也能准确定位,但存在语义混淆失败案例(如将湿地误标为水体)。

**总结讨论与结论翻译**

**讨论部分总结**:研究人员指出当前工作的局限性包括:数据集仅基于美国OSM数据,存在地理偏差;固定补丁尺寸(32×32像素)可能不适用于不同空间范围的特征;OSM数据质量区域不均,未显式处理不完整或未验证注释,存在空间错位和时间不一致风险;简单的平均池化聚合策略可能引入背景噪声。未来方向包括扩展到全球OSM覆盖、更大架构(ViT-B/16、ViT-L/14)、自适应多尺度补丁处理、密度预测任务、注意力聚合、软标签分配、利用大语言模型扩展标签、引入背景类以及集成时间可靠性评分。

**结论部分翻译**:本文介绍了OSM-CLIP,一个探索OpenStreetMap(OSM)作为遥感视觉-语言模型区域可扩展补丁级地理监督源的框架。通过自动将OSM矢量特征映射到ViT图像补丁并使用补丁级对比损失训练,OSM-CLIP无需任何手动标注即可学习空间接地表示。一项受控消融实验确认这些增益来自OSM监督信号而非新增训练数据。关键发现和贡献包括:一个可扩展的无标注管道,在美国自动构建超过265,000个卫星图像-OSM补丁对;一个补丁级地理监督框架,在13个分类和4个检索基准上较RemoteCLIP平均提升零样本分类10.81%、文本到图像检索(R@1)5.06%、图像到文本检索(R@1)3.87;一项消融实验,隔离出OSM监督的贡献:在同一卫星图像上使用通用标题预训练反而降低零样本性能(71.29% vs. FT的74.21%),证实地理特异性而非数据量是关键因素。公开释放数据集、预训练模型权重和训练管道以支持复现。虽然当前工作主要证明OSM作为补丁级监督源的可行性,但也为未来研究开辟了若干有前景的方向。未来工作将探索:(1)将数据集扩展到全球OSM覆盖,包括多语言标签支持;(2)扩展到更大架构(ViT-B/16, ViT-L/14);(3)在保持地理补丁对齐的同时引入数据增强;(4)针对不同空间范围地理特征的自适应多尺度补丁处理;(5)将所学表示应用于语义分割和变化检测等密度预测任务;(6)用基于注意力的聚合机制替代简单补丁特征平均,以更好分离地理特征与背景内容;(7)探索基于空间覆盖加权的软多标签补丁分配;(8)利用大语言模型将简洁的OSM标签扩展为更丰富的自然语言描述用于预训练;(9)为未标注补丁引入显式背景类以提高判别能力;(10)集成OSM元数据中的时间可靠性评分,以在训练期间降低过时或不确定注释的权重。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号