基于谷歌街景的社区指标的鲁棒且可扩展的表征学习

《Neurocomputing》:Robust and scalable representation learning for google street view–based neighborhood indicators

【字体: 时间:2026年07月08日 来源:Neurocomputing 6.7

编辑推荐:

  理解视觉表征模型如何跨域迁移对于将基础模型应用于真实世界数据集至关重要。在这项工作中,研究人员对谷歌街景(GSV)图像的表征学习进行了系统的实证研究,该领域与标准目标中心基准(如ImageNet)存在显著差异。研究人员研究了架构选择、模型规模、自监督后训练和数

  
理解视觉表征模型如何跨域迁移对于将基础模型应用于真实世界数据集至关重要。在这项工作中,研究人员对谷歌街景(GSV)图像的表征学习进行了系统的实证研究,该领域与标准目标中心基准(如ImageNet)存在显著差异。研究人员研究了架构选择、模型规模、自监督后训练和数据筛选如何影响社区分类任务的下游性能。具体来说,研究人员评估了视觉Transformer(ViT)、层次Transformer(Swin)以及基于状态空间的架构(Vim和VMamba)。为了缓解域差距,研究人员使用ImageNet预训练权重初始化模型,并利用DINO(一种基于蒸馏的自监督学习策略)在100万张未标记的GSV图像上进一步后训练模型。然后,研究人员在全微调和线性探针两种协议下评估了有后训练和无后训练的模型。实验揭示了几项关键发现。首先,无监督后训练一致地提高了全微调性能,尤其是与目标感知聚类基础的数据筛选相结合时。然而,在线性探针下,其效果依赖于任务:后训练提高了Streetlight和Sidewalk的性能,但降低了NSH和Green30的性能。这一模式与t-SNE可视化一致,显示这些任务形成了两个不同的特征对齐组。尽管目标感知采样在平衡未标记后训练数据时考虑了所有下游任务,但它并未完全消除这种权衡,可能是因为无监督后训练围绕主导的GSV视觉模式重塑了表征空间,而非每个任务所需的任务特定语义线索。全微调缓解了这种漂移,而线性探针仍受限于冻结特征。其次,较高的上游ImageNet精度并不必然转化为更强的跨域迁移,小容量模型在扩展后训练下表现出性能饱和。第三,基于Mamba的模型参数高效且具有竞争力,但在大规模后训练中表现出优化不稳定性,特别是在较大模型规模下。最后,增加未筛选后训练数据的量会产生递减的回报,而筛选数据则提供更一致的增益。总之,这些发现表明,有效的跨域迁移依赖于架构、规模、训练策略和数据筛选的联合选择,为将视觉基础模型适应域偏移的街景图像提供了实用指南。
**论文解读:基于谷歌街景社区指标的鲁棒且可扩展的表征学习**

**研究背景与问题**
社区环境研究传统上依赖调查和人工测量,难以大规模推广。近年来,借助街景图像(如Google Street View,GSV)和机器学习,研究者能够自动化提取建筑环境特征,用于分析空间模式与健康、经济等人口层面结果的关系。然而,GSV图像与标准视觉基准(如ImageNet)存在显著域差异:ImageNet图像以目标物体为中心,前景清晰;而GSV图像来自固定街景视角,场景广阔、背景杂乱、包含多物体共现且受地理、天气、季节等变化影响。因此,将ImageNet预训练模型直接迁移到GSV任务面临域偏移挑战,需要系统研究表征鲁棒性。为此,研究人员开展了本项研究,旨在理解架构选择、模型规模、自监督后训练和数据筛选如何影响下游社区分类性能,为视觉基础模型适应街景领域提供实用指导。论文发表在《Neurocomputing》。

**主要关键技术方法**
研究人员采用了以下关键技术方法:1)**DINO自监督后训练**:基于教师-学生蒸馏框架,使用100万张未标记GSV图像对ImageNet预训练骨干进行后训练,通过多视角增强和跨视图一致性学习特征。2)**目标感知聚类采样**:利用冻结的Vim-S模型提取特征,对下游任务训练样本进行k-means聚类,生成45个原型;从167M GSV图像池中选取与原型最相似的图像,并通过平方根重加权配额采样构建1M筛选数据集。3)**全微调与线性探针评估**:分别更新骨干和分类头或仅训练线性分类器,以评估表征质量。4)**t-SNE可视化**:分析特征空间分布,解释任务依赖的后训练效果。5)**注意力图可视化**:分析ViT-S在Streetlight任务上的失败模式。

**研究结果**
**1. 引言**:介绍了GSV图像与ImageNet的域差异,以及研究动机——系统评估现代视觉骨干在街景领域中的迁移性能。

**2. 模型选择**:选取了ResNet-50、Swin-S/B、ViT-S/16、Vim-S/B、VMamba-B等多种架构,涵盖CNN、Transformer、层次Transformer和状态空间模型,并比较不同模型规模。

**3. 无监督训练**:采用DINO对ViT-S、Vim-S和VMamba-B进行后训练,发现Vim-S和VMamba-B在训练中表现出优化不稳定性,需保守超参数和梯度裁剪。

**4. 模型评估**
- **4.2 全微调**:后训练普遍提升下游性能,VMamba-B后训练后表现最佳,Vim-S参数高效但竞争力强。高ImageNet精度不保证跨域迁移,如Swin-B在Streetlight上优于VMamba-B。
- **4.3 模型规模与训练稳定性**:小模型性能饱和,扩展后训练收益递减;Mamba模型参数高效但大规模训练不稳定,数据筛选至关重要。
- **4.4 线性探针**:后训练效果任务依赖——提升Streetlight和Sidewalk,但降低NSH和Green30。t-SNE可视化显示后训练特征向GSV主导模式漂移,部分任务与后训练数据重叠少,导致退化。
- **4.5 定量分析**:t-SNE表明后训练特征中Streetlight/Sidewalk与后训练数据重叠更多,NSH/Green30形成分离组,解释了线性探针任务依赖现象。

**5. 注意力图**:分析ViT-S在Streetlight任务上的失败案例,包括边界信息丢失(固定分辨率导致目标被裁剪)和外观变化(罕见形状或上下文导致误分类)。

**6. 消融研究**
- **6.1 目标感知聚类采样**:相比随机采样,筛选数据在全微调和线性探针下提供更一致增益,但线性探针任务依赖仍存在,因后训练重塑特征空间围绕主导视觉模式而非任务特定语义。
- **6.2 重叠裁剪投票**:使用四重叠裁剪并投票,提高平衡精度(减少漏检),但增加假阳性导致整体精度下降。

**总结讨论与结论**
讨论部分指出,无监督后训练将表征向街景视觉统计偏移,可提升全微调,但随机未筛选数据可能引入分布偏差,降低表征多样性。数据筛选策略(如目标感知聚类)能缓解此问题,但无法完全消除线性探针下的任务依赖,因为后训练重塑特征空间围绕主导视觉模式而非任务特定语义。此外,高ImageNet精度不保证跨域迁移,Mamba模型参数高效但大规模训练不稳定,数据质量和分布对齐比模型扩展更重要。研究结论翻译如下:**在这项工作中,研究人员对基于谷歌街景(GSV)的社区分析的表征学习进行了系统的实证研究,考察了模型架构、自监督学习(SSL)、模型规模和数据特征如何影响下游迁移。研究结果表明,弥合预训练数据与街景图像之间的域差距需要跨这些维度的协调设计选择。无监督后训练将表征向街景特定统计偏移,并能提升全微调性能;然而,应用于随机未筛选的GSV数据时,扩展后训练可能引入分布偏差并降低表征多样性。目标感知聚类采样策略进一步证实了数据筛选在缓解此问题中的重要性。小容量模型中性能增益迅速饱和,仅增加数据而不筛选不能保证迁移性。中等模型(如VMamba-B)从SSL后训练中获益更一致,但扩展后训练下增益也可能饱和。架构选择在迁移行为中起重要作用:强上游ImageNet性能并不一致转化为下游结果;Swin Transformer因内置空间先验而可靠,Mamba架构参数高效且小规模迁移性能有前景,但扩展至更大规模或更大数据集时引入优化不稳定性。最后,尽管无监督模型常被认为学习更通用的表征,但监督预训练提供更强的初始性能,有利于下游任务。这些见解为在城市和社区研究中部署可扩展视觉模型提供了实用指导。**
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号