《Geomatics》:Evaluating Deep Learning Local Features for RGB-Thermal Image Matching and 3D InfraRed Thermography
编辑推荐:
红外热成像(InfraRed Thermography, IRT)是一种非侵入式、非接触、无损检测(NDT)技术,已成为评估建筑行为和能源性能的成熟工具。然而,热红外(TIR)相机固有的低空间分辨率导致近期工作将热成像与几何数据融合,以生成包含温度信息的精确建
红外热成像(InfraRed Thermography, IRT)是一种非侵入式、非接触、无损检测(NDT)技术,已成为评估建筑行为和能源性能的成熟工具。然而,热红外(TIR)相机固有的低空间分辨率导致近期工作将热成像与几何数据融合,以生成包含温度信息的精确建筑三维表示。虽然现有数据融合方法依赖于固定相对取向(RO)的传感器、使用地面控制点(GCPs)对独立TIR和RGB块进行配准,或将TIR图像重投影到附加几何或参数模型上,但直接匹配多模态图像的方法仍然有限。原则上,如果存在多模态连接点,可以直接对齐RGB块与TIR块;然而,由于辐射特性的显著差异,这种匹配极具挑战性。本文的主要贡献是证明基于深度学习的现成图像匹配算法(最初在单模态数据集上训练)在多模态匹配任务中用于红外热成像三维数据融合(IRT-3DDF)的适用性。研究人员对近年来开发的主要算法进行了比较评估,特别强调三维精度和计算效率,假设由于这些算法解决问题的固有局部性质,它们可以从单模态训练域泛化到多模态应用域。结果与现有的手工制作开源多模态参考方法进行了基准测试。重要的是,所提出的方法完全自动化,无需传感器预校准、手动配准或相关定位信息。结果表明,使用预训练神经网络(在其预期训练域之外)的基于深度学习的图像匹配为IRT-3DDF提供了一种可行方法,能够跨不同尺度、设置、传感器和对象配准多模态图像块。研究人员的实验结果表明,三维精度比手工制作的多模态算法高出七倍,而手工制作的单模态方法完全无法配准图像。
**研究背景与问题**
红外热成像(IRT)作为非侵入式、非接触、无损检测(NDT)技术,广泛应用于建筑能效评估、热舒适性分析及结构完整性检测。然而,消费级热红外(TIR)相机分辨率低(通常640×512像素),限制了其直接用于三维重建。现有红外热成像三维数据融合(IRT-3DDF)方法多依赖固定相对取向(RO)传感器、地面控制点(GCPs)配准独立TIR与RGB块,或TIR图像重投影到几何/参数模型,但存在手动测量、传感器预校准、同步采集等限制。直接自动匹配多模态图像(TIR与RGB)是理想方案,但传统手工制作特征(如SIFT)在显著辐射差异下失效,而多模态手工制作方法(如RIFT2、SRIF)计算成本高且未充分验证于地面摄影测量场景。因此,亟需探索无需专用训练、可泛化的深度学习(DL)图像匹配方法,以实现全自动、高精度IRT-3DDF。
**研究内容与结论**
研究人员提出利用预训练的单模态DL局部特征算法(如SuperPoint、ALIKED、DISK等)直接进行TIR-RGB图像匹配,并用于联合光束法平差(CBBA)实现多模态块配准。通过对比手工制作方法(SIFT、RIFT2、SRIF)与多种DL方法在两个建筑案例(英国华威郡Dunrobin House现代住宅、诺丁汉Lenton Lodge Gatehouse历史建筑)上的表现,评估三维精度与计算效率。结论:DL方法(尤其是SuperPoint+LightGlue/ SuperGlue、ALIKED+LightGlue)在完全自动化、无需GCPs或传感器固定关系下,成功配准TIR与RGB块,三维精度(以检查点RMSE计)比最佳手工制作多模态算法(RIFT2)提升最高七倍,且计算效率高(如DeDoDe+NN每对0.09秒)。手工制作单模态方法(SIFT、KeyNet+HardNet)和多模态方法(SRIF)完全失败。该研究发表于《Geomatics》。
**关键技术方法**
(1)**深度学习图像匹配框架**:基于开源库Deep-Image-Matching(DIM),集成多种预训练DL特征提取器与匹配器,包括SuperPoint+SuperGlue、SuperPoint+LightGlue、ALIKED+LightGlue、DISK+LightGlue、DeDoDe+NN、KeyNet+HardNet+NN,以及半稠密方法LoFTR,均使用官方发布权重,无任务微调。(2)**手工制作对比方法**:多模态RIFT2(MATLAB实现,对数Gabor滤波器+相位一致性)、SRIF(尺度不变局部强度二值变换),以及单模态SIFT+最近邻匹配。(3)**数据采集与预处理**:两个建筑案例——Dunrobin House(现代住宅,TIR GSD 9.8 mm,RGB下采样至1/8分辨率)和Lenton Lodge Gatehouse(历史遗产,TIR GSD 9.8–26.2 mm)。TIR图像用UnSharp Masking增强,RGB图像下采样至994×663像素以匹配TIR分辨率。地面控制点(GCPs)和检查点(CPs)通过Leica TS10全站仪测量,精度毫米级。(4)**联合光束法平差(CBBA)**:使用COLMAP进行增量式运动恢复结构(SfM),结合TIR-TIR、RGB-RGB、TIR-RGB匹配,自标定相机内参。随后引入全分辨率RGB图像进行约束光束法平差(C-BA),以精化位姿并保持RGB块几何精度。(5)**评估指标**:图像度量(内点匹配率、平均重投影误差MRE)和三维度量(TIR/RGB块检查点均方根误差RMSE
TIR、RMSE
RGB)。
**研究结果**
**4.1 联合光束法平差(CBBA)**
- **Dunrobin House**:所有DL方法内点匹配率>72%,RMSE
RGB为1.6–3.2 mm(优于GSD~8–10.4 mm),RMSE
TIR为5.7–14.1 mm。SuperPoint+SuperGlue与SuperPoint+LightGlue表现最佳(MRE 0.3像素,RMSE相近)。LoFTR产生约4倍连接点但RMSE
TIR=13 mm。RIFT2仅成功配准,但内点匹配率22%,RMSE
RGB比DL高10倍,且需手动初始化(RGB块先定向、几何验证阈值调整为1.5像素)。KeyNet+HardNet、SRIF、SIFT完全失败(无足够多模态匹配)。
- **Lenton Lodge Gatehouse**:DL方法RMSE
RGB为4.7–34.2 mm,RMSE
TIR~<20 mm。ALIKED+LightGlue、DISK+LightGlue、SuperPoint+LightGlue表现好(RMSE
TIR分别为10.8、15.5、15.2 mm),且匹配率高(91%、92%)。LoFTR因噪声产生高RMSE
RGB(34.2 mm)及低内点匹配率(21%)。RIFT2表现最差(RMSE
RGB 36.6 mm,RMSE
TIR 22.3 mm)。
**4.2 约束光束法平差(C-BA)**
- 引入全分辨率RGB图像后,Dunrobin House的RMSE
RGB从平均3.8 mm降至2.1 mm,与参考方法(Agisoft Metashape独立配准)相当;RMSE
TIR基本不变。LoFTR未改善(MRE升至~8像素)。RIFT2改善有限。
- Lenton Lodge Gatehouse:所有DL方法(除ALIKED外)RMSE
TIR改善,RMSE
RGB降至2.0–3.7 mm(接近参考方法2 mm)。LoFTR的RMSE
RGB从34 mm降至8 mm但仍偏高。RIFT2无实质变化。
**讨论与结论**
讨论指出,DL方法成功实现全自动TIR-RGB块配准,无需GCPs或传感器固定关系,验证了预训练单模态网络对多模态任务的有效泛化。关键发现:①稀疏DL特征+匹配器内点匹配率>74%,三维连接点可靠;②RGB定向精度高,即使有多模态连接点影响;③特征多样性(线性、角点、斑点等)不受辐射差异限制。局限性:RGB图像需下采样才能匹配,表明DL方法尺度不变性有限。手工制作多模态方法(RIFT2、SRIF)计算慢、对地面摄影测量适应性差,需专用优化。结论翻译:本文证明,利用预训练神经网络(在大规模RGB图像上训练,具有显著辐射和几何变化)可泛化至多模态图像匹配,实现全自动TIR-RGB联合光束法平差,为IRT-3DDF提供高效、高精度方案。相比手工制作方法,DL方法在三维精度上提升最高七倍,计算时间减少两到三个数量级,且支持异步采集,无需固定传感器取向或GCPs,显著提升适用性。未来工作将扩展至新传感器、对象和尺度,并解决尺度不变性限制。