《Journal of Imaging》:Physics-Preserving Attention-Guided Artifact Removal for Spaceborne Optical Images
编辑推荐:
星载光学图像中的伪影(包括光晕和饱和亮斑)较为常见,可能降低恒星提取、空间目标探测和测光分析的可靠性。传统的信号处理方法(如形态学滤波和低秩分解)依赖于固定先验,在复杂伪影形态下可能失效。深度复原网络可以改善视觉质量,但并未显式强制辐射一致性。多模态指令驱动编
星载光学图像中的伪影(包括光晕和饱和亮斑)较为常见,可能降低恒星提取、空间目标探测和测光分析的可靠性。传统的信号处理方法(如形态学滤波和低秩分解)依赖于固定先验,在复杂伪影形态下可能失效。深度复原网络可以改善视觉质量,但并未显式强制辐射一致性。多模态指令驱动编辑模型具备语义定位能力,但概率性扩散重采样可能在非目标区域引入不受控制的像素变化,从而损害像素级物理一致性。研究人员将这一问题称为编辑诱发的辐射漂移(editing-induced radiometric drift)。为解决该问题,研究人员提出PARE,一种用于星载光学图像的保物理注意力引导伪影去除框架。PARE并未直接将编辑后的图像作为最终复原结果,而是将其视为候选复原,并从MM-DiT联合注意力矩阵的图像到文本(I2T)交叉注意力子块中推导伪影区域约束。这些约束与多尺度融合相结合,将生成性修改限制在局部伪影区域,从而在抑制伪影的同时减少非目标区域中的非预期变化。在仿真和真实星载光学图像数据集上的实验表明,PARE在实现有效伪影抑制的同时改善了辐射保持性能。在真实在轨图像上,PARE的伪影均值降低率(AMR)达到92.95%,伪影能量降低率(AER)达到98.57%,将外部区域平均绝对误差(O-MAE)降低至0.54,并将外部区域结构相似性指数(O-SSIM)提升至0.997。同时,PARE在所有对比方法中产生最小的背景偏移。这些结果表明,PARE在伪影抑制与辐射保真度之间提供了有利的权衡,并为将生成模型应用于需要像素级物理一致性的科学成像任务提供了一种实用途径。
# 保物理的注意力引导星载光学图像伪影去除框架研究解读
## 研究背景与问题
星载光学传感器在空间目标监视、航天器姿态确定和深空天文观测中具有重要作用。这些应用的可靠性高度依赖于图像保真度,因为微小的像素级失真可能传播为流量估计、质心定位和暗弱目标检测中的可测量误差。在实际观测中,星载光学图像常受到多种结构化伪影的污染,包括杂散光引起的光晕、饱和亮斑、宇宙射线引起的瞬态亮像素,以及由读出电子学不均匀性或平场校正不完善导致的条带模式。这些退化在空间结构和辐射效应上均不同于简单随机噪声,表现为空间相干且平滑变化的强度结构,而非稀疏的恒星响应和微弱的背景涨落。
现有方法难以同时满足伪影抑制和辐射保真的需求。传统信号处理方法(如形态学顶帽变换、多项式背景拟合、低秩稀疏分解)具有可解释性,但依赖固定的形态学先验或统计假设,在伪影尺度多变、边界柔和、空间相干强度模式以及与恒星结构重叠时容易失效。数据驱动的深度复原网络(如DnCNN、部分卷积修复)可以改善视觉质量,但未显式保证辐射保真度,并可能在非目标区域引入非预期变化。多模态指令驱动编辑模型提供了语义定位能力,但扩散模型的概率性重采样会在非目标区域引入不受控制的像素变化,损害科学测量所需的像素级物理一致性。研究人员将这一问题定义为编辑诱发的辐射漂移(editing-induced radiometric drift),并据此开展本研究。
## 研究内容与主要方法
针对上述问题,研究人员提出PARE(physics-preserving attention-guided artifact removal),一种保物理的注意力引导伪影去除框架。该框架利用多模态指令编辑模型Step1X-Edit生成候选复原图像,从MM-DiT联合注意力矩阵中提取图像到文本(I2T)交叉注意力响应,经聚合、上采样、阈值化和形态学细化得到伪影区域掩码,再通过尺度自适应的高斯平滑掩码在多尺度拉普拉斯金字塔中融合原始图像与编辑候选,使生成性修改仅局限于伪影区域。实验采用包含1500张仿真图像的数据集(其中1000对用于训练微调、200对用于验证、300对用于独立测试)以及103幅真实在轨图像数据集(仅用于无参考评估),并与TopHat、DnCNN、InstructPix2Pix、FLUX.1-Kontext-dev和LongCat-Image-Edit五种基线方法进行比较。
## 研究结果
### 仿真数据集定量结果
在协议I(基于真值的评估)下,DnCNN获得最高的伪影去除率(ARR)99.35%,PARE在多模态生成编辑方法中达到最高的ARR 96.40%,优于InstructPix2Pix、FLUX.1 Kontext和LongCat-Image-Edit。在非目标区域保持方面,PARE在生成编辑方法中表现最佳,外部区域均方根误差(O-RMSE)为5.22,外部区域峰值信噪比(O-PSNR)为34.32 dB,外部区域结构相似性指数(O-SSIM)为0.959。结果表明,PARE在有效去除伪影的同时,显著减少了非目标区域的扰动。
### 真实数据集定量结果
在协议II(输入参照评估)下,PARE取得92.95%的伪影均值降低率(AMR)和98.57%的伪影能量降低率(AER),在生成编辑方法中表现最优。在外部区域保真和背景统计保持方面,PARE在所有对比方法中取得最佳结果:外部区域平均绝对误差(O-MAE)为0.54,O-SSIM为0.997,背景均值偏移(BMS)为0.50,背景标准差偏移(BSS)为0.70。PARE的O-MAE、BMS和BSS比次优值低一个数量级以上,表明其将伪影抑制严格限制在目标区域,同时最大程度保留了非目标区域的辐射信息。
### 下游任务验证
对伪影掩码外恒星的提取和测光验证显示,PARE实现99.36%的恒星提取精度和0.068像素的亚像素质心误差,与输入图像(99.68%和0.056像素)几乎一致,而所有基线方法的提取精度低于22%、质心误差超过1.8像素。输入图像的测光误差因伪影引起的流量膨胀高达49.18%,PARE将其降至17.67%(改善64%),基线方法则产生更大偏差。这表明PARE有效保留了非目标区域的天文数据结构。
### 消融实验
消融研究显示,直接编辑变体虽然ARR高但外部区域扰动大;alpha混合变体改善外部保真但仍略逊于完整模型;完整PARE实现最优的伪影去除与外部保持平衡。超参数敏感性分析确定注意力阈值p=0.25、形态学核大小5、膨胀核大小3为最优权衡点,四层拉普拉斯金字塔深度在ARR(96.14%)和外部保真方面均最优。提示词鲁棒性分析表明,包含核心语义的提示词能稳定达到饱和性能(ARR约97.2%,O-SSIM约0.96),PARE对措辞变化具有高鲁棒性。
## 讨论与结论
讨论部分指出,伪影抑制强度与辐射保真度是两个不同维度。DnCNN和Top-hat虽然获得更高的原始抑制分数,但造成更大的非目标区域变化和背景统计偏移。仅靠高AMR和AER不足以判断科学图像复原质量,需要联合考虑外部区域保真和背景统计保持。PARE通过注意力掩码和多尺度融合这两个互补机制,将生成编辑限制在伪影区域,同时保留原始图像的高频恒星结构,从而解耦了最终复原质量与生成候选的像素级保真度。该方法对提示词变化和生成模型的内在缺陷具有较强鲁棒性,但直接使用生成编辑结果作为复原输出会引入可测量的辐射误差。此外,PARE以更高计算开销换取科学保真度,其峰值GPU内存16.22 GB低于FLUX.1 Kontext和LongCat-Image-Edit。
研究结论指出,PARE在仿真和真实星载光学图像数据集上实现了有效的伪影抑制,同时保持了目标伪影区域外的辐射信息。真实在轨图像上的结果表明,PARE并未简单最大化原始强度抑制,而是在伪影去除、非目标区域保真和背景统计保持之间提供了有利平衡。显式空间约束和保物理融合对于将生成编辑模型应用于需要像素级辐射一致性的科学成像任务至关重要。未来工作将聚焦于提升掩码鲁棒性、扩展至更多样化的结构化伪影,并将辐射约束纳入生成模型训练。该研究发表在《Journal of Imaging》。