编辑推荐:
•提出了一种基于专家混合的网络架构,用于全方位图像质量评估。•设计了一个自适应特征表示模块,将该专家混合机制融入到模型的多个阶段中,并利用从视口提取的失真信息作为先验信息,从而自适应地表示视口的多级特征。•引入了质量预测模块,通过加权各视口的质量得分来获得整体质量评价。引言全方位
- •
提出了一种基于专家混合的网络架构,用于全方位图像质量评估。
- •
设计了一个自适应特征表示模块,将该专家混合机制融入到模型的多个阶段中,并利用从视口提取的失真信息作为先验信息,从而自适应地表示视口的多级特征。
- •
引入了质量预测模块,通过加权各视口的质量得分来获得整体质量评价。
引言
全方位图像能够提供形式的视觉内容,已被广泛应用于沉浸式交互应用中。然而,在生成、传输和存储过程中,全方位图像容易受到各种失真的影响[1],这些失真会降低视觉质量,甚至导致视觉疲劳。因此,设计高效的全方位图像质量评估模型对于提供高质量的沉浸式视觉体验具有重要意义[2]。
本文重点研究无参考的全方位图像质量评估方法。随着深度学习的快速发展,基于深度学习的无参考全方位图像质量评估模型取得了优异的性能,因而受到了更多关注[3]。这类方法通常采用卷积神经网络[4]、[5]、[6]或视觉变换器[7]、[8]来表征与视觉质量相关的特征,以实现质量预测。有些研究还采用了知识蒸馏技术[9]、[10]或设计了增强模块[11],以提升特征表征能力。现有的全方位图像质量评估模型主要是针对均匀失真设计的,而全方位图像也易受非均匀失真的影响。与非均匀失真相比,均匀失真在空间分布上较为一致,这限制了现有评估方法的性能[12]、[13]。为解决这一问题,Yan等人[12]提出了基于视口序列建模的方法,模拟在不同起始点和浏览时长下的浏览过程,并使用视觉变换器来表征视口序列中的质量相关信息以进行质量预测。尽管他们已经考虑了非均匀失真的影响,但在提升模型对均匀和非均匀失真的处理能力方面仍有改进空间。
由于专家混合架构[14]能够利用多个独立的专家网络,并通过门控网络根据输入条件自适应地整合这些网络的输出,从而实现高效的特征表征,因此一些研究人员将其应用于人工智能生成图像的质量评估任务中[15]、[16]。例如,Wang等人[15]将多模态大型模型与深度图像质量评估模型相结合,利用专家混合架构自适应地整合不同分支的输出,以此评估人工智能生成图像的质量。此外,近期的一些研究表明,利用专家混合架构自适应地提取多级图像特征,能够更有效地提升特征表征能力[17]、[18]。例如在图像分类任务中,Riquelme等人[17]用专家混合架构替代了视觉变换器中的前馈网络,从而自适应地提取多级视觉信息,提升了分类性能。受这些研究的启发,我们也考虑采用专家混合架构来自适应地表征与质量相关的信息。
此外,利用先验信息可以让门控网络根据任务需求更有效地整合不同专家网络的输出[19]。在图像质量评估任务中,由于不同的失真会对视觉质量产生不同的影响,因此失真信息可作为有用的先验信息。通过将失真信息纳入门控网络,模型能够根据具体的失真情况有针对性地关注与质量相关的特征。具体而言,我们从全方位图像中提取具有失真感知能力的特征,并将其输入门控网络,从而实现专家网络输出的自适应整合。
本研究的主要贡献如下:(1)我们提出了一种基于专家混合架构的全方位图像质量评估方法,名为MoE-OIQA,该方法利用专家混合架构自适应地表示从纹理到语义的多级质量相关信息。(2)我们利用具有失真感知能力的特征作为先验信息,从而实现专家网络输出的有针对性整合。(3)实验结果表明,与现有方法相比,我们所提出的方法具有更出色的性能。
章节摘要
全方位图像质量评估
早期的研究主要是对传统的图像质量评估技术[20]、[21]、[22]、[23]、[24]、[25]进行扩展,用以评估全方位图像的质量。Sun等人[26]将峰值信噪比算法应用于球形图像的质量评估中,Zakharchenko等人[27]则用峰值信噪比来评估晶面抛物线投影图像的视觉质量。不过,这些方法往往忽视了人类在感知失真时的实际行为。
随着深度学习技术的发展
方法论
所提出的基于专家混合架构的全方位图像质量评估框架(MoE-OIQA)如图1所示。与传统二维图像质量评估方法[36]、[37]、[38]、[39]、[40]不同,全方位图像质量评估通常依赖于基于视口的感知方式,因为全方位图像一般都是以视口的形式呈现给用户的。由于低纬度区域包含更容易吸引视觉注意力的场景信息[41]、[42]、[43],因此我们首先从赤道区域通过均匀采样方式提取视口。
实验结果
我们在三个全方位图像质量评估数据库上测试了MoE-OIQA模型:OIQA数据库[61]、IQA-ODI数据库[62]以及OIQ-10K数据库[63]。OIQA数据库包含320张经过四种不同类型、五种不同程度失真处理的图像,这些失真类型包括JPEG压缩、JP2K压缩、白噪声干扰和高斯模糊处理。主观质量通过平均意见得分来量化。IQA-ODI数据库则包含120张参考图像以及通过添加JPEG压缩等方式产生的960张失真图像。
结论
我们提出了一种基于专家混合架构的全方位图像质量评估模型。该模型将专家混合架构的理念融入到模型结构中,设计出了一个自适应特征表示模块,该模块利用从视口提取的具有失真感知能力的特征作为先验信息,从而自适应地表示视口的多级特征。此外,我们还设计了质量预测模块,通过加权各视口的质量得分,最终得到整体质量的预测结果。大量实验表明,MoE-OIQA模型
利益冲突声明
作者声明,他们不存在任何可能影响本文研究结果的已知财务利益关系或个人关系。
致谢
本研究得到了中国国家自然科学基金的支持,项目编号为62372042。
Zihan Liu|Lixiong Liu