《Frontiers in Computational Neuroscience》:Perceptual distortions in PredNet and quantification of top-down/bottom-up flow
编辑推荐:
知觉扭曲广泛见于包括自闭症谱系障碍(Autism Spectrum Disorder, ASD)在内的多种精神疾病中。近期关于精神疾病和学习障碍的贝叶斯模型提出了一种基于“异常精确度(aberrant precision)”概念的通用理论。然而,这些模型尚未被
知觉扭曲广泛见于包括自闭症谱系障碍(Autism Spectrum Disorder, ASD)在内的多种精神疾病中。近期关于精神疾病和学习障碍的贝叶斯模型提出了一种基于“异常精确度(aberrant precision)”概念的通用理论。然而,这些模型尚未被用作视觉扭曲的现象学模型,因为先前的模型通常只处理带有拉普拉斯近似的低维输入。这种假设对于精确度被明确定义是必要的;否则,基于异常精确度的解释几乎不适用。本研究利用基于预测编码的深度神经网络PredNet和一种受精确度解释启发、使用希尔伯特-施密特独立性准则(Hilbert-Schmidt Independence Criterion, HSIC)的新分析方法,解决了这些局限性。研究人员发现,当使用更长的时程上下文进行训练时会发生视觉扭曲,而当增加顶层预测误差的权重时,这种扭曲会得到缓解。通过HSIC分析,研究人员表明,权重的增加增强了预测中的自上而下信息流,这导致了对视觉输入的全局特征(如旋转、平均亮度和色调)的捕捉能力增强。
研究背景与意义
视觉知觉扭曲是一个复杂的神经科学问题,即使感官器官功能正常也可能发生,例如在精神分裂症和自闭症谱系障碍(ASD)等疾病中观察到的低对比度敏感性和颜色视觉障碍。为了阐明其潜在机制,计算建模提供了一种宏观描述现象的途径。预测处理(Predictive Processing)理论认为大脑通过最小化预测误差来工作,其中先验信念(自上而下信息)和感官输入(自下而上信息)的结合产生预测,而每种信息源的相对重要性被称为“精确度”。异常精确度假说认为,精神疾病可能源于这两种信息整合的不平衡。然而,现有的计算模型大多局限于低维输入,无法处理实际的高维视觉数据,且缺乏量化PredNet等深度学习模型中自上而下与自下而上信息流的方法。因此,研究人员开展了此项研究,旨在通过PredNet模型和HSIC分析,探索视觉扭曲的计算机制,并填补高维视觉数据处理与信息流量化之间的空白。该研究发表在了《Frontiers in Computational Neuroscience》期刊上。
关键技术方法
研究人员采用了基于预测编码的深度神经网络PredNet作为核心模型,该网络通过学习预测视频的下一帧图像来模拟层级预测处理系统。为了探究视觉扭曲的产生机制,研究人员设置了两种发育条件:改变最高层误差损失的权重(λ3)以调节空间上下文的影响,以及对卷积长短期记忆网络(ConvLSTM)的内部状态进行重置或不重置以操纵时程上下文的长度。实验使用了由Watanabe等人修改的第一人称社交互动数据集(First-Person Social Interactions Dataset),并将其降采样至15帧每秒,裁剪为(160, 80)分辨率。为了量化网络中复杂的信息流动,研究人员引入了希尔伯特-施密特独立性准则(HSIC)这一非线性相关性度量方法,用于评估预测图像与高层输入(自上而下)及底层误差(自下而上)之间的依赖关系。此外,研究还通过计算峰值信噪比(PSNR)、结构相似性指数(SSIM)、拉普拉斯方差(锐度)、亮度偏差和饱和度偏差等指标,对生成图像的质量进行了定量评估。
研究结果
3.1 各条件下生成图像的特征
研究结果表明,训练条件对生成图像的稳定性和质量有显著影响。在不重置(no reset)条件下训练的网络,特别是在λ3=0时,在场景突变(t=20)后产生了持续的视觉扭曲,表现为模糊、低饱和度和高亮度。相比之下,重置(reset)条件下的网络生成的典型图像未出现扭曲。此外,增加最高层损失权重(λ3=1,100)能够有效缓解不重置条件下的视觉扭曲,使预测图像更加稳定。定量分析进一步证实,不重置且λ3=0的条件导致了最低的PSNR和SSIM值以及最大的亮度和饱和度偏差,而增加高层损失权重则改善了这些指标。
3.2 通过HSIC量化自上而下/自下而上信息
利用HSIC对信息流的量化显示,在正常预测阶段,自上而下和自下而上的HSIC值最初较高,随后逐渐收敛到较小值;在场景突变时两者均会再次上升,之后下降;而在外推阶段,由于不再有真实的感官输入,自下而上的HSIC降为零,而自上而下的HSIC则有所增加。在不重置且λ3=0的条件下,自上而下和自下而上的HSIC值在预测期间持续保持高位,表现出异常的信息流模式。
3.2.1 重置条件下高层损失的影响
在重置条件下,虽然不同λ3值的时间动态相似,但当λ3=1或100时,自上而下的HSIC显著高于λ3=0时。这表明在训练过程中增加高层损失权重能够显著增强预测过程中的自上而下信息流,而自下而上的HSIC在不同λ3条件下则没有显著差异。
3.3 高层损失加强了自上而下信息流与全局感知
进一步的分析表明,增强的自上而下信息流赋予了网络更强的全局特征捕捉能力。通过计算光流(optical flow),研究人员发现高λ3条件生成的全局运动更为明显。在全局统计适应实验中,面对亮度减半或饱和度减半的输入图像,高λ3条件的网络能更快地调整其预测图像的平均亮度和色度,使其与输入图像的全局统计特性相匹配。这证实了高层损失通过促进全局特征的整合,提升了网络对整体视觉场景的理解能力。
讨论与结论
4.1 PredNet重现的视觉扭曲
讨论部分指出,不重置条件模拟了减少对长时程上下文依赖的场景,允许网络利用扩展的时程依赖性,但这也引入了预测系统的不稳定性,导致视觉扭曲。而增加高层损失权重(λ3)作为一种抵消策略,通过增强高层处理的粗粒度、自上而下信息的影响,对网络预测起到了稳定作用,减少了视觉扭曲。
4.2 一般情况中“精确度”的测量
研究人员提出使用HSIC来测量PredNet模型中的自上而下/自下而上信息流,这种方法类似于层级预测处理系统中的精确度概念。与以往明确编码精确度的模型不同,PredNet中并未显式编码精确度,但HSIC提供了一种间接估计信息流相对重要性的方法。在理想化的标量高斯线性设置中,归一化的线性核HSIC对应于归一化的精确度权重,但在PredNet分析中,使用高斯核的HSIC应被解释为受精确度启发的、基于依赖性的度量,而非贝叶斯精确度的直接估计。
4.3 发育条件与信息流
本研究通过比较不同训练条件(即发育条件)下的网络,探讨了发育过程如何影响最终的网络结构和信息流。这种方法不同于以往直接操纵精确度参数的研究,它提供了关于发育条件与由此产生的网络结构之间关系的额外见解,有助于预测何种发育条件会导致异常精确度模型,或如何干预发育过程以缓解症状。
4.4 当前模型的局限性
尽管取得了进展,PredNet模型本身仍存在一些局限性。例如,其预测能力有限,主要策略可能是复制前一帧或模糊图像,并且预测误差并不总是随着层级上升而一致减小。此外,使用随时间反向传播(BPTT)进行训练在生物学上并不合理,且研究仅使用了单一数据集,未来需要在更多样化的长时程自然视频数据集上进行验证。HSIC方法虽然高效,但在处理高维信息时流时仍存在计算负担。
结论
本研究展示了一种超越高斯分布应用自上而下/自下而上信息流的新方法。通过该方法,研究人员直接测量了这些信息源相对重要性的时间动态。所提出的方法开启了使用相同度量比较不同架构的可能性,有助于整合神经科学或精神病学中不同的研究结果,例如本研究结果揭示了视觉扭曲症状与全局感知之间的联系。