《SCIENCE ADVANCES》:Medial temporal default mode network selectively encodes autobiographical visual imagery
编辑推荐:
人类大脑从记忆中想象视觉场景的能力被认为依赖于默认模式网络的内侧颞叶子系统(MT-DMN),但支持这种能力的神经代码仍知之甚少。研究人员将功能磁共振成像(fMRI)与视觉和语言人工智能模型相结合,以表征自传体想象过程中的神经代码。五十名参与者在接受fMRI扫描
人类大脑从记忆中想象视觉场景的能力被认为依赖于默认模式网络的内侧颞叶子系统(MT-DMN),但支持这种能力的神经代码仍知之甚少。研究人员将功能磁共振成像(fMRI)与视觉和语言人工智能模型相结合,以表征自传体想象过程中的神经代码。五十名参与者在接受fMRI扫描时,想象重新体验20个自然场景,这些场景由通用文本提示(如婚礼、锻炼和驾驶)触发。个体场景使用Stable Diffusion根据事先收集的参与者对所想象场景的口头描述生成个性化合成图像进行建模。这些描绘随后被转换为图像识别网络的隐藏状态表征。表征相似性分析(RSA)显示,MT-DMN编码了参与者特异的图像表征结构,即使在控制从大型语言模型(LLM)派生的语义特征后也是如此。这种效应在其他大脑网络中以及在无主动想象的阅读期间不存在,从而将MT-DMN确定为自传体经验视觉重建的核心基底。
自传体记忆中的视觉想象是人类大脑的一种核心能力,它允许个体从记忆中重建视觉场景,即使这些心理图像可能是模糊的。既往研究提示默认模式网络的内侧颞叶子系统(MT-DMN)参与记忆、想象和空间加工,但该子系统如何编码个体独特的视觉场景重建仍不清楚。主要难点在于缺乏对个体想象场景的表征模型,以及需要将视觉信息与非视觉语义成分(如情感、对话和社会意义)分离。该研究发表于《SCIENCE ADVANCES》,旨在检验MT-DMN是否选择性地编码自传体视觉意象的个体特异结构,并评估其相对于其他大脑网络的特异性。
研究人员重新分析了50名成年参与者的fMRI数据集,其中25名年轻成人(平均年龄24±3岁)和25名老年成人(平均年龄73±7岁)。参与者预先想象20个自然场景(如锻炼、购物、婚礼),并口头描述其心理图像。在扫描期间,他们根据通用文本提示重新想象这些场景。为了建模个体特异的视觉内容,研究人员使用Stable Diffusion 2.1根据每名参与者的文字描述为每个场景生成五张合成图像,然后通过VGG-16卷积神经网络提取最终softmax前层(FC8)的1000维激活向量,逐点平均后得到每个参与者每个场景的视觉模型(Visual Model)。同时,使用GPT-2的第16层激活向量对口头描述进行建模,作为非视觉语义控制模型。采用基于偏相关的表征相似性分析(RSA)评估fMRI模式相似性与模型表征结构之间的对应关系。
主要关键技术方法包括:功能磁共振成像(fMRI)数据采集与预处理(使用fMRIPrep);文本到图像生成模型Stable Diffusion(基于OpenCLIP语义编码)从参与者的口头描述合成个性化场景图像;图像识别网络VGG-16提取图像的FC8表征向量;大型语言模型GPT-2(Layer 16)对非视觉语义内容进行控制建模;基于偏相关的表征相似性分析(RSA)以及参与者身份解码的置换检验和Bootstrap分析。样本来源包括罗切斯特大学的两组参与者(25名年轻人和25名老年人)以及句子阅读数据集(14名来自KRNS项目的健康志愿者,数据公开)。
研究结果分三个部分。第一,MT-DMN选择性地反映视觉模型表征结构。通过偏相关RSA,研究人员发现MT-DMN对视觉模型的敏感性显著高于其他所有16个网络(所有比较Z≥2.5,P≤0.006,单尾),而GPT-2的效应不具特异性,Core-DMN的GPT-2系数显著高于MT-DMN。进一步分析显示,该模式在年轻和老年组均存在;使用5张图像优于单张;用OpenCLIP代替GPT-2控制时结果更显著;Stable Diffusion潜在空间表征不如VGG-16表征有效;用sdxl-turbo实现可复制;时间分辨分析显示视觉模型在提示后5至15秒持续对应,峰值在7.5至10秒,对应刺激后约3至5.5秒,提示模型拟合跨越记忆访问和沉浸式意象阶段。第二,MT-DMN反映参与者特异的视觉模型结构。通过两可选强迫选择身份解码,视觉模型在MT-DMN中以72%的准确率区分参与者身份(FDR校正P=0.001),FT-DMN中也显著(65%);而GPT-2在11个网络中均能解码,包括MT-DMN(69%)、FT-DMN(66%)和Core-DMN(71%)。将视觉模型和GPT-2组合时,MT-DMN的解码准确率最高(76%)。Bootstrap分析表明,在99.25%的随机35人子样本中,组合模型优于单独GPT-2,证明视觉模型独立贡献于个体解码。重复分析显示最少需要25至30名参与者才能稳定检测这种个体特异视觉结构。第三,在没有主动想象的句子阅读期间,MT-DMN不反映视觉模型结构。在另一组14名参与者阅读240个描述场景/对象的句子的数据中,相同分析显示MT-DMN对视觉模型无显著编码,视觉模型仅在Core-DMN有微小效应,而GPT-2在所有17个网络中均解释fMRI数据。句子长度匹配的控制分析(选取较短自传体描述和较长句子,平均7.4词)排除了描述长度差异的干扰,结果仍支持主动想象是MT-DMN视觉编码的必要条件。这一结果强调了想象任务本身的作用,而非一般性的场景语义加工。
讨论部分指出,该研究为MT-DMN在自传体视觉意象重建中的核心作用提供了证据,并证明了生成式AI与图像识别模型结合可用于构建个体化大脑模型。研究将自我生成思维、情景记忆和视觉意象三个领域联系起来,首次证明了MT-DMN编码个体特异的自传体场景视觉表征。讨论中,研究人员指出Stable Diffusion可能通过填充未明确提及的情境细节来丰富场景,VGG-16对上下文和纹理的敏感性有利于场景选择区域建模;同时承认大脑的想象可能是生成式的,而当前模型使用判别式变换,与神经机制不完全对应;未来工作需捕捉空间布局、研究物体想象,并发展个性化生成模型。结论部分翻译为:总之,这项研究表明,MT-DMN通过建模fMRI数据与参与者特异的自传体视觉重建之间的对应关系,对自传体视觉意象做出了独特贡献;该方法为研究人脑中自由形式想象的解码提供了框架,并可能成为表征心理意象个体差异(特别是在意象夸大、减弱或异常的情况下)的有用工具。