奖励预期形成与结果处理的独特神经动态:来自ERP与时频分析的洞见

《Psychophysiology》:Distinct Neural Dynamics Underlying Reward Expectation Formation and Outcome Processing: Insights From ERP and Time-Frequency Analyses

【字体: 时间:2026年09月02日 来源:Psychophysiology 3.2

编辑推荐:

  奖励预期对于决策和强化学习理论至关重要。虽然先前研究侧重于预期如何影响结果处理,但关于这些预期实际如何形成的研究却少得多。为填补这一空白,研究人员记录了参与者在完成一项两阶段二元选择任务时的脑电图(EEG)活动,该任务旨在将关于结果概率的预期形成与实际奖励结果

  
奖励预期对于决策和强化学习理论至关重要。虽然先前研究侧重于预期如何影响结果处理,但关于这些预期实际如何形成的研究却少得多。为填补这一空白,研究人员记录了参与者在完成一项两阶段二元选择任务时的脑电图(EEG)活动,该任务旨在将关于结果概率的预期形成与实际奖励结果的处理分离开来。为更全面地考察每个阶段背后的神经机制,研究人员测量了奖励正波(RewP)和P3b时域事件相关电位(ERP)成分,以及构成每个ERP的delta和theta频段活动。在结果概率阶段,参与者学习了其当次选择获胜的可能性。所有RewP潜伏期活动指标(ERP、delta、theta)对确定发生的结果均更大,但各指标与结果效价的关系却出现分化。相反,所有P3b潜伏期指标对确定发生的损失均增加。值得注意的是,RewP-Theta的变化(而非ERP成分)提供了对确定损失敏感性的最早标记。在实际结果阶段,RewP和P3b-ERP对意外获胜更大,这与奖励预测误差和情境更新理论一致。Delta活动通常遵循其时间匹配ERP中观察到的模式,但与结果效价的关系不一致,提示其可能反映情境化反馈处理,而非特定的获胜相关信号。Theta对结果效价不敏感,仅在较长潜伏期对预期敏感,表明其从预期形成期间的效价敏感处理转变为对预期违背监测的更广泛作用。总之,这些结果强调了在时间和功能上区分预期形成阶段与结果处理阶段的重要性,同时展示了多方法学分析路径在充分捕捉基于奖励决策动态本质方面的价值。
论文解读:奖励预期形成与结果处理的神经动态——基于ERP与时频分析的综合研究

一、研究背景与问题

奖励预期是决策与强化学习理论的核心基础。准确预期能够最大化未来积极结果(即奖励)的可能性,并最小化消极结果(即损失)的潜在风险;相反,不准确的预期可能导致错失机会,并提示需要进一步学习。因此,认知科学家和神经科学家投入了大量精力研究预期如何塑造人类和其他动物对奖励结果的处理。然而,关于奖励预期形成背后的神经机制,目前知之甚少。以往绝大多数脑电图(EEG)研究仅聚焦于奖励结果处理阶段,而忽略了形成预期的线索加工阶段,这一不平衡已在多篇综述中受到批评。例如,大量研究详细描述了奖励预期如何影响结果处理,但很少有研究考察形成预期的线索所诱发的神经处理。此外,预期的形成必然影响后续对结果的评价(例如,优于或劣于预期),但没有理由假设单一神经机制同时支持这两个过程;奖励相关线索诱发的RewP和P3b与其结果诱发对应成分之间并无显著相关。因此,迫切需要理解预期形成的机制及其底层神经过程。

据研究人员所知,此前仅有两项研究专门考察了创建奖励预期的线索加工(Yu et al. 2011; Zheng et al. 2020),但这些研究仅评估了少量神经过程,且存在各自的方法学局限。本研究旨在通过结合传统时域ERP分析与时频分析,对预期形成处理和最终结果处理进行全面考察,从而填补这一空白。

二、研究设计与主要技术方法

研究采用两阶段奖励预测任务分离预期形成与结果评价。在结果概率阶段,线索(八色圆环比例)提供当次获胜可能性的信息,形成或塑造参与者对输赢的预期;在实际结果阶段,参与者获知实际获胜颜色。研究招募36名健康志愿者,最终纳入32名(年龄21.1±3.6岁,20名女性),均来自杜克大学校园机构审查委员会批准的研究。EEG数据使用64通道Ag/AgCl主动电极采集,离线处理采用EEGLAB工具箱,应用独立成分分析(ICA)矫正眼动伪迹,并对事件相关电位(ERP)和时频活动(delta: 0.5–3.5 Hz; theta: 4.5–7.5 Hz)进行提取。关键分析方法包括:对RewP和P3b的时域ERP平均幅度进行测量;采用Cohen类时频变换的二项式简化界面分布变体提取诱发(相位锁定)时频功率;使用重复测量方差分析(rmANOVA)检验结果效价(输/赢)与确定性(确定/不确定)或预期性(预期/50-50/意外)的主效应及交互作用。

三、主要研究结果

1. 行为结果:参与者能够在每个block前半段学会识别并选择最优颜色,正确率随后稳定在80%左右;选择时间仅首 trials 显著较慢,后续趋于稳定。

2. 结果概率阶段的RewP成分:RewP-ERP对预测的获胜更大,且对确定结果更大;RewP-Theta对预测损失更大,且存在显著交互作用(仅确定损失时theta显著增加);RewP-Delta仅对确定性敏感,对效价无显著影响。这提示时频分析揭示了传统ERP未发现的效价与确定性交互效应,尤其frontocentral theta是对确定损失的最早敏感标记。

3. 结果概率阶段的P3b成分:P3b-ERP、P3b-Theta和P3b-Delta均对确定损失最大,而对不确定的输赢无显著差异。这些结果表明,确定损失可能触发参与者对后续选择的调整需求。

4. 实际结果阶段的RewP成分:RewP-ERP对意外获胜最大,与奖励预测误差理论一致;RewP-Theta对所有因素均不敏感;RewP-Delta对获胜的活动随意外性增加而增加,而损失活动在50/50条件(最模糊)下最大。

5. 实际结果阶段的P3b成分:P3b-ERP对意外获胜最大,损失活动在50/50条件下也增高;P3b-Theta仅对预期性敏感,对效价不敏感;P3b-Delta对损失和意外结果均独立敏感,无交互作用。

四、讨论与结论总结

讨论部分指出,预期形成阶段与结果处理阶段具有不同的神经动态:预期形成主要受确定性信息调节,尤其对损失敏感;结果处理则对意外结果(特别是意外获胜)最敏感。Frontocentral theta在预期形成阶段对效价敏感(尤其确定损失),而在结果处理阶段失去效价敏感性,仅对预期违背起监测作用。Parietal delta活动通常与时间匹配的ERP模式相似,但表现出与结果效价的不一致关系,提示其可能反映情境化的反馈评价而非单纯的获胜信号。传统时域ERP与诱发时频测量提供互补信息,时频分析可分离重叠信号,揭示混合ERP中丢失的效应。

研究结论总结:本研究的核心发现是预期形成与结果评价是可分离的过程,具有不同的神经机制和信息敏感性。预期形成阶段由确定性和损失信号主导,而结果处理阶段由意外性和奖励预测误差主导。多方法学分析路径(ERP与时频)能更完整地揭示奖励处理过程中的动态神经本质,为理解前扣带回皮层(ACC)功能及相关理论(如prediction error、context updating)提供了新的证据。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号