《Nature Human Behaviour》:Hierarchical resource rationality explains human reading behaviour
编辑推荐:
阅读是一种普遍且认知要求高的活动,支撑着现代人类文化。它是眼动为理解目的而协调的一类任务的首要实例。现有理论要么解释阅读中的眼动,要么解释理解,但两者之间的关键联系仍不清楚。在此,研究人员提出资源理性优化(resource-rational optimizat
阅读是一种普遍且认知要求高的活动,支撑着现代人类文化。它是眼动为理解目的而协调的一类任务的首要实例。现有理论要么解释阅读中的眼动,要么解释理解,但两者之间的关键联系仍不清楚。在此,研究人员提出资源理性优化(resource-rational optimization)作为统一控制原则,支配适应性阅读行为。眼动被选择为最大化预期理解,同时最小化认知和时间成本,并在嵌套的时间尺度上层级组织:注视决策支持词汇识别;句子级整合指导跳读和回归;文本级理解目标塑造记忆构建和重读。一个计算实现成功复制了人类阅读中前所未有的广泛发现,从词汇效应到理解结果。总之,这些结果表明资源理性(resource rationality)为知识密集型人类行为中协调感知、记忆和行动提供了一般机制,为复杂认知技能如何适应有限资源提供了原则性解释。
论文解读文章
研究背景与问题:阅读是支撑现代人类文化的普遍认知活动,涉及眼动与理解的协调。现有理论分别解释眼动控制(如E-Z Reader模型)或理解构建(如构建-整合框架),但两者之间的关键联系尚不清晰。研究人员旨在提出一个统一计算原则,解释眼动和理解如何共同受控于有限资源下的优化过程。
研究目的:本文提出资源理性(resource rationality)作为层级控制原则,协调感知、记忆和行动,以最大化长期理解效用,同时最小化认知和时间成本。研究人员开发了一个计算模型,将阅读形式化为层级部分可观察马尔可夫决策过程(Partially Observable Markov Decision Process,POMDP),并通过深度强化学习(deep reinforcement learning)学习最优策略。
主要技术方法:模型采用层级控制架构,包含三个层级:词级控制器、句子级控制器和文本级控制器。每个层级形式化为POMDP,通过深度强化学习独立训练,以最大化预期理解效用并最小化眼动努力和时间成本。模型整合了多个公开数据集进行验证,包括Kliegl等(德国波茨坦句子语料库)、Rayner(词内回归位置)、McConkie等(初始注视位置)、ZuCo 1.0任务2(自然句子阅读眼动)、McNamara等(文本连贯性与先验知识)、Staub and Clifton(句法歧义回归),以及Vibert等(法语时间压力阅读)。此外,研究人员新收集了英语时间压力阅读数据集,包含39名参与者,在30秒、60秒和90秒三种时间条件下同时记录眼动和阅读理解指标(多选准确率和自由回忆)。
研究结果:
1. 决定何时在词内注视(Deciding when and where to fixate in a word):模型复制了人类词汇效应,即词长增加注视时间,词频和可预测性降低注视时间。模型还再现了偏好注视位置(初始注视落在词的开头到中间)和词内回归模式(向较早字母位置回归),表明词识别是资源理性控制下的不确定性减少过程,注视位置选择最大化信息增益。
2. 决定在句子中注视何处(Deciding where to fixate in a sentence):模型复制了跳读和回归的词汇效应:短词、高频词和可预测词被跳过更多,困难词引发更多回归。句子歧义性增加回归概率,模型与人类数据一致。句子级眼动控制被形式化为策略性行动选择,在不确定下平衡理解目标与眼动成本,信念状态(comprehension belief和prediction belief)指导行动。
3. 文本理解与决定在文本中阅读何处(Text comprehension and deciding where to read in text):模型复制了先验知识和文本连贯性对回忆的影响:高先验知识或高连贯性文本下回忆更多命题。模型还再现了歧义句引发更多回归的效应,与Staub and Clifton数据一致。文本级控制中,记忆构建模拟了人类工作记忆限制,优先保留连贯或重要命题,并逐步压缩为要旨(gist)表征。
4. 时间压力下的速度-准确率权衡(Speed-accuracy trade-off when reading under time pressure):模型在时间压力下复现了人类适应性策略:时间越紧,阅读速度越快,跳读增加,回归减少,多选准确率和自由回忆下降。模型通过将剩余时间纳入观测空间和学习时间敏感奖励,成功捕捉了这些效应,反映了资源理性下深度与广度的权衡。
5. 验证层级资源理性的必要性(Validating the necessity of hierarchical resource rationality):消融实验比较了完整模型与五个基线(无限记忆、短视句子读者、短视文本读者)。完整模型与人类数据最一致(Pearson r=0.9999,MAE=1.46,RMSE=3.31),而所有基线模型都产生较大偏差。无限记忆模型导致超人类理解但较少回归,短视模型导致阅读停滞或过早终止,表明层级结构和长期效用优化对于生成类人阅读行为至关重要。
讨论与结论:本文表明,人类阅读行为源于一般性资源理性控制机制,该机制在不确定性下协调感知、记忆和序列行动。模型通过层级POMDP和深度强化学习实现,弥合了记忆、知觉和控制理论之间的长期鸿沟。研究结论部分翻译如下:本文确立了人类阅读行为源于一个一般的资源理性控制机制——该机制在不确定性下协调感知、记忆和序列行动。虽然深度强化学习已被推进为实例化人类心智计算理论的强大方法,但一直缺失的是在涉及眼动的知识密集型任务中层级处理如何出现的解释。读者通过策略性、序列性决策分配注视,以最大化理解同时最小化努力和时间,受限于认知资源带来的不确定性。我们的模型将此原则表示为层级POMDP,通过深度强化学习求解,使策略能够在现实感知和记忆不确定性下涌现,忠实捕捉类人资源限制。这一资源理性层级架构弥合了认知科学中记忆、知觉和控制理论之间的长期鸿沟,不仅适用于阅读研究,也适用于行为和认知科学。它提出高层次理解过程和低层次运动控制过程可以理解为统一优化过程的结果。