有限样本推无限目的:开放式目标推断作为自底向上提议的自顶向下贝叶斯滤波

《Topics in Cognitive Science》:Infinite Ends From Finite Samples: Open-Ended Goal Inference as Top-Down Bayesian Filtering of Bottom-Up Proposals

【字体: 时间:2026年07月24日 来源:Topics in Cognitive Science 3.3

编辑推荐:

  人类目标空间极其庞大;然而,仅通过观察场景片刻或阅读故事数秒,人们似乎能自发推断出相关主体可能追求的若干合理动机。何种机制解释了这种在目标无穷尽时仍能直觉他人目的的非凡能力?这如何与将他人理解为近似理性主体的常识相一致?研究人员提出开放式序贯逆规划搜索(ope

  
人类目标空间极其庞大;然而,仅通过观察场景片刻或阅读故事数秒,人们似乎能自发推断出相关主体可能追求的若干合理动机。何种机制解释了这种在目标无穷尽时仍能直觉他人目的的非凡能力?这如何与将他人理解为近似理性主体的常识相一致?研究人员提出开放式序贯逆规划搜索(open-ended sequential inverse plan search,open-ended SIPS),一种面向开放式目标推断的序贯蒙特卡洛(sequential Monte Carlo,SMC)模型。开放式SIPS将自顶向下贝叶斯逆规划与基于共现子目标统计的自底向上采样相结合。通过提出与主体已达成子目标相关的目标假设,该模型无需穷举搜索即可快速生成合理目标,随后滤除给定已观测动作下不合常理的目标。研究人员在称作Block Words的目标推断任务中验证该模型,被试需猜测他人用字母积木堆叠出的单词。相较启发式自底向上猜测与对数百目标精确贝叶斯推断,该模型更好预测人类目标推断的均值、方差、效率与资源理性(resource rationality),以远低认知代价取得与精确模型相近准确率,同时展现纯自底向上采样无法捕获的对非理性目标假设的理性剪枝。实验凸显统合自顶向下与自底向上模型对解释人类心智理论(theory of mind)速度、准确性与通用性的重要意义。
研究背景方面,心理学家长期研究人们如何生成与评估他人目标假设,但计算模型多假定固定小规模目标集并建模相对似然,未解决开放大空间下合理目标如何产生。由于任意复杂环境中目标组合爆炸,开放式目标推断成为默认设定,现有贝叶斯逆规划虽提升效率却未触及高效生成相关假设这一核心挑战。为解释人类以有限计算在无限目的空间中做出广理性推断,研究人员开展本研究,提出开放式SIPS作为理性过程模型,在Block Words任务中对照纯自底向上采样与精确枚举贝叶斯基线,得出结论:该混合SMC模型在分布相似度(IoU)、准确率、方差、样本效率与资源理性上最优,证明自底向上提议与自顶向下逆规划滤波的统合是人类目标推断的合理算法假设,论文发表于《Topics in Cognitive Science》。
关键技术方法上,研究人员基于Gen.jl概率编程框架实现开放式SIPS,在PDDL(Planning Domain Definition Language)定义的Blocksworld中运行;自底向上提议采用字符级n-gram语言模型,以last-and-next策略由已堆叠字母前缀采样完整单词;自顶向下滤波采用SIPS架构下有界理性智能体策略,用实时启发式搜索(RTHS)估计Boltzmann策略中的Q值,逆温度β、规划预算B与先验词频经网格搜索拟合wordfreq与3of6game词表;SMC循环含 rejuvenation 提议新粒子、按动作似然比重加权、按权重重采样并合并同粒子;人类实验经Prolific招募100名英语流利美国被试,随机分配16个Block Words场景中8个,按Brier分数给猜词奖励,分bottom-up friendly、irrational alternatives、garden paths、uncommon words四类情境。
研究结果部分,3.1.1节人机相似性显示开放式SIPS(N=10粒子)IoU 0.33–0.36高于精确推断0.31与纯提议0.30–0.32,在irrational alternatives条件尤佳,逐步推断中能像人类一样在堆叠t于p后下调pink权重,garden path条件下与人类同现“黏性推断”而非纯提议的近因偏差;算法属性上开放式SIPS方差匹配人类、计算调整效用优于零方差但假设巨量的精确推断。3.1.2节比较any-tower、last-tower、next-tower、last-and-next四种提议,last-and-next最优,且任意提议加SMC滤波均稳定提升相似度与准确率,证伪纯自底向上充分性。3.1.3节精度-耗时权衡显示精确推断BFS耗时7.31s/动作、A* 37.95s,开放式SIPS用A*与N=20达0.204准确率、2.14s/动作,N=50方差<0.055,纯提议毫秒级但准确率停滞0.145左右,表明该模型兼具实时性与高准。
讨论部分总结,人类自评相似度0.44仍高于模型0.35,差异来自语料频率与真人猜词偏好(避脏话、偏salient词)不符,可由人猜词数据重估先验弥补;garden path下精确推断也现黏性,疑因规划预算受限使早期误导动作权重过大,人类更黏且可能自适应决定何时提议新粒子,指向自适应rejuvenation与选择性遗忘观测的SMC扩展;自底向上与自顶向下占比由动作对假设的约束增量调节,未来可用先拆积木后建词场景测试。底层子目标共现统计可自网页规模语言模型提取script knowledge替代n-gram,或由PDDL规划图(planning graph)与分层规划目标分解中挖掘,拓展至烹饪、装配等域。对辅助博弈(assistance games)而言,开放式SIPS使AI无需预枚举即能实时推断开放意图,是构建类人理性贝叶斯助手的基础。
研究结论翻译:相较替代模型,该基于采样的开放式目标推断账户在经验与理论上均获最佳支持,为人类目标推断的速度与灵活性提供算法可信解释。实验发现人类自身相似度(IoU=0.44)仍高于最拟合模型(0.35),部分源于猜词统计与语料频率偏差,可通过由人猜词导出先验与提议缓解。garden path案例比预期复杂,逆规划模型与人同现黏性而精确推断亦如此,疑因规划预算有限,人类甚至更黏且可能自适应提议,可用自适应rejuvenation SMC或选择性遗忘SMC刻画。该模型跨需自顶向下、自底向上或混合场景复现类人推断,两系统平衡由动作超出自底向上线索的约束量调节。自底向上采样通用性可借大规模语言模型script knowledge或符号规划图子目标先决关系增强。该进展对开放设定下助人的AI系统直接相关,开放式SIPS以自底向上提议加自顶向下滤波在速度与规模上兼得,指向构建高效导航他人无穷目的而手段有限的理性贝叶斯助手。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号