《Frontiers in Psychology》:AI-assisted history education in China: a secondary evidence map of psychological antecedents and learning outcomes
引言: 关于人工智能在中国历史教育中应用的证据仍然零散。本研究绘制了现有次级证据图谱,并通过针对历史学科特定研究的定向验证对其进行了情境化补充。
方法: 我们分析了一份截至2024年4月1日的公共文献计量导出数据(含1,063条记录),并进行了定向全文验证,以识别原始数据库之外的历史教育证据。经过序贯筛选,30条记录被纳入情境化图谱。此外,还进行了扩展同义词审计,以评估是否存在被遗漏的直接历史教育研究。
结果: 九条记录明确将中国大陆、香港或台湾确定为研究情境,其中包含五项主要实证研究。同义词审计未在数据库中识别出直接的历史教育研究。定向验证识别出一项2025年中国大陆关于人工智能辅助中学历史教学的研究、两项描述更广泛历史教育文献的系统综述,以及一项相邻的文化遗产教育研究。在区域子集中,情感/焦虑/认知负荷结果在五条记录中报告,参与度在四条记录中报告,动机和自我效能感各在三条记录中报告,技能/能力在六条记录中报告,知识与表现各在五条记录中报告。
讨论: 该数据库应被解读为次级证据的情境化图谱,而非对该领域的全面估计。总体而言,证据表明中国历史教育中人工智能的关注度正在兴起,但仍然有限且异质性显著。
论文主体内容总结
1 引言
人工智能正以多种方式应用于教育领域,包括辅导系统、自动反馈、学习分析、教育机器人和生成式工具。在历史学科中,这些系统可用于帮助源材料比较、制作时间线、生成问题以及提供基于证据的写作反馈,但也可能编造引文、模糊多元解读或以虚假的确定性提出模糊主张。因此,研究焦点在于人工智能在何种情境下能够促进规范的历史探究,以及在何种情境下可能替代独立的史学思维。中国情境尤为重要,原因在于其庞大的教育数字化基础设施、对人工智能技术的快速采纳,以及显著的地区、机构和学习者异质性。历史教学本身具有挑战性,学生需要能够识别证据并作出断言、将主张置于具体情境中、比较不同观点并从不完整信息中得出结论。此前关于智能辅导、预测、评估、个性化和生成式人工智能的综述已识别出学习者能动性、参与度、透明度和教师中介设计等反复出现的关切,但未专门考察中国情境下的人工智能辅助历史教育。被称为“心理前因”的一组因素有助于解释为何同一人工智能工具可能帮助一位历史学习者却使另一位感到困惑:动机影响学生坚持处理困难源材料的毅力,自我效能感决定其是否检验某种解读或接受第一个流畅答案,情绪和认知负荷与比较和情境化过程中的注意力相关,学习者对人工智能的信任影响其独立核实来源与主张的可能性。历史教育领域存在多种学习结果:即时回忆虽有帮助,但不能体现历史思维;来源鉴别、佐证、情境化、时序推理、视角采择和基于证据的论证均为更强有力的证据形式。人工智能可增强表层学习,但可能无法强化这些深层学习实践,因此结果测量应以过程测量作为补充,包括来源核查、解释质量、提示词开发、引文准确性、向陌生文本的迁移以及延迟保持。
2 概念背景
2.1 人工智能辅助学习作为社会技术过程
教育中人工智能的应用常以其功能来界定:诊断、推荐、辅导、生成、预测和反馈。然而,历史学习并非简单的信息处理任务,它取决于来源的质量、出处、情境和关联性。社会技术方法在生成式人工智能领域尤为相关:单一系统可充当导师、编辑、翻译、规划者或答案生成器,这种灵活性也可能导致走捷径、即时编造引文或制造虚假平衡。近期的学术研究已将采纳问题扩展至动机、能动性、质量控制、诚信和负责任使用等考量。
2.2 心理前因
动机与兴趣长期受到教育心理学家的关注,它们影响注意力、努力程度、策略使用和对反馈的接受度。自我决定理论(Self-Determination Theory, SDT)区分自主动机与受控动机:人工智能在提供有意义选择时可增强自主性,但当其开始为学习者规划和作出判断时则可能成为障碍。自我效能感是学习者对自身任务胜任能力的信心,高自信学习者可能尝试检验想法、比较解释并寻求反馈,而低自信学习者可能不加批判地接受系统输出;然而过度自信也可能减少验证行为,“校准的信心”是更有利的目标。情绪与认知负荷同样影响学习者与人工智能互动的质量:焦虑可能限制评估资源,愉悦可能维持探索,适度的挫折感可能意味着建设性挑战。态度、感知有用性、接受度和信任是解释学习者是否使用系统的重要因素,教育情境中平衡的信任水平比高度信任更为有益。参与度和自我调节是心理前因与学习结果之间的中介变量:人工智能可通过提醒、提示和反馈协助这些过程,也可能通过为学习者作决策而取代之。
2.3 学习结果
历史思维超越了成绩与表现,尽管事实回忆仍是历史学习的重要组成部分。学生应了解来源的作者与目的、来源产生的背景及其与其他证据的关系。时序、延续与变迁、因果、重要性和基于证据的论证是历史推理的其他方面。生成式人工智能在历史教育中的应用在同时评估产品与过程测量时尤其具有信息价值:人工智能生成的回答可能包含虚构引文、错误时序或以超出证据支持的确定性作出的主张。评估应同时考察最终产品和产生该产品的过程,包括学习者如何使用来源、选择和引用证据、开发提示词、随时间修订解读以及在无人工智能辅助下捍卫其结论。副作用同样显著,包括认知卸载、依赖、能动性缺失、隐私风险、偏见、访问不平等和学术不端,这些已被识别为“政策关切”。
2.4 历史教育作为领域特定案例
历史教育中的人工智能应用需要特别谨慎,因为历史主张是暂定的、基于证据的且开放于解读的。学生必须学会鉴别来源、佐证叙述、将证据情境化,并解释论证是如何建构的。历史教育证据图谱必须明确识别学科领域,并将历史特定结果与满意度、速度或表现等一般测量区分开来。原始数据库经专门历史领域术语审计后未包含可直接识别的历史教育研究,后续定向全文核查在数据库之外识别出稀疏的直接证据,包括一项中国大陆中学历史研究。因此,证据缺口属于覆盖有限且不均衡,而非完全缺失。
2.5 综述问题
本综述由四个问题引导:RQ1:原始数据库和定向全文验证集中可见哪些关于中国人工智能辅助历史教育的直接证据?RQ2:在已确认的区域证据中出现了哪些心理前因和学习结果,其中哪些可直接而非仅暂时性地与历史教育关联?RQ3:证据在研究类型、教育部门、人工智能模态和区域情境方面有何差异?RQ4:何种假设生成框架可指导中国人工智能辅助历史教育的直接实证研究?
3 方法
3.1 次级证据图谱设计与报告方法
本研究采用次级系统性证据图谱设计,应用于固定的公共文献计量导出数据。选择证据图谱是因为可用材料在研究设计和结果报告方面具有异质性,无法获得可比较的效应估计,且主要目标是描述证据覆盖与缺口而非估计合并干预效应。研究以PRISMA 2020和PRISMA-ScR作为报告参考,未进行多数据库新检索,不应被解读为对所有中国或国际文献的全面系统综述。
3.2 数据来源
主要数据来源是Mendeley Data上公开的“教育中人工智能文献计量数据集”(Bibliometric Dataset on AI in Education),版本1,DOI 10.17632/46xbj75f6n.1。可用导出数据截至2024年4月1日,包含1,063行和7个字段(作者姓名、隶属机构、作者-隶属机构字符串、摘要、作者关键词、索引关键词和EID)。所有1,063条记录均有摘要字段,隶属机构和关键词字段存在缺失。区域分类要求摘要、关键词或可用书目信息中存在明确的研究地点信号,作者隶属机构本身不被视为数据收集发生在相应区域的证据。
3.2.1 定向语料后全文验证
四份独立提供的全文报告被检视以检验原始历史领域结果的解读。验证集包括:一项已发表的2025年中国大陆中学历史课堂人工智能辅助教学研究;一项2026年历史学习中人工智能的系统综述;一份未注明日期的综合18项历史教育实证研究的手稿;以及一项2026年以中国为焦点的人工智能辅助文化遗产教育研究。这些报告仅用于验证、引文发现和解读,未纳入数据库频率分母。
3.3 资格标准
资格采用适用于证据图谱的人群-概念-情境(Population-Concept-Context, PCC)结构进行操作化。人群涵盖学习者、教师和教育参与者;概念涵盖教育性人工智能使用以及心理构念和学习结果;情境将中国大陆作为主要国家情境,香港和台湾作为独立区域层记录。证据类型和明确的历史领域相关性作为额外分类字段编码。
3.4 筛选程序
数据库筛选分三个阶段完成。首先,预定义文本规则识别具有人工智能教育信号、中国文本或隶属信号、心理构念和学习结果的记录,产生35条候选记录。其次,记录级审计检查构念资格、结果资格、证据类型和研究地点,排除5条记录。第三,历史领域审计在摘要和关键词中搜索直接历史教育术语,原始数据库内未识别出直接历史教育记录。敏感性审计将术语扩展至机器学习、大语言模型、生成式人工智能、ChatGPT、智能辅导、社会研究、人文学科、历史探究、历史素养、来源评估、佐证、情境化、时序等相关术语,扩展词典重现了相同的人工智能筛选计数,13条记录匹配至少一个更广泛的历史邻近术语,但人工检查未识别出直接的历史教育研究。
3.5 编码框架
心理构念编码为:动机或兴趣;情绪、焦虑或认知负荷;参与度;自我效能感、信心或能力;满意度或愉悦感;接受度、态度或意图;自我调节、能动性或自主性;信任或可信度。学习结果编码为:知识/理解;技能/能力;成就/表现;问题解决/批判性思维;效率/生产力;满意度;创造力;保持/坚持。人工智能模态代码包括:生成式人工智能或聊天机器人、自适应或智能辅导系统、学习分析或预测、教育机器人、自动化评估或反馈、一般人工智能。证据类型单独编码为:主要实证研究、综述/综合、会议论文集、概念或系统设计、不明确。
3.6 综合与信心评估
采用描述性计数和批判性比较叙事。由于缺乏效应量、方差估计、干预时长和类似结果测量,未尝试进行元分析。信心被视作多层概念而非正式确定性分级系统:广泛图谱包含关于数据库覆盖的陈述;九条记录区域子集包含谨慎的情境观察;五项主要区域实证研究包含关于所观察结果的有限陈述;定向全文验证包含数据库之外的历史教育直接情境。
3.7 全文状态、分类限制与质量评估边界
35条数据库候选记录通过摘要、关键词、隶属字段和EID在记录层面进行验证。证据类型和研究设计的分类可能被视为基于摘要信息的初步分类。完整的报告连同所有相关设计特定信息是进行可辩护的MMAT 2018评估的前提,原始候选集未提供研究级MMAT结果或整体研究级质量评分。MMAT就绪表仅指示全文评估所需信息,不能替代质量评估。
3.8 PRISMA与PRISMA-ScR报告状态
次级证据图谱过程使用PRISMA 2020和PRISMA-ScR报告。适用的条目在补充表S1中分类为完整、部分、不适用于次级数据库设计或未完成。报告记录了数据库识别、筛选规则、数据图表字段、描述性综合和分层信心解读方法。
4 结果
4.1 筛选结果
数据库包含1,063条记录。人工智能教育筛选保留1,026条,中国文本或隶属筛选保留210条,心理筛选保留73条,学习结果筛选产生35条候选。排除5条候选后,30条记录保留在广泛情境图谱中,占数据库的2.8%。历史领域审计未在原始数据库内识别出直接符合资格的历史教育研究。九条记录明确将中国大陆、香港或台湾指定为研究情境,20条记录地点未决,一条实证记录明确位于韩国。
4.2 证据概况
审计后,30条记录情境图谱包含17项主要实证研究、3项综述或综合、3项会议论文集、1项概念或系统设计论文和6条设计报告不明确的记录。九条已确认区域记录中,5项为主要实证研究,3项为会议论文集,1项分类为不明确/其他。五项实证研究包括两项台湾研究、两项香港研究和一项中国大陆研究。四项摘要报告了24、47、12和750名参与者的样本,一项案例研究未说明样本量。这五项数据库研究均未被识别为历史课堂调查。
4.3 历史教育证据与定向全文验证
原始数据库审计未发现包含直接历史教育信号的摘要或关键词,即使经过更广泛术语敏感性检查后亦然。定向全文验证改变了这一解读:验证集包括已发表的2025年中国大陆课堂研究,该研究基于课堂观察和来自八所中学的36名历史教师,报告了广州中学历史课堂中人工智能辅助教学的研究;两项综述来源表明存在更广泛的历史教育文献;文化遗产教育研究提供了相邻的中国焦点证据。这些来源表明直接历史教育研究存在于原始数据库之外,但中国特定实证证据仍然稀疏且方法上具有异质性。
4.4 心理前因
在九条已确认区域记录中,情绪、焦虑或认知负荷信号在五条记录中识别,参与度在四条中识别,动机或兴趣在三条中识别,自我效能感、信心或能力在三条中识别。接受度、态度或意图出现在两条记录中,自我调节、能动性或自主性出现在一条中。满意度和信任未被明确编码。由于分母较小,这些结果以原始计数而非百分比报告。
4.5 学习结果
在九条已确认区域记录中,技能或能力在六条记录中识别,知识或理解在五条中识别,成就或表现也在五条中识别,问题解决或批判性思维在四条中识别,效率或生产力在两条中识别。学习满意度、创造力和保持或坚持未被明确编码。就五项区域实证研究而言,与即时表现/效率、态度、参与度和教师结果相关的证据最强。
4.6 人工智能模态与发现方向
30条记录情境图谱中,10条记录具有生成式人工智能/聊天机器人代码,9条具有学习分析/预测代码,8条具有自适应/智能辅导代码,8条具有一般人工智能代码,4条具有教育机器人代码,1条具有自动化反馈/评估代码。九条已确认区域记录中,5条为自适应或辅导系统,3条为生成式,3条为教育机器人,2条为分析,1条为一般。结构化系统更可能用于具有明确反馈规则的有限任务,而生成式系统更可能用于控制较少的活动。
4.7 假设生成的历史教育路径
概念路径将证据组织为四个阶段:心理前因、学习者-人工智能互动、历史探究过程和历史学习结果。教学设计与治理被视为情境调节变量。该路径用于构建编码和未来研究问题,并非从数据库数据估计的因果模型。
5 讨论
5.1 主要发现
研究包含四个分析层:30条记录的情境化数据库图谱、九条具有明确中国大陆、香港或台湾研究情境的记录、其中五项主要实证研究,以及数据库之外直接历史教育证据的定向全文验证集。区域情境证据最常反映情绪或认知负荷、参与度和动机。直接相关的广州研究聚焦于从人工智能作为助手到协作式教师-人工智能互动的范式转变,以批判性讨论、历史数据处理和进一步探索为例证。
5.2 理论解读
所提出的框架整合了动机性、自我调节性、社会技术性和历史思维方法。动机质量可通过自我决定理论解释:人工智能可在策略选择、提问和比较选项方面增强自主性,在提供及时可理解的反馈方面增强胜任感,在增强而非取代课堂人际支持方面增强关联性,但也可能通过消除有意义选择、使理由不可见或减少生产性互动而阻碍这些需求。有效学习者进行规划、监控和反思,人工智能可促进这些活动,但也可能代劳,关键在于保留能动性。
5.3 来自直接和区域证据的基于证据的启示
实际结论需谨慎提出:人工智能最适合用于教师主导的探究,而非取代教师在学科学习中作出教学决策的专业知识。历史教学的首要优先事项是保持教师中介和学习者验证。研究应说明学生是否将人工智能输出与一手和二手来源进行了比较,识别了人工智能输出中缺乏来源支持的主张,描述了草稿之间的修改,并捍卫了其作出的解读。
5.4 对中国历史教育的假设生成启示
人工智能素养应在特定历史学科情境中教授,涉及来源出处、虚构引文、缺失情境、偏见、不确定性、作者身份、隐私和验证。应进一步测试差异化支持:低自我效能感学生可能需要结构化来源集和支架式验证,焦虑学生可能受益于低风险练习,过度依赖人工智能风险较高的学生可通过来源标注、反证识别和口头解释等任务保持主动推理。
5.5 治理、伦理与学术诚信
政策考量主要来自人工智能教育的一般文献:可按任务类型识别可接受的人工智能使用情境,在适当情况下要求披露,并设定关于来源出处、引文核查和独立推理的期望。隐私需要关注,机构可设定明确规则、经批准的替代方案、数据保留和模型训练风险信息。分层治理模型可能比一般性允许或禁止更合适:机构层面规则涵盖隐私和经批准工具,项目层面规则考虑学科期望,课程层面规则涵盖披露、验证和可接受的辅助方法。
5.6 研究议程
未来研究应优先解决已识别证据缺口直接产生的问题:中国大陆中学中ChatGPT或大语言模型辅助历史教学的受控比较、有无人工智能辅助下来源鉴别与佐证行为的研究、无指导人工智能使用与教师支架式验证的比较实验。研究应精确识别人工智能系统类型、历史主题、来源集、提示词和反馈结构、教师角色、比较条件和学生独立完成的工作类型。应进行纵向研究,在干预后跟进历史知识延迟测试、来源评估和向陌生文献的迁移。心理机制应在测量中分离,使用验证过的工具分别评估动机、自我效能感、参与度、焦虑、认知负荷、信任和能动性。历史学习结果也应区分,包括事实回忆、来源鉴别、佐证、情境化、视角采择、时序推理和基于证据的论证。来源覆盖应增强中国情境,未来检索应纳入CNKI、万方数据、维普、ERIC、Scopus和Web of Science以及等效中英文术语。
5.7 局限性
本证据图谱存在若干重要局限:首先,这是对单一公共数据库导出数据的次级分析,而非全面的多数据库系统综述;导出数据缺乏候选标题、发表年份、期刊名称、文献类型和DOI字段,且仅截至2024年4月1日。其次,区域分类是保守的。第三,原始候选集的全文报告不可用,研究设计、抽样、工具、分析、流失、干预保真度和MMAT标准无法一致验证。第四,数据库编码依赖摘要和关键词,未进行独立双编码,无法报告评分者间信度。第五,发表偏倚、选择偏倚、数据库偏倚、摘要报告偏倚和方法异质性仍然可能存在。
6 结论
次级证据图谱表明,原始数据库包含与情绪或认知负荷、参与度、动机、自我效能感、技能、知识、表现和问题解决相关的广泛区域信号,但未提供中国人工智能辅助历史教育的全面描述。定向全文验证在数据库之外识别出直接的历史课堂证据,表明中国特定证据是稀疏而非缺失。最有力的下一步是对结构化人工智能使用、教师中介、学习者能动性和基于来源的历史任务中的验证进行直接测试。结果应包括来源鉴别、佐证、情境化、时序推理、基于证据的论证和延迟迁移,区域情境分别报告。对中国历史教育而言,人工智能使用应是有纪律的、透明的和经实证评估的,而非假定有益的。学习者应被教导将人工智能输出视为需要对照历史证据进行验证的主张。