《Frontiers in Psychology》:Reimagining writing assessment for the AI era: a systematic review on balancing AI support and authentic skill growth
编辑推荐:
本系统性综述遵循PRISMA 2020指南,综合了19项关于高等教育中AI(Artificial Intelligence)融入学术写作评估的实证研究证据,系统回应了五个相互关联的研究问题:AI工具功能、利益相关者认知、学生动机、院校实施差距及评估重构策略。研
本系统性综述遵循PRISMA 2020指南,综合了19项关于高等教育中AI(Artificial Intelligence)融入学术写作评估的实证研究证据,系统回应了五个相互关联的研究问题:AI工具功能、利益相关者认知、学生动机、院校实施差距及评估重构策略。研究发现,生成式AI平台(尤其是ChatGPT,采用率88.8%)与语法检查工具(如Grammarly,采用率67.4%)贯穿写作全流程,学生依据认知复杂度分层部署工具。利益相关者态度显著分化:学生重视生产力提升与可及性,教师优先考虑学术诚信,管理者持审慎开放态度,但资源配置失衡——面向教师的指导占比67%,直接支持学生的仅占17.8%。学生不当使用的动机源于结构性脆弱,包括时间压力、伦理模糊与政策空白,而非恶意作弊。地理不平等持续存在,全球南方院校受基础设施限制,教育差距被放大。有前景的教学与评估创新包括过程导向评估、口头答辩、多模态写作与显性AI素养课程,旨在重构写作评价实践,平衡AI辅助与真实技能发展。综述指出,有效融合需超越检测导向,转向基于公平、真实学习及人类特有批判判断与伦理推理能力的综合性教学重构。
1 引言
学术写作中AI已形成多元工具生态,大型语言模型(LLM)如ChatGPT广泛用于构思、起草与反馈;传统工具如Grammarly、Quillbot侧重语法润色;机器翻译工具(如DeepL)支持多语言学术交流;AI增强型文献管理工具(如Scite AI)则辅助研究组织。认知负荷理论(Cognitive Load Theory, CLT)指出,拼写检查等机械任务属于外在认知负荷,AI卸载此类任务可释放工作记忆资源用于高阶推理,但这也可能导致真实技能发展风险。布鲁姆认知目标分类法(Bloom’s Taxonomy)进一步阐释此分层:生成式AI支持分析、评价与创造等高阶认知,自动化写作评估(Automated Writing Evaluation, AWE)工具则聚焦记忆、理解等低阶技能。然而,过度依赖AI可能侵蚀论证构建与原创主张能力。
地理与院校差异显著影响AI采纳。全球北方及东亚发达地区整合速度远超全球南方资源匮乏院校,研究分布亦集中于北美、欧洲与东亚。南非历史白人大学比资源受限的历史黑人大学整合程度更高,全球南方学生在课程AI整合度与准备度上显著落后。这种不平等源于数字基础设施不足、政策缺位、工具英语中心设计及社会文化障碍。
AI写作评估涉及多利益相关者:学生是主要使用者,其学习过程与作者身份感受受直接影响,多语学习者尤为依赖AI反馈;教师处于决策核心,需平衡教学效益与诚信风险;管理者负责治理框架、AI素养倡议与公平政策制定;开发者则通过系统设计隐含偏见影响评估实践。学生AI使用行为受动机、情境压力与伦理框架共同塑造,社会规范、教师态度及政策清晰度均构成影响因素。过度依赖AI与批判性思维、创造力下降相关。
利益相关者对AI的认知呈趋同认可与分歧并存:学生普遍肯定其对组织、语言质量及信心的提升,尤其利于多语者,但也担忧准确性、依赖性及声音真实性丧失;教师承认教学效用,但强调对评估效度、人机文本区分及学术诚信的威胁;管理者聚焦治理框架、政策发展、公平性维护与机构声誉。这些分歧凸显了需通过透明协作政策平衡创新与诚信的必要性。
AI辅助对认知复杂度的影响呈差异化:低阶技能(记忆、理解、应用)获益显著,高阶技能(批判性分析、评价、创造性综合)则面临认知卸载导致的侵蚀风险。生成式AI在布鲁姆分类的“创造”层级表现最弱,难以构建连贯论证,虽有教学设计可支持深层参与,但元认知发展需显性支架,而非自然生成。若将AI视为答案提供者而非思维伙伴,记忆保留与自主问题解决能力将受特定威胁。
维持评估效度需根本性重构,而非对传统评估的渐进调整。新兴框架强调过程导向评估,记录迭代修订、反思决策与AI整合策略,而非仅评估最终产品;结合口头答辩、体验式任务的真实认知需求任务有助于维护学术诚信并培养就业能力;将AI定位为反馈伙伴而非代笔,要求学生批判调适AI建议,可增强元认知投入与批判评价能力;结合自评、同伴互评、AI分析与教师判断的多源评估生态系统,可提供能力的三角验证证据。
2 材料与方法
本研究严格遵循PRISMA 2020指南。检索覆盖Web of Science、Scopus、ERIC、PsycINFO及Google Scholar,时限为2020年1月至2025年12月,聚焦生成式AI兴起后的当代图景。检索词分为三组:AI技术术语(如生成式AI、LLM)、教育语境术语(如高等教育、学术写作)及评估与教学术语(如评估设计、学术诚信)。采用布尔运算符与截词符,并辅以引文追踪与参考文献回溯。
纳入标准包括:高等教育中AI融入写作的实证研究;聚焦评估实践、教学法、学术诚信或院校政策;包含学生、教师或管理者视角;英文同行评审文献(期刊、会议、系统综述);2020–2025年发表。排除标准包括:纯K-12研究;非写作类AI应用;纯理论或无实证框架;学位论文、预印本或非同行评审源;未涉及评估或学习产出;非英文文献;2020年前无生成式AI背景的自动评分研究。
研究筛选分三阶段:初检获1756条记录,去重后剩1389篇进行标题摘要筛查,排除1251篇,剩余138篇全文评估。最终纳入19项研究,科恩卡帕系数(Cohen’s κ)为0.87,显示审稿人间高度一致。数据提取采用标准化模板,涵盖文献信息、设计方法、参与者特征、AI工具功能及五大研究问题的发现。鉴于异质性,采用叙述性合成,按研究问题主题组织,并结合地理、院校、学科等背景进行比较分析。方法学质量评估使用适配工具(定量研究用Newcastle-Ottawa量表,定性研究用CASP清单,混合方法用MMAT标准),结果用于解释证据强度而非排除研究。
3 结果
3.1 AI工具及其学术写作功能
ChatGPT(使用率88.8%)与Grammarly(67.4%)为主导工具,分为四类:生成式AI模型(LLM)支持构思与起草等高阶任务;AWE系统专注语法与机械修正;翻译工具辅助跨语言写作;多模态平台(如Canva)支持视觉设计与词汇学习。学生策略性部署:LLM主导规划与起草,AWE集中于修订编辑。LLM对应布鲁姆分类的分析、创造与评价,AWE则对应记忆与理解。
3.2 利益相关者对AI整合的认知
学生总体积极,视AI为效率工具,但英语作为外语(EFL)与二语(L2)学生视其为声音增强器,母语者则担忧真实性丧失;本科生重效率,研究生关注伦理模糊与声音侵蚀。教师持“诚信中心”视角,担忧“AI剽窃”与批判性思维弱化。管理者采取“开放但谨慎”立场,但资源分配失衡:67%指导面向教师,仅17.8%直接支持学生。跨群体共识是AI应作为“近同行”而非替代人力,支持过程导向评估。
3.3 学生AI参与的动机
适当使用动机包括效率提升、认知减负与个性化支架,尤其L2学生借此克服语言障碍。不当使用源于学业压力、时间紧迫与政策空白,技术便利性(速度、可及性、低检测风险)助长“AI剽窃”捷径。评估偏重最终产品易诱发“元认知懒惰”,学生常因边界不清(非恶意)而进行隐蔽改写。
3.4 院校实施差距
资源分配不均、培训缺失与政策空白显著。地理不平等突出:全球南方受政治与经济限制,基础设施薄弱;即使在发达地区,弱势学生仍缺乏稳定网络或付费功能访问能力。最大缺口是学生直面资源匮乏,被迫自行导航伦理决策。教师亦感准备不足,尤其对现代改写工具不熟悉。学科差异加剧挑战:技术学科警惕编程漏洞,人文学科挣扎于AI复制传统文体。院校反应多被动,将AI视为需管控的诚信问题,而非需重构的课程机遇。
3.5 评估重构与政策创新
政策从禁令转向灵活框架。巴勒斯坦的“反对、避免、采纳、探索”(AAAE)模型按任务类型分级管控;美国院校多采用“开放但谨慎”的教师裁量模式。评估创新聚焦AI难复制的高阶认知:实时口头答辩确保真实理解;过程评估关注草稿迭代与提示工程日志;多模态写作(图文音结合)抵抗AI合成能力;项目式学习(PBL)解决真实问题以促进批判思维;显性提示工程教学将AI素养列为合法技能。
3.6 发表与方法学偏差评估
存在“正效用”报告偏差,成功案例被过度呈现,无效或负面发现稀缺。大量证据依赖便利抽样与自我报告数据,可能引入社会期望偏差。地理多样性(全球南北)增强了外部效度,但缺乏纵向数据限制了对批判性思维长期影响的判断。
4 讨论
AI工具的分层部署揭示了发展悖论:学生虽策略性优化认知负荷,却可能规避构建真实写作专长的“生产性挣扎”。这种分工反映了不同利益相关者对智力劳动合法性的根本分歧,现有政策尚未调和。学生(尤指弱势群体)视AI为均衡工具,教师则担忧评估效度与智力真实性。院校不对称响应(重教师轻学生)加剧了伦理导航困境。不当使用多源于结构性脆弱,惩罚性检测仅治标不治本。地理分析警示AI可能放大而非弥合全球教育不平等,基础设施、制度能力与资源差异导致“数字鸿沟”再生产。局限包括样本量小、自我报告偏差、缺乏纵向设计及时效性约束(AI快速迭代)。
5 结论
本综述基于19项实证研究得出五点互相关联的发现:学生依认知复杂度分层部署AI工具,体现策略性认知管理;利益相关者认知根本分化且资源分配失衡;不当使用由结构性脆弱驱动,非恶意作弊;地理与社会经济不平等因AI加剧;过程评估、口头答辩、多模态写作与AI素养课程可有效平衡AI支持与真实技能发展。当前实施存在资源不对称、地理差距与政策激励错位等问题,但评估创新已指明路径。核心挑战本质是教学与伦理的:院校必须从被动管控转向主动课程重构,将批判判断、伦理推理与真实作者身份确立为学术写作教育的不可削减核心,超越威胁/万灵药二元叙事,在公平与真实学习基础上,发展人类特有的高阶认知能力。