《Frontiers in Psychology》:Perceived quality of AI-generated and human-written news: a cross-national experimental study among journalism students in China and Vietnam
编辑推荐:
生成式人工智能(Generative Artificial Intelligence, GenAI)正在重塑新闻生产格局,然而新闻学学生如何评价AI生成内容,以及文化—心理因素是否系统性地塑造这些评价,目前在非西方语境中仍缺乏充分理解。本研究采用2(国家:中国
生成式人工智能(Generative Artificial Intelligence, GenAI)正在重塑新闻生产格局,然而新闻学学生如何评价AI生成内容,以及文化—心理因素是否系统性地塑造这些评价,目前在非西方语境中仍缺乏充分理解。本研究采用2(国家:中国/越南)×2(作者类型:AI/人工)×4(主题:自然/健康/社会/财经)的混合设计方差分析(mixed-design ANOVA),在盲测条件下对140名新闻与传播学学生展开调查。参与者在不知晓文章由AI生成还是人工撰写的情况下,从七个维度评价新闻质量。结果显示,AI生成新闻在总体评分上显著高于人工撰写新闻,但该优势并非均匀分布:显著的“国家×作者身份”交互效应表明,中国参与者对AI生成新闻的偏好显著大于越南参与者,而越南参与者对两类内容的评价无显著差异;显著的“作者身份×主题”交互效应表明,AI优势在自然与社会类新闻中比在健康与财经类新闻中更为突出;三重交互效应不显著。AI生成新闻在结构维度(感知标题相关性、报道充分性、可读性、标点与句式结构)上显著优于人工撰写新闻,但在感知事实准确性与来源使用方面无显著优势。性别对两类新闻的评价均有预测作用,但不存在显著的作者身份特异性不对称;而新闻兴趣与新闻信任对人工撰写新闻的预测强度显著高于对AI生成新闻的预测强度,该模式通过直接交互效应检验得到证实。上述模式可结合文化取向中的制度权威与技术支持态度(包括权威启发式与技术支持乐观主义)加以讨论,但这些构念系依据国家层面的文化指数推断而来,并未在个体参与者层面直接测量。一项事后文本分析发现,AI生成文章在词汇多样性上并不低于人工撰写文章,这使得基于同质化解释AI生成新闻评价跨国家趋同的假说变得更为复杂。这些发现通过展示以国家作为文化嵌入心理构念代理变量在AI生成内容研究中的潜力与局限,拓展了跨文化心理学的研究视野。
# 中越新闻学学生对AI生成新闻与人工撰写新闻的质量评价:一项跨文化实验研究的系统解读
## 一、研究背景与问题提出
生成式人工智能(Generative AI, GenAI)的迅猛发展正在深刻改变新闻内容的生产、分发与评价方式。一项覆盖六大洲新闻从业者的调查显示,73.8%受访者所在的新闻机构已将生成式AI应用于新闻生产,其中文本创建是最主要的使用场景。随着AI生成内容在新闻编辑室中的日益普及,受众如何感知、评价并信任AI生成新闻,已成为兼具理论意义与实践意义的重要议题。
从文化心理学视角来看,受众对AI生成新闻的评价并非纯粹的技术性判断,而是深度嵌入文化塑造的认知取向之中。已有研究对AI生成新闻的受众感知进行了多角度考察,聚焦于可信度、信任与感知质量等维度。部分研究发现算法厌恶(algorithm aversion)会导致受众对AI生成新闻持负面态度;另有研究表明读者在阅读时往往难以区分AI与人工撰写新闻,甚至可能给予AI生成新闻更高的可信度评价。与本研究最直接相关的是Baptista等人(2025)的研究,该研究发现葡萄牙和西班牙的新闻学学生对ChatGPT生成新闻的整体质量评价高于记者撰写的文章。
然而,已有研究存在明显缺口:针对非西方文化背景下受众如何评价AI生成新闻的系统性研究仍然稀缺。中国和越南为检验这些文化动态提供了理论上富有成效的比较语境:两国共享儒家文化遗产、集体主义社会取向和政党主导的媒体体制,但在Hofstede文化维度上存在显著差异——中国的权力距离(80 vs. 70)和长期导向(87 vs. 57)均高于越南,且在男性化倾向上更高(66 vs. 40)。此外,中国在国家主导的AI战略下积极推动AI应用,而越南的AI融入媒体生态的速度较慢且意识形态驱动较弱。这种既文化相近又内部有别的特质,使中越两国成为检验非西方语境下文化—心理机制的理想配对。本研究聚焦新闻与传播学学生,因为他们大多将成为未来的新闻从业者,其对于生成式AI的感知将深刻影响未来新闻编辑室的实践与专业规范。
## 二、研究设计与技术方法
本研究采用2(国家:中国/越南,被试间)× 2(作者类型:AI/人工,被试内)× 4(新闻类型:自然/健康/社会/财经,被试内)的混合实验设计。通过G*Power进行先验功效分析,在α = 0.05、功效1 ? β = 0.95、中等效应量f = 0.25条件下,最低所需样本量为54人。实际招募中国广西大学学生78人、越南河内人文社会科学大学学生67人,经数据筛查后最终有效样本为140人(中国74人,越南66人),远超最低要求。
实验材料分三步开发:首先选取北京新闻(Beijing News)和越南VnExpress两家主流媒体的真实新闻文章;其次提取每篇文章的核心信息,以五W框架(Who, What, When, Where, Why)构建提示词(prompt),输入DeepSeek生成对应的AI新闻文本;最后编制中越双语问卷。选择DeepSeek的原因在于:其一,它是由中国AI公司开发的大语言模型,在多项基准测试中表现与领先国际模型相当;其二,DeepSeek反映了本研究中学生参与者实际的AI工具环境——中国大学生面临监管和可及性限制,多依赖国产替代工具,而越南学生中DeepSeek也具有特定用户基础,据2025年全国调查,越南学生群体的AI采用率高达92%。
为确保实验材料客观可比,研究人员对全部16篇文章(2国×4主题×2作者条件)进行了自然语言处理分析,使用jieba(版本0.42.1)对中文文本分词,使用underthesea(版本9.5.0)对越南语文本分词,计算新闻标题长度、正文长度、句子数量、平均句长、词汇多样性(含类符—形符比TTR和文本词汇多样性测量MTLD)、显式来源标记频率等指标。结果发现,AI生成文章并非人工文章的逐字复制(Jaccard重叠系数为0.25–0.43),且在两个国家中AI生成文章的词汇多样性(MTLD)反而高于人工撰写文章。实验过程分三阶段:先测量新闻消费习惯,再以统一格式盲测阅读并评价新闻质量,最后收集人口统计学信息。新闻质量采用改编自Baptista等人(2025)的七项量表,涵盖可读性、事实准确性、标题相关性、报道充分性、来源使用、语言表达、标点与句式结构,采用7点李克特量表计分,总体质量分数为七项均值(语言表达项反向计分)。
## 三、主要研究结果
### 3.1 混合设计方差分析结果
2(国家)× 2(作者身份)× 4(主题)混合设计方差分析显示,三重交互不显著,F(2.66, 367.29) = 1.87, p = 0.141,表明主题特定的作者身份差异模式在两国间无本质区别。作者身份×主题交互显著,F(2.66, 367.29) = 11.83, p < 0.001,partial η2 = 0.079。AI生成新闻在自然(ΔM = 0.49)和社会(ΔM = 0.30)类别中获得更高评分,在财经类别优势较小(ΔM = 0.09),在健康类别无优势(ΔM = ?0.05)。国家×作者身份交互同样显著,F(1, 138) = 7.18, p = 0.008, partial η2 = 0.049:中国参与者的AI偏好度(ΔM = 0.33, 95% CI [0.23, 0.44])显著大于越南参与者(ΔM = 0.08, 95% CI [?0.08, 0.24],不显著)。主效应方面,AI生成新闻总体评分(M = 5.26)显著高于人工撰写新闻(M = 5.05),F(1, 138) = 19.88, p < 0.001;越南参与者总体评分(M = 5.29)高于中国参与者(M = 5.02),F(1, 138) = 6.41, p = 0.013;主题主效应也显著,F(2.68, 369.96) = 4.60, p = 0.005。
### 3.2 各质量指标的差异比较
配对t检验显示,AI生成新闻在感知可读性(t = 2.05, p = 0.042, dz = 0.17)、感知标题相关性(t = 7.51, p < 0.001, dz = 0.64)、感知报道充分性(t = 4.40, p < 0.001, dz = 0.37)和感知标点与句式结构(t = 3.71, p < 0.001, dz = 0.31)上显著高于人工撰写新闻,其中标题相关性的效应量最大。然而,在感知事实准确性(p = 0.126)、感知来源使用(p = 0.569)和感知语言简洁性(p = 0.121)上,两类新闻无显著差异。这表明AI的优势主要体现在文本结构维度,而非内容层面。
### 3.3 个体层面因素的影响
将性别、年龄、年级、新闻接触频率、新闻兴趣和新闻信任同时纳入三个线性回归模型(分别预测人工撰写新闻质量、AI生成新闻质量和AI减人工差值分数)发现:性别显著预测两类新闻质量(人工:B = ?0.29, p = 0.011;AI:B = ?0.45, p < 0.001),男性总体评分更低,但差值模型不显著(B = ?0.16, p = 0.128),表明性别效应不具有作者身份特异性。新闻兴趣显著预测两类新闻质量,但对人工撰写新闻的系数(B = 0.36)显著大于对AI生成新闻的系数(B = 0.23),差值模型确认了这一不对称性(B = ?0.14, p = 0.021)。新闻信任显著预测人工撰写新闻质量(B = 0.17, p = 0.002),但对AI生成新闻无显著预测作用(B = 0.06, p = 0.352),差值模型确认该交互显著(B = ?0.12, p = 0.021)。由于所有评价均在盲测条件下完成,这一不对称模式不能归因于读者对内容来源的知晓。
## 四、讨论总结与研究结论
本研究的发现具有多层面理论意义。第一,AI生成新闻总体获得更高评价,与基于伊比利亚半岛样本的已有研究结果一致,但国家×作者身份交互表明这种偏好并非普遍现象——中国学生的AI偏好远大于越南学生,这可能与中国国家主导的AI战略所营造的技术乐观主义氛围、较高的长期导向(LTO = 87)以及相互依存的自我建构(interdependent self-construal)有关,但需注意这些构念均未在个体层面直接测量。第二,AI优势的领域特异性可通过文本与文化双重机制解释:自然和社会类新闻的线性事件驱动叙事契合大语言模型的结构化输出模式,而健康和财经类新闻本身具备客观、正式、信息密集的文体特征,与AI默认输出风格趋同,加之东亚高权力距离文化中权威启发式(authority heuristic)的作用——AI生成文章缺乏显式来源标记,难以激活权威信任——抵消了其结构优势。第三,AI生成新闻在结构维度上的优势与内容维度上的无差异形成鲜明对比,这与葡萄牙和西班牙样本中AI在几乎所有维度均获高评价的发现不同,可能反映了高低权力距离文化中来源权威权重差异。第四,中越学生对人工撰写新闻的评价存在显著国别差异,而对AI生成新闻的评价相对趋同,但文本分析显示AI文章并未在词汇多样性上更低,因此同质化解释在此不成立,趋同机制仍有待进一步探究。第五,新闻兴趣和新闻信任对人工撰写新闻的预测力强于对AI生成新闻的预测力,这可能与相互依存文化中基于情境与关系的评价取向有关,但同样需要直接测量验证。
研究结论:在盲测条件下,新闻学学生对AI生成新闻的总体质量评价高于人工撰写新闻,尤其是在标题相关性、报道充分性、可读性和标点句式等结构维度上;在事实准确性和来源使用方面两类新闻持平。AI优势并非均匀分布——在自然和社会类新闻中更强,在健康与财经类中消失;中国学生的AI偏好显著大于越南学生。中越学生对人工撰写新闻的评价差异显著,而对AI生成新闻的评价较为一致。新闻兴趣和新闻信任对人工撰写新闻评价的预测力显著更强,而性别的影响无作者身份特异性。这些发现为理解生成式AI时代文化心理过程如何调节受众反应提供了来自非西方语境的经验证据,同时提醒研究者警惕以国家作为文化心理构念代理变量的局限性。未来研究应采用多组独立刺激材料、直接测量个体层面的文化心理构念、扩展样本代表性与AI模型类型,并独立验证事实准确性,以进一步厘清AI生成新闻评价背后的文化与文本机制。