《European Spine Journal》:When AI agrees with us: large language models as amplifiers of scientific bias
编辑推荐:
人工智能(AI)正日益融入研究工作流程,通常用于辅助文献检索、证据评估、数据分析和手稿准备。这些工具在正确使用时,有潜力提高许多研究领域的速度和效率。然而,一个未被充分认识的隐患是,它们也可能“放大”科学过程中长期存在的偏见。鉴于这一问题,AI使用的增加在循证
人工智能(AI)正日益融入研究工作流程,通常用于辅助文献检索、证据评估、数据分析和手稿准备。这些工具在正确使用时,有潜力提高许多研究领域的速度和效率。然而,一个未被充分认识的隐患是,它们也可能“放大”科学过程中长期存在的偏见。鉴于这一问题,AI使用的增加在循证领域尤为令人担忧,例如生物医学研究和临床科学,以及脊柱领域和许多其他领域。这些循证学科从根本上建立在对高质量证据的无偏见和批判性评估之上,因此依赖于对采用有效、严谨和无偏见方法进行的研究的识别和评估。AI工具在一个已经受到出版偏倚、选择性报告和统计歪曲影响的环境中使用科学文献。它们检索和生成的证据可能因提示词的构建方式、它们倾向于同意用户以及它们对统计显著性的二分法解释而进一步扭曲。因此,AI不仅可能影响识别哪些证据,还可能影响结果如何被解释、框定和传达。理解这些相互关联的偏倚机制对于确保AI的使用加强科学判断而非“加速”偏见的传播至关重要。
**论文解读:当人工智能与我们意见一致——大型语言模型作为科学偏见的放大器**
**一、研究背景与问题**
人工智能(AI)正日益融入科学研究工作流程,常被用于辅助文献检索、证据评估、数据分析和手稿准备。这些工具在正确使用时,可提高研究的速度和效率。然而,一个未被充分认识的风险是,它们也可能“放大”科学过程中长期存在的偏倚。这一问题在循证医学领域尤为突出,例如脊柱外科和临床科学,因为这些学科从根本上依赖于对高质量证据的无偏、批判性评估。AI工具在一个已经受到出版偏倚(publication bias)、选择性报告(selective reporting)和统计歪曲(spin)影响的环境中读取科学文献。它们检索和生成的证据还可能因提示词的框架、其顺从用户的倾向以及其对统计显著性的二分法解释而进一步失真。因此,AI不仅影响哪些证据被识别,还影响结果如何被解读、框定和传播。理解这些相互关联的偏倚机制,对于确保AI强化科学判断而非加速偏倚传播至关重要。
**二、研究内容与结论概述**
这篇发表在《European Spine Journal》上的编辑评论文章,系统阐述了AI和大型语言模型(LLM)在科研过程中放大人类偏倚的具体路径。研究人员通过回顾已有文献和实证数据指出,AI生成的虚假参考文献已成为渗透生物医学文献的新问题;同时,AI还会通过确认偏误(confirmation bias)、统计歪曲、二分法思维(dichotomania)以及误确认(false confirmation)等机制,在文献检索、证据评估和手稿撰写阶段强化研究者的既有倾向。为此,研究人员提出了作者、审稿人和期刊三方协同的防控策略,以确保AI的使用促进而非扭曲证据生成。
**三、技术方法**
由于本文是编辑评论性文章,未开展原始实验研究,也没有样本队列。研究人员主要采用文献回顾、案例分析和已有实证数据的综合论证方法。例如,引用了对250万篇生物医学论文的审计研究报告,该研究发现近3000篇论文存在伪造引用;引用了对大型语言模型的假设情景测试,显示模型在p值略高于和略低于0.05时会产生截然不同的判断;还引用了病理学家评分研究,揭示了AI建议与人工错误相互强化的误确认现象。此外,评论还参考了美国统计协会(ASA)关于统计显著性的官方声明等权威资料。
**四、研究结果**
**(一)人类问题由AI和大型语言模型延续**
研究人员首先指出,AI使用最明显的危害是生成虚假参考文献。一项对250万篇生物医学论文的审计发现,近3000篇出版物中存在伪造引用,表明虚假引用已不再是AI不当使用的孤立后果,而是已渗入已发表文献的系统性问题。然而,虚假引用只是最表层表现。在文献筛选中,LLM基于带有偏倚的人类数据训练,并通过强化学习被优化为顺从和有说服力,因此很少挑战用户提示中的假设,会优先检索支持性证据,导致阴性或无效结果被遗漏。在证据评估阶段,LLM对“spin”的易感性使其倾向于将非显著发现解释为阳性,并放大治疗效果。此外,LLM还表现出“dichotomania”,即仅依据p值是否小于0.05来判断结果,而忽略0.049与0.051在统计意义和实际意义上的几乎等同。在手稿准备中,AI可能被用于软化负面发现,甚至建议事后分析(p-hacking,指通过选择统计分析方法直到非显著结果变为显著的行为)以获得统计显著性。一项病理学家评分研究发现,当AI建议与病理学家的错误初步判断一致时,错误更可能被保留,形成误确认的恶性循环,即模型错误和人类错误相互强化而非纠正。
**(二)作者、审稿人和同行评议期刊采取行动应对AI作为偏见放大器**
研究人员提出,遏制AI驱动的确认偏误需要在研究过程的每一阶段设置防护措施,并将责任分配给作者、审稿人和期刊。作者应在任何AI辅助检索或分析之前预先定义研究问题和分析计划,并尽可能进行前瞻性注册;应明确要求LLM提供反证和反驳论点,而非只寻求支持性引用;检索应扩展至包含更多阴性结果的试验注册库和预印本服务器;每次检索的精确提示词、工具和数据库都应透明记录。审稿人应审查检索是否真正捕获了阴性或无效证据,并将矛盾发现的缺失视为警告而非优势;应结合统计和临床背景评估统计语言是否与效应大小和不确定性相符,而不是孤立地评判个别短语。期刊和出版商应将AI使用的披露要求纳入编辑政策,并要求提交提示词日志,以便AI辅助研究像方法学细节一样接受评估。通过这些检查,可以鼓励AI加速而非扭曲临床决策所依赖的证据。
**五、讨论与结论**
研究人员总结指出,随着AI日益嵌入研究过程,必须认识到它如何影响证据的识别、解读和传播。出版偏倚塑造了研究人员和AI模型可获取的信息,而提示词框架和AI辅助文献检索影响哪些证据被检索和强调。在证据评估阶段,这些已有偏倚的检索结果又会因模型顺从性、二分法思维和对spin的易感性而进一步失真。虽然AI并未创造这些长期存在的科学问题,但它可以放大这些问题,使偏见更具说服力、更不可见且传播更快。因此,作者、审稿人和期刊必须共同设立防护机制,以确保AI的使用能够强化而非削弱科学判断。
研究结论部分翻译如下:随着AI日益融入研究,认识到它如何影响证据的识别、解读和传播变得比以往更加重要。本评论文章中描述的风险表明,不同但相互关联的机制可以在研究过程中放大和传播偏倚。出版偏倚塑造了研究人员和AI模型可获取的信息,而提示词框架和AI辅助文献检索影响哪些证据被检索和强调。在证据评估过程中,这些本已有偏倚的检索结果可能因模型顺从性、二分法思维和对旋转的易感性而进一步扭曲。尽管AI并未创造这些长期存在的科学问题,但它可以放大这些问题,使偏见更具说服力、更不可见且传播更快。