《SCIENCE》:The levers of political persuasion with conversational artificial intelligence
编辑推荐:
有广泛担忧认为对话式人工智能(AI)可能很快会对人类信念产生实质性的说服影响。在这项工作中,通过三项大规模实验(参与者总数 N = 76,977人),研究人员部署了19个大语言模型(LLM)——包括一些明确针对说服进行后训练的模型——以评估其在707个政治议题
有广泛担忧认为对话式人工智能(AI)可能很快会对人类信念产生实质性的说服影响。在这项工作中,通过三项大规模实验(参与者总数 N = 76,977人),研究人员部署了19个大语言模型(LLM)——包括一些明确针对说服进行后训练的模型——以评估其在707个政治议题上的说服力。随后,研究人员核查了产生的466,769条LLM主张的事实准确性。研究表明,当前及近未来AI的说服力可能更多地源于后训练(post-training)和提示方法(prompting methods)——它们分别将说服力提高了多达51%和27%——而非个性化(personalization)或增加模型规模(model scale),后两者的效果较小。研究人员进一步表明,这些方法通过利用LLM在对话中快速访问和战略性地部署信息的能力来提高说服力,并且值得注意的是,在提高AI说服力的地方,它们也系统性地降低了事实准确性。
《SCIENCE》论文解读:对话式人工智能的政治说服杠杆
研究背景与意义
随着人工智能技术的飞速发展,大语言模型(LLM)展现出了前所未有的交互对话能力,引发了学术界与公众对AI操纵人类信念、影响公共舆论及政治话语的广泛担忧。尽管相关猜测甚嚣尘上,但驱动AI说服力提升的实际机制——“杠杆”——仍不明确。研究人员指出,未来的说服优势未必只属于掌握最大模型的强大参与者,因为特定的训练选择(如高度定制的数据集、针对性指令或用户个性化)同样可能是关键。此外,AI若利用误导性信息或个体数据进行说服,将对公共话语、信任和隐私造成恶性后果。因此,明确模型规模、后训练(post-training)、个性化(personalization)及修辞策略(rhetorical strategy)等因素如何具体影响AI说服力及其真实性,已成为亟待解决的科学问题。这项研究发表在顶级期刊《SCIENCE》,为理解AI说服机制、制定防范算法操纵与错误信息的政策提供了关键的实证基础。
技术方法
本研究通过开展三项大规模调查实验,招募了总计76,977名英国成年人参与者。研究人员让参与者与19个不同规模的开放和闭源大语言模型(LLM)进行双向对话(最少2轮,最多10轮),对话围绕707个政治议题展开。在对话前后,参与者需在0至100的量表上报告其对特定政治观点的认同度,以此测量说服效果(即处理组与控制组事后意见均值的差异)。在技术实现上,研究人员测试了八种不同的提示策略(prompting strategies),并对开源模型进行了针对性的说服后训练(PPT),包括监督微调(SFT)和奖励建模(RM)。同时,研究人员结合GPT-4o与专业人工事实核查员,对超过91,000次对话中产生的466,769条可核查事实主张的信息密度(information density)和准确性进行了量化验证。
研究结果
模型规模带来的说服收益
研究结果显示,在控制后训练(post-training)不变的情况下,更大的模型往往更具说服力。然而,前沿开发者后训练带来的最大说服增益(例如不同版本GPT-4o之间+3.50百分点),超过了将模型规模在当前前沿基础上增加10倍甚至100倍的预估收益(+1.59和+3.19百分点)。这表明,前沿AI说服力的进步更多源于新型后训练技术,而非单纯扩大模型规模。
模型后训练带来的说服收益
针对说服的后训练(PPT)能显著提升开源大语言模型(LLM)的说服力。其中,奖励建模(RM)提供了显著的说服收益(合并主效应+2.32百分点),而监督微调(SFT)未带来显著增益。值得注意的是,对较小的开源模型(如Llama3.1-8B)应用RM,可使其说服力提升至与前沿模型相当的水平,这意味着计算资源有限的参与者也可能训练出高效的说服系统。
模型如何实现说服
在个人数据支持下,个性化(personalization)对说服的影响虽然统计显著,但幅度较小(+0.43百分点),远低于规模和后训练带来的增益。相比之下,提示策略(prompting strategy)的效果更为显著。在八种理论中提到的策略中,鼓励大语言模型(LLM)提供新信息(基于信息的论证)的策略最为成功,比基本提示高出+2.29百分点。这种高说服力主要源于信息密度(information density):基于信息的提示导致每场对话平均产生超过25条可核查主张,且每增加一条新信息,说服力便增加约+0.30百分点。
模型提供的信息准确度如何
尽管大语言模型(LLM)部署的信息量与其说服力呈正相关,但这带来了令人不安的准确性权衡。整体而言,AI提供的信息平均准确率为77/100,但在最先进的模型中观察到了准确性的下降。例如,GPT-4.5的不准确主张比例超过30%,与较小的模型相当。基于信息的提示虽最具说服力,却显著降低了主张的准确性(如GPT-4o在信息提示下准确率降至62%)。此外,应用奖励建模(RM)后训练在提高说服力的同时,也增加了不准确主张的比例(-2.22百分点)。
拉满所有说服杠杆的影响
当综合考量所有特征以实现最大化说服时,估计的平均说服效应达到15.9百分点,在最初持反对意见的参与者中更是高达26.1百分点。在这种“最大化说服”条件下,AI每场对话产生22.5条主张,其中30.0%被评定为不准确。这揭示了现实世界中追求极致AI说服可能面临的巨大风险。
讨论与结论总结
研究人员在讨论中指出,尽管模型规模与说服力呈正相关,但后训练(post-training)和提示方法(prompting methods)是更强大的杠杆。研究揭示了一个核心机制:信息密度(information density)是驱动当前AI对话说服力的关键变量。这一发现不仅挑战了传统政治动机推理理论中对事实证据的怀疑,强调了基于信息的论证在改变政治态度中的核心作用,也平息了关于个性化(personalization)说服过度夸大的争论,证实其实际效果相对有限。
然而,研究最重要的警示在于说服力与真实性的权衡。优化说服力的过程往往伴随着事实准确性的系统性下降,这种动态可能对公共话语和信息生态系统产生恶性后果。此外,互动对话的即时说服影响显著高于静态信息,预示着说服领域的潜在变革。尽管存在计算需求、人类心理极限以及现实世界持续参与度的限制,该研究清晰地指明了AI说服的真实杠杆所在,强调确保这一力量负责任使用的紧迫性。