《Nature Communications》:Disentangling interaction and bias effects in opinion dynamics of large language models
编辑推荐:
大语言模型(Large Language Models, LLMs)越来越多地被用于模拟人类观点动态,然而真实交互效应常常被系统性偏差所掩盖。研究人员开发了一个贝叶斯框架(Bayesian framework),用以解耦并量化三类此类偏差:(i)话题偏差(to
大语言模型(Large Language Models, LLMs)越来越多地被用于模拟人类观点动态,然而真实交互效应常常被系统性偏差所掩盖。研究人员开发了一个贝叶斯框架(Bayesian framework),用以解耦并量化三类此类偏差:(i)话题偏差(topic bias),即模型偏向自身默认立场的趋势;(ii)同意偏差(agreement bias),即无论所问内容如何都倾向于同意所给陈述的趋势;(iii)锚定偏差(anchoring bias),即偏向发起讨论的智能体立场的趋势。研究人员将该框架应用于多个LLM,这些模型在从气候变化、社会正义到音乐偏好的12个不同问题上进行了多步对话。研究发现,观点轨迹往往迅速收敛到一个共享吸引子,交互与偏差的影响均随时间衰减,且偏差的影响在不同LLM之间存在差异。此外,研究还表明,在一个LLM上对不同强烈观点陈述(包括错误信息)集合进行微调,会相应地移动观点吸引子。通过揭示LLM之间的显著差异,并提供用于比较LLM智能体讨论中交互与偏差对观点转变贡献的定量工具,该研究凸显了将LLM用作人类行为代理的前景与陷阱。
大语言模型(Large Language Model, LLM)已被广泛用于模拟人类观点动力学,特别是在基于智能体的社会过程仿真中。然而,当LLM智能体进行多轮讨论时,观察到的观点转变既可能来自智能体之间的真实交互,也可能来自模型内在的系统性偏差,二者往往难以区分。传统基于主体的观点动力学模型虽然可解释性强,但无法捕捉真实人类交流的丰富语境;LLM则能直接使用自然语言,却因偏差隐含于训练权重中而可解释性不足。已有研究分别观察到话题偏差、同意偏差和锚定偏差,但缺乏统一框架来定量分离这些因素。为此,研究人员提出了一个分层贝叶斯模型(hierarchical Bayesian model),用于解耦双LLM智能体讨论中的交互效应与三类偏差,并系统比较多个LLM。该研究成果发表在《Nature Communications》。
在方法层面,研究人员设计了最简单的双智能体多轮讨论场景:两个LLM智能体先分别通过外部生成的思维链(Chain-of-Thought, CoT)单独初始化到五级意见量表(-2到+2)上的一个观点,再就12个话题(分属四个类别,涵盖从科学共识的社会议题到个人偏好)进行五轮论证交流;每轮后以常规和否定框架询问,并记录响应分布的期望值与香农熵(Shannon entropy)。研究共使用六个LLM:本地部署的Llama、Qwen、Mixtral及其反校准变体DolphinMixtral,以及云端托管的GPT和Grok。数据拟合采用分层贝叶斯影响-响应函数。此外,在来自公共Telegram频道的气候变化消息子样本(约3万条,经GPT标注并筛选)上,通过低秩适应(Low-Rank Adaptation, LoRA)对Mixtral进行微调,以检验初始观点保持性。
研究结果如下。
**LLM观点动态中的收敛与偏差**:通过分析模拟讨论轨迹发现,除Grok外,两个智能体的观点距离随时间逐渐减小;所有模型的观点转变幅度均在前几轮快速衰减,随后稳定在低但非零的平台。观点通常迅速收敛到依赖话题的吸引子,且该吸引子常与LLM的话题先验一致。部分话题中,否定框架下的回答仍偏向正向,反映出同意偏差;锚定偏差仅在个别话题中呈弱表现。
**不同LLM间的偏差与不确定性差异**:跨模型比较显示,快速收敛和话题偏差普遍存在;同意偏差只出现在部分模型中,而锚定偏差除DolphinMixtral外多表现为轻微负向影响。对于中性观点,Llama、Qwen和DolphinMixtral产生的中性平均意见主要来自分散的响应分布,表明不确定性较高;Mixtral、GPT和Grok则更倾向于真正的中性回答,不确定性较低。
**通过贝叶斯建模量化影响因子**:分层贝叶斯模型拟合结果支持上述定性发现,但效应大小在模型间差异显著。所有模型中,话题偏差单独具有最强的解释力;交互效应排在第二位,且在更强大的GPT和Grok中强度接近甚至超过话题偏差。同意偏差在Llama中与话题偏差和交互效应相当,在Qwen中为负值,在Mixtral中为中等正值,在GPT和Grok中接近零。锚定偏差除DolphinMixtral外均为负,但单独预测力很弱。时间尺度参数显示各效应均快速衰减,同意偏差和锚定偏差衰减最快,而DolphinMixtral的同意偏差和话题偏差持续更久。
**通过微调提高初始观点的保持性**:在气候话题上,研究人员对Mixtral针对五种观点水平进行微调,发现个体话题吸引子与初始化观点之间的相关性显著增强,尤其是“强烈反对”(-2)这一远离科学共识的立场。与基础Mixtral相比,微调模型表现出更强的交互效应和个体话题偏差,说明微调将话题偏差吸引子移向了所设定的初始观点。
**熵作为观点不确定性的度量**:研究将响应分布的香农熵作为观点不确定性指标,发现相同期望观点可能对应不同的熵值;中性观点可具有宽广的熵范围,而极端观点必然低熵。熵与后续观点转变的方差呈正相关,相关强度因模型而异,从Llama的r=0.38到Qwen的r=0.95不等,表明熵可以预测智能体后续观点变化的敏感性。
讨论部分指出,既有工作多定性描述LLM智能体的观点偏差,例如向“科学现实”收敛、同意偏向、谄媚行为以及道德困境中的不作为倾向,而本研究的贝叶斯框架将这些观察转化为可量化的参数,提高了跨模型和微调变体的可解释性与可比性。研究局限包括:所用模型多为自托管或较小云端模型,无法隔离能力因素;话题覆盖面有限,微调仅针对气候变化;且只分析双智能体讨论。未来可将框架扩展至更大规模智能体网络、更多偏差类型以及与真实人类对话的比较,也可将贝叶斯模型作为大规模社会网络模拟中LLM的替代代理。
研究结论:先前的工作已定性描述LLM观点动态中的偏差,而本文提出的贝叶斯框架量化了驱动LLM智能体之间讨论的交互效应与偏差,提高了跨LLM架构和微调变体的可解释性与可比性。将该框架应用于六个LLM和十二个话题后,研究人员发现观点轨迹迅速收敛到受话题偏差主导的、随话题变化的吸引子,而交互、同意和锚定效应在模型之间差异显著。研究进一步证明,智能体响应分布的熵能够预测观点不确定性,微调则可以将话题偏差吸引子系统性地移向所选立场。通过将以往定性观察转化为定量、可比较的参数,该框架提供了对AI安全关键属性——LLM改变立场的难易程度、这种改变对内容的敏感程度,以及所表达不确定性对观点稳定性的刻画程度——的行为度量,并以自上而下的方式补充了自下而上的机制可解释性。