《Nature Machine Intelligence》:Causal evidence that language models use confidence to drive behaviour
编辑推荐:
元认知(Metacognition)——评估自身认知表现的质量——引导着跨物种的适应性行为。置信度信号可以从语言模型输出中提取,但一个基本问题仍然存在:模型是否真的使用这些信号来决定回答还是弃权?在此,研究人员开发了一种四阶段范式。第一阶段在没有弃权选项的情况
元认知(Metacognition)——评估自身认知表现的质量——引导着跨物种的适应性行为。置信度信号可以从语言模型输出中提取,但一个基本问题仍然存在:模型是否真的使用这些信号来决定回答还是弃权?在此,研究人员开发了一种四阶段范式。第一阶段在没有弃权选项的情况下引发基线置信度。第二阶段表明,大型语言模型(LLMs)在弃权时对内部置信度施加隐式阈值,其置信度效应量大约比其他机制大一个数量级。第三阶段通过激活引导(activation steering)提供了因果证据:增强或抑制置信度相应地降低或增加了弃权,中介分析确认置信度再分配是主要机制。第四阶段指示模型在不同的置信度水平下弃权,并显示它们相应地调整了行为,表明它们读出置信度并据此设定弃权策略。重要的是,言语置信度(verbal confidence)——来自单独前向传递的显式自我评估——在所有模型中独立预测了弃权,尽管它对正确性的区分能力较弱,并且激活解码显示这两种测量(即令牌对数概率(token log probabilities)和言语置信度)都是更丰富的内部表征的有损读出。总之,这些结果表明,弃权是由多维内部置信度表示和基于阈值的策略的联合操作所捕获的——这与大型语言模型中的结构化元认知控制一致——随着模型转变为必须识别自身不确定性的自主智能体,这种能力日益重要。
**研究背景与问题**
人类和动物通过置信度(confidence,即对决策正确性的内部概率估计)指导适应性行为,例如低置信度促使改变想法或寻求更多信息,高置信度则支持计划与连续决策。尽管已有大量研究探讨大型语言模型(Large Language Models, LLMs)能否产出与真实概率一致的置信度评级,但很少探索LLMs能否利用内部置信感来调节自身决策——这是元认知(metacognition,对自身认知状态的监测与控制)的标志。元认知控制已在人类和动物中广泛证实,但在人工系统中仍不清楚。弃权(abstention)是置信度发挥关键作用的场景:模型需要决定是否回答问题或放弃回答,这类行为可视为元决策(metadecision,即关于基本决策的决策)。此外,低置信度且可能错误的高风险答案往往比拒绝更有害,因此理解LLMs的弃权机制对其安全部署至关重要。然而,已有工作多依赖事后阈值化或专门微调,缺乏清晰证据表明LLMs能利用其内生的置信度信号主动指导弃权。研究人员因此开发了一个四阶段受控范式,旨在回答置信度信号是否以及如何驱动弃权行为。
**研究内容与意义**
研究人员使用SimpleQA事实性数据集转换的四选一问题,对GPT-4o、Gemma 3 27B、DeepSeek 671B和Qwen 80B进行了测试。阶段1在无弃权选项下收集基线置信度;阶段2引入弃权选项并观察自然弃权行为;阶段3通过激活引导(activation steering)在Gemma 3 27B中因果干预内部置信度表示;阶段4通过系统改变指令阈值来测试阈值化政策。研究发现:校准置信度(calibrated confidence)主导预测弃权,效应量比替代机制大约一个数量级;激活引导能够因果性地改变弃权率,且中介分析表明置信度再分配为主要机制;模型会根据不同置信度阈值调整行为,表明它们能主动读出并利用置信度设定弃权策略;言语置信度(verbal confidence)作为独立的评估性信号,虽对正确性区分较弱,却在所有模型中独立预测弃权;激活解码显示两种置信度测量都是更丰富内部表征的有损读出。这些结果提供了LLMs使用置信度驱动行为的因果证据,支持结构化元认知控制的存在,对于构建能够识别自身不确定性的自主智能体具有重要意义。论文发表在《Nature Machine Intelligence》。
**关键技术方法**
研究人员使用了源于SimpleQA数据集的四选一事实性问题(1000个主测试题,另1000题用于校准,500个保留问题用于激活引导验证),测试了GPT-4o、Gemma 3 27B、DeepSeek 671B和Qwen 80B。关键技术包括:温度缩放(temperature scaling)校准logits以生成校准置信度;逻辑回归建模比较置信度与替代预测因子(问题难度、检索增强生成(RAG)分数、句子嵌入)的解释力;激活引导通过构造高/低置信度对比向量注入Gemma 3 27B残差流来干预内部置信度;并行中介分析区分置信度再分配与政策转移;线性探针(ridge回归)在最后一个回答前令牌(AC)上解码内部置信度表示。
**研究结果**
**第一阶段:基本表现与校准置信度(GPT-4o)。** 通过让GPT-4o在无弃权选项下回答1000道四选一问题,获得63.7%正确率。利用温度缩放(最优温度4.1)在独立校准集上校准logits,得到校准置信度(期望校准误差ECE=0.046,AUROC=0.90)。结果显示校准置信度与错误率强烈负相关(r(12)=?0.97,P=7.96×10
?9),表明模型的logits提供了有意义的选择正确性信号。
**第二阶段:校准置信度预测弃权行为(GPT-4o)。** 在同样问题上加入弃权选项后,模型弃权率56.6%,答题准确率上升至69.1%,出现覆盖率-准确率权衡。使用阶段1校准置信度作为预决策变量进行逻辑回归,置信度单独模型的AIC为1227.4,显著优于难度、RAG和句子嵌入模型;在全模型中,置信度的标准化效应量(|β
std|=0.99)比替代预测因子大约一个数量级,表明弃权主要由置信度驱动而非题目难度等。恢复出的隐式阈值约为77%,政策温度约20个置信度单位,表明存在平滑的决策边界。
**第二阶段:弃权行为的计算建模(GPT-4o)。** 通过逻辑回归比较置信度与难度、RAG分数、句子嵌入等预测因子,发现置信度增加0.1单位使弃权概率降低约12个百分点。似然比检验显示置信度在每个替代预测因子之上增加了显著解释力,而反过来则不然,进一步确认置信度的主导地位。
**第三阶段:激活引导(Gemma 3 27B)。** 在Gemma 3 27B中,基于阶段2高、低置信度边际试次构造激活向量,并注入到网络特定层(层31效果最强)。结果显示,从最大低置信度引导到最大高置信度引导,弃权率从66.5%降至7.0%,变化幅度达59.5个百分点(r(7)=?0.9855,P=1.19×10
?6)。引导还引起置信度分布协调变化:高置信度引导提高真实选项置信度并降低弃权选项置信度,反之亦然,表明激活引导通过协调地重新分配置信度来改变行为。
**中介分析。** 并行中介分析设置两个中介因子——置信度再分配(阶段1)和政策转移(阶段2)。结果显示,置信度再