《Machine Learning and Knowledge Extraction》:Accelerated LLM: A Fuzzy-Logic-Augmented Router Architecture for Efficient Multi-Domain Query Processing via Specialised Small Language Models
编辑推荐:
当自主语言模型智能体失败时,越来越多研究让大语言模型(Large Language Model,LLM)作为判定器读取轨迹并指认责任步骤。研究人员追问这种归因能否区分两类原因:单条坏输入导致的局部污染,与多步骤累积的分布式退化。通过在两个智能体任务、四种轨迹完
当自主语言模型智能体失败时,越来越多研究让大语言模型(Large Language Model,LLM)作为判定器读取轨迹并指认责任步骤。研究人员追问这种归因能否区分两类原因:单条坏输入导致的局部污染,与多步骤累积的分布式退化。通过在两个智能体任务、四种轨迹完整度、十个判定器上受控故障注入,研究人员发现只要轨迹可辨,判定器对两类原因区分很弱。多数判定器只用一种倾向:指认产出结果的步骤,因此其两类每类准确率其实是同一个数的读数,边际近零。两个前沿模型分别位于该轴两端:一个断言轨迹并不存在的矛盾,另一个在轨迹一致时弃答。在真实任务上,六个判定器中有四个反转,对分布式原因比局部原因更常指认具体步骤。限制不是能力缺失:当只需比较即可矛盾时,同一判定器50/50定位故障;需要算术时1/50;轨迹一致时0/50;故障量级2500倍扫描也不改变边际。确定性非模型规则在主面板轨迹上可区分两类,标准提示下无判定器在满细节超过0.16;一种提示干预把边际提升到0.34。研究人员将其读作对所评估模型、提示和构造任务中LLM-as-judge归因的可靠性警示。
研究背景方面,基于LLM的自主智能体(agent)执行长轨迹工具调用与中间决策,失败后执行轨迹是主要重建依据。将失败归因为局部坏值进入还是多步小错误累积,决定应不信任单一来源还是整段运行,但轨迹本身通常不显示哪步具决定性。LLM-as-judge因能读轨迹、免手编规则而流行,但已有基准显示其逐步定位准确率近随机。已有文献押注模型更强、轨迹更全会缩小差距。本文把问题收紧:局部污染(localized corruption)与分布式退化(distributed degradation)外观相似却需不同处置,研究人员测量模型判定器能否区分二者,以及轨迹更完整是否有用。
该研究由MDPI期刊《Machine Learning and Knowledge Extraction》发表。研究人员用受控故障注入提供精确真值:在订单总额算术任务、共识投票非算术任务、供应商支出六步真实工具链中,注入单值污染、早期误导向、多步漂移;轨迹分L0输出层、L1工具层、L2上下文记忆层、L3外部状态与溯源层四档完整度;判定器含GPT-4.1、Qwen3-235B-A22B、DeepSeek V3 0324、GPT 5.5、Claude Sonnet 4.6及后续六家当前模型;以指认结果步倾向率、容忍/严格定位、根因分类、判别边际δ为指标,并以确定性数值异常启发式作非模型基线。
主要关键技术方法上,研究人员采用确定性脚本策略生成可复现轨迹,以已知故障注入获得真值;设三种故障结构:污染输入、早期错误、分布式漂移,并用反事实准则校验分布式定义;从最大轨迹消融出L0—L3四层完整度;用标准提示与禁算数提示两套判定提示;以非模型数值异常规则作对照;统计上用Wilson区间、Fisher精确检验、Cochran-Mantel-Haenszel分层检验、Cohen’s h效应量、Benjamini-Hochberg误发现率控制;样本来自构造环境,订单与共识各50例/条件,供应商支出200例/格。
研究结果如下。3.1概述:用受控故障注入测判定器归因与轨迹完整度关系,轨迹生成无运行间方差,唯一随机项是判定器。3.2任务环境:订单总额、共识、供应商支出三环境背后统一接口;供应商支出中污染在读取远早于结果,漂移分散到亚军交易,证明发现不依赖求和。3.3故障注入:污染真决步骤为读取步与消费步集合;早期错误首步;漂移无单步决断;用反事实移除单扰动不恢复正确答案来定义分布式,共识环境不满足该准则故退为次要控制。3.4轨迹完整度:原始逐项数据仅在L3外部状态出现,模拟常规日志与因果重建间缺口。3.5归因与评分:严格定位要正好决断步,分布式须弃答;容忍定位放宽到接受集或相邻索引;根因分类独立计分;判定器结果步指责率p1、p3使容忍污染准确率=p1、漂移准确率=1?p3,判别边际δ=p1?p3。3.6判定器与统计:五家模型加六家真实环境模型,温度0.0与结构化输出;四十一族检验做BH校正;中央结论靠跨格δ与非模型规则而非单检。3.7单倾向账户:两准确率和分析依赖于指责结果步这一单行为,δ近零即一倾向,δ近1才可靠。
4.1标题准确率隐藏了什么:GPT-4.1污染定位随完整度0→100、漂移100→0,是两道看同一行为曲线,不是两个结果。4.2判别至多很弱:满细节δ在多数模型为0,标准提示主面板最高0.16、任意完整度不超0.30;CMH仅有两格显著且不跨环境;图1显示局部与分布指责率差不超0.16。4.3提示控制与无免费侧:禁算数提示使漂移不崩但污染满细节100→36,δ由0变+0.34;该提示只移边际不修归因,从业者是在选错法。4.4跨模型单轴:从Claude/GPT-4.1强指认到GPT 5.5/Qwen弃答,DeepSeek居中;完整度把指责型判定器从弃答推到指认,不增判别。4.5前沿两形失败:GPT 5.5因轨迹自洽而弃答漏掉局部;Claude Sonnet 4.6断言不存在矛盾,共识环境121/251理由含自我纠正后仍指步,推理改的是失败样式不是能力。4.6定位与分类及数据质量:GPT-4.1早期错误步100但根因标签低;DeepSeek格式失败约20%,按主惯例计失败不删观测,结论不变。4.7错误归因形状:指责型判定器在分布失败上69%—87%理由断言具体不一致;弃答型避假述但漏局部;断言型最危险因其形式与正确归因无异。4.8真实多工具环境:六模型供应商支出中污染定位全≤0.04;四模型关联倒置,分布原因更常被指名具体步,比冷漠更糟。4.9温度与轨迹序:温度0.7几乎不动;洗牌步骤序使指责散到不同位置,严格污染不升,δ仍近零,归因跟提示位置而非因果角色。4.10可追溯性与非模型参照:确定性数值异常规则在订单环境AUC 1.000、δ=1.00,供应商支出AUC 0.976、δ=0.86,证明满细节轨迹含可区分信息;L0—L2因逐项数据缺失才近随机。4.11共识环境范围修正:共识两原因观测证据相同、反事实不成立,撤出核心主张仅留非算术控制。4.12审阅请求控制:故障量级2500倍扫描δ仍0;矛盾可比较时50/50定位、需重算时1/50;无故障时被暗示失败就编造步骤;自检、投票、基率提示都不离单轴。
讨论部分总结:单类准确率不代表跨类判别力,基准报每类定位低数是现象,本文给机制——判定器不找对类原因而被执行结果步这一结构先验主导;加溯源/可观测性只让错误更自信。算术自由提示说明:抓局部污染靠察觉数值不一致,同一察觉在分布式上造假归因,提示修一边毁一边。两前沿实验室模型分居单轴两端,说明不随能力层级变;真实环境六模型反转说明模型判定器可主动误导维修方向。追踪忠实性本身受限,工具结果提示注入可摆布被指责位置,模型判定器叠加第二失效点。
结论部分翻译:用模型归因智能体失败很吸引人且愈发红火,其依赖的假设证据并不支持。被要求区分单条坏输入与缓慢分布式退化时,所评估判定器——从开放权重模型到不同实验室两个前沿推理模型,再到真实任务上六家当前模型——无一可靠区分。各自被同一种倾向主导:指责产出结果的步骤,对局部原因碰巧对、对分布式原因错;更多轨迹强化该倾向而非带来判别。该行为横跨能力区间与被评两前沿实验室,因而是所测模型判定器的性质,不是某一系统的弱点。研究人员不宣称所有LLM归因器都如此,结论限于所测局部污染与分布式退化之分。任何用这些判定器归因智能体失败的做法都应明示该保留。归因加流利理由并不是模型真区分了所指原因与未指原因的证据。