衡量大型语言模型(LLMs)的推理质量:一个多维的行为框架
《Big Data and Cognitive Computing》:Measuring Reasoning Quality in LLMs: A Multi-Dimensional Behavioral Framework
【字体:
大
中
小
】
时间:2026年09月04日
来源:Big Data and Cognitive Computing 5.3
编辑推荐:
摘要
尽管在推理基准测试方面取得了显著进展,但目前的大型语言模型(LLM)评估方法仍然主要基于最终答案的正确性。这无法充分了解模型是如何进行推理的、在上下文变化下的表现
摘要
尽管在推理基准测试方面取得了显著进展,但目前的大型语言模型(LLM)评估方法仍然主要基于最终答案的正确性。这无法充分了解模型是如何进行推理的、在上下文变化下的表现是否可靠,以及它们的推理效率如何。本文提出了RQEval,这是一个从行为角度衡量LLM推理质量的统一多维框架。该框架涵盖六个基于认知科学的理论维度:正确性(CQ)、一致性(CS)、鲁棒性(RS)、局部逻辑连贯性(LS)、效率(ES)和稳定性(SS)。此外,该框架还引入了考虑部署环境的聚合机制,从而能够在基于准确性的排行榜之外,根据具体情境选择合适的模型。将RQEval应用于七种LLM在四个基准测试中的表现后,发现存在一个由CQ、CS、RS和ES组成的结果层,这些指标之间具有很强的相关性;同时存在一个细节层,其中ls与其他结果层指标存在显著差异,而ss与其中几个指标仍保持中等关联程度。在28个模型-数据集组合的观察中,ls与其他任何维度均无统计学上的显著相关性。然而,考虑效率因素后的排名结果显示,在其他权重方案中表现一致的模型之间,rqeval的排名结果发生了部分变化。这一研究流程为诊断llm在不同部署环境下的推理行为提供了基础,并指出了领域特定验证作为未来研究的重要方向。
>
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号