衡量大型语言模型(LLMs)的推理质量:一个多维的行为框架

《Big Data and Cognitive Computing》:Measuring Reasoning Quality in LLMs: A Multi-Dimensional Behavioral Framework

【字体: 时间:2026年09月04日 来源:Big Data and Cognitive Computing 5.3

编辑推荐:

   摘要 尽管在推理基准测试方面取得了显著进展,但目前的大型语言模型(LLM)评估方法仍然主要基于最终答案的正确性。这无法充分了解模型是如何进行推理的、在上下文变化下的表现

  

摘要

尽管在推理基准测试方面取得了显著进展,但目前的大型语言模型(LLM)评估方法仍然主要基于最终答案的正确性。这无法充分了解模型是如何进行推理的、在上下文变化下的表现是否可靠,以及它们的推理效率如何。本文提出了RQEval,这是一个从行为角度衡量LLM推理质量的统一多维框架。该框架涵盖六个基于认知科学的理论维度:正确性(CQ)、一致性(CS)、鲁棒性(RS)、局部逻辑连贯性(LS)、效率(ES)和稳定性(SS)。此外,该框架还引入了考虑部署环境的聚合机制,从而能够在基于准确性的排行榜之外,根据具体情境选择合适的模型。将RQEval应用于七种LLM在四个基准测试中的表现后,发现存在一个由CQ、CS、RS和ES组成的结果层,这些指标之间具有很强的相关性;同时存在一个
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号