谁更具战斗力?探索大语言模型辩论智能体的制胜人格组合
《Pattern Recognition》:Who fights best? Discovering winning personality pairings for LLM debate agents
【字体:
大
中
小
】
时间:2026年09月25日
来源:Pattern Recognition 9.1
编辑推荐:
### 摘要
- 个性多样性显著影响多智能体辩论表现。
- 我们提出MBTI-DB,一个用于多智能体辩论中进行个性建模的框架。
- 精心挑选的个性配对可优于随机分配,且其效果在不同模型和领域间有所不同。
## 引言
多智能体辩论(MAD)已成为提升大语言模型(LLM)推
### 摘要- 个性多样性显著影响多智能体辩论表现。- 我们提出MBTI-DB,一个用于多智能体辩论中进行个性建模的框架。- 精心挑选的个性配对可优于随机分配,且其效果在不同模型和领域间有所不同。## 引言多智能体辩论(MAD)已成为提升大语言模型(LLM)推理能力的一种强大方法 [1], [2]。通过允许各智能体相互批判、修正或反驳彼此的推理过程,MAD在数学解题、常识推理和多跳问答等方面均展现出改进效果 [3], [4]。然而,现有的MAD系统普遍**采用中性人格的智能体**,缺乏能够区分推理风格和论证模式的显式人格特征。如图1所示,这种同质性可能会限制辩论过程中的推理多样性。这种设计忽视了心理学和行为科学中关于人格从根本上影响个体如何进行推理、论证和协作的大量证据 [5], [6]。不同人格类型在信息处理、冲突解决和论证策略方面表现出系统性差异。迈尔斯-布里格斯类型指标(MBTI)等性格框架 [7], [8] 为刻画这些差异提供了结构化的分类体系 [9], [10]。鉴于这些在人类团队中已被证实的影响,一个自然的问题随之产生:在MAD系统中,个性多样性是否也能影响协作推理?我们将这一问题分解为三个具体方面:**(i) 在辩论过程中引入个性模拟是否会影响MAD在目标任务上的表现?(ii) 哪些因素可能解释了个性对MAD表现的影响?(iii) 我们能否自动识别最佳个性配对以提升MAD表现?**我们提出了受MBTI启发的辩论框架(**MBTI-DB**),一个用于系统研究个性在多智能体辩论中影响的框架。基于MBTI理论,我们设计了16种不同的人格画像,每种画像都具有特定的与辩论相关的行为倾向,包括论证风格、信息处理偏好、反驳模式和协作方式。我们的研究遵循逐步评估策略:首先评估单个具备个性特征的智能体在推理任务上的表现以理解基线个性效应,然后评估不同个性配对在辩论场景中的表现。这使我们能够系统地考察个体个性影响及其协作表现。我们在来自MMLU-Pro的14个领域的700个问题上,针对四个流行的LLM家族进行了全面实验 [11]。我们的实验揭示了个性配置对辩论结果具有系统性影响。我们观察到某些个性配对能够稳定地优于中性人格基线,而其他配对则持续表现不佳的规律。值得注意的是,相同的个性配置在不同问题和模型间表现出相似的相对表现。为了更好地理解这些现象背后的机制,我们分析了辩论特征,包括词汇密度、个性-问题相似度和提示困惑度。分析表明词汇密度和困惑度与表现呈预期的相关关系,而个性-问题相似度则呈现出反直觉的负相关。我们进一步评估了自动选择最优个性配对的策略,发现基于信息的智能选择能够持续优于随机配对。我们的工作做出了三项关键贡献:- 我们提供了个性多样性影响多智能体辩论结果的首个系统性证据,展示了跨多个模型家族和问题类型的稳定且可重复的效应。- 我们提出MBTI-DB,一个用于在多智能体辩论系统中注入和研究个性特征的模块化框架,能够有控制地调查个性对MAD的影响。- 我们分析了个性条件下辩论中表现差异的底层因素,并进一步证明基于训练和基于预测的配对选择策略优于随机配对。这些发现为在MAD中选择有效的个性配对提供了实用指导。## 章节摘要### 多智能体辩论现有的MAD研究大致可分为三个主要方向:**(i) 结构化辩论框架**定义明确的角色分配、受控的轮次转换和协调的论证交换流程 [12],通常使用正方、反方、主持人和裁判来通过多轮审议提高答案一致性 [13]。**(ii) 任务特定的多智能体框架**设计具有专业化角色或能力的异构智能体以适应特定任务 [14],旨在……### 预备知识本节首先给出问题定义,然后介绍迈尔斯-布里格斯类型指标(MBTI)。### MBTI启发的辩论框架如图2所示,MBTI启发的辩论框架(MBTI-DB)包含两个主要组件:(1) **辩论行为描述**和(2) **辩论者角色分配**。*辩论行为描述*组件专注于将原始MBTI个性框架适配到辩论场景中,通过构建面向辩论的个性描述,使LLM在多轮辩论中展现不同的论证行为。*辩论者角色分配*组件解决了……的挑战。### 数据集我们在所有实验中使用MMLU-Pro [11]的一个子集。MMLU-Pro在原始MMLU基准测试 [45] 的基础上扩展,纳入了更具挑战性的、以推理为导向的问题,并将答案空间从四个扩展到十个选项。该基准涵盖14个不同领域,包括数学、物理、化学、工程和其他知识密集型领域。此外,为了保持领域覆盖的平衡同时控制计算成本,我们从14个领域中各随机抽样50个问题。### 个性一致性为了研究将显式个性描述纳入LLM的可行性,我们构建了一个人工标注的评估集,用于评估生成辩论中的个性一致性。具体而言,对于每个模型,我们随机抽取30个生成的辩论对话,并要求三名专家标注者使用五点李克特量表(1–5)独立评分回复对指定的MBTI风格行为提示的遵守程度 [51],随后进行线性化处理。### 案例研究为了进一步探讨引入个性如何影响辩论行为,我们展示了两个具有代表性的案例研究。我们首先使用三种推理策略来刻画辩论过程:**探索**(引入或扩展假设)、**约束**(应用不变量或挑战基本假设)和**巩固**(稳定一个临时解释)。在**案例1**(模式生物)中,具有个性差异的辩论遵循清晰的三阶段过程。### 结论本文提出MBTI-DB,一个系统研究MBTI启发的辩论行为提示对多智能体辩论影响的框架。我们将16个MBTI标签操作化为辩论行为提示的抽象,而非声称LLM拥有类似人类心理的人格。跨多个模型家族、领域和模型规模,我们的结果表明个性条件化能够引发系统性和可测量的预测准确率变化。然而,……### 局限性本研究存在若干局限性。首先,由于大规模实验的计算成本较高,我们将评估范围限定在四个开源LLM家族,未包含GPT-5等闭源模型。为便于未来研究,我们已发布了实验脚本,欢迎社区进一步研究角色扮演和个性条件化对额外模型上LLM表现的影响。其次,我们评估了由六个……形成的36个有序配对。### 作者贡献声明**王建磊**:撰写 – 初稿、方法论、调查研究、概念设计。**刘康君**:撰写 – 审阅与编辑、可视化、验证、资源、调查研究、形式分析、数据整理。**项露**:撰写 – 审阅与编辑、监督指导、方法论、调查研究、数据整理。**张伟宇**:监督指导、调查研究、经费获取。**钱铁云**:监督指导、项目管理、调查研究、形式分析。**卢文鹏**:撰写 – 审阅与编辑。### 伦理考量本工作研究多智能体辩论中的个性条件化,不涉及敏感的个人数据。我们认识到与该研究方向相关的若干伦理考量。首先,手工设计的个性提示及后续的实验分析可能会无意中强化与MBTI人格特质相关的现有刻板印象,例如将ISFJ智能体描绘为始终体贴和耐心,或暗示某些个性配对(例如……### 利益冲突声明作者声明以下可能被视为潜在利益冲突的财务利益/人际关系:卢文鹏报告获得中国国家自然科学基金的财务支持。卢文鹏报告获得山东省重点研发计划(重大科技创新项目)的财务支持。卢文鹏报告获得济南市高校新二十条政策项目的财务支持。### 致谢本工作受以下项目资助:国家自然科学基金(项目编号62376130和62506359)、山东省重点研发计划(重大科技创新项目)(项目编号2026CXGC010604)、济南市高校新二十条政策项目(项目编号202333008)、教育部算力网络与信息安全重点实验室开放课题(项目编号2024ZD027)、科学创新集成试点项目,---王建磊 | 刘康君 | 项露 | 张伟宇 | 钱铁云 | 卢文鹏
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号