基于强化学习的机器辅助自适应反馈共识方法:面向大规模群体决策(LSGDM)

《Frontiers in Big Data》:Machine-assisted adaptive feedback consensus method for large-scale group decision making based on reinforcement learning

【字体: 大 中 小 】 时间:2026年09月25日 来源:Frontiers in Big Data 3.8

编辑推荐:

  引言:传统大规模群体决策(LSGDM)中的共识达成过程(CRP)高度依赖经验确定的反馈参数,难以兼顾共识效率与专家意见保留。为解决该问题,本文提出一种基于强化学习的机器辅助自适应反馈共识方法。方法:首先,引入犹豫度改进犹豫模糊语言术语集(HFLTS)的得分函数

  
引言:传统大规模群体决策(LSGDM)中的共识达成过程(CRP)高度依赖经验确定的反馈参数,难以兼顾共识效率与专家意见保留。为解决该问题,本文提出一种基于强化学习的机器辅助自适应反馈共识方法。方法:首先,引入犹豫度改进犹豫模糊语言术语集(HFLTS)的得分函数,以减少语言信息转换过程中的信息损失。其次,构建融合偏好相似度与社会信任关系的综合关系矩阵,并采用K-Means聚类对大规模专家组进行划分。在此基础上,将共识达成过程建模为马尔可夫决策过程(MDP),并将LSGDM共识达成过程建模为动态序贯决策问题;利用深度确定性策略梯度(DDPG)智能体学习反馈调整策略,使反馈参数能够根据群体意见的演化状态动态调整。同时,结合网络文本数据与TF-IDF方法确定属性权重,提高决策客观性。最后,以“京津冀暴雨”应急决策案例对所提方法进行验证。结果:结果表明,所提方法能够在更少的讨论轮数内达到预设共识阈值,同时有效平衡群体共识水平与专家意见保留。讨论/结论:上述发现验证了所提方法的有效性与可行性,表明该方法可为LSGDM应急决策中的自适应反馈共识达成提供有效的决策支持。
突发公共事件频发,极端降雨、台风等情形对应急决策提出了很高要求。传统小规模群体决策难以充分整合多源信息,因此大规模群体决策(LSGDM)逐渐成为复杂应急决策的重要途径。共识达成过程(CRP)是LSGDM的核心环节,但现有CRP方法存在两方面不足:一是偏好转换依赖犹豫模糊语言术语集(HFLTS)的经典得分函数,当不同专家给出等值但犹豫程度不同的评价时容易产生误判,造成信息损失;二是反馈参数常由经验或固定规则确定,无法随群体意见演化自适应调整,难以兼顾共识效率与专家意见保留。为此,研究人员提出一种基于强化学习的机器辅助自适应反馈共识方法。

该方法的主要创新包括:利用犹豫度改进HFLTS得分函数,降低不确定语言信息转换中的信息损失;将专家偏好相似度与社会信任关系融合为综合关系矩阵,采用K-Means聚类划分大规模专家组;将CRP建模为马尔可夫决策过程(MDP),并引入深度确定性策略梯度(DDPG)算法,使智能体根据群体共识水平、意见偏差和历史反馈效果动态生成连续反馈参数;结合微博爬取的网络文本与词频-逆文档频率(TF-IDF)方法确定属性权重,提高决策客观性。以2023年“京津冀暴雨”应急决策为案例,20名专家对4个备选方案、4个属性(人员搜救、资源调配与安置、舆情管理、时效性)进行多粒度HFLTS评价,共识阈值设为0.9。结果表明,所提方法经6轮讨论使群体共识水平(GCL)由0.8599升至0.9043,达到预设阈值;备选方案综合排序为x4>x3>x2>x1,x4为最优方案。与传统固定参数、非强化学习随机调整和线性递增参数等方法相比,该方法在更少的轮数内达成共识,同时获得较高的偏好保留率,验证了自适应反馈机制的有效性。

在关键技术方法上,研究人员主要采用以下手段:基于犹豫度修正的HFLTS得分函数与归一化数值偏好转换;融合偏好相似度和社会信任的综合关系矩阵构建,以及采用轮廓系数确定簇数的K-Means聚类;以DDPG的Actor-Critic双网络实现连续反馈参数学习,通过经验回放和时间差分误差更新策略;利用TF-IDF对约5万余条微博文本进行关键词权重提取并映射到属性权重。样本来源包括模拟的多粒度语言偏好与社会信任关系数据、不同规模(20、50、100、200名)专家群体以及微博公开文本数据。

研究结果方面:

(1)案例应用与决策过程。在“京津冀暴雨”案例中,研究人员将专家偏好转换为数值矩阵,结合信任关系计算专家权重,经K-Means聚类得到5个子群;采用识别规则选出未达共识阈值的子群和需要调整的意见元素,由DDPG智能体给出各轮反馈参数,6轮后GCL达到0.9043,群体偏好矩阵随之更新,为方案选择提供基础。

(2)对比分析。将改进得分函数与原始得分函数比较,发现犹豫度信息会改变第三、第四方案的排序,并降低所有方案得分,说明犹豫度包含的决策不确定性确实影响最终排序;与两种已有反馈参数确定方法比较,所提方法达到相同的最大/最小方案识别,但讨论轮数更少,且反馈参数完全客观确定,避免了主观参数导致的不可靠结果。

(3)
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号