综述:不确定动力学条件下基于高斯过程的分布式零阶均衡点搜索

《Journal of the Franklin Institute》:Distributed Zeroth-Order Equilibrium Seeking under Uncertain Dynamics by Gaussian Process

【字体: 时间:2026年09月09日 来源:Journal of the Franklin Institute 3.7

编辑推荐:

   摘要 在基于博弈论决策框架建模的多智能体信息物理系统中,运行于复杂动态环境中的智能体经常面临未知的系统组件,这模糊了目标函数与控制策略之间的关系,并对基于梯度的均衡求解构成了重大挑战。为应对这一问题,本文提出了一种基于高斯过程回归(GPR)的分布式零阶均衡求解方法。通过GP

  

摘要

在基于博弈论决策框架建模的多智能体信息物理系统中,运行于复杂动态环境中的智能体经常面临未知的系统组件,这模糊了目标函数与控制策略之间的关系,并对基于梯度的均衡求解构成了重大挑战。为应对这一问题,本文提出了一种基于高斯过程回归(GPR)的分布式零阶均衡求解方法。通过GPR重构未知系统动力学,得到一个标称动力学模型。利用该标称系统,开发了一种零阶梯度估计方案,从而实现分布式通信和策略更新。对通信误差和梯度估计误差进行了严格分析。刻画了动态系统的概率能量衰减,并建立了智能体的次线性遗憾界。引入稳态映射来桥接控制输入与目标梯度,从而确保均衡求解与系统稳定性。最后,在一个未知环境中进行了多传感器覆盖实验,展示了所提方法在未知漂移动力学和有噪声状态观测条件下的可靠性。

引言

随着信息物理环境中多智能体系统的快速发展,动态博弈已成为建模智能体交互的一种基本决策范式。它在机器人编队控制、自动驾驶和电力系统运行等应用中实现了重大进展[1]、[2]、[3]、[4]、[5]。在动态博弈中,每个智能体在将其他智能体的策略视为固定不变的情况下优化自身策略的过程被称为均衡求解,由此得到的稳定策略组合被称为纳什均衡。

尽管动态博弈和均衡求解取得了显著进展,但实际应用中往往要求智能体在未知系统动力学下且不获取梯度信息的情况下做出决策。因此,本工作的核心目标之一是在未知动力学下桥接控制输入与目标梯度,从而实现在数据驱动的分布式均衡求解中可靠且高效。

多项代表性研究探讨了动态系统中的博弈论问题。早期工作主要集中在线性动态系统上。在[6]、[7]和[8]中,开发了分布式均衡求解方法,其中每个智能体仅需与其邻居交换信息即可实现全局均衡,同时保证系统稳定性。该范式在[9]中进一步应用于传感器网络中的高效覆盖问题。在此类场景中,通过适当设计的控制律(例如通过状态反馈),可以建立控制输入与目标函数中出现的状态变量之间的显式等价关系,从而通过基于梯度的方法实现分布式均衡求解。

在这些成果的基础上,非线性动态系统中的博弈近年来因能够更好地描述复杂物理过程而引起了越来越多的关注。例如,在[10]中提出了一种基于高增益观测器的分布式算法,对非线性状态耦合系统实现了纳什均衡的任意精度近似。对于实践中常见的二阶非线性动态系统,如Euler-Lagrange系统,在[11]、[12]、[13]、[14]中进一步开发了分布式控制方案。这些方法通常将伪梯度反馈纳入系统动力学中,并利用Lyapunov稳定性理论驱动集体行为趋近纳什均衡。

在实际应用中,系统模型往往不准确,甚至可能因环境扰动而变得不确定或未知。因此,基于模型的均衡求解方法难以实施,数据驱动或基于学习的方法受到了越来越多的关注。例如,[15]和[16]研究了具有未知状态函数的动态系统,其中采用神经网络来近似未知动力学。在[17]中,开发了一种基于自适应控制的方法来补偿未知动力学并实现稳定的均衡求解。

此外,学习方法也得到了探索。例如,[18]和[19]研究了反馈优化方法,其中使用稳态映射来直接刻画状态与输入之间的关系,从而简化均衡求解控制器的设计。在[20]中,利用数据和高斯过程回归构建了未知动力学的模糊集,从而实现了分布鲁棒均衡求解。方差控制是零阶梯度估计的关键问题。经典结果表明,与单点方案相比,两点函数评估可以降低无梯度估计器的方差和维度依赖[21]。在分布式场景中,相关的零阶和无梯度方法研究了多智能体网络上的随机梯度估计器,并进行了与方差相关的收敛性分析[22]、[23]、[24]。此外,[25]还研究了零阶均衡求解方法,其中梯度信息通过函数评估来估计。这些方法提供了一种无需显式梯度信息的均衡求解替代范式。与上述研究不同,它们主要关注静态优化或直接函数评估的均衡求解,而本文研究的是具有未知动力学的动态博弈的分布式均衡求解。在我们的设定中,由输入扰动引起的函数变化受未知状态转移的影响;因此,两点估计器与基于GPR的动力学重构、通信误差分析和稳态映射相结合。

尽管取得了这些进展,但在未知非线性动力学下可靠地部署分布式均衡求解仍然是一个基本挑战。此类未知组件在实践中通常由未建模的动力学、环境扰动以及有限的感知或系统辨识能力引起。缺乏显式的系统知识阻碍了稳态映射的构建,从而模糊了控制输入与目标函数之间的关系,使传统的基于梯度的方法无法适用。此外,通过高斯过程回归对未知动力学进行建模会导致梯度计算中出现极高的计算复杂度。零阶方法提供了一种自然的替代方案,即通过函数评估来估计梯度。

虽然零阶方法通过函数评估来估计梯度提供了一种有前途的替代方案,但对于具有未知非线性动力学的动态博弈中不依赖梯度或模型信息的分布式均衡求解,仍然缺乏一个系统的框架。这一缺口促使开发了一种数据驱动的分布式零阶框架,能够在不需要精确漂移动力学或梯度信息的情况下桥接输入-目标关系。

受上述挑战的启发,研究了具有未知系统函数的动态博弈,并开发了一种数据驱动的共识型分布式零阶均衡求解框架。主要贡献总结如下:

- 通过高斯过程回归构建了未知动力学的数据驱动表示,得到一个标称随机模型。建立了GPR诱导的标称预测律与基于观测的替代律之间的概率Wasserstein证书。还提供了额外的以高概率不匹配界将替代证书与实际系统演化联系起来。
- 开发了一种分布式零阶均衡求解算法,其中梯度信息通过扰动的状态评估来近似。所提方法建立了控制输入与目标变化之间的显式联系,而无需精确的漂移动力学或伪梯度信息。
- 严格分析了通信误差和梯度估计误差,建立了次线性遗憾以表征长期性能。此外,通过稳态映射,获得了均衡求解与系统稳定性之间一致性的统一刻画。

符号说明:设???表示n维欧几里得空间,‖?·?‖表示欧几里得范数。?xf表示关于x的偏梯度。?????[???(??)]表示在分布?下的期望。??(Ξ)表示支持在Ξ上的概率测度集合。W1(?·?,?·)表示Wasserstein距离。???(??,??2)表示均值为μ、方差为σ2>0的高斯分布。Π?????(·)表示到集合????上的欧几里得投影,即Π?????(??):=arg min??∈????∥?????∥。

本文其余部分组织如下:第2节给出问题表述和高斯过程回归。第3节开发分布式算法及其收敛性和稳定性分析。第4节提供多车仿真,第5节为结论。

问题描述与建模

本节建立具有未知动力学的博弈,并引入用于未知动力学函数的高斯过程回归。

主要结果

本节提出分布式零阶均衡求解算法并给出主要理论结果。

案例研究

一个场景被建模为移动传感器之间的非合作覆盖博弈,其中每个智能体??∈??选择其控制输入??????来优化一个局部目标,该目标取决于其自身状态和其他智能体的预测状态。耦合性来源于在区域Ω上共享的覆盖任务,其中每个智能体的感知性能受所有智能体空间构型的影响。因此,该问题可以视为一种动态博弈,其中智能体之间相互竞争。

结论

针对具有未知漂移动力学的动态博弈,我们开发了一种基于高斯过程回归的共识型分布式零阶均衡求解算法。所提算法可以在不知道精确的未知漂移动力学fi(?·?)、稳态灵敏度或伪梯度信息的情况下实施。在分布式博弈的标准信息结构下,每个玩家仅使用有噪声的状态观测、其局部已知的与输入相关的组件gi(?·)

CRediT作者贡献声明

Mengting Ye:写作 – 审阅与编辑,写作 – 初稿,软件,方法论,形式分析,概念化。
Longcheng Liu:方法论,调查研究,概念化。
Jun-e Feng:监督,项目管理。
Yingzhe Jia:验证,监督,资金获取,数据整理。

利益冲突声明

作者声明不存在任何已知的竞争性经济利益或个人关系可能影响本文所述工作的研究。

Mengting Ye | Longcheng Liu | Jun-e Feng | Yingzhe Jia
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号