基于零和博弈的强化学习跟踪控制及其在高柔性飞机上的预设时间预设性能

《Aerospace》:Zero-Sum Game-Based Reinforcement Learning Tracking Control with Predefined-Time Prescribed Performance for Highly Flexible Aircraft

【字体: 时间:2026年09月08日 来源:Aerospace 2.5

编辑推荐:

   **摘要** 本文针对高柔性飞行器,提出了一种基于零和博弈强化学习且具有预定义时间规定性能(ZG-RL-PP)的跟踪控制器。首先,将受扰跟踪误差动力学转化为一个极小极大最优控制问题,其中控制输入与扰动被视为具有对立目标的两方博弈者。为保证规定的瞬态和稳态跟踪性能,将对数障碍

  **摘要**本文针对高柔性飞行器,提出了一种基于零和博弈强化学习且具有预定义时间规定性能(ZG-RL-PP)的跟踪控制器。首先,将受扰跟踪误差动力学转化为一个极小极大最优控制问题,其中控制输入与扰动被视为具有对立目标的两方博弈者。为保证规定的瞬态和稳态跟踪性能,将对数障碍Lyapunov函数引入值函数和Hamilton–Jacobi–Isaacs方程中。对于高阶相对度的跟踪误差通道,引入递推辅助约束变量,以维持原始误差的规定边界,并通过控制输入所出现的导数通道实现约束强制。采用评论家神经网络在线近似值函数,并采用预定义时间分数幂学习律进行评论家权重更新。研究表明,评论家权重估计误差具有实际预定义时间收敛性,且所有闭环信号一致最终有界。仿真结果证明,ZG-RL-PP在跟踪精度、扰动抑制、规定性能满足以及预定义时间学习方面具有有效性和鲁棒性。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号