用于无人机辅助移动边缘计算中轨迹与资源联合优化的双时间尺度PPO算法

《Physical Communication》:Dual-Timescale PPO for Joint Trajectory and Resource Optimization in UAV-Assisted Mobile Edge Computing

【字体: 时间:2026年08月11日 来源:Physical Communication 1.9

编辑推荐:

  •在深度强化学习中,慢轨迹与快资源时间尺度的不匹配会导致梯度干扰。•DTS-PPO将轨迹规划(慢过程)和资源分配(快过程)视为两个耦合的马尔可夫决策过程。•通过截断替代函数、广义优势估计以及熵正则化方法,可稳定双时间尺度PPO算法。•与DTS-TD3/DTS-SAC相比,DTS-

  •在深度强化学习中,慢轨迹与快资源时间尺度的不匹配会导致梯度干扰。•DTS-PPO将轨迹规划(慢过程)和资源分配(快过程)视为两个耦合的马尔可夫决策过程。•通过截断替代函数、广义优势估计以及熵正则化方法,可稳定双时间尺度PPO算法。•与DTS-TD3/DTS-SAC相比,DTS-PPO能将延迟降低11.5%–14.6%,同时将超时率降低67%。•每步推理延迟仅为667微秒,具备实时部署能力。

引言
随着增强/虚拟现实、自动驾驶以及工业物联网等计算密集型、对延迟敏感的应用不断发展,对移动网络基础设施提出了前所未有的需求[1]。移动边缘计算作为一种变革性方案,通过将计算资源从远程数据中心转移到网络边缘,有效降低了服务延迟并缓解了回传拥堵问题[2]。然而,传统地面移动边缘计算系统依赖于固定的基站部署,在用户分布动态变化的场景下——如突发灾难、临时热点区域或快速扩大的信号盲区——难以提供一致且可靠的边缘服务[3]。

无人机因其按需部署、三维机动能力以及良好的视距传输特性,成为地面移动边缘计算基础设施的理想补充[4]。在无人机上部署移动边缘计算服务器,可构成一种无人机辅助移动边缘计算系统,该系统能够在空中动态调整位置以服务于地面用户,从而在固定基础设施不可用或负荷过重时实现灵活、低延迟的边缘计算功能[5]。由于无人机轨迹直接决定了空地间的信道质量,进而影响所有用户的上传速率及数据卸载延迟,因此如何联合优化无人机轨迹与计算资源分配已成为该领域的重要研究课题[6][7]。

现有研究从两个方向探讨这一联合优化问题。凸优化方法在理想假设下能够得到高质量解,但需要预先完全掌握任务到达概率和信道分布信息,且当通过序列最小二乘规划等迭代数值方法求解时,其复杂度随用户数量N的增长而呈O(N3)阶,无法实现实时应用[8][9]。深度强化学习方法则通过在线、无模型适应的方式避免了对外部模型的依赖,但其将轨迹控制与资源分配置于相同的决策频率下处理,忽视了实际上无人机最优位置在各个时间槽间变化较缓,而数据卸载比例和资源分配则需要在每个时间槽重新优化的差异。这种时间尺度不匹配会导致轨迹策略的梯度更新出现冗余,进而引发梯度干扰和样本利用效率低下,尤其是在存在任务超时惩罚所带来的稀疏奖励信号情况下更为明显。近期的双时间尺度方法试图通过分离慢速与快速决策来解决这一结构性问题,但现有方案要么依赖无法处理非连续超时约束的基于模型的分解方法,要么采用缺乏防止大规模策略更新及过早收敛到次优解机制的简单策略梯度算法。值得注意的是,目前尚无研究将PPO算法的三大核心机制——截断替代目标函数、广义优势估计以及熵正则化——整合到双时间尺度架构中,这一方面存在明显的理论空白。第2节将对相关研究进行详细综述。

针对上述不足,本文提出了一种用于无人机辅助移动边缘计算系统的双时间尺度近端策略优化框架DTS-PPO。本文的主要贡献如下:
1. 系统模型与问题建模:构建了无人机辅助移动边缘计算系统模型,优化目标是在满足无人机实际运动能力和资源限制的前提下,最小化平均任务完成延迟、能耗以及任务超时率,优化变量包括无人机轨迹、任务卸载比例、带宽分配以及计算资源分配。
2. DTS-PPO算法设计与分析:提出DTS-PPO算法,将该联合序贯决策问题分解为两个在时间上相互耦合的马尔可夫决策过程,分别用于慢时间尺度的无人机轨迹规划以及快时间尺度的任务卸载与资源分配。相应的PPO智能体各自维护独立的网络参数和策略更新机制,同时通过共享的环境状态和分层奖励结构进行交互。每个智能体均引入截断替代目标函数、广义优势估计以及熵正则化措施,以提高训练稳定性并促进探索行为。
3. 全面性能评估:通过与其他五种基准方法的对比仿真表明,与DTS-TD3和DTS-SAC相比,DTS-PPO可使平均任务完成延迟分别降低11.5%和14.6%,任务超时率分别降低67.2%和67.4%,能耗则分别降低2.6%和9.9%。进一步的消融实验、泛化性测试、可扩展性验证以及信道鲁棒性测试进一步证明了DTS-PPO的稳定性和适应性。实际运行测试显示,其每步推理平均延迟仅为667微秒,远低于100毫秒的时间槽时长。

本文其余结构如下:第2节回顾相关研究,第3节阐述系统模型与问题建模,第4节详细介绍DTS-PPO算法,第5节展示仿真结果,第6节总结全文。

无人机辅助移动边缘计算的传统优化方法
鉴于无人机辅助移动边缘计算系统中联合优化问题的非凸性和高维耦合特性,早期的研究主要依赖于凸优化、逐次凸逼近以及交替优化方法。赵等人[12]将李雅普诺夫优化与块坐标下降法相结合,对无人机辅助移动边缘计算系统中的轨迹控制、任务卸载、服务缓存及迁移功能进行了全面联合优化,取得了显著的吞吐量提升效果。

系统模型
本文所研究的无人机辅助移动边缘计算系统如图1所示,由三个部分组成:(1)N个地面用户,记为集合N={1,2,…,N},这些用户随机分布在二维服务区域Q内,每个用户在每个时间槽都会生成一个计算密集型任务,且其本地计算能力有限;(2)一架搭载有移动边缘计算服务器的无人机,该无人机在固定高度H处飞行,充当空中边缘计算节点;(3)一个宏基站,负责为系统提供回传连接。

DTS-PPO算法设计
基于前述问题分析,本节介绍用于解决问题(P1)的DTS-PPO框架。首先,我们将原问题转化为两个在时间上相互耦合的马尔可夫决策过程,随后阐述智能体-评论家网络架构、PPO优化目标、广义优势估计方法以及协同训练流程。为便于理解和复现,DTS-PPO的训练参数汇总于表2中。

仿真结果
本节在Python仿真环境中对DTS-PPO进行了系统性评估。所有实验均使用固定的随机种子以确保结果可复现,所报告的指标均为多次独立运行后的平均值。

结论
本文提出了一种名为DTS-PPO的双时间尺度强化学习框架,用于无人机辅助移动边缘计算系统中无人机轨迹、任务卸载及资源分配的联合优化。DTS-PPO将轨迹规划与资源管理视为在不同时间尺度下运行的两个耦合马尔可夫决策过程。相应的学习组件各自维护独立的策略参数、滚动缓冲区及更新流程,同时通过共享的环境状态和分层奖励结构进行交互。

CRediT作者贡献声明
王书民:撰写——初稿、可视化、验证、软件实现、方法设计、形式分析、概念构思。吴俊华:撰写——审稿与编辑、指导、资金获取。李广顺:撰写——审稿与编辑、指导、资金获取。王铁林:撰写——审稿与编辑、指导。张新雷:撰写——审稿与编辑。

利益冲突声明
作者声明不存在任何可能影响本文研究结果的已知财务利益或个人关系。

伦理声明
作者声明本研究未涉及人类或动物实验对象。

王书民|吴俊华|李广顺|王铁林|张新雷
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号