评估深度演员-评论家方法在移动操作臂轮式地形交互路径规划中的应用

《Mathematics》:Evaluating Deep Actor–Critic Methods for Path Planning of Mobile Manipulators Under Wheel–Terrain Interaction

【字体: 时间:2026年09月04日 来源:Mathematics 2.3

编辑推荐:

   摘要 强化学习(RL)

  

摘要

强化学习(RL)已成为一种有效的范式,使自主机器人能够通过与复杂且不确定环境的互动直接获取导航策略。然而,对于滑移转向移动机械手(Skid-Steer Mobile Manipulators, SSMMs)而言,自主路径规划仍然是一个具有挑战性的问题,因为这需要同时控制非完整约束的移动底座和机械手,并考虑避障以及轮子与地面的交互效应。本文提出并评估了基于RL的SSMM路径规划策略,明确地将移动平台和机械手的耦合动力学纳入考虑,以在变化的地形条件下生成无碰撞的轨迹。所提出的框架采用了一种考虑到滑移的奖励机制,该机制会对指令动作与实际机器人动作之间的差异进行惩罚,同时考虑了由轮子与地面交互引起的纵向和横向滑移。主要贡献包括:i) 基于Actor-Critic技术的统一RL框架,用于SSMM路径规划,将移动底座和机械手的动力学整合到一个耦合系统中表示中;ii) 考虑物理特性的多目标奖励机制,将轮子与地面的交互纳入策略学习中;iii) 通过仿真和现场验证,在逐渐复杂的导航条件及真实的地下采矿场景中实施所提出的策略。该框架使用了四种RL算法,在来自真实采矿场景的多种环境和地图上进行了评估,涵盖了多种导航条件和从起点到终点的配置。评估的方法包括深度确定性策略梯度(Deep Deterministic Policy Gradient, DDPG)、近端策略优化(Proximal Policy Optimization, PPO)、软Actor-Critic(Soft Actor-Critic, SAC)和双延迟DDPG(Twin Delayed DDPG, TD3)。实验结果表明,SAC实现了最短的规划时间,与PPO、TD3和DDPG相比,规划时间分别减少了127.3%、24.1%和2.52%。SAC还实现了最短的路径长度,与PPO、DDPG和TD3相比,平均路径长度分别减少了20.32%、8.58%和1.90%。此外,SAC为移动底座和机械手臂生成了更平滑的控制曲线,而TD3在多个导航指标上表现出竞争力。所提出的框架展示了基于滑移意识的RL在协调SSMM导航中的潜力,为提高暴露在复杂采矿环境中的移动机械手的运行安全性、能源效率和操作自主性提供了实用的基础。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号