
-
生物通官微
陪你抓住生命科技
跳动的脉搏
强化学习引导的多目标轨迹规划在机器人操作器中的障碍物规避应用
《Scientific Reports》:Reinforcement learning-guided multi-objective trajectory planning for obstacle avoidance in robotic manipulators
【字体: 大 中 小 】 时间:2026年09月14日 来源:Scientific Reports 4.9
编辑推荐:
摘要 在杂乱环境中工作的机器人操作器需要能够避开碰撞的轨迹,并且这些轨迹必须在运动学和动力学约束下仍然能够执行。本文提出了一种基于强化学习(RL)的多目标轨迹规划框架,称为RL-MOP-HNE,适用于6自由度的UR5操作器。该规划模型在满足避碰、运动学和动力学约束的同时,同时最
在杂乱环境中工作的机器人操作器需要能够避开碰撞的轨迹,并且这些轨迹必须在运动学和动力学约束下仍然能够执行。本文提出了一种基于强化学习(RL)的多目标轨迹规划框架,称为RL-MOP-HNE,适用于6自由度的UR5操作器。该规划模型在满足避碰、运动学和动力学约束的同时,同时最小化路径长度、能耗和执行时间。一个基于表格的SARSA智能体被嵌入到进化搜索过程中,根据当前的优化状态自适应地选择搜索行为。为了改善探索与利用之间的平衡,该框架结合了高斯扰动自适应混合交叉算子和层次化邻域进化(HNE)策略,从而在整个搜索过程中逐步优化种群质量。在三个具有逐渐增加规划复杂性的典型环境中对所提出的方法进行了评估,包括单障碍物、狭窄的三障碍物和不规则五障碍物场景,并将其与MOEA/D、MOPSO、MSCLPSO、NSGA-II和RL-NSGA-II进行了比较。实验结果表明,RL-MOP-HNE在所有测试案例中都能生成可行的轨迹,并在所比较的算法中实现了最低的动态稳定性优先综合评分。规划出的轨迹具有更平滑的关节运动和更低的速度波动,尽管这些改进通常伴随着更长的执行时间。包括时间尺度分析、可操作性评估、统计显著性测试和消融研究在内的补充分析进一步解释了所提出框架的性能特点,并量化了其关键组件的贡献。因此,该框架非常适合那些运动稳定性和动态可行性比最小时间操作更为重要的机器人应用。