《European Journal of Operational Research》:Deep Reinforcement Learning for path planning and storage policy in automated warehouses
编辑推荐:
•提出了一个GRU-Attention深度强化学习(DRL)框架,用于3D仓库中AGV路径规划与存储分配的联合优化。•在Actor-Critic框架中建模动态优先级、周转率、重量和实时交通流量,以减少拥堵。•在真实和合成数据集上,总成本比启发式方法和近期DRL基线方法最多降低
- •
提出了一个GRU-Attention深度强化学习(DRL)框架,用于3D仓库中AGV路径规划与存储分配的联合优化。
- •
在Actor-Critic框架中建模动态优先级、周转率、重量和实时交通流量,以减少拥堵。
- •
在真实和合成数据集上,总成本比启发式方法和近期DRL基线方法最多降低19.6%。
- •
发现半圆形存储策略优于其他方案,路径更短且阻塞更少。
引言
随着电子商务的快速发展,物流与运输行业已成为现代经济的关键支柱。高效的物流系统不仅能降低运营成本,还能增强企业的竞争优势(Fernandez-Viagas, 2025)。在物流系统的各个组成部分中,精心规划的仓储管理尤为关键,因为其运营效率直接影响供应链的整体表现。车辆路径问题(VRP)是物流与运输领域的经典优化问题,旨在设计合理的车辆路线计划,在满足客户需求的同时最小化运输成本(James et al., 2019)。由于其广泛的适用性,VRP存在于许多实际场景中,从城市配送到仓库管理。
近年来,许多仓库采用了先进的仓库管理系统(WMS),如自动化存储与检索系统(AS/RS)和自动导引车(AGV)。这些技术的应用提高了仓库的存储与运输能力,但同时也带来了新的挑战。现代仓库通常采用多层货架系统,存储货物需要在三维(3D)空间中进行路径规划(Su et al., 2023)。在存储阶段优化货物的存储节点以促进高效存储并最小化资源消耗已成为一个主要的研究焦点(Tian et al., 2024)。
尽管对VRP的研究广泛,但大多数研究集中在二维空间中的路径规划,很少考虑货物的存储优先级和动态需求。在实际的仓库应用中,存储节点分布在3D空间中,货物类型和运输需求可能动态变化。为节省存储空间,通常将多个相同类型的小件货物存储在一个位置,需要一个存储节点有效地容纳大量货物;这在传统VRP中转化为各种客户需求(Schiffer et al., 2022)。
如图1所示,单个运输过程现在必须同时优化车辆路线和包裹(货物)到存储节点的分配。货物的运输与存储通常涉及以下阶段:
- (s1)
货物卸载:货物首先卸载到分拣平台。
- (s2)
货物分配:WMS将货物分配给每台AGV。
- (s3)
AGV运输、存储与返回:AGV运输并存储货物,然后返回分拣平台等待下一次运输序列。
流程从货物卸载(S1)开始,货物到达并由工人放置在分拣平台上。在货物分配(S2)阶段,深度强化学习(DRL)框架联合优化存储节点分配和AGV路由路径。最后,在AGV运输、存储与返回(S3)阶段,AGV执行优化后的路径。S3阶段代表仓库内运营成本的主要来源。每件货物的存储位置直接影响AGV的行驶距离。货物的周转频率和物理重量会影响运输过程中的仓库运营成本。因此,考虑存储优先级和运输成本的优化方法对于确保周转率高的较重货物存储在靠近仓库平台的位置以减少运营成本至关重要(Hübner et al., 2021)。
本文研究了轻量级小体积货物的聚类,使多个货物可以存储在一个位置,并研究不同存储策略如何影响VRP中的仓库结构。货物聚类通过将相同类型的包裹存储在一个位置来降低货架空间使用率(Albán et al., 2023)。在VRP中,调整AGV的拣货路线以适应各节点的需求可以减少AGV行驶距离。DRL通过学习状态与动作之间的关系来生成高效的路由解决方案,在解决复杂优化问题方面显示出强大的潜力。DRL在具有动态需求的3D仓库环境中的应用仍然具有挑战性且研究不足。仓库具有复杂的空间结构,面临不断变化的存储需求。存储系统必须考虑各种因素,如存储优先级、货物的周转率以及可用存储节点的波动(Zhang et al., 2023)。为应对这些挑战,我们开发了能够动态适应不断变化的存储需求并实时优化存储策略的DRL算法。因此,本研究致力于开发一种DRL优化器来解决3D空间中的VRP。我们做出了以下几项贡献:
- 1.
提出了一种新的VRP模型,将3D路径规划与货物存储优先级相结合,并提供一个框架来同时优化车辆路由和存储分配。
- 2.
提出了一种集成门控循环单元(GRU)-注意力网络的DRL框架,通过结合策略梯度和价值估计来解决复杂仓库环境中的路径规划问题,提高了计算效率和优化性能。
- 3.
大量的数值实验表明,GRU-Attention方法始终优于现有方法和传统算法,大幅降低运输成本和拥堵,同时提高整体运营效率。
- 4.
在多种存储策略和仓库布局下的大量评估表明,存储策略和结构设计影响AGV路由性能和瓶颈,为仓库规划和优化提供了实用指导。
本文其余部分安排如下。第2节回顾文献。第3节详细说明研究问题。第4节详细阐述所提出的GRU-Attention网络。第5节通过实验验证所提方法的有效性并与其他方法进行对比。第6节总结。
章节摘要
文献综述
本节涉及仓库优化中的两个研究方向。第一个方向涵盖旨在提高复杂仓库环境中路由效率的模型和算法。第二个方向涉及存储策略设计及其与路由决策的集成,特别是存储策略对路由复杂度和系统性能的影响。
问题描述
VRP旨在确定一组最优的车辆路线,以满足多个客户需求同时最小化运输成本。
方法论
我们基于数学模型描述GRU-Attention网络和训练过程。
实验设置
本节描述模型训练期间的实验设置,包括数据集处理、模型超参数和训练环境。
结论
本研究通过提出一个集成存储优先级与动态路径规划的GRU-Attention网络框架来解决3D仓库环境中的VRP。实验验证表明所提方法的实际适用性,在运营效率方面相比现有方法取得了可衡量的改进。在不同仓库规模和存储策略下的稳定表现表明,该框架可作为开发
CRediT作者贡献声明
Hanzhao Wu:原创撰写、验证、软件、方法论、调查研究、形式化分析、数据管理、概念化。Zhenyong Wu:审阅与编辑、原创撰写、监督、资源、项目管理、调查研究、获取经费、数据管理、概念化。Wenyan Song:审阅与编辑、监督、方法论、概念化。Mark Goh:审阅与编辑、监督、资源、调查研究,
利益冲突声明
作者声明他们没有已知的竞争性经济利益或个人关系可能影响本论文报告的工作。
致谢
本工作由江苏省社会科学基金(项目编号 24TQB002)、中国航空科学基金 [ASFC-2024Z066109001]、江苏省高校哲学社会科学研究基金(项目编号 2022SJYB0183)、江苏省高层次创新创业人才引进计划 [JSSCB20210481]以及南京信息工程大学种子研究基金资助。
Hanzhao Wu|Zhenyong Wu|Wenyan Song|Mark Goh|Yuan Wang