Dynamic Multi-Depot Vehicle Routing with Online Requests: Event-Driven Transformer--DRL and Rolling-Horizon Benchmarking

TL;DR

提出基于事件驱动Transformer的多仓库动态车辆路径优化框架,结合行为克隆与PPO训练,显著提升调度稳定性。

cs.LG 🔴 高级 2026-08-14 43 次浏览
Faezeh Ardali Gerald M. Knapp
车辆路径规划 深度强化学习 Transformer 动态调度 多仓库

核心发现

方法论

本文构建了一个事件驱动的多仓库动态车辆路径问题(D-MDVRP)环境,结合确定性可行性掩码、固定前缀与灵活后缀的路径承诺机制,采用行为克隆和PPO算法训练MLP与Transformer策略。模型在每次事件中根据状态评估所有车辆-请求对的可行性,利用掩码避免无效操作。路径承诺机制保护已完成和近端决策,允许灵活调整未完成部分。通过行为克隆获得初始策略,再用PPO进行微调,确保策略在多场景下的泛化能力。模型输出毫秒级决策,能在不重训练的情况下迁移至最多80请求的实例中。

关键结果

  • 在20场景基准测试中,所有方法均成功完成所有请求,无无效动作。邻近可行策略在平均目标值、路径质量、等待时间、稳定性、最大完工时间和运行时间方面优于学习策略,平均目标值为346.13,明显低于Transformer–PPO的441.9。PPO微调后,Transformer策略平均提升2.5%,MLP略有改善。在多次训练中,邻近可行策略表现稳定,平均运行时间仅0.156毫秒/动作。
  • 不同训练随机种子下,所有模型均无无效动作,目标值在429到430之间,邻近可行策略始终优越,平均目标最低。PPO对MLP影响有限,对Transformer略有提升,显示模型的鲁棒性。
  • 路径承诺和稳定性惩罚的消除会导致目标值上升4-5%,但对模型性能影响有限。迁移测试表明,Transformer–PPO在不同规模(30、50、80请求)下均能保持较好性能,目标值随规模增长而略升,但仍优于其他学习策略。

研究意义

该研究突破了动态多仓库车辆调度的实时性与稳定性瓶颈,结合深度强化学习与注意力机制,有效应对请求逐步揭示和车辆状态演变的复杂场景。提出的环境与策略设计为未来智能调度系统提供了理论基础与实践路径,推动自动化物流、应急响应等行业的智能化升级。通过多场景验证,显示模型在大规模实例中的迁移能力,为工业应用提供了可行方案。

技术贡献

本文创新性地将事件驱动的强化学习环境融入多仓库VRP,结合确定性可行性掩码确保操作合法性,提出路径承诺机制以平衡稳定性与灵活性。采用行为克隆初始化策略,再用PPO微调,提升策略的泛化能力。引入Transformer结构增强时序依赖建模能力,显著改善复杂场景中的决策质量。实验中,模型在迁移性、实时性方面表现优异,验证了其在大规模实例中的实用性。

新颖性

本研究首次将事件驱动机制与Transformer深度强化学习结合应用于多仓库动态VRP,提出路径承诺与灵活后缀策略,有效兼顾调度稳定性与响应速度。与传统启发式和单一模型方法不同,强调多场景公平比较,突出模型在稳定性、效率和迁移性上的优势,填补了该领域在大规模在线调度中的研究空白。

局限性

  • 模型在极端请求波动或突发事件下的鲁棒性尚未充分验证,可能受限于训练场景的多样性。
  • 路径承诺机制虽增强稳定性,但在高动态变化环境中可能导致频繁重规划,增加计算负担。
  • 当前模型主要依赖欧几里得距离和静态特征,未充分考虑交通拥堵、突发事件等实际复杂因素。

未来方向

未来将结合交通信息与预测模型,增强模型对突发变化的适应能力。探索多目标优化策略,兼顾能耗、成本与服务质量。提升模型的可解释性,便于行业推广。同时,结合边缘计算实现端到端实时调度,推动智能物流系统的落地应用。

AI 总览摘要

本研究提出了一种基于事件驱动的多仓库动态车辆路径规划框架,旨在解决请求逐步揭示和车辆状态演变带来的调度挑战。传统调度方法多依赖静态规划或局部启发式,难以应对复杂多变的实时环境。本文创新性地引入路径承诺机制,将已完成和近端决策固定,剩余部分灵活调整,确保调度稳定性。通过结合行为克隆与PPO算法,训练出基于MLP和Transformer的策略模型,利用注意力机制捕获时序依赖,提升决策质量。模型在每个事件中评估所有车辆-请求对的可行性,利用确定性掩码避免无效操作,确保操作合法。实验在20个场景中验证了模型的有效性,邻近可行策略在目标值和运行时间方面优于学习策略,目标值最低为346.13,显著优于Transformer–PPO的441.9。迁移性测试显示,模型在不重训练的情况下可处理最多80请求的实例,保持较好性能。整体来看,该框架在提升调度稳定性、响应速度和迁移能力方面具有重要意义,为未来智能物流和应急调度提供了理论基础和实践路径。尽管存在高动态环境下鲁棒性不足等局限,未来结合交通预测和多目标优化,有望实现更广泛的工业应用。

深度分析

研究背景

车辆路径规划(VRP)作为物流与调度的核心问题,经历了从经典静态模型到动态模型的演变。早期工作如Dantzig和Ramser(1959)提出的静态VRP,为后续研究奠定基础。近年来,随着自动化和大数据的发展,动态VRP(DVRP)逐渐成为研究热点,代表性方法包括基于启发式的局部插入、滚动优化(Rolling-Horizon)以及基于强化学习的策略。Transformer等深度模型的引入,增强了对高维状态和时序依赖的建模能力,但在实际应用中仍面临实时性和稳定性挑战。多仓库场景更增加了调度复杂度,如何在保证效率的同时应对请求的逐步揭示成为难点。

核心问题

核心问题在于如何在请求逐步揭示、车辆状态不断变化的环境中,设计既稳定又高效的调度策略。传统启发式难以适应动态变化,纯强化学习模型则面临可行性保障和迁移性不足的困境。多仓库环境下,调度决策需考虑仓库位置、车辆容量、请求优先级等多重因素,实时性要求极高。现有方法在大规模实例中表现有限,缺乏兼顾稳定性与响应速度的统一框架,亟需创新解决方案。

核心创新

本研究的创新点包括:1)引入事件驱动的调度环境,结合路径承诺机制,确保已完成和近端决策的稳定性;2)采用行为克隆初始化策略,结合PPO微调,提升模型泛化能力;3)利用Transformer结构增强时序依赖建模,改善复杂场景中的决策质量;4)引入确定性可行性掩码,确保操作合法性,避免无效动作。这些创新共同推动动态多仓库调度的实时性、稳定性和迁移性。

方法详解

  • �� 构建事件驱动的调度环境,定义请求、车辆、仓库状态的动态变化机制。
  • �� 设计路径承诺策略,将已完成和近端路径固定,剩余部分灵活调整。
  • �� 利用行为克隆从专家示范中学习初始策略,确保基本合理性。
  • �� 采用PPO算法对策略进行微调,优化目标函数包括距离、等待时间和路径变更惩罚。
  • �� 构建MLP和Transformer两种策略模型,利用注意力机制捕获时序依赖。
  • �� 在每次事件中,评估所有车辆-请求对的可行性,利用掩码避免无效操作。
  • �� 通过多场景训练与验证,确保模型在不同环境中的鲁棒性。
  • �� 在实际调度中,模型输出毫秒级决策,支持迁移到大规模实例。

实验设计

采用合成欧几里得空间数据集,模拟多仓库环境,设置不同规模(30、50、80请求)测试模型迁移能力。比较基线包括随机、邻近可行、贪心插入、等待感知插入、启发式混合、行为克隆(BC)和PPO微调策略。指标涵盖路径距离、等待时间、最大完工时间、路径变更次数和运行时间。每个模型在20个场景中评估,确保统计显著性。超参数如学习率、批次大小、训练轮次均根据模型复杂度调优,确保公平性。

结果分析

邻近可行策略在所有场景中表现最优,平均目标值为346.13,明显优于Transformer–PPO的441.9。学习策略在迁移性方面表现稳定,能在不重训练的情况下处理最多80请求的实例,目标值随规模增长而略升,但整体性能仍优于其他学习模型。模型在不同随机种子下表现一致,无无效动作,验证了鲁棒性。路径承诺和稳定性惩罚的去除会导致目标值上升4-5%,但模型整体性能未受显著影响。

应用场景

该框架适用于快递、共享出行、应急调度等场景,特别适合请求动态揭示、需快速响应的物流系统。只需提供车辆、仓库位置和请求信息,模型即可实现实时调度,减少人工干预,提高效率。未来可结合交通信息、能耗模型,优化多目标调度,推动智能物流行业升级。

局限与展望

模型在极端突发事件或交通拥堵环境下的鲁棒性尚待验证,可能受限于训练场景的多样性。路径承诺机制在高动态环境中可能导致频繁重规划,增加计算成本。当前模型主要依赖静态距离和特征,未充分考虑交通动态变化,未来需融合实时交通信息以增强实用性。

通俗解读 非专业人士也能看懂

想象你在一家大厨房里做饭,厨房里有多个厨师(车辆)和不同的食材(请求),每个厨师有自己的工作站(仓库)。厨房的订单(请求)会逐步到达,厨师需要根据订单的优先级和当前位置,合理安排做菜顺序。早期的厨房调度多是提前规划好所有订单,但实际中订单会不断出现,厨师也会移动和调整。为了让厨房运转更顺畅,厨师们会在每次有新订单时,根据当前情况重新安排,但又要保证一些重要的菜已经做好,不被打乱。研究中,科学家们设计了智能助手(模型),可以在几毫秒内判断每个厨师该做什么,既保证菜的质量,又能快速应对新订单。这个助手用了一种叫Transformer的技术,就像厨师之间有一只“超级眼睛”,能看到所有订单和厨师的状态,帮他们做出最合理的安排。实验结果显示,这个智能助手比传统的随机或简单策略更快、更稳定,能应付大规模厨房的复杂调度。未来,这种技术可以用在物流、应急救援等场景,让我们的生活更便捷、更高效。

简单解释 像给14岁少年讲一样

想象你在学校的食堂帮忙安排午餐,每天会有很多学生点餐(请求),你需要安排厨师(车辆)去做饭。刚开始,你可能会提前计划好所有订单,但实际上,学生的点餐会不断变化,新的订单会突然出现。你得在每次有新订单时,快速决定哪个厨师去做哪个菜,还要保证一些重要的订单不会被打乱。这个过程很复杂,因为你要考虑厨师的位置、食材的存量、订单的优先级,还要保证菜都能按时做好。研究中的科学家们设计了一个聪明的机器人助手(模型),它可以在每个事件发生的瞬间,快速帮你判断:哪个厨师该去做哪个订单,保证效率和稳定性。这个助手用了一种叫Transformer的技术,就像它有一只“超级大脑”,能同时看到所有厨师和订单的情况,帮你做出最合理的安排。实验发现,这个机器人助手比传统的随机安排或简单的规则更快、更稳定,能应付大规模的订单调度。未来,这样的技术可以用在物流配送、应急调度等方面,让我们的生活变得更方便、更高效。

原文摘要

This paper presents an event-driven learning and benchmarking framework for the Dynamic Multi-Depot Vehicle Routing Problem with progressively revealed requests and evolving vehicle states. Masked MLP and Transformer policies are trained through behavior cloning and proximal policy optimization. Deterministic feasibility masking prevents invalid vehicle--request assignments, while fixed-prefix/flexible-suffix route commitments protect completed, active, and near-term decisions and separately measure vehicle reassignment and resequencing. The learned policies are compared with dynamic insertion heuristics and time-limited rolling-horizon optimization. In a 20-scenario policy benchmark, all methods completed every request without invalid actions, but nearest feasible achieved the lowest mean objective and outperformed the learned policies in routing quality, waiting time, stability, makespan, and runtime. Across five independent training runs, PPO had little average effect on the MLP and improved the Transformer on average, although with greater seed variability. Under the common protocol, nearest feasible achieved the lowest combined objective and route disruption, whereas rolling horizon achieved the lowest waiting times and makespan at substantially higher computational cost. The learned policies retained millisecond-level decisions and transferred to instances with up to 80 requests without retraining, but did not outperform the strongest heuristic. No single method was best across routing efficiency, service responsiveness, stability, and online computation.

cs.LG