← 最新论文
🤖 machine learning

Dynamic Multi-Depot Vehicle Routing with Online Requests: Event-Driven Transformer--DRL and Rolling-Horizon Benchmarking

本文提出了一种针对带有在线请求的动态多仓库车辆路径问题(Dynamic Multi-Depot Vehicle Routing Problem)的事件驱动型 Transformer 与深度强化学习(DRL)框架,并证明了虽然所学习的策略能够实现毫秒级的决策并能在无需重新训练的情况下迁移至更大规模的实例,但在路径质量方面仍逊于最近可行启发式算法,在服务响应能力方面仍逊于滚动时域优化器,从而凸显出没有任何单一方法能在效率、稳定性及计算指标的所有维度上都表现卓越。

原作者: Faezeh Ardali, Gerald M. Knapp

发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Faezeh Ardali, Gerald M. Knapp

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位庞大且混乱的管弦乐团的指挥,乐手们是送货卡车,乐谱是待派送的包裹清单,而观众则是充满顾客的城市。在“静态”路由的完美世界里,指挥在音乐会开始前就能预知每一个音符。但在现实世界的“动态”世界中,当卡车已经在街上行驶时,新的需求就会不断涌现。一位顾客打电话要求送货,或者出现了交通拥堵,亦或是卡车发生了故障。指挥必须在行进中即时重写乐谱,决定哪辆卡车应该去哪里,同时确保彼此不会发生碰撞,也不会让任何人等待太久。这就是车辆路径问题(VRP)的核心——一个经典的物流难题,尤其是当加入多个起点(仓库)和源源不断的订单流时,这个问题会变得异常复杂。科学家们一直试图教会计算机成为比人类调度员更出色的指挥,希望利用人工智能等先进工具来实时解决这一问题。

这篇论文步入了那个混乱的乐池,测试一种新型的指挥:一个能够学习进行瞬时决策的智能计算机程序。研究人员构建了一个数字模拟环境,其中的送货卡车从多个不同的仓库出发运行,且新请求会不可预测地到达。他们训练了两种类型的“神经网络”指挥——一种是简单的、反应迅速的思考者(MLP),另一种是更复杂的、擅长发现模式的天才(Transformer),以学习如何分配这些新请求。他们通过向AI展示优秀决策的范例(一种称为“行为克隆”的方法),然后让它们进行练习并调整策略(使用一种称为“PPO”的算法)来教导这些AI指挥。为了确保AI不会尝试做不可能的事(比如把一辆已经满载的卡车派去接更多的货),他们使用了一个“掩码”(mask)来屏蔽掉错误的选项,就像老师告诉学生:“你不能选那个答案,因为它已经被占用了。”

研究人员不仅是让AI进行游戏,还让它与另外三种类型的指挥进行了一场严苛的正面交锋:一种是仅仅选择最近卡车的简单基于规则的系统;一种是考虑了等待时间的复杂基于规则的系统;以及一种“滚动时界”(rolling horizon)优化器,后者试图在每次有新请求到达时都完美地解决整个谜题,但需要耗费大量的计算时间。他们还引入了一个特殊的规则——“路径承诺”(route commitment),这意味着一旦卡车正前往某位顾客处,AI就不能突然改变主意将其派往他处,这模拟了现实世界对稳定性的需求。

这场数字竞赛的结果令人惊讶,甚至让高科技的AI显得有些逊色。在20个不同场景的基准测试中,每种方法都成功完成了所有包裹的交付且未违反规则。然而,那个仅仅选择最近可行卡车的“简单”基于规则的系统赢得了比赛。它以最短的总行驶距离、最短的客户等待时间和最少的原计划变更次数完成了交付任务。而且,它完成得极快——每次决策仅需约0.156毫秒。那些花哨的AI指挥虽然在决策速度上极快(处于毫秒量级),却没能击败那个简单的规则系统。事实上,AI有时会让路径变得稍长,或者造成更多的混乱。即便是在面对那个试图通过每次重新计算最佳方案来表现得最聪明的“滚动时界”优化器时,后者虽然获得了最佳的等待时间,却付出了巨大的代价:它的计算时间过长,无法用于实时应用。

论文还测试了这些AI指挥处理更大规模需求的能力。研究人员在没有重新训练的情况下,将AI应用于包含30个、50个甚至80个请求的路径。AI成功处理了更大的群体而没有崩溃,证明了其具备扩展性,但它仍然无法超越简单的“最近卡车”规则。研究人员发现,虽然基于学习的系统是一个有能力的快速决策者,但在这种特定的复杂环境下,它并不具备超越那些经受过考验的、简单的启发式算法的“魔力”。这项研究得出结论:虽然基于学习的系统前景广阔且速度极快,但“最优”解并不总是最复杂的那个。有时,一个遵循既定计划并避免不必要变更的直截了当的、基于规则的方法,仍然是管弦乐团中最高效的指挥。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →