技术摘要:用于多任务车辆路径规划求解器的 LLM-as-Trainer (LaT)
1. 问题陈述
车辆路径问题 (VRP) 涵盖了广泛的组合优化变体(例如:带容量限制的 VRP、带时间窗的 VRP、回程约束 VRP)。虽然基于深度强化学习的神经求解器在高效生成可行解方面已展现出潜力,但早期的研究方法通常需要为每种特定的约束组合训练单独的模型。这种缺乏可扩展性的问题在现实应用中非常突出,因为 VRP 的变体种类超过 60 种。
多任务神经求解器旨在将这些变体统一在一个模型中,以避免重复训练。然而,一个重大的挑战仍然存在:不同的 VRP 变体具有不同程度的优化难度。现有的多任务训练方法通常通过损失函数或梯度平衡来协调共享参数,但缺乏关于不同任务在训练期间相对性能的显式阶段性反馈 (stage-wise feedback)。因此,模型可能会向较简单的变体产生偏差,从而限制了整体解的质量。虽然元学习提供了自适应训练,但它通常依赖于双层优化 (bi-level optimization),这会带来巨大的计算成本和额外的梯度更新。
2. 方法论:LLM-as-Trainer (LaT)
作者提出了 LaT (LLM-as-Trainer),这是一种即插即用的训练范式,利用预训练的大语言模型 (LLM) 作为外部训练器,来调节多任务神经求解器的联合训练。其核心创新在于使用 LLM 来分析跨任务验证指标,并生成一个阶段性指导向量 (stage-wise guidance vector),而无需修改求解器的架构,也不需要双层优化。
2.1 训练框架
LaT 运行在标准的自回归 Transformer 编码器-解码器架构(如 POMO、CaDA、ReLD)之上,但在每个编码器层引入了一个轻量级的侧支 (side branch)。其流程如下:
- 跨任务验证: 在预定义的间隔(每 Tctrl 个 epoch)进行评估,针对所有 16 种 VRP 变体在固定的验证集上测试当前的策略。
- 状态构建: 系统计算每个任务 k 相对于预计算参考解(由 HGS 或 OR-Tools 生成)的相对参考差距 (relative reference gap) (ηr,k)。同时,它还会追踪该差距的变化量 (Δηr,k) 并维护近期验证记录的历史记录。
- LLM 指导生成: 将这种结构化的训练状态(包括任务约束、当前差距、差距变化及历史趋势)格式化为提示词 (prompt),并输入到冻结的预训练 LLM(实验中特指 GLM-5.1)中。LLM 输出一个 5 维的指导向量 γr=[γC,γO,γB,γL,γTW],其中每一维对应一种基本约束(容量、开放路径、回程、路径长度、时间窗)。
- 注入求解器: 在随后的训练 epoch 中,指导向量 γr 与当前任务的二进制约束向量 zk 进行拼接。该组合向量被注入到每一个编码器层的轻量级侧支中。侧支的输出通过一个可学习系数 α 被加回到主干网络 (backbone) 的输出中。
- 策略优化: 使用标准的策略梯度方法(如 POMO 式)更新求解器。LLM 不接收梯度,且在推理过程中不会被调用。
2.2 推理
训练结束后,最终的指导向量被固定,LLM 被移除。部署的求解器仅保留学习到的侧支和固定的指导向量,不需要 LLM API 调用,且引入的计算开销微乎其微。
3. 核心贡献
本文强调了三个主要贡献:
- 新颖的训练范式: LaT 是第一个专门为多任务车辆路径求解器引入预训练 LLM 作为外部训练器的训练范式。它显式地将跨任务验证性能纳入了策略优化循环中。
- 轻量级指导机制: 作者设计了一种从验证指标生成阶段性指导向量的机制。该向量与任务约束相结合并注入编码器层,在提供额外训练信息的同时,避免了双层优化或内层更新带来的计算负担。
- 即插即用的通用性: 该方法旨在与现有的神经求解器(在 ReLD 和 CaDA 主干上进行了验证)集成,而无需改变核心自回归策略或解码器架构。
4. 实验结果
实验在由五种基本约束组成的 16 种 VRP 变体上进行,问题规模分别为 50 和 100 个节点。
- 在已训练变体上的表现: 与其主干模型相比,LaT 变体(LaT-ReLD 和 LaT-CaDA)在所有六个训练变体中均一致实现了更低的相对参考差距。例如,LaT-CaDA 将训练变体的平均差距从 1.810% 降低到了 1.669%。
- 零样本泛化能力: 在剩余的十种未见过的 VRP 变体上,LaT 展示了强大的泛化能力。在所有 20 个未见设置(50 和 100 节点)中,LaT-CaDA 的表现均优于基准模型 CaDA,将平均差距从 5.490% 降低至 5.067%。
- 与 SOTA 的对比: 与其他最先进的多任务求解器(如 MVMoE、CCL、PoMtVRS)相比,LaT 变体在大多数设置下都取得了最低的差距。
- 效率: 该方法引入的推理时间开销极小(50 节点实例仅增加 3–4 秒),与主干模型相当。由于是周期性调用 LLM,训练时间增加不到 1.5%。
- 消融实验:
- 移除 LLM 生成的指导(替换为固定向量)会导致性能下降,证实了自适应指导的价值。
- 移除任务约束向量也会导致性能恶化,表明了显式任务信息的重要性。
- 用基于 MLP 的指导生成器替换 LLM 会导致更高的差距,这表明性能提升源于 LLM 的推理能力,而非仅仅是增加了模型容量。
- 在每个编码器层注入指导(LaT EncAll)被证明优于仅在输入、输出或解码器上下文处注入指导。
5. 意义与主张
本文主张 LaT 通过显式响应当前的跨任务性能差异,有效地解决了现有多任务求解器的局限性。通过利用冻结的 LLM 作为周期性的“训练器”,该方法提供了阶段性反馈,引导神经求解器在不同难度的变体之间实现学习平衡。
作者强调,LaT 在提高已训练变体和未见变体解质量的同时,保持了推理效率。作者指出,虽然 LaT 显示出持续的改进,但其有效性可能取决于特定的主干架构(例如,在未见变体上,LaT-CaDA 比 LaT-ReLD 表现出更一致的增益)。论文总结道,这种方法为复杂的约束场景提供了一种通用且有效的训练范式,尽管未来的工作可以探索更广泛的约束集以及在不同求解器间更一致的指导机制。