← 最新论文
🤖 machine learning

Preserve Support, Not Correspondence: Dynamic Routing for Offline Reinforcement Learning

本文提出了 DROL,一种通过“动态路由”机制训练的单步离线强化学习策略,它通过将数据集动作动态分配给最接近的候选动作进行学习,解决了传统提取方法在追求高 Q 值与保持数据支持度之间难以兼顾的问题。

原作者: Zhancun Mu, Guangyu Zhao, Yiwu Zhong, Chi Zhang

发布于 2026-04-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhancun Mu, Guangyu Zhao, Yiwu Zhong, Chi Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

1. 背景:离线学习的“死板教条”

想象一下,你正在训练一个自动驾驶外卖小哥。你不能让他直接上街乱跑(因为会撞车,这叫“离线”环境),你只能给他看一堆**“老司机驾驶记录”**(这就是数据集)。

现在的难题是:
老司机们在同一个路口,有时候会左转,有时候会右转(这就是“多模态”行为)。

  • 旧的方法(Pointwise Correspondence): 就像是给小哥发了一本极其死板的教条。教条说:“如果你抽到了编号为 1 的指令,你就必须模仿编号为 1 的老司机;如果你抽到了编号为 2 的指令,你就必须模仿编号为 2 的老司机。”
  • 问题在哪? 如果编号 1 的老司机虽然走得稳,但其实走了一条绕远的路;而编号 2 的老司机走了一条更近的捷径。旧方法会强迫小哥在“模仿老司机”和“走捷径”之间左右为难,最后小哥可能会因为想兼顾两者,结果走了一条既绕远又危险的中间路线

2. DROL 的核心思想:从“死记硬背”到“动态分工”

DROL 的出现,把这种“死板的对应关系”变成了**“动态的责任分配”**。

我们可以把 DROL 想象成一个“外卖配送团队”:

在训练时,我们不再只派一个“小哥”去学习,而是派了一组**“候选小哥”**(Candidate Set)同时在练习。

  1. 动态认领任务(Dynamic Routing):
    当一个真实的订单(数据集里的动作)出现时,我们不强求某个特定的候选小哥去接。相反,我们看这组小哥里,谁离这个订单最近,谁就负责接这个单

    • 比喻: 路上突然来了一个订单,团队里有 16 个小哥。我们不规定“小哥 A 永远送 1 号单”,而是看谁离 1 号单最近,就让谁去送。
  2. 责任转移(Responsibility Transfer):
    这是最神奇的地方!如果“小哥 A”原本负责某个区域,但他发现自己练得不够好,或者“小哥 B”练得更厉害、离那个区域更近了,那么这个区域的“接单权”就会自动转移给小哥 B

    • 比喻: 以前这个片区由小哥 A 管,但小哥 B 练成了“片区专家”,以后这个片区的单子就自动归小哥 B 管了。
  3. 既要稳,又要快(BC + Q-improvement):
    接单的小哥有两个任务:第一,要像老司机一样稳(行为克隆 BC);第二,要尝试找更快的路(Q值优化)。
    因为有了“团队分工”,如果小哥 A 想尝试走捷径,他可以大胆地去试。即使他试错了,或者走得偏了,没关系,其他的候选小哥还在原地守着“老司机路线”,保证了安全性


3. 总结:DROL 到底牛在哪里?

用一句话总结:它不再强迫每一个样本都必须死磕一个特定的老师,而是让一群候选者通过“谁近谁负责”的规则,共同维护住数据的边界。

  • 以前的方法(FQL等): 像是一个学生在背诵标准答案,一旦答案和实际情况有冲突,学生就懵了。
  • DROL 方法: 像是一个灵活的团队,大家各司其职。有人负责守住底线(模仿数据),有人负责探索高分(优化路径)。当有人探索成功时,团队的整体水平就提升了,而底线依然稳固。

最终效果:
在复杂的模拟环境(如 OGBench)中,DROL 表现得非常出色。它既保留了“单步推理”的快(就像一个熟练工直接上手,不需要反复思考),又拥有了“多步思考”的聪明(能找到更优的路径),而且运行成本非常低。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →