← 最新论文
🤖 machine learning

Long-Horizon Model-Based Offline Reinforcement Learning Without Explicit Conservatism

本文介绍了 NEUBAY,这是一种基于模型的长视野离线强化学习算法,它用贝叶斯视角取代了显式的保守性,从而有效处理认知不确定性,并在多种数据集上实现了最先进的性能。

原作者: Tianwei Ni, Esther Derman, Vineet Jain, Vincent Taboga, Siamak Ravanbakhsh, Pierre-Luc Bacon

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Tianwei Ni, Esther Derman, Vineet Jain, Vincent Taboga, Siamak Ravanbakhsh, Pierre-Luc Bacon

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人穿过房间。你拥有一个巨大的其他机器人行走的视频库,但你不能让你的机器人在现实世界中练习,因为它可能会摔倒并损坏某些东西。这就是离线强化学习的世界:仅从过去经验的静态数据集中学习。

多年来,从这些视频中教导机器人的标准建议一直是"极度谨慎"。

旧方法:“安全第一”策略

大多数以前的方法就像一个神经质的家长。它们会说:“如果机器人看到了视频库中未曾出现的情况,我们必须做最坏的打算。不要尝试任何新事物,否则你可能会撞毁。”

  • 隐喻:想象你仅凭一张小街区的地图开车。如果你看到一条地图上未标注的道路,“谨慎”的做法会说:“停下!那条路很危险。待在已知的街道上。”
  • 问题:如果地图完美无缺,这招很管用;但如果地图漏掉了一条通往更好目的地的捷径,谨慎的驾驶员就永远找不到它。他们会陷入“安全但平庸”表现的循环中。

新想法:“贝叶斯侦探”

这篇论文的作者NEUBAY提出了一个不同的问题:如果我们不再如此悲观,而是像一个随着进程更新信念的侦探那样行事,会怎样?

贝叶斯方法不再对未知做最坏的假设,而是说:“我不确切知道世界如何运作,但我有一组可能性范围。让我们随着移动去弄清楚哪种可能性是真实的。”

  • 隐喻:想象你在一个黑暗的房间里拿着手电筒。“谨慎”的方法因为看不清整个房间而拒绝移动。“贝叶斯”方法则说:“我会迈出一小步,打开手电筒,看看那里有什么,并更新我的心理地图。如果看到墙,我就转弯;如果看到路,我就前进。”
  • 结果:在视频库杂乱无章或不完整(低质量数据)的情况下,这种侦探方法在寻找最佳路径方面要出色得多,因为它愿意探索未知,而不仅仅是固守已知。

大挑战:“幻觉”陷阱

这里有个陷阱。当你不再谨慎时,你就有产生幻觉的风险。

  • 隐喻:如果你试图基于一个不稳定的猜测来预测 100 步之后会发生什么,你的预测很快就会变成幻想。这就像和自己玩“传话游戏”;到了第 50 步,信息已经完全错误了。
  • 论文的洞察:作者发现,为了避免这些幻觉而不过度谨慎,你实际上需要想得更长远,而不是更短。
    • 为什么? 如果你只考虑未来 5 步,你就必须猜测第 6 步会发生什么。如果你考虑未来 500 步,那么最末端的“猜测”会被打折(它变得不那么重要),而计划开头那些真实、已知的数据则占据更大权重。
    • 类比:这就像规划一次公路旅行。如果你只规划 10 英里,你可能会因为没看到 20 英里外的路标而驶入死胡同。如果你规划了整个旅程,你就能提前看到死胡同并避开它,即使你的地图有点模糊。

NEUBAY 如何解决它

作者构建了一个名为NEUBAY的系统,它结合了三个巧妙的技巧,使这种“长期思考”成为可能,而不会导致机器人撞毁:

  1. “不确定性减速带”:机器人不是硬性停止,而是检查自己的信心。如果它开始对地形感到不确定(高不确定性),它就会停止规划那条特定路径。这就像徒步者在小径变得太雾时停下脚步,而不是完全拒绝徒步。
  2. “稳定器”(层归一化):他们在机器人的大脑中加入了一个数学上的“减震器”。这防止了机器人在想象长序列事件时,其预测失控螺旋上升。它让机器人的想象力保持脚踏实地。
  3. “记忆库”:既然机器人试图在行进中弄清楚世界的规则,它就需要记住之前发生的一切。他们赋予了机器人长期记忆,使其能从整个旅程中学习,而不仅仅是最后一步。

他们的发现

他们在 33 个不同的挑战性任务(如机器人行走、摆动门和穿越迷宫)上测试了这种方法。

  • 获胜者:NEUBAY 在 7 个数据集上击败了最好的“谨慎”方法,并在几乎所有数据集上都具有竞争力。
  • 最佳点:当训练数据杂乱无章或不完整时,它表现最为出色。在这些情况下,“谨慎”的方法会陷入停滞,而 NEUBAY 的侦探工作则能找到解决方案。
  • 意外发现:他们发现,使用非常长的规划视野(思考数百步之后)实际上是成功的关键,这与大多数其他研究人员的做法恰恰相反。

一言以蔽之

这篇论文认为,在从旧数据学习的领域中,盲目的悲观并不总是最稳妥的选择。通过信任机器人从其自身历史中学习并规划遥远的未来——同时为它感到困惑时保留安全网——我们可以构建出比那些仅仅被要求“求稳”的代理更智能、更具适应性的智能体。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →