想象一下,你正在尝试教一个机器人穿过房间。你拥有一个巨大的其他机器人行走的视频库,但你不能让你的机器人在现实世界中练习,因为它可能会摔倒并损坏某些东西。这就是离线强化学习的世界:仅从过去经验的静态数据集中学习。
多年来,从这些视频中教导机器人的标准建议一直是"极度谨慎"。
旧方法:“安全第一”策略
大多数以前的方法就像一个神经质的家长。它们会说:“如果机器人看到了视频库中未曾出现的情况,我们必须做最坏的打算。不要尝试任何新事物,否则你可能会撞毁。”
- 隐喻:想象你仅凭一张小街区的地图开车。如果你看到一条地图上未标注的道路,“谨慎”的做法会说:“停下!那条路很危险。待在已知的街道上。”
- 问题:如果地图完美无缺,这招很管用;但如果地图漏掉了一条通往更好目的地的捷径,谨慎的驾驶员就永远找不到它。他们会陷入“安全但平庸”表现的循环中。
新想法:“贝叶斯侦探”
这篇论文的作者NEUBAY提出了一个不同的问题:如果我们不再如此悲观,而是像一个随着进程更新信念的侦探那样行事,会怎样?
贝叶斯方法不再对未知做最坏的假设,而是说:“我不确切知道世界如何运作,但我有一组可能性范围。让我们随着移动去弄清楚哪种可能性是真实的。”
- 隐喻:想象你在一个黑暗的房间里拿着手电筒。“谨慎”的方法因为看不清整个房间而拒绝移动。“贝叶斯”方法则说:“我会迈出一小步,打开手电筒,看看那里有什么,并更新我的心理地图。如果看到墙,我就转弯;如果看到路,我就前进。”
- 结果:在视频库杂乱无章或不完整(低质量数据)的情况下,这种侦探方法在寻找最佳路径方面要出色得多,因为它愿意探索未知,而不仅仅是固守已知。
大挑战:“幻觉”陷阱
这里有个陷阱。当你不再谨慎时,你就有产生幻觉的风险。
- 隐喻:如果你试图基于一个不稳定的猜测来预测 100 步之后会发生什么,你的预测很快就会变成幻想。这就像和自己玩“传话游戏”;到了第 50 步,信息已经完全错误了。
- 论文的洞察:作者发现,为了避免这些幻觉而不过度谨慎,你实际上需要想得更长远,而不是更短。
- 为什么? 如果你只考虑未来 5 步,你就必须猜测第 6 步会发生什么。如果你考虑未来 500 步,那么最末端的“猜测”会被打折(它变得不那么重要),而计划开头那些真实、已知的数据则占据更大权重。
- 类比:这就像规划一次公路旅行。如果你只规划 10 英里,你可能会因为没看到 20 英里外的路标而驶入死胡同。如果你规划了整个旅程,你就能提前看到死胡同并避开它,即使你的地图有点模糊。
NEUBAY 如何解决它
作者构建了一个名为NEUBAY的系统,它结合了三个巧妙的技巧,使这种“长期思考”成为可能,而不会导致机器人撞毁:
- “不确定性减速带”:机器人不是硬性停止,而是检查自己的信心。如果它开始对地形感到不确定(高不确定性),它就会停止规划那条特定路径。这就像徒步者在小径变得太雾时停下脚步,而不是完全拒绝徒步。
- “稳定器”(层归一化):他们在机器人的大脑中加入了一个数学上的“减震器”。这防止了机器人在想象长序列事件时,其预测失控螺旋上升。它让机器人的想象力保持脚踏实地。
- “记忆库”:既然机器人试图在行进中弄清楚世界的规则,它就需要记住之前发生的一切。他们赋予了机器人长期记忆,使其能从整个旅程中学习,而不仅仅是最后一步。
他们的发现
他们在 33 个不同的挑战性任务(如机器人行走、摆动门和穿越迷宫)上测试了这种方法。
- 获胜者:NEUBAY 在 7 个数据集上击败了最好的“谨慎”方法,并在几乎所有数据集上都具有竞争力。
- 最佳点:当训练数据杂乱无章或不完整时,它表现最为出色。在这些情况下,“谨慎”的方法会陷入停滞,而 NEUBAY 的侦探工作则能找到解决方案。
- 意外发现:他们发现,使用非常长的规划视野(思考数百步之后)实际上是成功的关键,这与大多数其他研究人员的做法恰恰相反。
一言以蔽之
这篇论文认为,在从旧数据学习的领域中,盲目的悲观并不总是最稳妥的选择。通过信任机器人从其自身历史中学习并规划遥远的未来——同时为它感到困惑时保留安全网——我们可以构建出比那些仅仅被要求“求稳”的代理更智能、更具适应性的智能体。
以下是论文《无显式保守主义的长视野基于模型的离线强化学习》的详细技术总结。
1. 问题陈述
离线强化学习(RL)旨在从静态数据集中学习策略,而无需进一步与环境交互。离线 RL 的主导范式是显式保守主义,它通过惩罚分布外(OOD)动作或限制 rollout 视野来防止价值高估和不安全的外推。
作者挑战了这一原则的普适性,认为:
- 保守主义限制了适应性:通过严格惩罚 OOD 动作,保守方法往往无法适应测试时的条件,特别是在低质量数据集中,最优动作可能代表性不足。
- 贝叶斯潜力未被充分利用:贝叶斯视角(在世界模型的后验分布上优化期望回报)自然地处理了认知不确定性,而无需显式的悲观主义,但在长视野设置中,历史上一直难以解决模型误差的累积问题。
- 权衡:去除保守主义意味着去除了控制价值高估的机制,从而导致了短视野是必要的这一假设。本文质疑长视野是否实际上有害,或者它们是否可以被利用来减少高估。
2. 方法论:NEUBAY
作者提出了NEUBAY(NEUtral BAYesian,中性贝叶斯),这是一种基于认知 POMDP框架的基于模型的离线 RL 算法。它不是针对最坏情况模型(保守主义)进行优化,而是针对世界模型后验分布上的期望回报进行优化。
核心设计选择
为了使贝叶斯方法在没有显式保守主义的情况下既实用又有效,NEUBAY 引入了四个关键的架构和算法创新:
A. 自适应长视野 Rollouts(核心洞察)
- 问题:标准的基于模型的 RL 使用短视野来避免误差累积。然而,短视野严重依赖自举(bootstrapping,即利用价值函数估计未来奖励),当去除保守主义时,这会导致严重的价值高估。
- 解决方案:NEUBAY 利用长视野 rollouts(数百步)。通过延长视野,算法将估计负担从自举值(高偏差)转移到模型生成的奖励(较低偏差)。折扣因子 γH 指数级地降低视野末端自举项的权重,自然地抑制了高估。
- 机制:Rollouts 不是固定长度的,而是基于认知不确定性进行自适应截断。如果模型的不确定性 Uθ(s,a) 超过阈值(由数据集不确定性分布的分位数 ζ 定义),rollout 就会停止。这确保了在模型自信的地方 rollout 保持较长,而在不自信的地方则较短。
B. 世界模型架构以实现稳定性
- 大集成规模:为了准确近似后验分布并处理长 rollout 引入的方差,NEUBAY 使用了大型世界模型集成(N=100),这显著大于标准的 N=5 或 N=10。
- 层归一化(LayerNorm):作者在世界模型的隐藏层中应用了 LayerNorm。理论上,这限制了预测状态增量的幅度,防止了长视野下累积误差的指数级爆炸。
C. 依赖历史的智能体(循环 RL)
- 由于贝叶斯目标将真实 MDP 视为隐藏变量,最优策略必须是依赖历史的(POMDP 解)。
- NEUBAY 采用基于线性循环单元(LRUs)(一种状态空间模型)的循环演员 - 评论家架构。这使得智能体能够维持长期记忆(跨越整个回合),以推断底层模型参数并在测试时调整其行为,而无需参数更新。
D. 训练策略
- 无不确定性惩罚:与保守方法(如 MOPO、COMBO)不同,NEUBAY 不在奖励中添加惩罚项 λU(s,a)。
- 数据混合:它在真实数据和想象 rollouts 的混合集上进行训练,由混合比例 κ 控制。
3. 主要贡献
- 拒绝普适的保守主义:本文证明显式保守主义并非普遍最优。在低质量或偏斜的数据集中,贝叶斯适应性通过探索代表性不足但高回报的动作,优于保守方法。
- 长视野作为正则化器:作者提供了理论和实证分析,表明长视野 rollouts充当了一种自然机制,用于在非保守设置中控制价值高估,反直觉地取代了对短视野的需求。
- NEUBAY 算法:一种实用算法,结合了基于不确定性的自适应截断、大型集成、LayerNorm 和循环记忆,在不使用显式悲观主义的情况下实现了最先进的性能。
- 理论分析:论文包含了形式化证明,比较了“贝叶斯最优”和“鲁棒最优”策略,表明在某些数据条件下,贝叶斯集中性系数严格弱于(即优于)鲁棒系数,解释了性能差距。
4. 实验结果
作者在D4RL和NeoRL基准测试的33 个数据集上评估了 NEUBAY(包括运动控制、Adroit 操作和 AntMaze)。
- 最先进(SOTA)性能:NEUBAY 在7 个数据集上取得了新的 SOTA 结果,包括在
walker-random-v2、walker-medium-v2、pen-cloned-v1 和 hammer-cloned-v1 上的显著提升。
- 低质量数据上的表现:NEUBAY 在低质量数据集(例如随机策略)和中等覆盖率数据集上显著优于保守基线。它成功适应了测试时的条件,而保守方法则陷入次优行为。
- 与保守方法的比较:平均而言,NEUBAY 与领先的保守算法(如 VIPO、MOPO、COMBO)具有竞争力,并优于其他仍依赖保守主义或短视野的贝叶斯启发式方法。
- 消融研究:
- 视野长度:去除自适应长视野(使用短固定视野)会导致因价值高估而性能崩溃。
- LayerNorm:去除 LayerNorm 会导致状态预测中的误差迅速爆炸。
- 不确定性截断:使用固定的短视野或低不确定性阈值(ζ<0.99)会导致失败,证实了自适应长视野的必要性。
- 记忆:虽然马尔可夫智能体在某些运动控制任务上有效,但依赖历史的智能体对于 AntMaze 等高不确定性任务至关重要。
5. 意义与影响
- 范式转变:本文挑战了离线 RL 中“悲观主义是必要的”这一教条,建议转向贝叶斯中性,即智能体适应不确定性而不是回避它。
- 实用指南:它为基于模型的 RL 提供了一套新配方:使用大型集成、LayerNorm 和自适应长视野,而不是短视野和不确定性惩罚。
- 测试时适应:这项工作突出了离线 RL 智能体的潜力,即它们可以根据观察到的历史在回合内调整行为,这是保守的马尔可夫策略所缺乏的能力。
- 未来方向:作者指出,随着世界建模的改进(例如通过生成模型),贝叶斯离线 RL 的局限性可以进一步被突破,推动该领域进入一个“经验时代”,智能体通过测试时的交互来完善行为。
总之,NEUBAY证明,通过拥抱贝叶斯视角并利用具有自适应截断的长视野规划,可以在不使用显式保守主义的限制性惩罚的情况下,实现稳健且适应性强的离线 RL 性能。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。