想象一下,你正试图通过向机器人展示一段人类行走的视频来教它走路。这就是**离线强化学习(Off-Policy Reinforcement Learning)**的工作原理:机器人从“回放缓冲区”(replay buffer)中学习,这仅仅是一个过去经验的集合(就像一个视频库),而不是在实时中通过试错来学习。
问题在于外推误差(Extrapolation Error)。如果机器人尝试做与它在视频库中看到的内容略有不同的事情——比如把腿抬得比人类看到的稍高一点点——机器人就没有数据来告诉它这是否是个好主意。它可能会胡乱猜测,犯下错误,然后摔倒。这就像试图仅通过观察自家后院的地图来预测一个从未去过的地方的天气;这种猜测很可能是错误的。
核心思想:静摩擦力
本文的作者 Hyunwoo Kim 和 Hyo Kyung Lee 提出了一个巧妙的解决方案,借用了物理学中的一个类比:静摩擦力。
想象一个重箱子停在一个斜坡上。
- 重力想把箱子拉下斜坡。
- 静摩擦力是阻止箱子移动、抵抗这种拉力的力。
- 只要斜坡不太陡,摩擦力就会占上风,箱子保持不动。如果斜坡变得太陡,摩擦力就会失效,箱子就会滑下去。
在机器人的学习过程中:
- 回放缓冲区(视频库)是“平地”或安全区,机器人知道该做什么。
- 外推误差就像“斜坡”。它是试图推动机器人去尝试库中不存在的新颖、未经测试的动作的力。
- 摩擦 Q 学习(FQL)充当静摩擦力。它创建一个“阈值”,阻止机器人滑离安全路径进入未知且危险的领域。
工作原理:平滑道路 vs. 悬崖
该论文将机器人可能的动作可视化为一条由它在视频库中看到的所有动作构成的平滑、低维度的“道路”(流形)。
- 切向方向(道路): 这些是对动作的微小改变,保持在“道路”上。例如,走得稍快一点或稍慢一点。机器人在这裡是安全的,因为它有数据支持这些动作。
- 法向方向(悬崖): 这些是将动作推离“道路”、进入没有数据的虚空中的改变。例如,尝试用双手而不是双脚走路。这就是发生“外推误差”的地方。
作者的算法摩擦 Q 学习(Frictional Q-Learning)使用了一种特殊的 AI,称为对比变分自编码器(cVAE)。把它想象成一个拥有两项任务的智能过滤器:
- 任务 1(好路径): 它学习识别并生成保持在“道路”上(切向方向)的动作。
- 任务 2(坏路径): 它主动生成“负样本”——指向悬崖正下方(法向方向)的动作。
通过向机器人展示安全路径和危险悬崖,该算法学会了说:“我知道这个动作是安全的,因为它看起来像视频中的动作”,以及“我知道这个动作是危险的,因为它看起来像悬崖”。它有效地建立了一道“摩擦”屏障,阻止机器人滑下边缘。
结果
研究人员在标准的机器人行走模拟(如 Hopper、HalfCheetah 和 Humanoid)上测试了这种方法。
- 结果: 使用摩擦 Q 学习的机器人学会了更稳定地行走,并取得了比其他流行方法更高的分数。
- 原因? 因为它没有浪费时间和精力去尝试从不可能或危险的猜测中学习。它坚持使用有真实数据支持的“受支持”动作,就像箱子依靠摩擦力停留在平缓的斜坡上一样。
总结
这篇论文介绍了一种利用过去数据教机器人行走的新方法,同时避免它们因尝试从未见过的事情而感到困惑。通过将已知数据的“安全区”视为平滑表面,并利用受物理学启发的“摩擦力”来阻止机器人滑入未知领域,该算法创造了一个更稳定、更可靠的学习者。这相当于在说:“不要猜测如果你跳下悬崖会发生什么;坚持走你知道可以行走的道路。”
技术摘要:摩擦性 Q 学习
1. 问题陈述
离线策略强化学习(RL)在所学策略选择那些在回放缓冲区中支持微弱或完全缺失的动作时,会遭受外推误差的影响。当策略查询的 state–action 对超出存储数据的分布范围时,价值估计会变得不准确,从而导致策略更新不稳定。尽管批处理约束 Q 学习(BCQ)试图通过变分自编码器(VAE)将策略限制在回放缓冲区的支撑集内来缓解这一问题,但现有方法仍面临理论局限性。具体而言,批处理约束方法中外推误差的界限与 (1−γ)−2 成正比,这意味着对于长视野任务(其中折扣因子 γ→1),误差界限会变得过于宽松,可能导致对预期回报的显著高估。
2. 方法论:摩擦性 Q 学习(FQL)
作者提出了摩擦性 Q 学习(FQL),这是一种通过基于静摩擦类比进行几何解释来解决外推误差的离线策略算法。
2.1. 静摩擦类比
该论文将外推误差与经典力学中的静摩擦进行了类比:
- 流形:回放缓冲区被建模为一个平滑的低维动作流形。
- 切向分量与法向分量:回放缓冲区支撑集内的动作对应于切向分量(与观测数据一致的扰动)。偏离该支撑集的动作对应于法向分量(诱导最大一阶偏离的扰动)。
- 摩擦阈值:正如静摩擦在达到阈值之前抵抗运动一样,外推误差充当策略收敛的阻力。“摩擦”在法向方向上最强。为了确保稳定性,策略必须优先选择与切向方向一致的动作,同时严格避免法向分量。
2.2. 动作几何与各向异性
该方法依赖于将动作空间分解为相对于局部动作流形的切向和法向方向:
- 切空间(TsMB):捕捉重建保真度得以保持的方向(受支持的动作)。
- 法空间(NsMB):捕捉诱导一阶重建失真的方向(不受支持的动作)。
- 各向异性比率(κ):定义为外推误差的法向与切向方向 Lipschitz 界限之比(κ=gn/gt)。稳定性条件要求策略偏离的角度 θ 满足 tanθ≤λtol/∣κ∣,从而确保策略保持在价值评估可靠的区域内。
2.3. 算法实现
FQL 采用**对比变分自编码器(cVAE)**来强制执行这些几何约束:
- 法向方向的规范正交基:由于法空间是无限的,该算法利用动作向量正交补的规范正交基构建一组确定性的法向方向。应用仿射变换对动作空间进行重新居中,确保这些基向量位于可行域内。
- 对比学习:cVAE(Gζ)通过两个目标进行训练:
- 目标数据集(Dt):从回放缓冲区重建受支持的动作。
- 背景数据集(Db):使用规范正交基向量作为代表法向(不受支持)方向的“负”样本。
- 该模型将潜在空间分解为目标数据独有的显著因子(sˉ)和与背景共享的无关因子(z)。使用**总相关性(TC)**惩罚来解耦这些因子,确保解码器在生成动作时对无关结构(法向方向)不敏感。
- 策略更新:
- 评论家评估由解码器生成的一组有限候选动作。
- 选择估计 Q 值最低的背景样本,以代表“支持度最低”的动作。
- 策略最大化生成候选动作的 Q 值,同时 cVAE 最小化重建损失和 TC 惩罚。
3. 主要贡献
- 批处理 RL 的几何解释:这项工作首次引入了基于物理类比(静摩擦)的批处理 RL 几何解释,形式化了动作流形几何与外推误差之间的关系。
- 摩擦性 Q 学习(FQL):一种新颖的离线策略算法,利用 cVAE 显式分离受支持(切向)和不受支持(法向)的动作变化,有效抑制外推误差,而无需依赖宽松的理论界限。
- 稳定性条件:基于各向异性比率 κ 推导出的稳定性条件,为策略偏离提供了比全局 Lipschitz 界限更严格的约束。
- 规范正交基构建:一种利用正交补的规范正交基生成确定性背景样本的方法,促进了连续动作空间中的对比学习。
4. 实验结果
作者在 MuJoCo 环境套件的标准连续控制基准(Hopper, HalfCheetah, Walker2d, Ant, Humanoid)上评估了 FQL。
- 性能与基线对比:与离线策略基线(DDPG, TD3, SAC)和批处理约束基线(BCQ)相比,FQL 表现出稳健且稳定的性能。它在大多数环境中实现了更优或相当的平均回报,特别是在 HalfCheetah 和 Humanoid 等高维任务中。
- 模仿学习:在模仿学习设置中(仅在固定回放缓冲区上训练,无在线交互),FQL 的表现优于 BCQ 和行为策略。这表明摩擦约束有效地调节了支撑分布,即使在没有额外数据的情况下也能抑制有害的外推。
- 离线 RL:在 D4RL 基准测试中,FQL(带有行为克隆目标)在 HalfCheetah 和 Hopper 上的表现与隐式 Q 学习(IQL)相当,但在 Walker2d 上表现出一定的不稳定性。
- 消融研究:移除总相关性(TC)惩罚或减少潜在维度 consistently 导致性能下降,证实了解耦显著因子和无关因子以及保持足够表示能力的重要性。
5. 意义与主张
该论文声称,FQL 通过通过显式比较受支持和不受支持的动作变化来诱导动作流形,为连续控制提供了一种实用且可扩展的方法。
- 机制:通过模仿静摩擦,该算法引入了一种稳定性机制,抑制了非支撑扰动,同时允许沿受支持方向进行策略改进。
- 通用性:该框架的益处被证明不仅适用于移动基准,还泛化到了操作任务(DMControl, MyoSuite)。
- 局限性:作者谦逊地承认,当前框架并未显式强制执行动作空间与潜在流形之间的等距性,也未在设计上保证正交性。观察到的近正交性是模型结构的涌现属性,而非正式的几何保证。他们建议未来的工作可以整合等距表示学习方法来解决这一问题。
总之,FQL 为处理 RL 中的分布偏移提供了新视角,利用几何约束实现稳定性,而传统的批处理约束方法可能因宽松的误差界限而在此方面遇到困难。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。