✨ 要点🔬 技术摘要
想象一下,你正试图教一个机器人如何自主学习移动,而不需要人类在它的每一步动作中都给出“做得好”或“再试一次”的信号。这被称为无监督强化学习 (Unsupervised Reinforcement Learning, URL) 。目标是教会机器人一套“技能库”(比如走路、跳跃或转弯),以便它稍后可以混合并组合这些技能来解决新问题。
这篇论文介绍了一种名为 GenDa (通用高效数据智能体,Generalizable Data-efficient Agent)的新方法。作者认为,现有的教授机器人这些技能的方法存在两个主要缺陷,而 GenDa 解决了它们。
以下是使用简单类比进行的拆解:
两个大问题
1. “移动中的目标”问题 (非平稳技能语义/Non-Stationary Skill Semantics)
缺陷: 想象你正在教一个学生画“圆”。你给他们看一张圆的照片并说:“这是一个圆。”但随着学生的学习,你对“圆”的定义也在不断变化。等到他们画完时,你可能已经认定“圆”其实是一个正方形。
结果: 学生会感到困惑。他们一直在努力画出你过去 定义的圆,但你现在是根据新的定义来评分的。这浪费了时间和数据,因为机器人一直在与一个移动的目标作斗争。从技术层面讲,这意味着“技能标签”(行为的名称)会随时间漂移,导致学习过程效率低下。
2. “过度依赖的学生”问题 (脆弱的泛化性/Brittle Generalization)
缺陷: 想象你教一个学生只能在特定的绿色地毯和红色墙壁的房间里走路。如果要求他们在蓝色地毯和白色墙壁的房间里走路,他们就会僵住。他们并没有学会“如何走路”,而是学会了“如何在特定的绿色地毯上走路”。
结果: 机器人学会了依赖“全局上下文”(比如精确的起始位置或背景颜色),而不是学习技能本身。当环境发生轻微变化(分布偏移)时,机器人就会失败,因为它过度拟合了训练条件。
GenDa 的解决方案
GenDa 通过两个工具解决了这些问题:
1. “重写教科书”机制 (技能重标记/Skill Relabeling)
为了解决“移动中的目标”问题,GenDa 不仅仅是存储旧的经验并寄希望于它们仍然有效。相反,它会不断地重新标记 过去。
运作方式: 当机器人回顾一段自己从 A 点移动到 B 点的视频时,它会问:“基于我现在 所知道的知识,我刚才执行了什么技能?”它会将那个旧动作的标签更新为符合其当前理解的标签。
类比: 这就像一位老师在学生完成考试后,根据当前的 课程大纲重新评定答案,确保学生不会因为遵循旧规则而受到惩罚。这使得学习过程更快、更稳定,因为机器人始终在从一致且最新的指令中学习。
2. “蒙眼”技术 (互补信息瓶颈/Complementary Information Bottleneck - CIB)
为了解决“过度依赖的学生”问题,GenDa 强迫机器人忽略背景噪音。
运作方式: 机器人被戴上了一个“蒙眼布”(一种数学过滤器),这个过滤器会剥离掉绝对位置或背景颜色等全局信息。它迫使机器人只关注“以自我为中心”的特征——即它自己的身体相对于自身是如何移动的。
类比: 想象在教某人骑自行车。与其让他们观察风景(树木、建筑、天空),不如在他们的视野中套一个隧道,让他们只能看到车把手和正前方的路面。这迫使他们学习平衡的“技能”,这样无论是在公园、车库还是在另一个星球,他们都能骑好车。
实验结果
作者在各种机器人模拟器上测试了 GenDa,包括像数字狗和鱼这样复杂的环境。
效率: GenDa 学习有用技能的速度比以往的方法快得多,需要的尝试次数(数据)也少得多。
鲁棒性: 当他们将机器人移动到新环境(不同的起始点或背景)时,GenDa 的机器人保持正常工作,而使用旧方法的机器人往往会完全失败。
高维成功率: 在其他方法放弃并无法学到任何东西的极复杂环境中,GenDa 成功发现了有意义的技能。
总结
该论文声称,通过不断更新旧标签 以匹配当前知识,并强迫机器人忽略背景 ,我们可以教机器人更快地学习技能,并让它们在面对新的、真实的现实世界情况时表现得更好。
技术摘要:学习具有泛化能力的通用技能策略——基于高效数据的无监督强化学习
问题陈述 无监督强化学习(URL)旨在通过无需外部奖励的预训练,构建可扩展的技能条件策略,从而为下游控制任务提供基础。尽管近期取得了进展,但作者认为,当前的离策(off-policy)URL 方法面临两个被忽视的关键瓶颈,这些瓶颈阻碍了其可扩展性:
非平稳技能语义(样本效率低下): 在离策设置中,轨迹存储在带有采集时刻技能标签(z z z )的经验回放池中。随着技能策略和潜在表示函数(ϕ \phi ϕ )在训练过程中的演进,固定的 z z z 的语义含义会发生变化。因此,存储在缓冲池中的相同 z z z 在不同时间可能对应不同的行为轨迹。使用这些“陈旧”的标签进行训练会引入高方差噪声和语义漂移,从而导致学习不稳定并降低数据效率。
脆弱的泛化能力: 现有的方法通常将技能策略建立在全状态观测之上,而全状态观测包含了全局上下文信息(例如绝对坐标或视觉背景)。这会导致策略对特定的全局上下文产生过拟合。当部署在分布发生偏移的环境中(例如不同的起始位置或背景)时,相同的技能 z z z 无法产生一致的行为,从而限制了其在下游任务中的可重用性。
方法论:GenDa 作者提出了 GenDa (Generalizable Data-efficient Agent,可泛化且高效数据的智能体),这是一个旨在通过两种主要机制解决上述瓶碱的统一框架:
用于表示与策略学习的技能重标记(Skill Relabeling):
机制: 为了减轻语义漂移,GenDa 会动态地重标记经验回放池中的历史轨迹。该框架不再使用原始的展开标签(z r o l l z_{roll} z r o l l ),而是根据当前的潜在表示函数 ϕ \phi ϕ 计算一个新的标签(z r e l a b z_{relab} z r e l ab )。具体而言,z r e l a b z_{relab} z r e l ab 被定义为潜在空间中终点状态与初始状态之差的单位向量:z r e l a b = unit ( ϕ ( s T ) − ϕ ( s 0 ) ) z_{relab} = \text{unit}(\phi(s_T) - \phi(s_0)) z r e l ab = unit ( ϕ ( s T ) − ϕ ( s 0 )) 。
优化: 表示学习目标使用这些重标记后的目标进行更新,同时对目标网络进行梯度停止(使用指数移动平均,EMA)。这使得监督信号与潜在空间的当前解释保持一致。
均匀性正则项(Uniformity Regularizer): 为了防止由非固定重标记技能分布导致的表示崩溃(即所有状态都映射到狭窄区域),引入了一种对比风格的均匀性正则项。该项通过最大化重标记技能的熵(H ( z r e l a b ) H(z_{relab}) H ( z r e l ab ) )来确保行为发现的多样性。
策略重标记: 对于策略学习,通过将重标记后的技能 z r e l a b z_{relab} z r e l ab 与源自同一轨迹内中间状态对的多时界目标(z c z_c z c )进行混合,丰富了内在奖励,从而提高了自助式(bootstrapping)能力和离策数据的利用率。
互补信息瓶颈(Complementary Information Bottleneck, CIB):
机制: 为了将技能执行与全局上下文解耦,GenDa 引入了一个 CIB 模块。一个变分编码器 q ψ ( ℓ ∣ s ) q_\psi(\ell|s) q ψ ( ℓ ∣ s ) 学习一个与度量感知潜在表示 ϕ ( s ) \phi(s) ϕ ( s ) 互补的嵌入 ℓ \ell ℓ 。
目标: 编码器通过变分信息瓶颈目标进行训练(J C I B = I ( ℓ ; s ) − I ( ℓ ; ϕ ( s ) ) J_{CIB} = I(\ell; s) - I(\ell; \phi(s)) J C I B = I ( ℓ ; s ) − I ( ℓ ; ϕ ( s )) )。由于解码器可以重建已被 ϕ ( s ) \phi(s) ϕ ( s ) 捕获的信息,因此编码器被迫仅保留重建状态 s s s 所必需的剩余 信息。
应用: 技能策略 π ( a ∣ s , z ) \pi(a|s, z) π ( a ∣ s , z ) 被替换为 π ( a ∣ ℓ , z ) \pi(a|\ell, z) π ( a ∣ ℓ , z ) ,其中策略以 CIB 嵌入 ℓ \ell ℓ 而非原始状态进行条件化。这种结构性地防止了策略利用全局上下文线索,迫使其依赖于与技能相关的自我中心(ego-centric)特征。
核心贡献
失效模式的形式化: 本文正式识别并提供了关于离策 URL 中的“语义漂移”以及由于全局上下文过拟合导致的“脆弱泛化”的理论与实证证据。
技能重标记框架: 一种通过将过去经验与不断演进的潜在空间动态对齐来减轻非平稳性的新颖方法,显著提升了数据效率。
互补信息瓶颈(CIB): 一个能够学习解耦全局上下文与技能执行的嵌入模块,增强了鲁棒性。
统一框架: GenDa 将这些组件集成到一个基于最先进的度量感知目标的、可扩展的无监督技能发现流水线中。
实验结果 作者在包括高维环境(如具有 226 个状态维度的“Dog”)在内的多种基于状态和基于像素的基准测试(DeepMind Control Suite 和 MuJoCo)上评估了 GenDa。
数据效率: 与基准方法(METRA, CSF, DIAYN, CIC)相比,GenDa 以显著更少的环境交互实现了卓越的状态和任务覆盖率。在高维“Dog”和“Fish”环境中,GenDa 成功学习到了连贯的技能,而基准方法在这些环境中无法发现有意义的行为。
下游泛化: 在涉及偏移初始条件(如随机起点、随机目标)和复杂导航(迷宫基准)的下游任务中,GenDa 展示了显著更高的成功率。
鲁棒性: 消融实验证实,移除重标记机制会导致预训练效率低下,而移除 CIB 则会导致策略在分布偏移(如不同的起始坐标或背景颜色)下失效。
可扩展性: GenDa 仅需 5 倍于基准方法的环境交互,即可达到与基准方法相当的渐近极限性能,展示了其作为实际机器人学习基础模型的潜力。
意义与主张 本文声称 GenDa 解决了无监督强化学习在可扩展性方面的基本局限。通过解决语义漂移,该方法释放了离策学习在 URL 中的潜力,使预训练更加高效。通过利用 CIB 强制执行自我中心式的技能执行,它确保了学习到的技能在多样化的下游任务和环境偏移下具有鲁棒性和可重用性。作者将 GenDa 定位为迈向通用控制基础策略的一步,这种策略能够以极少的微调适应各种任务。
局限性与未来方向 作者承认目前的重标记框架假设每个回合(episode)只有一个技能,这在处理单一轨迹内的异构行为时可能并不成立。他们建议未来的工作可以将重标记扩展到随时间变化的技能标签。此外,CIB 的有效性依赖于度量感知潜在函数 ϕ \phi ϕ ,且当前的度量感知目标可能会阻碍精细操作技能的获取,这表明未来需要引入基于量级的机制。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。