← 最新论文
🤖 machine learning

Learning Generalizable Skill Policy with Data-Efficient Unsupervised RL

本文介绍了 GenDa,这是一个统一的无监督强化学习框架,通过引入用于解决非平稳技能语义的技能重标记机制,以及用于确保对分布偏移鲁棒性的互补信息瓶颈,从而提升了数据效率和泛化能力。

原作者: Jongchan Park, Seungjun Oh, Seungho Baek, Yusung Kim

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Jongchan Park, Seungjun Oh, Seungho Baek, Yusung Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何自主学习移动,而不需要人类在它的每一步动作中都给出“做得好”或“再试一次”的信号。这被称为无监督强化学习 (Unsupervised Reinforcement Learning, URL)。目标是教会机器人一套“技能库”(比如走路、跳跃或转弯),以便它稍后可以混合并组合这些技能来解决新问题。

这篇论文介绍了一种名为 GenDa(通用高效数据智能体,Generalizable Data-efficient Agent)的新方法。作者认为,现有的教授机器人这些技能的方法存在两个主要缺陷,而 GenDa 解决了它们。

以下是使用简单类比进行的拆解:

两个大问题

1. “移动中的目标”问题 (非平稳技能语义/Non-Stationary Skill Semantics)

  • 缺陷: 想象你正在教一个学生画“圆”。你给他们看一张圆的照片并说:“这是一个圆。”但随着学生的学习,你对“圆”的定义也在不断变化。等到他们画完时,你可能已经认定“圆”其实是一个正方形。
  • 结果: 学生会感到困惑。他们一直在努力画出你过去定义的圆,但你现在是根据新的定义来评分的。这浪费了时间和数据,因为机器人一直在与一个移动的目标作斗争。从技术层面讲,这意味着“技能标签”(行为的名称)会随时间漂移,导致学习过程效率低下。

2. “过度依赖的学生”问题 (脆弱的泛化性/Brittle Generalization)

  • 缺陷: 想象你教一个学生只能在特定的绿色地毯和红色墙壁的房间里走路。如果要求他们在蓝色地毯和白色墙壁的房间里走路,他们就会僵住。他们并没有学会“如何走路”,而是学会了“如何在特定的绿色地毯上走路”。
  • 结果: 机器人学会了依赖“全局上下文”(比如精确的起始位置或背景颜色),而不是学习技能本身。当环境发生轻微变化(分布偏移)时,机器人就会失败,因为它过度拟合了训练条件。

GenDa 的解决方案

GenDa 通过两个工具解决了这些问题:

1. “重写教科书”机制 (技能重标记/Skill Relabeling)

为了解决“移动中的目标”问题,GenDa 不仅仅是存储旧的经验并寄希望于它们仍然有效。相反,它会不断地重新标记过去。

  • 运作方式: 当机器人回顾一段自己从 A 点移动到 B 点的视频时,它会问:“基于我现在所知道的知识,我刚才执行了什么技能?”它会将那个旧动作的标签更新为符合其当前理解的标签。
  • 类比: 这就像一位老师在学生完成考试后,根据当前的课程大纲重新评定答案,确保学生不会因为遵循旧规则而受到惩罚。这使得学习过程更快、更稳定,因为机器人始终在从一致且最新的指令中学习。

2. “蒙眼”技术 (互补信息瓶颈/Complementary Information Bottleneck - CIB)

为了解决“过度依赖的学生”问题,GenDa 强迫机器人忽略背景噪音。

  • 运作方式: 机器人被戴上了一个“蒙眼布”(一种数学过滤器),这个过滤器会剥离掉绝对位置或背景颜色等全局信息。它迫使机器人只关注“以自我为中心”的特征——即它自己的身体相对于自身是如何移动的。
  • 类比: 想象在教某人骑自行车。与其让他们观察风景(树木、建筑、天空),不如在他们的视野中套一个隧道,让他们只能看到车把手和正前方的路面。这迫使他们学习平衡的“技能”,这样无论是在公园、车库还是在另一个星球,他们都能骑好车。

实验结果

作者在各种机器人模拟器上测试了 GenDa,包括像数字狗和鱼这样复杂的环境。

  • 效率: GenDa 学习有用技能的速度比以往的方法快得多,需要的尝试次数(数据)也少得多。
  • 鲁棒性: 当他们将机器人移动到新环境(不同的起始点或背景)时,GenDa 的机器人保持正常工作,而使用旧方法的机器人往往会完全失败。
  • 高维成功率: 在其他方法放弃并无法学到任何东西的极复杂环境中,GenDa 成功发现了有意义的技能。

总结

该论文声称,通过不断更新旧标签以匹配当前知识,并强迫机器人忽略背景,我们可以教机器人更快地学习技能,并让它们在面对新的、真实的现实世界情况时表现得更好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →