← 最新论文
🤖 AI

RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking

RankQ 是一种从离线到在线的强化学习方法,它通过用自监督的多项式排序损失替代均匀悲观主义来学习结构化的动作偏好,从而提升样本效率和策略性能,在稀疏奖励基准测试中展现出优越结果,并在基于视觉的机器人学习中实现了显著的仿真到现实迁移增益。

原作者: Andrew Choi, Wei Xu

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Andrew Choi, Wei Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《RankQ:通过自监督动作排序实现离线到在线强化学习》的通俗解释,辅以生动的类比。

宏观图景:在不破坏机器人的前提下教导它

想象一下,你想教一个机器人堆叠积木。你有两个选择:

  1. 在线学习:让机器人尝试、失败、撞毁,然后从零开始学习。这既缓慢、危险,又昂贵(就像让一个蹒跚学步的幼儿开汽车来学习驾驶一样)。
  2. 离线学习:给机器人看别人操作的视频。机器人从视频中学习,但从不接触真实的积木。这既快速又安全,但如果视频画面抖动,或者视频中的人犯了错,机器人可能会学到坏习惯。

RankQ 是一种新方法,试图兼得两者的优点。它让机器人先从视频中学习(离线),然后让它在现实世界中练习(在线)以变得更好。问题在于,当机器人开始练习时,它往往会因为自己的错误或视频中的糟糕部分而感到困惑。RankQ 通过教导机器人对动作进行排序(ranking),而不仅仅是死记硬背,从而解决了这个问题。


问题所在:“悲观”教练

以前的方法(如 CQL 和 Cal-QL)试图通过扮演悲观教练来解决“糟糕视频”的问题。

  • 它们的工作原理:它们告诉机器人:“任何你在视频中没见过的东西可能都很危险。所以,如果你尝试新事物,我们会严厉惩罚你。”
  • 缺陷:如果视频展示的是完美的动作,这招很管用。但如果视频充满了失败呢?悲观的教练会说:“别尝试任何新东西,因为视频里说一切都很糟。”这导致机器人永远无法进步。它被困在视频中看到的完全相同的次优动作中,即使它本可以做得更好。

解决方案:“排序”教练(RankQ)

RankQ 改变了教练的风格。RankQ 不像那个惩罚一切新事物的悲观者,它更像一位聪明的排序教练

它不说“新事物是坏的”,而是说“让我们比较一下。这个新动作比视频里的动作是更好还是更差?”

以下是 RankQ 教导机器人对动作进行排序的方式:

  1. 成功与失败:它查看视频,将“好动作”(成功)与“坏动作”(失败)区分开来。
  2. “噪声”测试:它从视频中选取一个“好动作”,并对其进行轻微调整(比如加入一点静态噪声)。它教导机器人:“原本完美的动作比这个稍微出错的版本更好。”
  3. “混乱”测试:它选取一个“好动作”,使其变得非常杂乱或随机。它教导机器人:“稍微出错的版本仍然比这种完全的混乱要好。”
  4. “失败”测试:即使视频显示的是失败,RankQ 也教导机器人,视频中的“坏动作”仍然比完全随机、凭空捏造的动作要好。

魔法所在:通过学习这些相对排序,机器人构建了一张心理地图(即"Q 景观”)。在这张地图上,“好动作”位于山顶,而“坏动作”位于谷底。

  • 当机器人尝试新动作时,它得到的不仅仅是一个“是/否”的答案,而是一个方向
  • 数学计算告诉机器人:“你在这里。要到达山顶(成功),你需要向这个方向移动。”

这使得机器人能够从糟糕视频数据的“谷底”中爬出来,找到新的、更好的堆叠积木的方法,即使原始视频充满了错误。


他们测试了什么(结果)

研究人员在两类挑战上测试了这种方法:

1. “电子游戏”测试(D4RL 基准)

他们使用了标准的机器人模拟任务(如蚂蚁穿越迷宫或机械手移动钢笔)。

  • 结果:RankQ 的表现与另外七种顶级方法相当甚至更优。它特别擅长解决其他机器人会陷入困境的最难迷宫。

2. “真实机器人”测试(视觉 - 语言 - 动作模型)

这是最关键的一项。他们使用了一个复杂的 AI 模型(VLA),该模型能够“看见”并“理解”语言指令。

  • 低数据场景:他们只给机器人提供了极少量的练习数据(仅 200 次尝试)。
    • 其他方法:停滞不前。因为它们太害怕尝试新事物,无法改进。
    • RankQ:成功了。与次优方法相比,它将机器人的成功率提高了42.7%。它学会了更好地堆叠立方体并将勺子放入碗中。
  • 高数据场景:他们给机器人提供了大量数据(800 次尝试),并模拟了许多不同的光照条件和相机角度。
    • 结果:RankQ 仍然是最快且最成功的。它完成任务的速度比竞争对手快25.7%
  • 现实世界迁移:他们将计算机模拟中训练好的机器人放到真实的物理机器人上,并在真实实验室中进行测试。
    • RankQ 之前:机器人堆叠立方体的成功率仅为43.1%
    • RankQ 之后:机器人堆叠立方体的成功率达到了84.7%

核心启示

可以将 RankQ 视为一种教导机器人不仅做什么,而且如何判断其正在做什么的方法。

RankQ 不是让机器人盲目遵循脚本,也不是让它害怕尝试新事物,而是给了机器人一个指南针。它帮助机器人理解,“比失败稍好一点”是向上的一步,而“完美”是目标。这使得机器人能够从不完美的数据中快速学习,并在开始在现实世界中练习时迅速进步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →