← 最新论文
🤖 AI

Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning

本文提出了一种目标条件决策 Transformer,利用预收集的离线数据高效解决具有稀疏奖励的复杂多目标机器人任务,在 Franka Emika Panda 平台上展现出优于最先进在线基线的性能。

原作者: Paweł Gajewski, Dominik Żurek, Marcin Pietroń, Kamil Faber

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Paweł Gajewski, Dominik Żurek, Marcin Pietroń, Kamil Faber

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想教机械臂执行复杂任务,比如拿起一个方块并将其放置在特定位置。通常,你必须让机器人在现实世界中尝试、失败、撞向物体,并从错误中学习。但这既危险又昂贵,还会损耗机器人。

本文介绍了一种更智能、更安全的机器人训练方法,即离线学习。可以这样理解:与其让机器人在实时中练习,不如给它一个巨大的“家庭视频”库,记录其他机器人(或专家)执行任务的画面。机器人随后通过研究这些视频来学习如何移动,而在训练过程中完全无需接触现实世界。

以下是他们新方法的分解说明,辅以简单类比:

1. 问题:“单一任务”机器人

大多数机器人就像只为一次特定考试而学习的学生。如果你教机器人推动红色方块,它可能不知道如何推动蓝色方块或去抓取杯子。它缺乏泛化能力

2. 解决方案:“目标条件决策 Transformer"

作者创建了一种名为目标条件决策 Transformer的新 AI 模型。其工作原理如下:

  • “Transformer"部分(超级阅读者): 想象一个学生,他不仅死记硬背步骤,还能理解动作背后的“故事”。该模型像阅读书籍一样读取事件序列(机器人曾在哪里、做了什么、接下来发生了什么)。它利用"Transformer"架构(与先进聊天机器人背后的技术相同)来理解整个故事的上下文,而不仅仅是最后一句话。
  • “目标条件”部分(GPS): 传统机器人可能只被指令“做这个”。而这个新模型被指令“为了到达那个特定位置,做这个”。
    • 类比: 想象你在给司机指路。
      • 旧方式: “左转,然后右转。”(司机不知道目的地)。
      • 新方式: “左转,然后右转为了到达披萨店。”
    • 通过将“期望目标”(披萨店)与动作历史一起明确输入机器人的记忆,机器人学会了不同的路径可以通向同一个目的地。它学会了根据自己想要到达的终点来调整动作。

3. “后见之明”技巧

论文提到了一种称为后见之明经验回放的技术。

  • 类比: 想象机器人试图将方块推到厨房,但意外将其推到了客厅。普通机器人会想:“我失败了。”
  • 后见之明技巧: 这种方法会说:“好吧,你没去成厨房,但你确实成功地把方块推到了客厅!让我们假设那原本就是目标。”这将“失败”转化为“成功的课程”,帮助机器人从稀疏数据中更快地学习。

4. 实验:Franka Panda 机器人

团队在真实的机械臂(Franka Emika Panda)上测试了该方法,包含三个任务:

  1. 到达: 触碰特定点。
  2. 推动: 将立方体滑动到某处。
  3. 抓取与放置: 提起物体并移动它。

他们将新的“目标条件 Transformer"与以下方法进行了对比:

  • 行为克隆: 仅复制视频而不理解“为什么”。
  • TQC+HER: 一种非常强大的标准在线学习方法,通过在实时中试错进行学习。

5. 结果:黑马胜出

结果令人惊讶且印象深刻:

  • 速度: 他们的方法训练耗时80 分钟,而标准在线方法耗时240 分钟
  • 性能: 在复杂任务(如抓取与放置)中,他们的离线方法实际上表现优于经过数小时现实世界练习的在线方法。
  • 鲁棒性: 即使他们研究的“视频”大部分是糟糕的(随机错误),只有少数好例子,该模型仍能找出成功的方法。这就像一名学生,只要核心逻辑存在,即使教科书有 75% 是错的,也能通过考试。
  • 稀疏奖励: 在机器人直到最后才收到“干得好!”信号(稀疏奖励)的情况下,该方法保持稳定,而其他方法则陷入混乱并失败。

总结

该论文声称,通过将机器人学习视为带着明确目的地阅读故事,他们仅利用预录数据就能教会机器人执行复杂任务。这比需要机器人在现实世界中物理练习的传统方法更快、更安全,且往往更有效。他们还发布了所使用的数据集,以便其他人也能尝试。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →