Efficient Reinforcement Learning by Guiding World Models with Non-Curated Data
本文提出了一种通过经验回放和执行引导,利用丰富的、非人工筛选的离线数据来引导世界模型的方法,从而增强在线强化学习的样本效率,进而克服分布偏移问题,并在多种视觉运动任务中显著优于基准方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你想要教一个机器人走路、跑步或拿起咖啡杯。传统上,你必须坐在那里盯着机器人看,每当它做对了或做错了,你都要告诉它一次。这既慢又贵,而且需要大量的人力来进行数据标注。
这篇论文介绍了一种名为 NCRL(用于高效强化学习的非策划离线数据)的新方法,它通过一种“变废为宝”的方法让机器人的学习速度大大加快。以下是其工作原理的拆解,分为几个简单的概念:
1. 问题所在:“垃圾”数据的困境
通常情况下,要训练一个机器人,你需要一个干净、有序的数据集,其中每一个动作都要有一个评分标签(例如:“做得好!”或“做得不好!”)。但现实世界中,我们拥有的是海量的杂乱、无序的数据。
- 它们没有评分(无奖励)。
- 它们是优秀动作与糟糕失误的混合体(质量参差不齐)。
- 它们来自不同类型的机器人(多具身性)。
这就像一个充满了数百万本书的图书馆,但这些书都没有标题、摘要或评分。大多数人会忽略这个图书馆,因为使用它太难了。以往的方法试图利用这些数据,但由于它们假设数据是整洁且带有标签的,因此往往以失败告终。
2. 解决方案:先建立一个“心理地图”
与其立即尝试学习特定任务,NCRL 方法首先构建一个世界模型(World Model)。
- 类比: 想象一个想要学习开车的人。他们不是直接坐进车里尝试开去超市,而是先花了几个月时间观看各种各样的驾驶视频——有些来自赛车,有些来自卡车,有些是人们开得很烂的视频,还有一些是专家的视频。他们现在还不知道目的地在哪里,他们只是在学习汽车是如何移动的、道路看起来是什么样的,以及转向是如何工作的。
- 论文的观点: 作者利用来自 6 种不同类型机器人的这种杂乱、无标签数据,训练了一个单一的“大脑”(世界模型)。这个大脑学习了运动的一般物理规律,而无需知道最终目标是什么。
3. 陷阱:为什么“仅仅进行微调”会失败
研究人员发现,如果你拿这个预训练好的“大脑”,并立即尝试教它一个特定的新任务(比如“走到门口”),它往往会失败。
- 类比: 这就像是一个学习了通用驾驶视频的学生,被立即放进了一辆赛车,并在一条他从未见过的赛道上驾驶。学生会感到恐慌,因为这条特定的赛道看起来与他看过的视频完全不同。他建立的“心理地图”与新任务的现实情况不匹配。
- 论文的发现: 他们发现这是因为存在分布偏移(Distributional Shift)。用于训练的杂乱数据与机器人开始尝试解决新任务时遇到的特定数据之间,看起来非常不同。
4. 修复方案:两种特殊的技巧
为了解决这种不匹配,作者添加了两个“辅助轮”,帮助机器人跨越杂乱的过去与特定的现在之间的鸿沟。
技术 A:经验回溯(“闪卡”法)
- 运作方式: 当机器人开始学习新任务时,它不仅仅只看自己那份微小的、新的经验。它会回到它庞大的杂乱数据库中,搜索与当前情况看起来相似的具体片段。
- 类比: 想象机器人在某个转弯处卡住了。它不再只是瞎猜,而是从它的旧视频库中抽出一张“闪卡”,显示一个看起来与当前转弯类似的动作,即使那个旧视频来自不同的机器人或不同的日子。它通过“复习”这些相关的记忆来提醒自己事物是如何运作的,从而防止忘记之前学到的知识。
技术 B:执行引导(“副驾驶”法)
- 运作方式: 机器人有一个“副驾驶”(一个在杂乱数据上训练出的策略),它知道如何安全地移动,尽管并不完美。在学习的早期阶段,机器人会在尝试自己的新想法与让“副驾驶”接管控制权几秒钟之间交替进行。
- 类比: 想象一个带着驾驶教练的初学者。新司机尝试转向,但如果他们开始偏离航线,教练就会轻轻地接管一会儿,以保持车辆行驶在道路上,然后将控制权交还。这能防止机器人陷入无法学习任何东西的“死胡同”,引导它走向更有可能成功的区域。
5. 结果:快了一倍
论文在 72 个不同任务上测试了该方法,范围从猎豹奔跑到机器人手臂堆叠积木。
- 结论: 使用这种方法,机器人的学习速度比从零开始(没有任何先验数据)的学习速度快了两倍。
- 对比: 即使与其他试图利用离线数据的方法相比,NCRL 也取得了显著优势,尤其是在那些需要机器人自主探索和摸索的困难任务上。
总结
论文认为,我们不需要完美的、带标签的数据来教机器人。如果能做到以下几点,我们就可以利用现有的“杂乱”数据(即没有评分的机器人运动视频):
- 首先建立对世界的通用理解。
- 在学习新任务时,使用“搜索”系统寻找相关的旧记忆(经验回溯)。
- 使用“副驾驶”来引导机器人,以免它在初期迷失方向(执行引导)。
这使得机器人能够以更少的尝试次数学会复杂的技能,使 AI 训练变得更加高效。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。