Adapting Generalist Robot Policies with Semantic Reinforcement Learning
本文提出了语义动作强化学习(Semantic Action Reinforcement Learning, SARL),这是一种通过利用强化学习来优化语言提示而非原始动作,从而增强通用机器人策略的方法,旨在高效地组合预训练技能,以解决超出策略零样本能力的复杂长程任务。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个机器人,它读过数百万本书,也看过无数关于如何做事的视频。它是一个“通用型”机器人;它知道如何抓取杯子、打开门或擦桌子。然而,如果你要求它执行一项复杂的、从未见过的多步骤家务——比如“把锤子放在盘子上,然后拿起蘑菇”——它往往会感到困惑。它可能会抓错物体、掉落东西,或者干脆僵住。
这篇论文介绍了一种教导这种机器人的新方法,称为 SARL(语义动作强化学习)。以下是它的工作原理,我们使用一些简单的类比:
问题所在:“过度自信的大厨”
把机器人的预训练大脑想象成一位大厨,他知道成千上万种食谱。如果你要求做“一份沙拉”,大厨很清楚该怎么做。但如果你要求做一份非常特殊、古怪的菜,比如“一份带有锤子和蘑菇的沙拉”,大厨可能会惊慌失措。他知道什么是锤子,但他不知道如何将锤子与沙拉结合起来,使其看起来合理。
传统的修复方法通常涉及直接尝试调整机器人的“手”(机器人的物理运动)。这就像试图通过物理移动大厨的手腕,以毫米为单位来教他如何切一种特定的蔬菜。这种方法既缓慢又困难,而且如果大厨的起始位置不对,他可能会直接切到自己的手指。
解决方案:“聪明的副厨”
作者们的大胆想法是停止尝试直接移动机器人的手。相反,他们将语言指令视为机器人的“动作”。
想象机器人的身边站着一位副厨(这个新的 AI 系统)。副厨并不接触食物,他们只向大厨低声传达指令。
- 旧方法: “向左移动 2 英寸,然后向下移动 1 英寸,然后闭合手指。”(过于详细,难以学习)。
- SARL 方法: 副厨低声说,“抓起锤子”,然后是“把锤子移到盘子上”,接着是“拿起蘑菇”。
这位副厨(SARL)通过试错来学习。他尝试不同的低语指令。
- 如果副厨说“抓起锤子”,而大厨却抓起了一个勺子,副厨就会学习到:“好吧,对于这个特定的锤子,这个指令行不通。”
- 如果副厨说“向右移动并抓取”,而大厨成功了,副厨就会学习到:“这个指令是个赢家!”
它是如何学习的:“具身化”词典
论文强调了这种方法与仅仅使用智能语言模型(如聊天机器人)来给出指令之间的关键区别。
- 聊天机器人 (VLM): 一个聪明的聊天机器人可能会说,“抓起锤子”。这听起来很有逻辑。但它不知道这个特定的机器人在面对锤子时会感到困惑并抓起勺子。这就像一个读过关于锤子的书、但从未真正握过锤子的大厨。
- SARL(具身学习者): SARL 通过实践来学习。它尝试指令,观察机器人实际做了什么,然后更新它的“词典”。它学习到,对于这个机器人,“向右移动并抓取”比“抓起锤子”更有效。
这就是所谓的**“具身化”(Grounding)**。SARL 将单词与机器人的物理动作联系起来。它学习到“向右移动”是一个稳妥的选择,而“抓起锤子”可能是一个陷阱。
结果:以分钟计,而非以年计
论文表明,通过使用这种“低语”方法,机器人可以在不到 100 次尝试内学会解决复杂的长任务(例如锤子和蘑菇的任务)。
- 其他方法(尝试直接修复机器人的手部动作)通常会陷入困境,因为机器人的起始“肌肉记忆”对于新任务来说是不正确的。
- SARL 通过寻找合适的词汇来触发机器人已有的技能,从而绕过了肌肉记忆的问题,解决了这些问题。
总结
简而言之,这篇论文指出:不要试图从头开始重新训练机器人的肌肉。 相反,利用强化学习来教导一个“聪明的助手”,让它学会如何用正确的语言与机器人沟通。这个助手通过学习哪些词汇可以触发机器人现有的技能,从而解决新的、复杂的谜题,将一个困惑的机器人变成了一个能干的工人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。