LaGO: Latent Action Guidance for Online Reinforcement Learning
该论文提出了 LaGO,这是一个利用预训练大语言模型作为潜在动作先验来软性引导在线强化学习的框架,证明了与标准 PPO 相比,该框架在离散和连续控制基准测试上的成功率和奖励均有显著提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试教一个机器人如何通过复杂的迷宫,或者拿起一个特定的物体。你有两个主要工具:一个才华横溢但笨手笨脚的专家(大语言模型,简称 LLM)和一个固执但学习极快的新手(强化学习智能体)。
长期以来,研究人员一直试图让这位“笨手笨脚的专家”直接驾驶机器人。他们要求专家说出具体要按哪个按钮或向哪个方向移动。问题在于,专家擅长谈论和规划,但在给出精确、瞬时的指令方面表现很差。如果专家犯了一个微小的错误,机器人就会撞车,整个任务就会失败。
LaGO(潜空间动作指导,Latent Action Guidance) 是一个改变了这种动态关系的全新框架。LaGO 并没有让专家直接驾驶汽车,而是让专家坐在副驾驶位上,向驾驶员低声指引方向。
以下是它的工作原理,分为简单的步骤:
1. 设置:两个阶段
论文描述了一个让机器人进行有效学习的两步过程。
阶段 1:“学习环节”(离线阶段)
首先,系统选取了一个“笨手笨脚的专家”(预训练 AI,如 Llama),并向它展示大量人类成功完成任务的视频(专家演示)。它并不要求专家现在就开始驾驶。相反,它教会专家识别模式。这就像是给一位国际象棋大师看一千盘国际象棋比赛,并要求他们理解什么是“好棋”的感觉,而不是强迫他们立即下一场完美的棋局。专家学会了一种关于哪些动作通常有效的“直觉”或潜空间先验(latent prior)。阶段 2:“驾驶课程”(在线阶段)
现在,真正的学习开始了。一个独立的、学习极快的机器人(RL 策略)开始与现实世界进行交互。它尝试各种动作,经历失败,获得奖励,并不断学习。- 转折点: 在机器人学习的过程中,“笨手笨脚的专家”依然坐在那里。但它不再大声喊叫命令,而是温柔地轻推机器人。它会说:“嘿,根据我所看到的,你可能想往这个方向移动。”
- 机器人会听从这个轻推,但并不被强制服从。如果机器人尝试了一个新动作并获得了巨大的奖励,它就会忽略这个轻推并继续原来的路。如果机器人迷失了方向,这个轻推能帮助它找到更好的路径。
2. 类比:GPS 与 副驾驶
把旧的方法(使用 LLM 作为直接控制器)想象成使用一个给出精确、僵化指令的 GPS 来开车,比如“在 3.42 英寸处左转”。如果 GPS 稍微偏了一点,你就会撞树。
LaGO 则像是拥有一个知识渊博的副驾驶。副驾驶不会抢夺方向盘,而是会对你说:“我觉得那边有个近路,”或者“那条路看起来很危险。”
- 如果副驾驶是对的,你就走近路,更快到达目的地。
- 如果副驾驶错了,你就忽略他们,继续按自己的方式开车。
- 结果是:你既获得了他们经验带来的好处,又没有因为他们夺取控制权而导致撞车的风险。
3. 结果:它奏效了吗?
研究人员在两个不同的“迷宫”中测试了它:
- CLEVR-Robot: 一个机器人在网格上移动球体的游戏(离散步骤)。
- Meta-World: 一个复杂的机器人手臂模拟环境,机器人手臂需要开门、按按钮和拿起物体(连续、平滑的运动)。
结果:
在这两种情况下,使用 LaGO 的机器人比单独学习的机器人学得更好。
- 在移动球体的游戏中,成功率从 15% 跳升至 27%。
- 在复杂的机器人手臂游戏中,成功率从 2.7% 飙升至 15.2%。
这是一个巨大的进步,因为这个“笨手笨脚的专家”并不完美。事实上,如果你直接让专家驾驶机器人,它会失败得很惨。但通过将专家作为软性引导,机器人学会了更频繁地取得成功。
4. 秘密武器:更聪明的专家
论文还发现,这个“笨手笨脚的专家”的质量至关重要。
- 当他们使用一个较小、较弱的 AI 作为引导时,机器人的学习效果并不理想。
- 当他们使用一个更大、更聪明 AI(Llama 2 7B 对比 TinyLlama)时,引导效果要好得多,机器人的学习速度也更快。
这表明,随着未来的 AI 模型变得越来越聪明,即使它们本身不是完美的驾驶员,它们也会自动成为更好的“副驾驶”。
总结
LaGO 是一种巧妙的方法,它利用大型 AI 模型的海量知识来帮助机器人学习,同时又不强迫这些模型去做控制机器人那样精确且困难的工作。它将一个“博学但笨拙”的 AI 变成了一个有用的向导,加速了学习进程,并帮助机器人更频繁地取得成功。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。