RMTL: Reinforced Micro-task Learning for Long-Horizon Manipulation with VLM Rewards
本文提出了强化微任务学习(Reinforced Micro-task Learning, RMTL),这是一种分层强化学习框架,它将长程机器人操控任务分解为由语言描述的微任务,并结合多视图视觉语言模型(VLM)奖励和逆向课程学习,以克服单一提示词 VLM 奖励的稀疏性和平坦性,从而实现更快、更具扩展性的学习。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个机械臂去抓起一个红色的方块并将其举起。在机器人领域,这就像教一个孩子系鞋带:这是一个漫长且复杂的过程,包含许多微小的步骤。
名为“RMTL”的论文解决了一个特定的问题:当机器人离终点线还很远时,你该如何告诉它它做得很好?
问题所在:“平坦化”奖励 (The "Flatline" Reward)
通常,在教导机器人时,你会给它一个“奖励”(就像一块数字饼干),当它成功时给予奖励。但对于长任务,你需要一个“稠密”的奖励系统——即一种能够随着任务进展提供小额奖励的方式。
作者尝试使用一种超级智能的 AI,即 VLM(视觉语言模型)。你给 VLM 一张机器人的照片和一句话,例如 “机器人正在举起红色方块”。VLM 会根据这张图片与这句话的匹配程度进行打分。
难点在于:
如果整个任务只使用这一句话,机器人就会感到困惑。
- 类比: 想象你正在登山。你的目标是山顶。如果你的 GPS 只告诉你,“你距离山顶还有 10 英里”,那么无论你是在大本营还是在半山腰,这个距离数值在初期几乎不会发生变化。GPS 的信号是“平坦”的。
- 结果: 机器人在任务的前半段得不到任何有用的反馈;它在盲目地徘徊,因为“奖励”信号太弱,无法引导它前进。此外,如果机器人的手挡住了摄像头的视线,VLM 就会产生困惑并停止评分。
解决方案:RMTL(强化微任务学习)
作者提出将大任务分解为像书中的章节一样细小、易于管理的“微任务”。机器人不再接收一个宏大的指令,而是针对每个阶段接收一个新的、具体的指令。
以下是 RMTL 的工作步骤:
1. “微任务”分解
与其在整个过程中只说 “举起方块”,系统会随着机器人的移动切换提示词(Prompts):
- 阶段 1(接近): “机械臂正在向红色方块移动。”
- 阶段 2(对齐): “机器人夹爪正在与红色方块对齐。”
- 阶段 3(抓取): “机器人夹爪正在捏住红色方块。”
类比: 这就像电子游戏关卡。你不是告诉玩家“赢得游戏”,而是给出具体目标:“走到门口”,然后“打开门”,最后“拿起钥匙”。每个目标都提供了清晰、即时的“你正在接近目标!”的信号。这把平坦的 GPS 信号变成了一级级机器人可以实际攀爬的阶梯。
2. “六眼”摄像头技巧
机器人经常会遇到被自己的手或抓取的物体遮挡镜头的情况。
- 类比: 想象你试图通过一扇窗户观看足球赛。如果一名球员站在窗前,你就什么也看不到了。但如果你在体育场周围设有六扇窗户,即使其中一扇被挡住了,其他的窗户依然能让你看到比赛。
- 解决方法: RMTL 同时从 六个不同的摄像视角 观察场景。它会对这六个视角的评分进行平均。如果其中一个摄像头被遮挡,其他摄像头仍能保持信号强度。这为机器人创造了一个平滑、可靠的引导。
3. “逆向课程表”(辅助轮)
如果你直接把机器人扔到一个完全随机的起始位置,难度会太大。此时 VLM 的奖励信号太弱,无法提供帮助。
- 类比: 你不会通过把孩子扔进深水池来教他们游泳。你会从浅水区开始,等他们适应后再进入深水区。
- 解决方法: 系统会让机器人从一个“容易”的位置开始(紧挨着方块)。随着机器人变得越来越熟练,系统会慢慢将起始位置移得更远、更随机。这被称为“逆向课程表”,因为它从最难的场景向最简单的场景倒退进行,循序渐进地建立机器人的技能。
4. “管理者”机器人
最后,系统使用一个微型的“管理者”AI 来决定使用哪一个微任务提示词。
- 工作原理: 起初,一个简单的规则(例如“如果手臂距离较远,则使用‘接近’提示词”)会告诉管理者该做什么。随后,管理者会学会自主决策,最终变得比简单的规则更加聪明。
实验结果
当他们在模拟机器人臂(Fetch)上进行测试时:
- 旧方法(单一提示词): 机器人完全失败(成功率为 0%),因为它无法搞清楚如何开始。
- 新方法 (RMTL): 机器人学会了以 98% 的成功率 抓取方块。
总结
这篇论文认为,要利用语言来教导机器人完成复杂任务,你不能只给它们一个宏大的目标。你必须:
- 将目标分解 为微小、具体的步骤(微任务)。
- 从多个角度观察任务 以避免盲区(多视角)。
- 从易到难 循序渐进(逆向课程表)。
通过这样做,机器人能获得持续不断的有效反馈,将一段混乱、平坦的旅程转变为一段清晰、可攀爬的阶梯。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。