Object-Centric Residual RL for Zero-Shot Sim-to-Real VLA Enhancement
本文提出了一种以物体为中心的残差强化学习框架,该框架通过利用物体位姿和模拟的 VLA 对手在纯仿真环境中训练纠偏策略,以实现零样本的从仿真到现实迁移,从而在无需额外遥操作数据的情况下,显著提升了视觉-语言-动作模型在现实世界操控任务中的成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个非常聪明、博学多才的机器人助手(被称为 VLA)。这个助手读过数百万本书,看过数千个视频,因此它知道在几乎任何情况下“应该做什么”。然而,当你要求它用物理双手在现实世界中“执行”某项任务时,它往往会变得笨拙。它可能会偏离杯子几毫米,或者用力过猛推开抽屉。因为它通过模仿人类来学习,微小的误差会不断累积,最终导致任务失败。
研究人员提出了这样一个问题:“我们能否教会机器人变得更精准,而不需要把它送到危险的现实世界训练营去?”
他们的答案是一种名为 “以物体为中心的残差强化学习”(Object-Centric Residual RL) 的方法。以下是其工作原理的拆解说明:
1. 问题所在:“训练中的恐怖谷”
通常,要让机器人变得更好,你要么:
- 在视频游戏中训练(模拟环境): 但机器人看到现实世界时会感到困惑,因为光照和纹理看起来完全不同(就像戴着一副会让世界看起来很假的面具进行 VR 体验)。
- 在现实世界中训练: 这既缓慢、昂贵又具有风险。如果机器人学错了,它可能会损坏物品或伤到自己。
2. 解决方案:“副驾驶”系统
作者构建了一个由两部分协同工作的系统:
- 机长(基础 VLA): 这是聪明的、预训练好的机器人大脑。它知道总体的计划(例如,“拿起杯子”)。在整个过程中,它是冻结状态且不会改变的。
- 副驾驶(残差策略): 这是一个微小的、超快速的“修正”大脑。它的唯一任务就是观察机长的计划并说:“等等,你瞄准的位置偏左了一点;往右挪一点。”
3. 核心秘诀:“以物体为中心”的眼睛
这项重大突破在于副驾驶观察的对象。
- 基于图像的方法试图观察整个摄像机画面(像素)。这很难,因为真实的厨房看起来与模拟的厨房截然不同。
- 这种方法忽略了杂乱的背景。相反,副驾驶只观察物体的数学坐标(例如,“杯子在 X, Y, Z 位置”)。
类比: 想象你在尝试射击一个目标。
- 基于图像的训练就像是戴着一副颜色会随环境变化的墨镜去射击目标。你会感到困惑。
- 以物体为中心的训练则像是拥有一个激光指示器,无论天气如何,它都能准确告诉你目标的位置。这个“激光”(物体的位姿)在视频游戏和现实生活中都是一样的。
4. 他们是如何训练的(“幽灵”练习)
为了确保副驾驶在从未见过现实世界的情况下也能在现实世界中发挥作用,他们采取了一种聪明的做法:
- 他们提取了用于训练真实机器人的完全相同的动作演示。
- 他们在视频游戏(模拟环境)中重现了这些完全相同的动作,以训练一个“模拟机器人(Sim-Robot)”。
- 他们在视频游戏中训练副驾驶,让它去修正模拟机器人的错误。
- 因为副驾驶只观察“激光坐标”(物体位姿)而不是背景图像,所以它不在乎是在游戏中还是在现实生活中。它只知道:“杯子在这里,把手移到那里。”
他们还在训练过程中加入了“噪声”(比如轻微抖动坐标),以教导副驾驶即使在传感器不完美的情况下也要保持强韧。
5. 结果:零样本成功
“零样本(Zero-shot)”意味着他们将训练好的副驾驶直接应用到真实机器人上,而没有在真实机器人上进行任何进一步的训练或测试。
- 之前: 机器人在完成任务(如堆叠方块或关闭抽屉)时的成功率仅为 42%。
- 之后: 在副驾驶的帮助下,成功率跃升至 76%。
副驾驶就像是一个安全网,在机长开始偏离航线时将其接住。
6. 额外奖励:机器人能自我进化
论文还表明,一旦机器人开始在副驾驶的辅助下成功完成任务,你就可以记录下这些成功的尝试,并利用它们来重新训练“机长”(主大脑)。这创造了一个循环,让机器人可以自我教学,变得更加出色,而无需人类再次牵着它的手。
总结
研究人员为机器人大脑构建了一个通用的修正工具。他们并没有试图让机器人完美地“看见”世界,而是教会它只关注物体的数学位置。这使得一个完全在视频游戏中训练的机器人,在被放置到现实世界时,能够立即变得更加精准,并能实时修正自己的错误。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。