RA-VLA: Retrieval-Augmented VLA for Test-Time Adaptation
本文介绍了 RA-VLA,这是一种检索增强的视觉-语言-动作框架,它通过将行为对齐的上下文检索与落地执行流水线相结合,克服了现有无需训练方法的适应瓶颈,从而在模拟和真实世界的各种新颖机器人任务中实现了更高的成功率和效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
长期以来,机器人一直难以像人类那样学习新任务。当一个人观察一次如何打开一个顽固的罐子或堆叠特定的一组箱子的演示时,能立即理解其目标;而一个经过数千个案例训练的机器人,在面对稍有不同的情况时往往会陷入停滞。这是因为现代机器人依赖于庞大的预训练知识库,这使得它们在处理熟悉的工作时表现出色,但在情况发生变化时却显得非常脆弱。为了弥补这一差距,研究人员开发了一种称为“上下文模仿学习”(in-context imitation learning)的方法。这种方法不再是从头开始重新训练机器人的大脑,而是将几个关于新任务的示例与指令放在一起提供给机器,希望它能利用这些新鲜的线索来弄清楚该做什么。然而,目前这种方法的尝试经常失败,因为机器人要么抓取了错误的示例,要么完全忽略了提示,回到了其旧有的、预设的习惯中。
一组研究人员推出了一套名为 RA-VLA 的新系统来解决这个特定问题。他们的工作针对了一个核心问题,即现有的机器人无法有效地区分那些看起来相似但功能不同的示例。在实验中,标准方法经常检索到在功能上毫无用处的视觉匹配项,例如,当机器人实际上需要知道如何打开炉灶时,它却找到了一个手拿起杯子的视频。这个新框架通过教机器人去寻找行为模式而非仅仅是视觉相似性,从而解决了这个问题。它学会了识别出两种外观不同的动作如果能实现相同的目标,则在功能上是等同的,从而确保机器人能从其记忆库中提取出最相关的指导。
一旦机器人检索到了正确的示例,该系统还会确保机器人确实使用了它。以往的方法存在一种“固执”现象,即机器人看到了新的指令和有用的示例,却仍然默认执行其原始训练的内容。研究人员通过增加一个特定的训练步骤解决了这个问题,该步骤强制机器人关注检索到的指导。他们创建了一种机制,如果机器人忽略了新的上下文而仅仅依赖于其旧知识,就会受到惩罚。这迫使机器人将其动作扎根于当前时刻提供的特定指令和示例中,而不是漂移回其预训练的本能。
团队在两个不同的环境中测试了这种方法:一个被称为 LIBERO 基准的复杂计算机模拟环境,以及使用物理 UR5e 机器人手臂的真实世界设置。在模拟中,机器人被要求执行它从未见过的任务,例如堆叠物体或操作特定物品,仅凭几个演示片段作为引导。结果显示出显著的改进。虽然旧方法在成功率极低的情况下挣扎,但新系统在模拟任务中的成功率有了大幅提升,性能提高了近 18 个百分点。在物理机器人的现实世界测试中,这种改进更为显著,新系统的成功率超过了一半,而之前方法的成功率则要低得多。
该系统的一个关键优势是其速度和效率。许多现有方法在尝试处理更多示例时会显著变慢,从而产生一个使其在实际应用中变得不切实际的瓶颈。研究人员设计了他们的系统,使其可以在不减速的情况下查看更多示例。通过在机器人需要行动之前独立处理每个示例,无论有多少可用示例,做出决策所需的时间都保持几乎恒定。这意味着机器人可以访问庞大的知识库,而不会遭受此类系统通常面临的延迟困扰。
研究人员还分析了该系统为何运作得如此出色。他们发现,关键不仅在于拥有更多数据,而在于拥有正确类型的检索数据。当他们用标准的、现成的视觉搜索引擎替换掉专门的搜索工具时,机器人的性能大幅下降,这证实了识别功能意图比匹配视觉外观更为重要。此外,他们测量了在给定新上下文与给定随机信息的情况下,机器人的动作变化程度。新系统表现出了对所提供上下文的强敏感性,证明了它是在真正地从示例中学习,而不是在忽略它们。
这项工作表明,无需进行昂贵且耗时的重新训练,也可以让机器人变得更具适应性。通过将一种更智能的寻找相关示例的方法与一种迫使机器人倾听这些示例的方法相结合,研究人员创造了一个框架,使机器能够以一种此前难以企及的灵活性来处理新颖的任务。研究结果表明,为了让机器人在动态的现实环境中安全且有效地运行,它们必须能够从即时上下文中学习,而这种新方法为实现这一目标提供了一条可靠的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。