Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment
该论文提出了 Anchor-Align,一种结合了视觉-语言表示锚定与语言-动作对齐的微调方法,旨在防止预训练知识在视觉-语言-动作(VLA)策略中的覆盖,从而显著提高在不同基准测试中的泛化能力和真实机器人任务的成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
机器人的大脑:关于记忆、语言与执行任务的故事
想象一下,你正在教一个机器人做家务。你并不想亲手编写每一个动作的程序;那太慢了。相反,你给了机器人一个已经阅读过整个互联网的“大脑”。这个大脑是一个视觉-语言模型(VLM)。把它想象成一个超级聪明的学生,看过数百万张图片,读过数百万本书。它知道“杯子”长什么样,知道“绿色”是一种颜色,也知道“拿起”意味着抬起某物。它以一种通用的方式理解世界。
然而,了解世界并不等于在其中移动。为了让这个大脑变成一个机器人,科学家们使用了一种叫做**行为克隆(Behavior Cloning)**的技术。这就像是给机器人看一段人类完成任务(比如拿起一个红色的马克杯)的视频,并告诉机器人:“完全模仿这个动作。”机器人学习通过移动手臂来匹配视频中的动作。一个巨大的问题是,当机器人尝试学习这项新技能时,它往往会过于专注于模仿手部动作,以至于忘记了从互联网中学到的所有知识。它可能会停止理解“红色”代表一种特定的颜色,或者“马克杯”是一个特定的物体。它变成了一个盲目的模仿者,一旦场景发生哪怕极其微小的变化,它就会失败。这就是这篇论文要解决的挑战:我们如何在教机器人移动的同时,不让它忘记如何思考?
解决方案:锚定过去,对齐未来
研究这篇论文的研究人员在计算机模拟和真实的物理机械臂上进行了实验,他们发现传统的机器人训练方式存在缺陷。他们发现,当你仅仅教机器人模仿动作时,它会慢慢抹除自己对语言和视觉的理解。为了解决这个问题,他们发明了一种新的训练配方,叫做 Anchor-Align。
把机器人的大脑想象成一个正在参加一场新的、困难考试的学生。标准的方法(称为行为克隆)就像是告诉学生:“忽略你所知道的所有历史和数学知识;只需背诵这些特定的练习题答案。”最终,学生会完全忘记历史和数学。如果你问:“法国的首都是哪里?”他们可能会猜“纽约”,因为那是他们在练习题中背下来的答案,尽管他们其实知道正确答案。
Anchor-Align 通过两种巧妙的方式改变了考试规则:
视觉-语言锚定(“记忆锚点”):
想象机器人有一个孪生兄弟,一个“冻结”的版本,它永远不会改变,并记得从互联网训练中学到的所有知识。当机器人学习移动时,这个孪生兄弟会注视着它。每当机器人试图改变它对“杯子”或“绿色”的理解时,孪生兄弟就会说:“等等!你以前知道这是个杯子。别忘了!”这被称为蒸馏(distillation)。这就像有一个严格的导师,确保学生在学习特定技能时不会丢失其通用知识。论文表明,如果没有这个“锚点”,机器人的视觉和语言技能几乎会完全丧失。语言-动作对齐(“一致性检查”):
论文发现的第二个问题是,机器人经常会对它们所说的内容与它们所做的动作感到困惑。在标准训练中,机器人可能会学会说“拿起粉色的马克杯”,但实际上却伸手去拿绿色的那个,因为那是它在训练视频中看到的。这就像一个人说着“我要去公园”,却朝着杂货店走去。
Anchor-Align 通过强制机器人实现自我一致来修复这个问题。它获取机器人的动作(例如向右移动手臂),并将其转化为一个简单的单词标签(例如“右”)。然后,它要求机器人的语言大脑根据看到的图像来预测同一个单词(“右”)。如果机器人说“左”但实际向“右”移动,它就会受到惩罚。这迫使机器人的语言和动作保持一致。
研究发现:真实的机器人,真实的结果
团队在两种不同类型的机器人大脑以及两个不同的世界中测试了这种方法:一个复杂的计算机模拟环境和一个真实的物理机械臂(xArm7)。
在计算机模拟中,他们使用了复杂的测试,通过改变机器人周围的场景来考验它。例如,他们交换了物体的位置或改变了光照。
- 旧方法: 当物体被交换位置时,标准机器人几乎 100% 的情况下都会失败。它们记住了旧的布局,无法适应变化。
- 新方法: Anchor-Align 机器人在这些“交换”场景中的成功率达到了 22.6%,而表现最好的以往方法得分仅为 0%。
- 他们还测试了机器人处理混乱环境(如传感器噪声或奇怪的光照)的能力。新方法显著提高了成功率,在改变背景纹理时达到 99.6% 的成功率,在改变光照条件下达到 99.0% 的成功率,而其他方法的得分较低。
但最令人兴奋的部分发生在现实世界中。研究人员将该方法应用到了一个物理机械臂上。
- 测试: 他们训练机器人拿起一个绿色的马克杯。然后,他们通过在一个新的、混乱的设置中要求它拿起一个粉色的马克杯来进行测试。
- 结果: 使用旧方法训练的标准机器人 90% 的情况下都会忽略指令并去拿绿色的杯子。它忘记了“粉色”的含义。然而,Anchor-Align 机器人则完全听从指令,100% 地拿起了粉色的杯子。
- 总体而言,在真实机器人上,新方法将一种机器人大脑处理困难任务的成功率从 28% 提升到了 54%,将另一种机器人大脑的成功率从 37% 提升到了 60%。
为什么这很重要
这篇论文表明,我们不必在“聪明的机器人(理解语言和视觉)”和“熟练的机器人(能移动手臂)”之间做选择。旧的训练方法强迫我们进行权衡:为了获得优秀的移动能力,机器人必须放弃思考。Anchor-Align 证明了你可以两者兼得。
通过将机器人的记忆“锚定”到其原始知识,并将它们的语言与动作“对齐”,机器人变得更加灵活。它不仅仅是死记硬背一段视频;它学会了理解眼前的场景,无论物体如何排列或是什么颜色。作者指出,这种方法不需要任何新的数据或昂贵的硬件更改;它只是改变了如何教导机器人。这是一个简单的配方,让机器人能够更好地应对混乱且不可预测的现实世界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。