Lost in Reconstruction: Aligning Action Representations with Language in Vision-Language-Action Models
本文介绍了 SALT,一种语义对齐动作分词器,它通过在标准重建目标的基础上增加一个辅助语言恢复任务,以保留动作潜变量中的动词落地信息,从而显著提升了与仅基于重建的基准模型相比的语言条件机器人控制性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在教一个机器人做饭。你可能会认为最重要的事情是告诉它最终菜肴应该是什么样子的:“汤应该是热的,并且在碗里。”但如果机器人只在意最终的画面呢?它可能会尝试通过把汤甩向空中、溅得到处都是,或者甚至摔掉锅来把汤弄进碗里。为了正确地烹饪,机器人不仅需要理解目的地,还需要理解运动本身的“舞姿”——那温柔的搅拌、小心翼翼的倾倒、以及手握把手时特定的方式。这就是视觉-语言-动作(Vision-Language-Action, VLA)模型的世界。这些是超级聪明的 AI 大脑,它们结合了机器人所看到的(视觉)、被告知要做什么(语言)以及如何移动身体(动作)。长期以来,科学家们在教机器人理解“是什么”和“在哪里”方面做得很好,但在教机器人理解“如何做”方面却一直很挣扎。他们一直试图将机器人复杂的连续运动转化为简单的指令列表,但在这种过程中,他们可能在无意中删除了食谱中最重要的部分:动作的风格与细微差别。
这篇题为《迷失在重建中》(Lost in Reconstruction)的论文探讨了关于如何教这些机器人大脑运动的一个特定问题。研究人员发现,当我们把机器人的平滑、流动的运动转化为数字“标记”(tokens)(就像把一首歌变成一系列音符)时,标准的方法会丢弃那些告诉机器人正在执行“哪个”动词的线索。他们发现,像“翻转”(flip)、“推动”(push)或“折叠”(fold)这样的词汇,其蕴含的信息隐藏在机器人的运动方式之中,而不仅仅是最终停留的位置。通过修复这种翻译运动的方式,他们创造了一个名为 SALT(语义对齐动作分词器,Semantically ALigned action Tokenizer)的新系统。在测试中,使用 SALT 的机器人能够更好地遵循指令,任务成功率约为 72%,而旧方法则不足 43%。该论文指出,要让机器人真正理解人类语言,我们需要确保它们的“运动词汇”能保留动词的含义,而不仅仅是专注于如何精确地重绘路径。
问题所在:当“如何做”在“是什么”中丢失
把机器人的运动想象成一条连续、流动的河流。为了使用视觉-语言-动作模型来教机器人,科学家通常必须将这条流动的河流变成一系列踏脚石。他们将运动切成微小的块,并为每一块分配一个数字标签,即“标记”(token)。这就像把一段流畅的爵士乐旋律变成一系列数字,以便计算机读取。
问题在于,标准做法痴迷于重建(reconstruction)。它在问:“我们能否将这些数字变回完全相同的河流?”如果这些数字与原始运动足够接近,系统就会说:“做得好!”但研究人员意识到,“足够接近”并不等于“有意义”。
想象你在描述一段舞蹈。你可以说:“舞者从点 A 移动到了点 B。”这是目标。但动词——他们是“滑行”、“跺脚”还是“旋转”——隐藏在运动的细节之中。论文认为,目前的机器人系统就像是一个只关心目的地的翻译员。如果“翻转”和“推动”最终都到达了同一个位置,它们可能会被转化为同一组踏脚石,即使这两种运动完全不同。系统丢失了“动词落地”(verb-grounding)的信息——即那些告诉机器人“如何做”动作的线索。
发现:动词存在于运动之中
为了证明这一点,研究人员观察了一个大规模的真实机器人数据集,由人类控制,其中每一次运动都配有一条口头指令,如“把勺子放在毛巾上”或“翻转煎饼”。他们将指令分解为动词,并分析了机器人的运动。
他们发现了两个截然不同的信息源:
- 目标: 起点与终点之间的视觉变化(例如,勺子现在在毛巾上了)。
- 运动动力学: 机器人为了到达那里所采取的实际路径(例如,速度、曲线、机械臂抓取器的时机)。
论文表明,这两个来源是互补的。对于某些动词,如“折叠”,最终的形状是最重要的线索。但对于其他动词,如“翻转”或“转动”,机器人运动的方式是识别该动词的唯一途径。你无法仅通过观察起点和终点来区分“翻转”和“推动”;你必须观察运动过程。研究人员对此进行了测量,发现运动动力学提供了独特的、视觉目标本身无法捕捉的信息。事实上,对于某些动词,运动携带了约 0.059 比特的独特信息——这足以对理解指令产生巨大影响。
错误:压缩抹去了意义
研究人员随后测试了不同的将运动转化为数字标记的方法在保留这种“动词”信息方面的表现。他们查看了三种常见的方法:
- Bin(分箱): 简单地将运动切分为固定大小的桶。
- FAST: 将运动压缩为频率模式。
- VQ-VAE: 通过尝试尽可能准确地重建运动来学习一组“踏脚石”。
他们发现,随着这些系统为了减小体积(减少标记数量)而压缩数据,它们会系统性地抹除动词信息。这就像挤压海绵:当你挤出水分(数据)时,你也挤出了形状(意义)。那些仅关注重建路径准确性的“仅重建”方法,无法保留语言层面的线索。随着压缩强度的增加,原始运动与标记版本之间的差距变得越来越大。论文认为这是一个瓶颈:如果机器人的内部运动语言与人类的运动语言不匹配,机器人将难以遵循指令。
解决方案:SALT
为了解决这个问题,作者引入了 SALT(语义对齐动作分词器)。他们不再仅仅教机器人重建运动,而是增加了一条新规则:“你也必须能够根据运动猜出指令。”
用一个简单的类比来解释:想象你在教一个学生画画。
- 旧方法: 你告诉学生,“画这张画,使其看起来和原图一模一样。”他们会专注于把线条画对。
- SALT 方法: 你告诉学生,“画这张画,使其看起来像原图,并且如果我把你的画给朋友看,他们应该能猜出这张画原本要画的是什么。”
从技术角度讲,SALT 获取运动的数字“踏脚石”,并将它们输入到一个冻结的、预训练的语言模型中。模型必须仅根据这些踏脚石来猜测原始指令(如“翻转杯子”)。如果踏脚石中包含的信息不足以猜出指令,系统就会受到惩罚。这迫使机器人以一种能够保护“动词”信息的方式来组织其运动标记,即便它仍在学习如何准确地重建运动。
结果:更好的机器人,更清晰的含义
研究人员在名为 SimplerEnv 的模拟环境中测试了这个新系统,其中机器人必须执行四种不同的任务,例如把勺子放在毛巾上或堆叠积木。他们对比了三个版本的机器人:
- 使用标准 FAST 分词器的机器人。
- 使用标准 VQ-VAE 分词器(仅重建)的机器人。
- 使用新型 SALT 分词器的机器人。
结果非常明确。使用 SALT 的机器人成功率达到了 71.9%。标准的 VQ-VAE 机器人成功率仅为 42.7%,而 FAST 机器人仅为 31.2%。
但这不仅仅关乎赢得更多比赛。研究人员深入观察了机器人的“大脑”,看它是如何组织其运动词汇的。他们发现,SALT 开发出了动词专门化的代码。例如,特定的数字标记高度专注于“翻转”或“转动”等动作。相比之下,旧方法将这些运动分散在通用的、混合的标记中。SALT 甚至学会了将表达相同意思的不同方式(如“转动杠杆”和“将杠杆垂直于前方移动”)归类到同一个运动代码下,这表明它理解的是意义,而非仅仅是表面的文字。
这意味着什么
论文表明,为了让机器人真正理解并遵循人类语言,我们不能仅仅关注让它们的运动看起来正确。我们必须确保它们的内部运动表示能够保留人类所做的语言区分。通过将机器人的动作标记与其描述的语言相对齐,我们可以构建出不仅更准确,而且更直觉化的机器人。作者指出,虽然这些结果令人鼓舞,但它们是在特定的数据集和模拟环境中进行的测试,未来的工作需要观察这些增益是否能在复杂、不可预测的现实世界中保持。然而,其核心思想——即保留动作的“如何做”与关注“是什么”同样重要——为让机器人真正理解我们提供了一条新的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。