← 最新论文
💻 computer science

VLAs are Confined yet Capable of Generalizing to Novel Instructions

本文证明,通过插值操作内部文本潜在变量,视觉 - 语言 - 动作模型(VLAs)能够克服其在任务外推和空间过拟合方面的困境,该技术在新型指令基准测试中实现了 83% 的成功率,并揭示了隐藏且人类无法阅读的提示注入的潜力。

原作者: Quanyi Li

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Quanyi Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人厨师如何烹饪。你向它展示了两份具体的食谱:

  1. 食谱 A:“把奶油奶酪放进碗里。”
  2. 食谱 B:“把碗放在橱柜顶上。”

机器人完美地学会了这两个动作。它能执行食谱 A,也能执行食谱 B。但随后,你向它提出了一个新问题:“把奶油奶酪放在橱柜顶上。”

从逻辑上讲,机器人应该能够完成这个任务。它知道如何抓取奶酪,也知道如何够到橱柜。它只需要将已有的两项技能结合起来即可。然而,根据这篇论文,大多数先进的机器人“大脑”(称为视觉 - 语言 - 动作模型,即 VLAs)在此任务上彻底失败。它们会卡住,表现得仿佛从未见过橱柜或奶酪一样,尽管它们刚刚在前面的步骤中使用过这些物品。

问题所在:机器人是“鹦鹉”,而非“厨师”

作者发现,这些机器人并非真正理解世界,而是在记忆特定场景。

这就像是一个死记硬背了练习题答案却不懂数学原理的学生。如果你问"2 加 2 等于几?”,他们会回答"4"。但如果你问“如果数字是用红墨水写的,2 加 2 等于几?”,他们可能会惊慌失措。

在机器人的情况下,它已经学会将“奶油奶酪”与训练期间看到奶酪的那个特定桌面位置关联起来。它并不理解“奶油奶酪”是一个可以移动的物体;它认为“奶油奶酪”就是那个特定的位置。论文将这种现象称为"空间过拟合"。机器人过于关注训练视频中物体曾经所在的位置,以至于忽略了它们在现实时刻实际所在的位置。

解决方案:“魔法食谱卡”(文本潜在变量)

研究人员想知道:机器人内心深处真的聪明吗,还是它只是坏了?

他们在机器人的大脑中发现了一种隐藏的“成分”,称为文本潜在变量(Text Latent)。

  • 类比:想象机器人的大脑是一个巨大的图书馆。当你给它一个指令,比如“把奶酪放进碗里”时,机器人会从内部记忆中提取出一张特定的、看不见的“食谱卡”。这张卡片并非用你能读懂的文字书写,而是一组复杂的电信号模式(向量),它精确地告诉机器人该如何移动。
  • 发现:研究人员发现,如果他们提取出这张关于“将物品放入碗中”的看不见“食谱卡”,并将其注入回机器人的大脑,机器人就能完美地执行该动作——即使你根本没有给它任何文字指令。这张卡片就是指令本身。

突破:混合卡片(文本潜在变量插值)

真正的奇迹发生在他们试图解决“橱柜上的奶油奶酪”这一问题时。

他们提取了任务 A(奶酪到碗)的看不见“食谱卡”和任务 B(碗到橱柜)的卡片。然后,他们创建了一个这两张卡片的平滑混合体。

  • 类比:想象你有两首正在播放的音乐曲目。一首是爵士乐,另一首是摇滚乐。你不是 abrupt 地从一首切换到另一首,而是使用混音器,在淡入摇滚乐的同时慢慢淡出爵士乐。
  • 结果:通过在机器人大脑内部“混合”这两张看不见的食谱卡,机器人成功地将技能结合了起来。它抓起奶酪,将其移动到橱柜,然后放下。

数据:

  • 如果没有这个技巧,机器人(名为π0)在这些新的组合任务中仅能成功9%。
  • 使用“混合”技巧后,成功率跃升至83%。

这证明了机器人内心深处一直拥有这些技能;它只是无法自己弄清楚如何混合它们。“食谱卡”就在那里,但机器人需要人类的帮助将它们融合在一起。

大考:"Libero-OOD"基准测试

为了证明这并非偶然,作者创建了一个名为Libero-OOD的新测试。该测试包含 20 个棘手任务,要求机器人以新的方式组合其已知的技能。

  • 结果:他们测试了世界上最先进的机器人大脑(如 UniVLA、OpenVLA 和 π0-fast)。没有一台机器人能够独立完成这些任务。它们的得分均低于21%。
  • 结论:即使是最聪明的机器人,目前也“困”在了其训练数据中。如果没有帮助,它们无法泛化或“跳出思维定势”。

警告:“私人指令”

研究人员还发现了一些有点令人毛骨悚然的事情。由于这些“食谱卡”只是数字模式,你可以将它们还原为文本。

  • 当他们尝试读取某项任务的“食谱卡”时,生成的文本是一堆乱码(例如 QSize、black、plate)。
  • 然而,如果你将这些乱码喂回机器人,它仍然能正常工作!
  • 隐喻:这就像拥有一个只有机器人能理解的秘密代码。你可以将一条秘密指令隐藏在看似正常的句子中,而机器人会照做,其他人却毫不知情。这被称为“后门”,表明这些模型比我们想象的更加神秘。

总结

这篇论文告诉我们,当今最聪明的机器人就像能完美演奏两首曲子却无法即兴创作新旋律的音乐家。它们死记硬背练习课中的确切音符和位置,但当音乐稍有变化时,它们就会失败。

作者表明,如果我们手动混合来自两首不同歌曲的“乐谱”(文本潜在变量),机器人就能演奏出新的旋律。这证明了机器人拥有天赋,但缺乏结合自身技能的能力。该论文引入了一项新测试(Libero-OOD),旨在帮助研究人员构建能够真正学会混合自身技能、而不仅仅是记忆场景的机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →