← 最新论文
💻 computer science

Primitive Subspaces Mediate Few-Shot Transfer in VLAs

本文证明了通过具有原语分割(primitive-segmented)的片段来训练视觉-语言-动作(VLA)策略,可以创建一个可迁移的子技能库,从而实现比平铺轨迹训练(flat trajectory training)显著更高效的少样本任务自适应,这一因果关系已通过子空间消融研究得到了证实。

原作者: Anya Singh, Cabrel Happi, Jai Relan, Varun Nair, Vidyut Baradwaj

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Anya Singh, Cabrel Happi, Jai Relan, Varun Nair, Vidyut Baradwaj

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人组装家具。目前,标准的做法是为每一件家具聘请一位专门的导师。如果你想让机器人组装一把椅子,你就给它看 50 段组装椅子的视频,它就会记住这个特定的任务。如果你接着想让它组装一张桌子,你就必须聘请一位新的导师,给它看 50 段新的视频,并让它从头开始重新训练。这既缓慢又昂贵,而且机器人必须“忘记”如何组装椅子才能学习如何组装桌子。

这篇论文提出了一个不同的问题:我们能否先教机器人一个“基础动作库”,以便稍后只需给它看几段新任务的视频,它就能靠自己弄明白如何组合这些基础动作?

以下是他们使用简单类比对实验过程和发现进行的详细拆解。

核心理念:“扁平化”训练 vs. “原语”训练

研究人员测试了两种训练机器人的方式,使用了两种不同的机器人“大脑”(架构称为 OpenVLA 和 π0.5\pi_{0.5}):

  1. “扁平化”方法(记忆者):

    • 类比: 想象通过向一名学生展示一段组装复杂机器的全程电影来教导他们。你说:“看完整部电影,学习如何制造这台机器。”
    • 结果: 学生记住了整部电影。如果稍后你给他们看一台新机器,他们会感到吃力,因为他们只知道第一部电影的具体序列,而不了解其中的各个组成部分。
  2. “原语”方法(乐高搭建者):

    • 类比: 想象教同样的学生,但这次你将电影分解成一个个带有标签的小片段。你暂停视频并说:“这个片段是‘拿起螺丝’。”然后,“这个片段是‘把螺丝拧进去’。”你给了他们一个基础动作(原语)的词汇表,比如“拿起”、“放置”、“插入”和“旋转”。
    • 结果: 学生学习了一个基础动作库。当稍后你向他们展示一台新机器时,他们不需要重新学习一切。他们只需要看到几个新机器的示例,就可以说:“啊,我知道如何‘拿起’和‘插入’;我可以组合这些动作来建造这个。”

实验:“少样本”测试

研究人员预留了 6 个机器人在训练期间从未见过的具体任务。在测试阶段,他们向机器人提供了少量演示视频(从 0 到 10 段)来完成这些新任务,并要求机器人在不进行进一步重新训练的情况下执行任务。

  • 目标: 观察机器人需要多少个视频(演示)才能成功。
  • 发现:
    • “原语型”机器人表现得极其高效。仅需 3 段视频,它们的表现就几乎达到了经过 50 段视频充分重新训练后的水平。
    • “扁平型”机器人则慢得多。它们需要 10 段视频才能达到“原语型”机器人通过 3 段视频就能达到的性能水平。
    • 差距: “原语”方法的样本效率高出 3 倍。这就像“原语型”机器人只需 3 天就能学会一门新语言,而“扁平型”机器人则需要 10 天才能学到同样程度。

“为什么”:证明这不是巧合

研究人员不仅想知道它是否有效,还想知道为什么有效。他们怀疑机器人将这些“基础动作”存储在脑部的特定部分(即其隐藏状态的一个“子空间”中)。

为了证明这一点,他们进行了一场“脑部手术”模拟:

  • 测试: 他们暂时“关闭”了机器人理解这些基础动作的特定大脑区域(子空间)。
  • 结果: 机器人的少样本学习能力(从少量视频中学习的能力)崩溃了(性能下降了 32%)。
  • 对照: 当他们关闭大脑中一个随机且无关的部分时,机器人的性能保持不变。
  • 结论: 这证明了“基础动作”库不仅仅是一个幸运的副作用;它是让机器人能够快速学习新任务的核心引擎。

缺陷:什么时候它不起作用

研究人员还发现了一个局限性。“原语”方法只有在新的任务是由已知基础动作组成时才有效。

  • 类比: 如果你教会了一个机器人“拿起”、“放置”和“拧”的动作,它可以组装一把新椅子。但如果展示给它一个需要完全陌生的动作(比如“扭转一种特殊的线”)的任务,机器人就会感到困惑。它会试图将这个新动作强行归入它已知的旧类别中,这会导致它的表现比那个仅仅尝试从头开始记忆整个新任务的“扁平型”机器人还要差。

关于我们如何衡量成功的修正

论文还指出,目前衡量机器人是否成功的技术评估方式存在错误。

  • 问题: 当机器人以“块”(即一组步骤,而非逐一步骤)的形式输出动作时,传统的检查正确性的方式过于严苛了。这就像是在批改一篇由 16 个问题组成的作文时,不是检查句意是否通顺,而是检查每一个单词是否都完美无缺。这导致机器人即使完成了任务也会被判定为失败。
  • 修正: 他们创建了一个更公平的评分系统,考虑到了这些“块”的存在,确保我们不会因为机器人追求效率而对其进行不公平的惩罚。

总结

这篇论文表明,如果在训练期间教机器人一套基础动作的词汇(原语),它们就能在仅凭极少数示例的情况下,更好地学习新的复杂任务。它们可以像玩乐高积木一样混合并组合这些基础动作。然而,这只有在新的任务是由机器人已经掌握的“积木”组成时才有效。这种方法可以节省工厂的时间和成本,因为机器人无需针对每种产品变化都从头开始重新训练。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →