想象一下,你正在教一个机器人组装家具。目前,标准的做法是为每一件家具聘请一位专门的导师。如果你想让机器人组装一把椅子,你就给它看 50 段组装椅子的视频,它就会记住这个特定的任务。如果你接着想让它组装一张桌子,你就必须聘请一位新的导师,给它看 50 段新的视频,并让它从头开始重新训练。这既缓慢又昂贵,而且机器人必须“忘记”如何组装椅子才能学习如何组装桌子。
这篇论文提出了一个不同的问题:我们能否先教机器人一个“基础动作库”,以便稍后只需给它看几段新任务的视频,它就能靠自己弄明白如何组合这些基础动作?
以下是他们使用简单类比对实验过程和发现进行的详细拆解。
核心理念:“扁平化”训练 vs. “原语”训练
研究人员测试了两种训练机器人的方式,使用了两种不同的机器人“大脑”(架构称为 OpenVLA 和 π0.5):
“扁平化”方法(记忆者):
- 类比: 想象通过向一名学生展示一段组装复杂机器的全程电影来教导他们。你说:“看完整部电影,学习如何制造这台机器。”
- 结果: 学生记住了整部电影。如果稍后你给他们看一台新机器,他们会感到吃力,因为他们只知道第一部电影的具体序列,而不了解其中的各个组成部分。
“原语”方法(乐高搭建者):
- 类比: 想象教同样的学生,但这次你将电影分解成一个个带有标签的小片段。你暂停视频并说:“这个片段是‘拿起螺丝’。”然后,“这个片段是‘把螺丝拧进去’。”你给了他们一个基础动作(原语)的词汇表,比如“拿起”、“放置”、“插入”和“旋转”。
- 结果: 学生学习了一个基础动作库。当稍后你向他们展示一台新机器时,他们不需要重新学习一切。他们只需要看到几个新机器的示例,就可以说:“啊,我知道如何‘拿起’和‘插入’;我可以组合这些动作来建造这个。”
实验:“少样本”测试
研究人员预留了 6 个机器人在训练期间从未见过的具体任务。在测试阶段,他们向机器人提供了少量演示视频(从 0 到 10 段)来完成这些新任务,并要求机器人在不进行进一步重新训练的情况下执行任务。
- 目标: 观察机器人需要多少个视频(演示)才能成功。
- 发现:
- “原语型”机器人表现得极其高效。仅需 3 段视频,它们的表现就几乎达到了经过 50 段视频充分重新训练后的水平。
- “扁平型”机器人则慢得多。它们需要 10 段视频才能达到“原语型”机器人通过 3 段视频就能达到的性能水平。
- 差距: “原语”方法的样本效率高出 3 倍。这就像“原语型”机器人只需 3 天就能学会一门新语言,而“扁平型”机器人则需要 10 天才能学到同样程度。
“为什么”:证明这不是巧合
研究人员不仅想知道它是否有效,还想知道为什么有效。他们怀疑机器人将这些“基础动作”存储在脑部的特定部分(即其隐藏状态的一个“子空间”中)。
为了证明这一点,他们进行了一场“脑部手术”模拟:
- 测试: 他们暂时“关闭”了机器人理解这些基础动作的特定大脑区域(子空间)。
- 结果: 机器人的少样本学习能力(从少量视频中学习的能力)崩溃了(性能下降了 32%)。
- 对照: 当他们关闭大脑中一个随机且无关的部分时,机器人的性能保持不变。
- 结论: 这证明了“基础动作”库不仅仅是一个幸运的副作用;它是让机器人能够快速学习新任务的核心引擎。
缺陷:什么时候它不起作用
研究人员还发现了一个局限性。“原语”方法只有在新的任务是由已知基础动作组成时才有效。
- 类比: 如果你教会了一个机器人“拿起”、“放置”和“拧”的动作,它可以组装一把新椅子。但如果展示给它一个需要完全陌生的动作(比如“扭转一种特殊的线”)的任务,机器人就会感到困惑。它会试图将这个新动作强行归入它已知的旧类别中,这会导致它的表现比那个仅仅尝试从头开始记忆整个新任务的“扁平型”机器人还要差。
关于我们如何衡量成功的修正
论文还指出,目前衡量机器人是否成功的技术评估方式存在错误。
- 问题: 当机器人以“块”(即一组步骤,而非逐一步骤)的形式输出动作时,传统的检查正确性的方式过于严苛了。这就像是在批改一篇由 16 个问题组成的作文时,不是检查句意是否通顺,而是检查每一个单词是否都完美无缺。这导致机器人即使完成了任务也会被判定为失败。
- 修正: 他们创建了一个更公平的评分系统,考虑到了这些“块”的存在,确保我们不会因为机器人追求效率而对其进行不公平的惩罚。
总结
这篇论文表明,如果在训练期间教机器人一套基础动作的词汇(原语),它们就能在仅凭极少数示例的情况下,更好地学习新的复杂任务。它们可以像玩乐高积木一样混合并组合这些基础动作。然而,这只有在新的任务是由机器人已经掌握的“积木”组成时才有效。这种方法可以节省工厂的时间和成本,因为机器人无需针对每种产品变化都从头开始重新训练。
技术摘要:原语子空间介导视觉-语言-动作模型(VLA)的少样本迁移
问题陈述
在工业环境中部署视觉-语言-动作(VLA)策略目前受到高额重训成本的阻碍。标准的部署流程涉及收集特定任务的演示数据,并针对每个新任务或产品变体对 VLA 进行微调。这种方法使得扩展成本随数据收集量线性增长,且需要大量的基础设施支持,这使得在过程持续变化的场景下变得不切实际。本文研究了 VLA 是否可以在测试时,在仅依赖少量演示的情况下,在不进行权重更新的情况下习得新任务。作者假设训练数据的结构至关重要:他们推测,使用显式原语级监督训练的 VLA 比使用扁平化任务轨迹训练的 VLA 学习到了更具组合性的表示,从而实现了更好的少样本迁移。
研究方法
实验设计
作者使用了一个结合了两种不同 VLA 架构的 2×2 设计进行了受控实验:
- OpenVLA:一种基于 Llama-2 的 7B 参数自回归模型。
- π0.5:一种基于 PaliGemma 的、具有 16 步动作块(action chunks)的流匹配(flow-matching)策略。
两种架构均使用匹配的 LoRA 配方(秩为 32,α=64,学习率为 5×10−5)进行微调,并在三个训练种子下保持超参数一致。唯一的变量是训练数据的视图方式:
- 扁平化训练(Flat Training):情节(episodes)为连续的任务对(例如,“拾取并插入”),并配以高层级语言提示。
- 原语训练(Primitive Training):情节被分割为单个原语动作(例如,“拾取”或“插入”),并配以特定于原语的语言提示。
数据集与评估
- 主要数据集:REASSEMBLE,一个基于 NIST Assembly Task Board 1 基准的接触密集型工业组装数据集。
- 复现数据集:LIBERO-Long,一个具有多步任务结构的家庭操作基准。
- 留出任务(Held-Out Tasks):六个特定的(物体,任务序列)组合完全从训练中剔除。这些任务在物体(物体包含训练中见过的原语,但处于新组合中)、任务序列(原语以新顺序排列)以及组合距离方面各不相同。还测试了一个词表外(out-of-vocabulary)类别(要求使用训练中不存在的原语类型)。
- 少样本协议:在测试时,模型接收一个高层级任务描述和 m∈{0,1,3,5,10} 个演示情节。演示通过视觉编码器特征进行编码,并被前置到语言提示中。模型在不进行权重更新的情况下执行动作。
因果干预
为了建立因果关系,作者采用了子空间消融干预:
- 线性探测(Linear Probing):他们在隐藏状态上训练线性探测器,以识别编码原语身份的方向。
- 消融:在推理时,他们将隐藏状态投影到识别出的原语可解码子空间的正交补空间(第 24 层),从而有效地移除原语信息。
- 控制组:他们消融了一个维度相等的随机子空间,以确保效应是针对原语表示特有的。
方法论修正
作者识别出了在评估分块策略(chunked policies)时存在的一个“族系误差膨胀(family-wise inflation)”伪影。对 16 步分块逐元素应用单步动作范围门控(single-step action-range gates),会导致相对于人类真实演示产生 40–42% 的错误失败率。他们提出并实现了一种经过校准的元素级门控,该门控针对真实分块分布进行校准,以确保评估公平。
关键结果
少样本迁移效率
经过原语训练的模型展现出比经过扁平化训练的模型显著更高的样本效率优势:
- 性能差距:在 m=3 个演示时,原语训练模型的成功率达到 0.62–0.66,而扁平化训练模型仅达到 0.31–0.34(约 2 倍的优势)。
- 饱和度:原语训练模型在 m=5 时趋于饱和,达到了全量微调上限的 78%。扁平化训练模型需要 m=10 才能达到相同的性能水平,表明存在 3 倍的样本效率差距。
- 鲁棒性:这种优势在两种架构(OpenVLA 和 π0.5)、三个训练种子以及 LIBERO-Long 上的跨数据集复现中均得到了验证。
因果证据
子空间消融干预证实了原语表示的必要性:
- 消融原语可解码子空间导致少样本成功率下降了 32 个百分点(例如,对于 OpenVLA,从 0.62 降至 0.30)。
- 消融等维度的随机子空间对结果的影响微乎其微(在采样噪声范围内),这证实了原语可解码表示是迁移所必需的因果因素,而非仅仅是相关因素。
基线对比
在 m=3 时,原语感知型少样本迁移显著优于以下基线:
- 零样本原语排序(Zero-shot primitive sequencing):+35 个百分点。
- Octo 式演示条件基线(Octo-style demonstration-conditioned baseline):+21 至 22 个百分点。
- 扩散策略(Diffusion Policy):被显著超越。
局限性与失效模式
论文指出,原语感知训练并非普遍能提高性能。在处理需要词表外原语(例如,训练词表中不存在的“旋转以啮合”动作)的任务时,原语训练模型的表现逊于扁平化训练模型。作者假设,原语训练模型倾向于将新的演示映射到最近的已知原语,而扁flat 训练模型可能学习得更加灵活。
重要性与主张
该论文声称提供了第一个受控对比,证明了原语感知训练产生了一种可迁移的产物:一个可以在推理时进行组合的子技能库。
- 机制:作者确立了显式的原语监督在训练期间解耦了子技能表示与任务上下文,从而在隐藏状态中创建了一个对于少样本迁移具有因果必要性的“原语可解码子空间”。
- 实际影响:对于工业部署,结果表明,通过使用原语分割进行训练,可以让 VLA 仅通过 5 个演示就恢复约 90% 的全量微调性能,从而大幅降低因应对新任务变体而导致的重训成本和停机时间。
- 范畴:其发现关于泛化能力的结论是适度的;其优势在于重新组合已知原语类型的任务,但在需要训练词表中不存在的根本性新原语的任务中,这种优势会发生逆转。目前的研究结果仅限于模拟环境(REASSEMBLE 和 LIBERO-Long)以及两种特定的架构。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。