想象一下,你正在试图教一个机器人如何在房子里导航或拿起物体。你给它看一段视频,视频里一个机器人在走廊里行走并向右转。你告诉机器人:“这就是‘直走’的样子。”
问题在于,这个机器人是个有点偷懒的学生。它注意到每当它看到走廊时,视频里的机器人都会向右转。所以,它学会了一个捷径:“如果我看到走廊,我就向右转。” 它不再听从你的具体指令(比如“在蓝色桌子那里左转”),因为它认为走廊的画面已经告诉了它所需的一切。用论文中的技术术语来说,这被称为“后验崩溃”(posterior collapse)——机器人忽略了你的声音,仅仅根据它所看到的进行猜测。
CAST 的解决方案:这个“如果……会怎样?”的游戏
来自加州大学伯克利分校和普林斯顿大学的研究人员想出了一个聪明的办法来解决这个问题。他们称之为 CAST(通过反事实标签提升指令遵循能力)。
把 CAST 想象成一个机器人的创意写作教练。与其只是向机器人展示它实际走过的唯一路径,教练会要求机器人玩一个**“如果……会怎样?”**的游戏。
它是如何运作的,步骤如下:
- 原始场景: 机器人有一段自己在走廊里行走的视频。
- “如果……会怎样?”的问题: 研究人员使用一个超级智能的 AI(视觉语言模型)来看这段同样的走廊,并问道:“嘿,在这里机器人还可以做些什么?”
- 原始指令: “直走。”
- 反事实(如果……会怎样): “在橙色桌子处向右转,”或者“沿着左侧的墙壁移动。”
- 发明路径: 这个 AI 不仅仅是编造一个句子;它还会发明一段与那个新句子相匹配的虚假视频路径。它会想象:“好吧,如果机器人是在橙色桌子处向右转,那么接下来的几秒钟看起来会是什么样子的?”
- 新的课程: 现在,机器人针对同一个走廊有了两堂课:
- 课程 A:“直走”(真实的视频)。
- 课程 B:“在橙色桌子处向右转”(发明的视频)。
为什么这改变了一切
在此方法之前,机器人看到走廊会想:“我知道这个!我向右转!”它不需要听你的话。
在使用 CAST 技巧后,机器人看到同一个走廊,但意识到:“等等,有时我会直走,有时我会向橙色桌子处右转。单看画面并不能告诉我该做什么。我必须听从你给出的具体词句,才能知道该走哪条路。”
实验结果
研究人员在两类机器人上测试了该方法:
- 导航机器人: 在室内外行走的机器人。
- 操作机器人: 拿起西兰花或勺子等物品的机械臂机器人。
他们发现,通过使用这种“如果……会怎样?”的数据(而无需收集任何新的真实世界视频),机器人的指令遵循能力得到了显著提升。
- 在导航任务中,成功率比没有使用此技巧的机器人翻了一倍。
- 在操作任务中(例如在有干扰物存在时拿起物品),机器人的表现提升了 27%。
底线
CAST 就像是给了机器人一个“平行现实”的图书馆。通过向机器人展示同一个场景可以根据不同的指令导致许多不同的结果,它迫使机器人停止猜测并开始倾听。它将一个只会“观察并猜测”的机器人,变成了一个真正能够“倾听并行动”的机器人。
技术摘要:CAST —— 反事实标签提升视觉-语言-动作模型的指令遵循能力
问题陈述
通用机器人需要具备遵循多样化、开放词汇语言指令的能力。虽然视觉-语言-动作(VLA)模型为实现从语言到机器人动作的映射提供了一种极具前景的架构,但它们目前在细粒度指令遵循方面仍面临困难。一个主要的局限性在于现有机器人数据集缺乏语义多样性和语言接地(language grounding)。在许多数据集中,观测结果与特定动作高度相关(例如,抽屉暗示了“打开抽屉”),这导致了后验崩溃(posterior collapse)。在这种现象中,策略学会了忽略语言输入,仅凭视觉观测来推断任务,因为语言无法提供额外的预测信息。此外,现有的数据集往往缺乏针对相似观测的细粒度任务多样性,且部分导航数据集完全缺乏语言标签。扩大数据清洗规模来解决这些问题既昂贵又繁琐。
方法论:基于合成轨迹的反事实增强(CAST)
作者提出了 CAST,这是一个数据增强框架,利用视觉-语言模型(VLM)为现有的、未经整理的机器人轨迹数据集生成反事实语言标签和合成动作。其核心洞察是:通过在相同的观测值下,针对不同的指令训练策略执行多种截然不同的动作,可以迫使模型为了预测正确的动作而必须关注语言输入,从而缓解后验崩溃。
CAST 流水线主要分为四个阶段:
- 决策点识别: 将现有的轨迹根据行为变化(如转向、停止)分割成原子块(atomic chunks)。这些边界即作为决策点。
- 反事实指令生成: 在每个决策点,使用 VLM(具体为 Gemini 2.5 Pro)结合当前观测和原始轨迹上下文进行查询。VLM 会生成合理的反事实指令(例如,将执行的“向右转”改为“向左转”)以及相应的原子命令(例如,“向左转”)。
- 合成动作生成: 使用一个预训练的原子策略 (πa),该策略是在真实机器人数据上训练的,用于遵循简单的原子命令(如“前进”、“向左转”),来生成这些反事实指令对应的实际动作块。该策略从原始轨迹中分支出来,创建一个新的、合理的“反事实结尾”。
- 数据集增强: 使用这些新增的 (observation,counterfactual_instruction,counterfactual_action) 元组对原始轨迹进行增强。这个扩充后的数据集被用于训练最终的 VLA 策略,称为 CounterfactualVLA。
作者基于互信息提供了理论依据。他们认为,通过最大化给定观测 o 条件下动作 a 与语言 ℓ 之间的互信息 I(a;ℓ∣o),可以提高语言遵循能力。通过在给定观测的情况下增加原子命令的熵 (H(ℓa∣o)),同时确保原子命令可以从完整指令中预测出来 (H(ℓa∣ℓ,o)),CAST 有效地推高了该互信息的下界。
实现细节
作者在两个领域实例化了 CAST:
- 导航: 使用 GNM 数据集(室内/室外),他们采用事后重标记(hindsight relabeling)流水线为无标签数据生成初始标签。他们将轨迹分割为原子行为(左转/右转、前进、停止)以训练原子策略。VLM 生成反事实导航提示,而原子策略则合成相应的动作块。
- 操控: 使用 Bridge 数据集,他们利用现有的任务级标签和子任务分解(如“拿起”、“移动到”)作为原子命令。VLM 生成反事实任务(例如,将物体放置在不同的表面上),并由预训练的可控策略(Steerable Policy)生成动作。
在这两种情况下,最终的 CounterfactualVLA 都是经过微调的 3B 参数量 PaliGemma VLM,并使用动作分块(action chunking)技术进行训练,以确保时间一致性。
实验结果
作者通过多个维度评估了该方法:
- 标签质量: 人类评判员评估了生成的标签在物体、运动和场景接地方面的准确性。反事实标签被发现是准确且合理的。
- 导航性能: CounterfactualVLA 在三个环境(办公室、厨房、室外公园)中的 27 个指令遵循任务上进行了测试。任务包括物体导航、指代导航(空间关系)和连续导航。
- CounterfactualVLA 比使用未增强数据的 VLA 性能提升了 27%。
- 它实现的成功率是基准模型的 两倍。
- 它超越了该领域的现有最先进方法。
- 操控性能: 在带有干扰物的拾取与放置任务中,该方法相比于使用标准数据的 VLA 展现了 27% 的性能提升。
意义与主张
论文声称,CAST 提供了一种可扩展且高效的数据方法,用于提高 VLA 策略的可控性和指令遵循能力,而无需收集额外的现实世界数据。通过利用现成的 VLM 生成反事实数据,该方法解决了当前数据集中固有的“后验崩溃”问题。作者将这项工作定位为“迈向真正开放集机器人语言遵循的第一步”,证明了通过使用合成反事实数据来增强现有数据集,可以显著提升机器人在多样化环境中遵循复杂、细粒度指令的能力。代码、数据和检查点均已开源,以促进进一步研究。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。