← 最新论文
💻 computer science

CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models

该论文提出了 CAST,一种利用视觉-语言模型生成反事实标签以增强机器人数据集的方法,从而在不需要额外数据采集的情况下,显著提升了视觉-语言-动作模型的指令遵循能力。

原作者: Catherine Glossop, William Chen, Arjun Bhorkar, Dhruv Shah, Sergey Levine

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Catherine Glossop, William Chen, Arjun Bhorkar, Dhruv Shah, Sergey Levine

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人如何在房子里导航或拿起物体。你给它看一段视频,视频里一个机器人在走廊里行走并向右转。你告诉机器人:“这就是‘直走’的样子。”

问题在于,这个机器人是个有点偷懒的学生。它注意到每当它看到走廊时,视频里的机器人都会向右转。所以,它学会了一个捷径:“如果我看到走廊,我就向右转。” 它不再听从你的具体指令(比如“在蓝色桌子那里左转”),因为它认为走廊的画面已经告诉了它所需的一切。用论文中的技术术语来说,这被称为“后验崩溃”(posterior collapse)——机器人忽略了你的声音,仅仅根据它所看到的进行猜测。

CAST 的解决方案:这个“如果……会怎样?”的游戏

来自加州大学伯克利分校和普林斯顿大学的研究人员想出了一个聪明的办法来解决这个问题。他们称之为 CAST(通过反事实标签提升指令遵循能力)。

把 CAST 想象成一个机器人的创意写作教练。与其只是向机器人展示它实际走过的唯一路径,教练会要求机器人玩一个**“如果……会怎样?”**的游戏。

它是如何运作的,步骤如下:

  1. 原始场景: 机器人有一段自己在走廊里行走的视频。
  2. “如果……会怎样?”的问题: 研究人员使用一个超级智能的 AI(视觉语言模型)来看这段同样的走廊,并问道:“嘿,在这里机器人还可以做些什么?”
    • 原始指令: “直走。”
    • 反事实(如果……会怎样): “在橙色桌子处向右转,”或者“沿着左侧的墙壁移动。”
  3. 发明路径: 这个 AI 不仅仅是编造一个句子;它还会发明一段与那个新句子相匹配的虚假视频路径。它会想象:“好吧,如果机器人是在橙色桌子处向右转,那么接下来的几秒钟看起来会是什么样子的?”
  4. 新的课程: 现在,机器人针对同一个走廊有了两堂课:
    • 课程 A:“直走”(真实的视频)。
    • 课程 B:“在橙色桌子处向右转”(发明的视频)。

为什么这改变了一切

在此方法之前,机器人看到走廊会想:“我知道这个!我向右转!”它不需要听你的话。

在使用 CAST 技巧后,机器人看到同一个走廊,但意识到:“等等,有时我会直走,有时我会向橙色桌子处右转。单看画面并不能告诉我该做什么。我必须听从你给出的具体词句,才能知道该走哪条路。”

实验结果

研究人员在两类机器人上测试了该方法:

  • 导航机器人: 在室内外行走的机器人。
  • 操作机器人: 拿起西兰花或勺子等物品的机械臂机器人。

他们发现,通过使用这种“如果……会怎样?”的数据(而无需收集任何新的真实世界视频),机器人的指令遵循能力得到了显著提升。

  • 在导航任务中,成功率比没有使用此技巧的机器人翻了一倍。
  • 在操作任务中(例如在有干扰物存在时拿起物品),机器人的表现提升了 27%。

底线

CAST 就像是给了机器人一个“平行现实”的图书馆。通过向机器人展示同一个场景可以根据不同的指令导致许多不同的结果,它迫使机器人停止猜测并开始倾听。它将一个只会“观察并猜测”的机器人,变成了一个真正能够“倾听并行动”的机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →