← 最新论文
💻 computer science

From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models

本文系统比较了面向视觉 - 语言 - 动作模型的基于图像与基于动作的潜在动作监督策略,揭示出基于图像的方法增强了长程推理能力,而基于动作的方法改善了运动协调性,其中直接令牌监督取得了最佳的整体性能。

原作者: Yihan Lin, Haoyang Li, Yang Li, Haitao Shen, Yihan Zhao, Chao Shao, Jing Zhang

发布于 2026-05-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Yihan Lin, Haoyang Li, Yang Li, Haitao Shen, Yihan Zhao, Chao Shao, Jing Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人做家务。你拥有一个巨大的视频库,里面展示了人类做各种事情的画面:有人在叠碗,有人在擦桌子,还有人在搬运沉重的箱子。问题在于,每个人的动作方式都不同。有人用整只手抓杯子,有人只用指尖。有的机械臂短而粗,有的则长而细。

如果你试图直接从所有这些不同的视频中教机器人,它会感到困惑。这就像试图通过同时聆听使用不同方言和口音的说话者来学习一门语言。机器人不知道哪个“动作”才是正确的。

这篇论文介绍了一位聪明的中间人,称为潜在动作(Latent Actions)。将潜在动作想象成一张通用的“编舞卡”。与其教机器人精确的肌肉运动(这些运动变化极大),我们首先教它识别动作的概念

研究人员问道:“使用这些编舞卡来教机器人的最佳方式是什么?”他们使用统一的机器人大脑(视觉 - 语言 - 动作模型)测试了四种不同的教学风格。以下是他们的发现,简单解释如下:

1. 两种类型的“编舞卡”

论文将这些卡片分为两类,就像两种不同类型的地图:

  • “图片地图”(基于图像的潜在动作):

    • 工作原理: 它观察任务的之前之后的画面。它会问:“场景之前看起来是什么样,现在看起来是什么样?”它忽略具体的机械臂,专注于视觉变化。
    • 最适合: 漫长、复杂的故事。 如果机器人需要规划多步骤任务(例如“叠三个碗,然后擦桌子”),这些图片地图非常棒。它们帮助机器人理解大局和事件序列,就像阅读连环画来理解故事一样。
    • 结果: 机器人在处理漫长、多步骤的任务以及应对它从未见过的杂乱新环境时,表现有了显著提升。
  • “动作地图”(基于动作的潜在动作):

    • 工作原理: 它观察实际的物理运动(机器人的关节和电机),并将它们转化为简单的符号列表(标记),就像将复杂的舞蹈转化为简单的“左、右、跳”代码。
    • 最适合: 棘手的物理动作。 如果任务需要精确、协调的肌肉控制(例如同时移动两只手臂来拿起一个滑溜溜的瓶子),这些动作地图更胜一筹。它们帮助机器人掌握动作的“感觉”。
    • 结果: 机器人成为了复杂、协调的物理任务的大师。

2. 四种教学风格

研究人员测试了向机器人大脑展示这些卡片的四种方式:

  1. “低语”(隐式对齐): 老师向机器人的大脑低语提示,试图在不明确说“做这个”的情况下,将其内部思维与编舞卡对齐。
    • 裁决: 它有一点帮助,但有点模糊。
  2. “直接指令”(显式直接解码): 老师说:“首先,思考编舞卡(计划),然后再弄清楚如何移动。”机器人被强制在移动之前明确预测计划。
    • 裁决: 这是长任务的最佳方案。 它迫使机器人在行动之前先思考。
  3. “条件指令”(显式条件解码): 老师说:“预测计划,并且你这样做的时候,也预测动作。”它试图同时完成这两件事。
    • 裁决: 不错,但对于大多数任务来说,效果略逊于直接指令。
  4. “标记交换”(动作到标记的映射): 老师将物理动作直接转化为简单的词语(标记),并说:“只说这些词。”
    • 裁决: 这是复杂物理任务的最佳方案。 它将动作简化到了极致,使机器人能够更快地学习。

3. 重大发现:“离散标记”是王者

最重要的发现是关于机器人如何接收信息。

想象一下你正在教一个孩子画画。

  • 连续表示: 你说:“画一条 4.32 英寸长、角度为 15.7 度的线。”(数字太多,太令人困惑)。
  • 离散标记: 你说:“画一条‘长线’。”(简单、清晰、易于记忆)。

论文发现,将复杂的运动转换为简单的、离散的“标记”(就像句子中的单词),比试图教机器人精确的连续数值要有效得多。这就像机器人学习了一种新语言,其中“移动”是一个单词,而不是一道数学方程。这种方法 consistently 产生了最聪明的机器人。

4. 为什么这很重要(在实验室中)

研究人员在模拟机器人和他们实验室里的真实机械臂上测试了这一点。

  • 在实验室中: 当他们混合不同的任务(同时教机器人叠碗擦桌子)时,机器人通常会感到困惑,并忘记如何做其中一项或另一项(这被称为“负迁移”)。
  • 解决方法: 使用这些潜在动作“编舞卡”阻止了这种混乱。机器人可以一起学习所有任务而不会忘记旧任务。它使机器人更加稳健,能够更好地应对以前无法处理的杂乱现实世界情况。

总结

这篇论文并没有声称这明天就能治愈疾病或制造自动驾驶汽车。它只是说:如果你想教机器人从许多不同的视频中做许多不同的事情,不要教它原始的肌肉运动。相反,教它识别“计划”(使用图片)或“简单动作代码”(使用标记)。

具体来说,如果你希望机器人规划长序列,请使用基于图片的计划。如果你希望它执行棘手的物理动作,请使用基于动作的代码。在这两种情况下,将这些代码转换为简单的离散标记(像单词一样)是成功的秘诀。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →