← 最新论文
🤖 AI

Z-1: Efficient Reinforcement Learning for Vision-Language-Action Models

Z-1 是一个强化学习后训练框架,它利用公开可用的 RoboCasa 演示数据在组相对策略优化(GRPO)上进行训练,在不需要额外私有数据的情况下,显著提升了基于流(flow-based)的视觉-语言-动作模型的性能和成功率。

原作者: Lang Cao, Renhong Chen, Luyi Li, Peng Wang, Mofan Peng, Yitong Li

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Lang Cao, Renhong Chen, Luyi Li, Peng Wang, Mofan Peng, Yitong Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人做一道复杂的菜,比如冲咖啡或者打开一个难开的抽屉。

问题所在:“复读机”机器人
直到现在,大多数机器人训练员使用的是一种叫做“行为克隆”(Behavior Cloning)的方法。这就像一个只通过观看老师完美的教学视频来学习的学生。机器人观察老师成功完成任务的过程,并试图完全复制每一个动作。

  • 缺陷: 如果学生犯了一个微小的错误(比如伸手去抓把手时偏离了毫米级的距离),视频里并不会展示如何纠正这个错误。机器人会因此卡住,不知道如何恢复,并最终失败。它无法从自己的错误中学习,因为它在训练期间从未被允许犯错。

解决方案:Z-1(“试错型”教练)
这篇论文介绍了一种名为 Z-1 的新训练系统,它让机器人通过实践、失败和再次尝试来进行学习。这就像一位教练,让学生在厨房里练习,允许他们失败,然后给出关于下次如何做得更好的具体反馈。

以下是 Z-1 的工作原理,使用了简单的类比:

1. 起点(SFT)

首先,机器人通过观看人类完成任务(如开门或使用水槽)的公开视频来进行一次“速成课程”。这让它对要做什么有一个基本的概念,类似于在烹饪前阅读食谱。

2. “小组练习”(GRPO)

Z-1 不仅仅让机器人独自练习,而是使用了 群体相对策略优化(Group Relative Policy Optimization, GRно) 方法。

  • 类比: 想象一位教练同时派了 8 名学生进入厨房制作咖啡。
  • 目标: 教练不仅仅是说“做得好”或“做得不好”。相反,教练会将这 8 名学生进行相互比较。如果 7 名学生都洒了咖啡,而只有 1 名学生成功了,教练会告诉那位成功的学生:“你的做法有所不同,保持这种状态。”这有助于机器人弄清楚究竟是哪一个细微的动作造成了差异。

3. 智能技巧(新模块)

论文引入了四个聪明的技巧,使这种练习更加高效且稳定:

  • 共享前缀(“相同起点”规则):

    • 问题: 如果学生 A 从左边走,而学生 B 从右边走,那么比较他们最终制作咖啡的技能是不公平的。因为他们的起点不同。
    • 解决方法: Z-1 强制要求所有 8 名学生必须以完全相同的初始动作开始(比如走向柜台)。一旦他们都站在柜台前,他们再分头尝试不同的抓取杯子的方式。这确保了机器人学习的是关键环节(抓取),而不是走路的过程。
  • 树状结构分支(“分支路径”规则):

    • 问题: 有时候,“走向柜台”这个环节也需要练习。如果我们强迫他们必须完全一样地开始,他们就永远学不会如何修正错误的走路姿势。
    • 解决方法: Z-1 使用了一种“树”状结构。所有学生一起开始,但随后会在不同的时间点分成小组。有些人在早期分支,有些人在后期分支。这让机器人可以在练习修复小错误的同时,依然保持练习的组织性。
  • 成功感知奖励衰减(“速度奖励”):

    • 问题: 如果一个机器人用 10 分钟打开一扇门,而另一个机器人用 1 分钟打开同一扇门,标准系统可能会给他们贴上同样的“做得好”标签。
    • 解决方法: Z-1 会给完成速度更快的机器人贴上更大的“做得好”标签。它不会惩罚慢的学生,但会更奖励快的人。这鼓励机器人提高效率,同时又不会因为害怕出错而不敢尝试。
  • 选择性联合训练(“大脑与双手”开关):

    • 问题: 有时机器人失败是因为它的“手”(动作专家)不够灵活;有时则是由于它的“眼睛”(视觉语言大脑)看不清把手。
    • 解决方法: 通常情况下,为了保持稳定,Z-1 只训练机器人的“手”。但如果机器人一直因为看不清或理解不了物体而失败,Z-1 就会切换开关,同时训练“大脑”和“手”。这就像意识到:“哦,这个学生不是手笨,而是看不清把手!”并教导他们如何看得更清楚。

结果

团队在 24 种不同的家务任务(如打开抽屉、使用水槽和冲咖啡)上测试了 Z-1。

  • 使用 Z-1 之前(仅观看视频): 机器人的成功率约为 67%
  • 使用 Z-1 之后(结合了这些新技巧进行练习): 机器人的成功率达到了 80.6%

这一提升非常显著,甚至超越了目前公开领域中的其他顶尖机器人模型,尽管 Z-1 并没有使用任何秘密的私有数据——它仅使用了公开视频及其自身的练习过程。

总结:
Z-1 将一个只会“复读”的机器人变成了一个“问题解决者”。通过让它进行小组练习、从相同起点出发、奖励速度以及识别何时训练“眼睛”而非“双手”,机器人能够比以前更好地应对家庭环境中复杂多变的现实挑战。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →