← 最新论文
🤖 machine learning

Learn Where Outcomes Diverge: Efficient VLA RL via Probabilistic Chunk Masking

本文介绍了概率分块掩码(PCM),这是一种基于 GRPO 的视觉 - 语言 - 动作(VLA)强化学习的计算高效改进方法,它通过仅对成功与失败轨迹产生分歧的轨迹分块进行选择性反向传播梯度,从而显著加速训练并降低内存占用,且无需额外的奖励模型或评论家。

原作者: Vaidehi Bagaria, Nikshep Grampurohit, Pulkit Verma

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Vaidehi Bagaria, Nikshep Grampurohit, Pulkit Verma

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人执行一项复杂任务,比如拿起一个马克杯并将其放入碗中。你使用一种称为**强化学习(RL)**的方法,其运作方式类似于试错游戏。机器人会多次尝试该任务(称为“ rollout")。有时它会成功,有时则会失败。基于这些结果,机器人会更新其“大脑”(即其“策略”),以便下次做得更好。

这篇论文指出,目前教这些机器人的方式极其浪费。以下是该问题及其解决方案的分解,使用了简单的类比。

问题:“全有或全无”的学习指南

目前,当机器人尝试一项任务时,它会生成一段记录其动作的长视频(即轨迹)。假设这段视频时长为 64 秒。

  • 旧方法: 计算机查看每段视频的每一秒,以找出如何改进机器人。它会计算每一刻的“分数”。
  • 现实情况: 论文发现,对于视频中的大部分时间,机器人只是在执行它已经掌握的枯燥、常规的动作(例如将手臂移向桌子)。无论机器人成功还是失败,这些常规秒数看起来几乎完全相同。
  • 浪费: 计算机花费了约78% 的时间来计算这些常规秒数的分数,尽管它们并没有教给机器人任何新东西。这就像一位老师批改学生的作文,花几个小时检查学生已经掌握的单词拼写,却忽略了学生逻辑出错的那个段落。

论文发现,真正的学习只发生在少数特定时刻,即成功机器人与失败机器人分道扬镳(走向不同方向)的时刻。这些是“决策关键”时刻,例如机器人试图抓取马克杯的确切那一秒。

解决方案:“概率分块掩码”(PCM)

作者创造了一种名为PCM的新方法。把它想象成一份智能学习指南,它告诉计算机:“停止批改枯燥的部分。只批改学生真正犯错或做出精彩举动的那部分。”

以下是 PCM 逐步的工作原理:

  1. 将视频切分为分块: 计算机不再查看每一秒,而是将视频切割成小块(分块)。
  2. 寻找“分歧点”: 系统查看成功视频和失败视频。它会问:“它们是从哪里开始变得不同的?”
    • 类比: 想象两名跑步者。他们跑完第一英里时完全一样。然后,A 选手被一块石头绊倒,而 B 选手继续前进。这个“分歧点”就是绊倒的那一刻。论文中的系统识别出这一特定时刻是学习唯一需要的部分。
  3. “掩码”技巧: 系统创建一个“掩码”,在物理上阻止计算机查看枯燥的常规分块。它只保留“分歧”分块(即成功与失败存在差异的那些分块)。
  4. 预算限制: 计算机只被允许查看少量这些重要分块(例如,64 个中只选 12 个)。它会忽略其余部分。

为什么这很重要

论文在三个不同的机器人基准测试(LIBERO-Object、LIBERO-Spatial 和 LIBERO-Goal)上测试了这种方法。结果令人印象深刻:

  • 速度: 训练过程快了2.38 倍。达到相同技能水平所需的时间减少了一半以上。
  • 效率: 计算机执行的繁重计算(梯度更新)次数减少了4.8 倍
  • 内存: 它使用了60% 更少的内存,意味着它可以在更小、更便宜的计算机上运行。
  • 性能: 尽管忽略了 80% 的视频数据,机器人学到的效果与旧方法一样好。它达到了相同的成功率。

秘诀:“动作方差”

计算机如何知道该保留哪些分块,而无需人类告知?
论文使用了一种称为成功 - 失败动作方差的巧妙技巧。

  • 如果在特定分块期间,机器人手臂在“成功”视频中的移动方式与“失败”视频中的移动方式略有不同,则该分块获得高分。
  • 如果手臂在成功和失败视频中的移动方式完全相同,则该分块获得低分并被忽略。

这就像教练观看比赛录像。如果球队进球了,教练不需要重看导致进球的那 10 分钟传球,前提是每次传球都完美无缺。教练只需要研究那一瞬间,即球员做出错误动作或改变比赛的精彩动作的时刻。

总结

论文指出:“停止浪费时间去批改机器人已经掌握的内容。”

通过使用概率分块掩码,系统自动在长视频中找出机器人真正学习的几秒钟,忽略其余部分,并以更快、更便宜的方式更新机器人的大脑,而不会损失任何智能。它通过只关注结果分道扬镳的时刻,将缓慢、昂贵的过程转变为快速、高效的过程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →