Prism-GRPO: Faster VLA Policy Optimization via Splitting Same-outcome Groups
Prism-GRPO 通过利用执行质量评分来增强二元成功奖励,从而拆分相同结果的组别,进而加速视觉-语言-动作策略优化,以此从被丢弃的展开中恢复训练信号,并实现达到目标成功率所需的展开次数减少高达 56%。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
能够视觉感知、理解语言并有目的地运动的机器人已不再是科幻小说。它们正通过一种被称为“视觉-语言-动作模型”(vision-language-action model)的类人工智能技术被制造出来。这些系统充当了机器人所见与指令要求之间的桥梁。想象一下,一个机器人听到“拿起红色的杯子”,并看到了桌上的一个杯子;它必须计算出其手臂的精确运动轨迹来抓取它。为了让这些机器人变得更好,研究人员通常使用一种称为“强化学习”的方法。在这个过程中,机器人尝试执行一项任务,如果成功,它会获得奖励;如果失败,它则一无所获。经过数千次的尝试,机器人会学习哪些动作会导致成功。然而,这种学习过程极其昂贵。每当机器人尝试一项任务时,它都会消耗时间并占用计算能力。如果机器人反复失败,或者成功得非常笨拙,计算机通常会将那次尝试视为无效数据并将其丢弃。这种浪费是一个主要的瓶颈,减缓了开发能在现实世界中安全高效工作的机器人的进程。
一个研究团队开发了一种新方法来解决这种浪费,将曾经被丢弃的数据转化为宝贵的教训。他们的方法被称为 Prism-GRPO,它改变了机器人评估自身尝试的方式。在标准的训练方式中,机器人被给予一个简单的“通过或失败”的分数。如果一组尝试都成功了,它们都会得到相同的完美分数;如果它们都失败了,它们都会得到相同的零分。因为分数是完全一样的,计算机无法分辨哪一次尝试比其他尝试更好,因此会为了节省时间而丢弃整组数据。研究人员意识到,即使在机器人失败或成功时,其表现方式也往往存在细微差别。一次成功的尝试可能是平滑且温柔的,而另一次则是颠簸且撞倒了周围物体。一次失败的尝试可能离目标很近,而另一次则完全偏离了目标。通过忽略这些细微差别,旧方法丢弃了那些对于教导机器人变得更加精准所必需的信息。
这种新方法通过增加第二层反馈来解决这个问题。系统不再仅仅询问“它是否成功了?”,还会询问“它完成得有多好?”它会根据执行任务时的物理表现分配一个质量得分,例如使用了多少力、动作有多平滑,或者机器人是否不小心碰到了不该碰的东西。这个得分会与“通过或失败”的结果相结合。现在,即使一组尝试都成功了,系统也能识别出其中某一次比其他的更干净利落,并据此给予奖励。同样,如果一组尝试都失败了,系统可以识别出哪次失败造成的损伤最小,并将其作为学习信号。这一简单的改变意味着几乎没有数据被浪费。机器人能从每一次尝试中学习,而不仅仅是从那些极少数成功或失败的尝试中学习。
研究人员在四种不同的机器人任务上测试了这个想法,范围从用双臂举起一个锅,到移动一个罐子并将其放置在锅旁边。他们发现,与标准方法相比,这种新方法使机器人达到同样的成功水平所需的尝试次数减少了高达 56%。这是一个在时间和计算能力上的显著节省。更重要的是,使用这种新方法训练的机器人不仅学会了成功,还学会了优雅地成功。它们不太容易产生“捷径”。例如,在其中一个任务中,机器人被要求举起一个罐子并将其放在一个锅旁边,旧方法有时会教机器人直接把锅推向罐子,而不是抬起罐子。这虽然满足了计算机的成功检查,但并不是人类要求的动作。通过惩罚这种粗鲁的推搡动作,新方法教会了机器人执行正确的、轻柔的“抬起并放置”动作。
当研究人员将模拟器中表现最好的机器人转移到真实的物理机器人上时,结果依然成立。使用新方法训练的机器人更加可靠,也不太容易表现出那些在模拟中奏效但在现实世界中会失败的笨拙“捷径”。这项研究表明,通过关注动作的质量而非仅仅关注最终结果,我们可以更快地训练机器人,并让它们变得更安全。研究人员在数学上证明了这种方法绝不会损害机器人学习主任务的能力,而他们的实验也证实了这种方法能持续提升速度和行为表现。这项工作为使机器人不仅能够胜任一项工作,而且能够以与人类协作所需的细致与精准度来完成工作,指明了一条清晰的前进道路。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。