Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control
本文介绍了基于漂移的策略优化(Drift-Based Policy Optimization, DBPO),这是一个通过将迭代细化过程内化至训练中并支持在线强化学习,从而实现原生单步生成式策略用于机器人控制的两阶段框架,由此实现了超越现有多步扩散模型和单步基准模型的高频、低延迟性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
机械臂在工厂和实验室中变得越来越普遍,承担着诸如组装电子元件或分类物体等精细工作。为了让这些机器表现出色,它们需要一个“大脑”,能够根据摄像头所见的景象决定其关节如何精确移动。这个决策过程在瞬间发生,并周而复始地进行,以应对不断变化的现实世界。挑战在于,现实世界是混乱且不可预测的。仅仅看到桌上的一个方块,根据机器人之前的动作或光线的微小变化,可能会产生几种不同的有效抓取方式。为了处理这种不确定性,研究人员开发了一些系统,这些系统不仅选择一个单一的答案,而是学习一系列可能的优质动作。迄今为止最成功的系统使用了一种类似于缓慢、细致的雕塑家的的方法:它们从一个随机猜测开始,然后逐步、循序渐进地进行精炼,直到动作看起来完美无缺。虽然这种方法能产生高质量的动作,但速度很慢。机器人在做出每一个动作时都必须运行多次计算机大脑,这产生的延迟使其对于快速实时任务或通过试错学习新技能来说过于迟缓。
一组研究人员现在找到了一种方法,使这些智能机械大脑在保持同样高水平能力的同时,速度大幅提升。他们开发了一个新系统,可以在瞬间生成同样高质量的多选项动作计划,而不是经过数十个步骤的精炼。在他们的工作中,他们展示了通过改变机器人在训练期间的学习方式,可以教会它完全跳过缓慢的精炼过程。系统不再是学习在犯错后去修正错误,而是学习在第一次尝试时就做到正确。在测试了一套由十二种不同机器人任务组成的套件后,这种新方法实现的平均成功率高于旧的、较慢的系统,同时将决策所需的时间从一百次计算机计算缩减到了仅一次。这种提速不仅仅是理论上的改进;在实验室中的一台物理双臂机器人上,新系统完成了82%的任务,而之前的最佳单步方法仅完成了59%,且新系统反应迅速,足以实现实时控制。
这一突破的核心在于机器人如何从示例中学习。产生高质量动作的传统方法通常依赖于一个被称为“迭代去噪”的过程。想象一下机器人试图拿起一个杯子的过程:旧系统可能会从一个完全随机的手部位置开始,然后慢慢将其向杯子靠近,检查自己的工作,再次微调,并重复这个循环多次,直到手部处于完美的位置。这确保了机器人能找到一个好的解决方案,但非常耗时。新的方法——研究人员称之为“基于漂移的策略(drift-based policy)”——反转了这一逻辑。与其在实际行动的瞬间进行精炼,不如让机器人在训练期间将整个修正过程内化。在训练期间,系统会被展示许多成功的运动示例,并被教授如何预测一个随机猜测会如何向正确的方向“漂移”。它学习将这些修正吸收进自身的内部设置中,因此在最终部署时,它不需要进行那些缓慢的增量步骤。它只需直接输出最终修正后的动作即可。
为了证明这一理念可行,研究人员在各种挑战中测试了他们的系统。他们首先在一套包含推动方块、抬起物体和操作工具的标准十二项模拟任务中进行了测试。旧的多步系统需要计算机运行其网络一百次才能决定一个动作。而新系统仅需运行一次即可完成同样的工作。结果显示,该系统不仅速度快了百倍,而且整体成功率略高,实现了83%的平均成功率,而较慢的方法为79%。这证明了速度的提升并非以牺牲质量为代价;机器人完成任务的能力依然出色,只是效率更高了。
研究人员随后进一步测试了该系统,看它能否处理更复杂的、三维环境下的任务,即机器人看到的不是平面图像,而是点云。他们在三十七个不同的任务上进行了测试,范围从简单的物体操纵到使用锤子或转动门把手等困难的灵巧任务。在这些测试中,新系统再次超越了现有的旨在实现单步速度的领先方法。它实现了88.4%的平均成功率,大幅领先于排名第二的单步系统。这表明该方法足够鲁棒,能够处理现实世界3D视觉的复杂性,而无需此前认为在处理此类困难工作时必不可少的缓慢多步精炼过程。
然而,一个擅长模仿人类演示的机器人并不总是擅长解决新问题或从错误中恢复。为了解决这个问题,研究人员在他们的框架中增加了第二个阶段,允许机器人通过“在线强化学习(online reinforcement learning)”进行学习。这是一个机器人通过与环境互动并接收关于其成功与否的反馈,从而不断改进自身性能的过程,而不仅仅是复制旧视频。这里的挑战在于,标准的学习算法通常需要系统计算每一种可能动作的概率,这对于这些快速的单步生成器来说非常困难。团队通过创建一个特殊的接口解决了这一问题,使机器人在保持其快速单步特性的同时,能够从经验中学习。他们发现,这种方法使机器人能够有效地微调其技能,提高其在最初仅接受人类演示训练的任务上的表现。
最后的测试将该系统从计算机模拟带到了真实实验室中的物理机器人上。他们将该系统安装在一台具有类似人类双臂的双手协作机器人上,并要求它执行诸如抬起方块、搬运罐头以及在两臂之间移动物体等任务。机器人必须根据摄像头的视觉信息进行实时反应,无需人工干预。该系统的视觉感知到手臂移动的平均延迟仅为9.5毫秒,其速度足以进行高频控制。在系列试验中,机器人成功完成了150次尝试中的123次,成功率为82%。相比之下,之前的最佳单步系统在150次尝试中仅成功了89次,成功率为59%。发生的失败大多是由于物理层面的问题,如物体滑动或双臂碰撞,而非决策系统本身的失效。
这项工作表明,机器人控制中速度与智能之间的权衡并不像曾经认为的那样固定。通过将精炼的负担从行动时刻转移到学习阶段,可以创造出既高度智能又极其快速的机器人控制器。研究人员已经证明,机器人不需要通过逐步思考选项来做出明智决策;它可以学会瞬间做出正确的决策。这为能够以人类反射速度运行、并在复杂且不可预测的现实环境中实时学习和适应的机器人打开了大门。该新系统的代码已向其他研究人员开放,允许学术界在此基础上进行进一步开发。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。