WeaveRL: Weaving Reconstruction into Scene-Aware Fabrics for Perceptive Reinforcement Learning
WeaveRL 引入了一种 GPU 加速方法,该方法将主动式、在线 3D surfel 重建集成到几何织物(geometric fabrics)中,使强化学习策略能够利用基于传感器的几何信息处理复杂的、碰撞密集的操控任务,并且与基于静态原语的基准方法相比,在应对新颖障碍物时表现出显著提升的鲁棒性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
机器人正开始离开工厂车间的安全地带,进入家庭和医院这些混乱且不可预测的世界。为了在这些空间中穿行,机器需要的不仅仅是一套预设好的指令;它必须理解周围房间的形状。多年来,研究人员一直尝试通过一种被称为强化学习的方法来教导机器人,在这种方法中,机器通过试错来学习,就像孩子学习走路一样。然而,当涉及到像拿起一个杯子并将其放入橱柜而不撞倒一叠书这样复杂的任务时,这种学习过程往往会陷入停滞。机器人难以对世界的几何结构进行推理,经常撞上那些它看不见或无法记忆的物体。一种常见的解决方案是给机器人提供一张简化过的、手工绘制的周围环境地图,但当现实世界发生变化,或者物体过于复杂而无法用简单的形状来描述时,这些静态地图就会失效。
NVIDIA 的一个研究团队开发了一种新的方法来弥补这一差距,使机器人能够在构建实时三维环境理解的同时学习复杂的技能。他们将这种方法称为 WeaveRL,它将强化学习的试错学习与一个高速的实时场景重建系统结合在一起。机器人不再依赖预制的地图或简化的形状列表,而是利用其摄像头,在移动过程中构建一个详细的、动态的世界模型。这个模型随后被直接输入到机器人的控制系统中,充当一个安全网,在机器人专注于执行任务的同时,不断引导其避开碰撞。其结果是,机器人能够学会如何在杂乱拥挤的空间中操纵物体,并且至关重要的一点是,它能够处理从未见过的全新障碍物。
这项成就的核心在于解决了一个巨大的计算问题。为了进行有效学习,现代强化学习系统通常会同时运行数千个模拟,创建一个虚拟机器人军队并行尝试不同的动作。从历史上看,为这数千个机器人同时构建详细的三维地图速度太慢,且需要过多的计算机内存。研究人员通过创建一个高效的并行化系统克服了这一难题,该系统使用被称为“表面元素”的小型扁平几何片来重建场景。可以将这些切片想象成微小的、有方向性的瓷砖,它们粘合在一起,构成了房间内的墙壁、桌子和物体。通过将这些瓷砖组织成一个完美适配图形处理器的庞大结构化网格,系统可以在瞬间更新成千上万个环境的三维地图。这使得学习过程能够以现代训练所需的速率进行,同时又不会牺牲避免碰撞所需的细节。
在实验中,研究人员将该系统应用于各种困难的操纵任务,例如从摆满其他物体的桌子上拿起一个立方体,或者将其放入盒子或架子里。他们将该方法与以往依赖简化、手工构建形状来代表障碍物的方法进行了对比。结果非常悬殊。在最复杂的场景中(即机器人必须在拥挤狭窄的空间中穿行时),旧的方法完全失败了。使用简化地图的机器人无法学会避开障碍物,因为这些地图无法捕捉到环境的真实形状。相比之下,使用这种新型场景感知系统的机器人成功学会了完成这些任务。该系统让机器人看到了世界的真实模样,包括其所有的不规则性和复杂性,并利用这些信息来引导其安全运动。
或许最重要的发现是这些机器人处理意外情况的能力。研究人员针对一组特定的任务对机器人进行了训练,然后在出现了训练期间不存在的新障碍物的环境下对其进行了测试。当一个新物体(如圆柱体)出现在机器人的路径上时,使用新系统训练的机器人成功率明显更高。它们的成功率达到了 61%,而使用旧的简化地图的机器人仅为 35%。这种鲁棒性表明,机器人不仅仅是在记忆一条避开特定物体的特定路径,而是在实际理解空间的几何结构并进行实时反应。该系统的工作原理是不断计算机器人的手臂与三维地图中最近表面的距离,从而产生一种温和的排斥力,在碰撞发生之前将手臂推离危险区域。
研究人员还证明了这种方法不仅适用于模拟环境,也适用于现实世界。他们将训练好的机器人部署在一个配备了夹持器的物理机械臂上,任务是在一个真实的类似厨房的环境中移动物体。机器人成功完成了诸如将立方体放入架子等任务,并在狭窄空间内绕行而未撞到侧壁。即使在没有事先警告的情况下,在机器人的路径上放置了一个物理障碍物(如纸箱),该系统也能引导机械臂绕过它,依靠对场景的实时重建来避免碰撞。这种从虚拟训练场向物理环境转移的能力,是让机器人投入日常生活的关键一步。
这项研究强调了机器人感知世界方式的转变。它不再依赖于静态的、预定义的模型,也不再仅仅依赖于机器人必须从头解释的原始像素流,而是提供了一个在每一刻都在更新的、连续的高保真环境表示。机器人学习执行任务,而底层系统则处理避免碰撞的复杂数学运算。这种分离使得学习过程可以专注于目标,而安全机制则确保机器人不会损坏任何东西或伤及自身。研究人员指出,虽然该系统目前在静态摄像头下表现最好,但未来的工作将致力于使其适应移动摄像头,例如安装在机器人头部或手腕上的摄像头。通过将场景重建直接织入学习过程的肌理之中,这项工作为机器人在现实世界中进行安全且有效的操作提供了可扩展的基础。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。