Guided Riemannian Optimization (GuRO): Bridging Model Predictive Control and Decision Transformers
本文介绍了引导式黎曼优化(GuRO),这是一个将模型预测控制与决策 Transformer 相结合的新颖框架,并采用曲率感知的黎曼优化,以在处理高维、非线性机器人控制任务时实现更快速、更鲁棒的训练和卓越的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现实世界中移动的机器人面临着一种持续且困难的平衡挑战。它们必须决定如何在通常不平整、湿滑或不可预测的环境中进行跨步、转向或攀爬。为了做出这些决策,工程师们传统上依赖于两种主要方法。第一种就像一位细心的导航员,不断检查地图并根据已知的世界模型重新计算最佳路径。这种方法高效且易于理解,但当地图出错或地形发生地图未预见的改变时,它就会显得力不从心。第二种方法更像是一个学习走路的孩子:它尝试各种尝试,跌倒,起身,并通过试错来缓慢学习什么才是有效的。这种方法最终可以掌握非常复杂的动作,但它需要大量的时间和练习,并且当任务过于困难或错误代价过高时,往往无法完成学习。
多年来,研究人员一直试图结合两种方法的优点:导航员的细心规划与学习者的适应能力。一种较新的想法出现了,它将机器人的运动历史和奖励视为一个“故事”,利用最初为阅读人类语言而设计的强大计算机模型来预测下一个最佳动作。虽然这种“读故事”的模型前景广阔,但它们极难训练。它们经常陷入缓慢、不稳定的学习循环,无法找到通往解决方案的最有效路径。曼彻斯特大学的一个研究小组现在开发出了一种新的引导这些模型的方法,帮助它们比以往更快、更可靠地学习复杂的机器人动作。
研究人员专注于教一个被称为“四足机器人”的四足机器人应对具有挑战性的环境。他们希望机器人能够走过崎岖不平的地面、爬楼梯以及登上湿滑的斜坡而不摔倒。为此,他们创建了一个混合系统,架起了细心规划者与试错学习者之间的桥梁。他们使用了一种称为“模型预测控制”(Model Predictive Control)的技术,这起到了实时引导的作用。在每一时刻,这个引导程序都会计算出一条机器人可以遵循的短期、局部完美的路径,本质上是在向机器人展示此时此刻什么是好的动作。这个引导程序不需要知道整个未来;它只需要知道接下来的几步。
这些由引导程序生成的短期高质量路径随后被输入到一个“决策 Transformer”(Decision Transformer)中,即那个“读故事”的模型。机器人不再需要通过漫无目的的徘徊和犯错从零开始学习,而是通过研究引导程序提供的优秀范例来进行学习。这消除了对海量离线数据或在现实世界中进行无休止试错的需求。机器人可以通过学习引导程序的建议,来精炼自己关于如何高效移动的理解。然而,训练这些大型模型在数学上仍然是一个难题。可能的解决方案空间充满了尖峰和深谷,使得标准的学习算法很容易陷入困境或移动过慢。
为了解决这个问题,研究人员引入了一种新的方式来引导学习过程本身。他们将机器人大脑存在的数学空间视为一个弯曲的表面,而不是一个平坦、简单的网格,就像地球表面一样。标准学习方法在曲面上沿直线移动,这可能是低效的。这种新方法——作者称之为“引导黎曼优化”(Guided Riemannian Optimization)——理解了这个空间的曲率。它调整学习的方向以遵循问题的自然轮廓,从而让机器人的大脑更快地找到最佳解决方案。这种方法就像一位了解地形的徒步旅行者,他知道如何沿着山丘的自然纹理行进,从而采取最直接的路线,而不是走直线导致陷入死胡同或陡峭悬崖。
团队在模拟真实物理环境的 Unitree AlienGo 四足机器人上测试了该系统。他们为机器人设定了三个截然不同的挑战:行走在不平整的地形上、爬楼梯以及在低摩擦力的倾斜面上攀爬。他们将这种新方法与几种成熟的技术进行了对比,包括标准的强化学习算法以及其他未使用曲面学习方法的决策 Transformer 版本。结果显示出新系统的明显优势。在每一项任务中,使用引导式、感知曲率方法的机器人都能达到更高的性能水平,并且完成任务所需的尝试次数更少。
数据表明,机器人学习在崎岖地面行走、爬楼梯和攀爬湿滑斜坡时,表现出了更高的稳定性和速度。训练过程本身也显著提高了效率,其损失函数(衡量机器人预测错误程度的指标)下降速度比传统方法快得多。统计分析证实,这些改进并非偶然。新方法始终优于现有的最佳替代方案,证明了将实时规划器与“读故事”模型相结合,并利用对底层几何结构的理解来优化学习过程,可以创造出一种强大的控制工具。
这项工作表明,机器人学习的未来可能不在于在细心规划与试错之间做出选择,而在于将两者交织在一起。通过使用规划器提供高质量的范例,并使用专门的数学方法来引导学习过程,机器人可以更快、更稳健地掌握复杂的物理任务。研究人员证明,这种方法在模拟环境中行之有效,为在现实世界中部署智能、适应性强的机器人提供了一条充满希望的路径,因为在现实世界中,情况很少是完美的,且失败的代价很高。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。