在现实世界中移动的机器人经常面临一个根本性的困境:它们必须足够强壮,以承载自身重量并推开障碍物,同时又必须足够灵活,以便在地面发生变化时进行适应。传统的机器人由刚性金属框架构建,在面对崎岖、多石或杂乱的地形时往往表现不佳,容易被卡住或倾覆。另一种方法是使用由刚性杆件和连接它们的柔性缆绳网络组成的结构。这些“张拉整体”(tensegrity)机器人轻巧且极其耐用;如果它们摔倒,会通过弹跳而非破碎来应对。然而,控制它们是非常困难的。因为它们的运动依赖于缆绳张力与杆件接触地面方式之间复杂的相互作用,预测它们如何滚动或翻滚就像是用不完整的数据来预测天气一样难以捉摸。这些机器人往往无法感知自身的完整形状或接触地面的精确角度,这使得计算机很难规划一条安全的路径。
罗格斯大学和耶鲁大学的研究人员开发了一种新方法,引导这些蹦跳机器人穿过复杂的环境,包括陡峭的坡道、狭窄的走廊和低垂的障碍物。该模型不再依赖于描述机器人运动的完美数学公式,而是通过经验来教计算机模型学习。该模型使用一种被称为图神经网络(graph neural network)的人工智能技术,这种技术特别擅长理解系统中不同部分是如何相互连接的。在这种情况下,这个系统就是机器人本身,以及它可能碰撞到的墙壁和地面。研究人员在这个学习系统中加入了一个特殊功能,使机器人能够“感知”何时触碰到表面,无论该表面是平坦的地面、倾斜的坡道,还是机器人自身的其他部分。这种感知接触的能力至关重要,因为机器人通常需要靠在墙上或挤过障碍物才能向前移动。
为了将这种学习模型投入使用,团队创建了一个充当持续、快速规划器的控制系统。想象一下,机器人在移动过程中,每隔一秒钟就会停下来,在脑海中构思未来几秒钟内可能进行的成千上上种不同的移动方式。它在脑海中模拟每一种可能性,检查哪条路径能在不发生碰撞的情况下到达目标。系统随后选择最佳方案并执行,紧接着立即开始规划下一组动作。这个过程被称为模型预测控制(model predictive control),它使机器人能够实时对变化做出反应。然而,研究人员发现,机器人在自主转向方面表现挣扎。为了解决这个问题,他们将智能规划系统与一套简单的、预设好的转向动作相结合。当机器人需要改变方向时,它会使用这些可靠的转向动作来调整朝向,然后让智能规划器接管剩余路径的导航。
团队在模拟真实世界物理特性的高保真计算机模拟中测试了这种方法。他们为机器人设置了五种不同的挑战,从带有墙壁的简单平坦赛道到包含陡坡和狭窄空间的复杂三维障碍赛道。在难度最大的测试中,机器人必须通过一条它从未见过的路线,该路线结合了之前所有的挑战。结果显示,使用这种新学习系统和混合转向策略的机器人比旧方法成功得多。当其他方法在爬坡或通过狭窄通道时失败时,新系统即使在未见的场景中也能在绝大多数尝试中成功到达目标。随着收集到更多数据,机器人的表现不断提升,变得越来越快且越来越准确。
这项工作表明,通过教机器人理解它们如何与周围世界接触,并赋予它们学习智能与简单可靠动作的结合,我们可以创造出能够应对现实世界混乱、不可预测地形的机器。研究人员证明了这种方法在模拟实验中的有效性,为未来对实体机器人的测试铺平了道路。虽然目前的系统仅限于平坦表面,且需要进一步开发以处理完全无结构的复杂环境,但这一方法的成功为开发能够探索灾区、搜寻废墟中的幸存者或穿越其他行星崎岖景观的机器人提供了一条充满希望的路径。
技术摘要:基于接触感知图神经网络动力学模型的张拉整体机器人模型预测控制
问题陈述
张拉整体(Tensegrity)机器人由刚性杆件和柔性缆绳组成,具有适合非结构化地形的轻量化和顺应性移动能力。然而,其控制受限于复杂的、富含接触的动力学过程以及部分可观测性。传统的控制方法通常依赖几何规划或运动基元来规避系统动力学,而从仿真中迁移的强化学习策略往往表现出有限的运动能力。此外,现有的基于图神经网络(GNN)的已学习动力学模型通常假设水平地面接触,未能考虑到非水平平面地形、环境障碍物或自碰撞。本研究旨在解决在复杂环境中实现张拉整体机器人鲁棒闭环导航的挑战,其中准确建模接触交互至关重要。
方法论
所提出的框架将学习到的 GNN 动力学模型与模型预测路径积分(MPPI)控制器集成,并在迭代数据采集循环中运行。
接触感知 GNN 动力学模型:
- 该方法的核心是对先前 GNN 动力学模型的扩展。作者引入了一个使用 PyTorch 实现的可微接触检测模块。
- 该模块生成接触特征,表示机器人的端盖与非水平平面(如坡道、墙壁)之间的相互作用,以及机器人圆柱形杆件之间的自碰撞。
- 这些相互作用被编码为图中的节点特征(符号距离)和边特征(相对速度、表面法线和距离)。这使得模型能够在具有复杂接触约束的环境中,在部分观测条件下预测状态变化(杆件速度和缆绳静止长度)。
混合 MPPI 控制器:
- 控制器利用学习到的 GNN 作为其内部预测模型进行基于采样的最优控制。
- 为了解决三杆张拉整体机器人转向行为采样困难的问题(这需要长时界和大量样本),采用了混合策略。
- 系统评估机器人的航向相对于局部代价梯度的方向。如果航向与目标方向一致(在阈值 α 内),则执行 MPPI 控制器。如果航向不一致,系统将切换到人工设计的转向运动基元(顺时针或逆时针)以重新调整机器人的朝向,然后再恢复 MPPI 控制。
- 代价函数利用在网格上构建的具备障碍物感知的波前启发式算法。通过从目标点传播具备障碍物感知的距离估计,该方法避免了在拥挤环境中直接使用欧几里得距离度量的缺陷。
迭代数据采集循环:
- 系统在一个闭环中运行,MPPI 控制器执行任务并生成新的轨迹数据。
- 这些数据被添加到训练集中以重新训练 GNN 动力学模型,从而在随后的迭代中提高控制器的预测精度和性能。该过程始于来自人工设计基元的数据,并通过连续的训练周期不断演进。
核心贡献
- 扩展的 GNN 动力学模型: 一个结合了可微接触检测的学习模型,用于处理非水平平面地形、环境障碍物和自碰撞,超越了以往仅限于平坦地面的假设。
- 迭代 MPC 框架: 一个在学习到的 GNN 之上使用 MPPI 的 MPC 框架,通过迭代循环同时改进动力学模型和控制性能。
- 混合控制策略: 一种结合了 MPPI 与转向运动基元的解决方案,用以增强机动性并克服纯 MPPI 在转向操作中的采样效率低下问题。
- 全面评估: 在 MuJoCo 中针对五种不同的导航任务进行了实验验证,包括斜坡、狭窄通道、低矮结构和复合 3D 障碍物赛道。
结果
实验在五种导航场景下进行:平坦障碍物赛道、5° 斜坡、狭窄转角/通道、低矮结构以及复合 3D 障碍物赛道(后者作为未见的测试环境)。
- 模型精度: 接触感知 GNN 模型在预测质心位置和杆件方向方面始终优于基准 GNN(假设平坦地面)。随着数据集随控制器生成数据的增加,预测误差在训练迭代过程中不断降低。
- 导航性能:
- 平坦障碍物赛道: 混合 MPPI 从第一次迭代就实现了 100% 的成功率,优于 MPPI 仅有的表现(后者在转向方面表现挣扎),并达到了 A* 重规划基准的最终性能。
- 斜坡: A* 基准由于航向动力学的漂移而完全失败。仅使用 MPPI 取得了有限的成功(33%),而混合 MPPI 从第一次迭代就实现了 100% 的成功率。
- 狭窄通道与低矮结构: 这些任务需要与障碍物发生有意接触,而 A* 基准无法进行此类规划。混合 MPPI 显著优于仅使用 MPPI 的方案,实现了更高的成功率和更快的收敛速度。
- 3D 障碍物赛道(未见环境): 混合 MPPI 策略展示了强大的泛化能力,在最终迭代中达到了 84% 的成功率,而仅使用 MPPI 的方案仅为 35%。
- 消融实验: 结果表明,距离接触的节点特征对预测精度的影响比仅有接触边特征更大,强调了显式邻近信息的重要性。
意义与声明
本文声称,结合接触感知的学习动力学和基于采样的模型预测控制,能够实现在复杂且富含接触的环境中进行鲁棒的张拉整体导航,而在这些环境中,传统的几何规划或纯强化学习会失效。作者强调,迭代数据采集循环对于优化模型处理部分可观测性和复杂接触物理特性的能力至关重要。
该工作在当前范围内的表述较为谦逊,承认目前的方法仍受限于平面表面表示,且转向基元是人工设计的。作者指出未来的工作方向包括将模型扩展到完全非结构化的地形、直接从数据中学习转向基元,以及在物理三杆张拉整体机器人上演示该迭代改进循环。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。