← 最新论文
💻 computer science

Neuromorphic Reinforcement Learning for Quadruped Locomotion Control on Uneven Terrain

本文提出了一种基于平衡传播的近端策略优化框架,该框架通过使用局部学习取代传统的反向传播,旨在实现能够在不平整地形上进行高能效、自适应四足运动,同时在性能上与标准方法相当且显著提升了内存效率。

原作者: Zhuangyu Han, Abhronil Sengupta

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhuangyu Han, Abhronil Sengupta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你拥有一只四足机器人狗。教它在平地上行走很容易,但让它在崎岖不平、凹凸不平的地形上小跑而不摔倒,却是一个巨大的挑战。通常,我们使用一种叫做“强化学习”的方法来教这些机器人,这就像一个学生在超级快速的计算机模拟中尝试成千上万道练习题。计算机通过观察全局图景并向整个大脑发送回传修正信号(这个过程被称为反向传播),来计算出“正确”的答案。

然而,这种方法有两个大问题:

  1. 极其耗能: 它需要强大的、沉重的计算机,这会迅速消耗机器人的电池。
  2. 过于僵化: 一旦机器人在模拟中训练完成,它很难在现实世界中学习新技巧,或者适应磨损的腿部或背负重物。

这篇论文提出了一种新的方式来教导机器人,其灵感来源于动物实际的学习和运动方式。

动物灵感:节奏与修正

思考一下人类或狗是如何走路的。你并不会有意识地告诉每一块肌肉何时该抽动。相反,你的脊椎有一个内置的“节拍器”(称为中枢模式发生器CPG),它创造了走路的基本节奏。你的大脑只需进行微小的调整,以确保你在踩到石头时保持平衡。

作者使用这种相同的两部分理念构建了机器人的控制器:

  • 节拍器 (CPG): 一个预设的节奏,负责处理基本的步进动作。
  • 调节器 (残差策略): 一个学习型大脑,当地形变得复杂时,对腿部进行微小的修正。

新的学习方法:“平衡传播”

这里的创新在于他们如何教导这个“调节器”大脑。

旧方法 (反向传播): 想象一下试图修理一个坏掉的时钟,你需要把它拆解开,观察每一个齿轮,精确计算每个齿轮是如何导致误差的,然后将修正信号通过整个机器传回。这很精确,但需要大量的能量和内存来存储所有这些计算。

新方法 (平衡传播): 想象这个时钟是一个弹簧驱动的系统。与其把它拆开,不如轻轻地推动指针向前或向后移动。观察整个系统如何趋于一个新的、稳定的位置(即“平衡”)。通过比较这种轻微推动前后的状态,系统就能学习到需要做出哪些改变。

  • 不需要全局地图: 它不需要同时看到整台机器。它只关注局部连接。
  • 高效节能: 这种方法更接近生物大脑的工作方式,并且旨在运行在低功耗的专用硬件(神经形态芯片)上。

他们做了什么以及结果如何

研究人员使用这种新的“轻推并趋于平衡”的方法,训练了一只标准的机器人狗(Unitree A1),使其能在崎岖不平、多石的地形上行走。他们将此与传统的、耗能巨大的方法进行了对比。

以下是研究结果,已转化为通俗易懂的语言:

  • 性能相同: 机器人学走路的效果与使用旧的、沉重方法训练的机器人一样好。它没有更容易摔倒,走路速度一致,且稳定性同样出色。
  • 巨大的内存节省: 新方法在训练过程中使用的芯片内存减少了 4.3 倍。这就像是从需要一个仓库来存储训练数据,变成了只需要一个小型文件柜。
  • 稳定性: 在尝试新的学习方法时,机器人并没有出现“崩溃”或陷入混乱,而这在尝试新方法时是一个常见问题。

为什么这很重要

论文认为,这是迈向那些无需依赖大型服务器集群或巨大电池包、就能在“外场”进行学习的机器人的关键一步。通过使用模仿生物平衡(轻推与趋于平衡)的学习规则,他们证明了复杂的、高性能的机器人行走可以在不需要传统方法那样沉重的计算成本的情况下实现。

简而言之: 他们用一种“轻推”式的学习风格,而不是“重度计算”式的风格,教会了一只机器人狗如何在岩石上行走。机器人走得一样好,但计算机教学时所需的内存要少得多,这为未来更智能、更省电的机器人铺平了道路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →