← 最新论文
💻 computer science

Hebbian Attractor Networks for Robot Locomotion

本文提出了一种名为赫布吸引子网络(HAN)的可塑性神经网络,通过局部权重更新归一化及双时间尺度可塑性机制,在模拟四足机器人(Unitree Go1)的 locomotion 任务中展示了如何通过调节可塑性更新频率与激活平均化来诱导稳定的权重吸引子或动态极限环,从而实现对变化环境的快速适应。

原作者: Alexander Dittrich, Fuda van Diggelen, Dario Floreano

发布于 2026-03-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Alexander Dittrich, Fuda van Diggelen, Dario Floreano

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个关于**如何让机器人像生物一样“边做边学”**的故事。

想象一下,传统的机器人就像是一个背熟了乐谱的钢琴家。在演出前(训练阶段),它把每一个音符(动作)都死记硬背下来,记在脑子里(固定的权重)。一旦上台(部署),无论观众怎么起哄、舞台地板怎么晃动,它都只能机械地按原样弹奏,一旦出错就无法挽回。

而这篇论文提出的**“赫布吸引子网络”(HAN),则像是一个即兴演奏的爵士乐手**。它不仅在演奏,还在根据当下的感觉实时调整手指的力度和位置(在线学习)。

核心概念:什么是“赫布学习”?

首先,我们要理解“赫布学习”(Hebbian Learning)。这源于生物学的一个著名原则:“一起激发的神经元连在一起”(Cells that fire together, wire together)。

  • 比喻:想象你的大脑里有很多小灯泡(神经元)。如果两个灯泡经常同时亮起,连接它们的那根电线就会变粗、导电性变强。
  • 在机器人里:当机器人的传感器(比如脚底触地)和它的动作(比如抬腿)同时发生时,它们之间的连接就会自动加强。这种学习不需要老师告诉它“你错了”,而是完全基于它自己的体验。

论文发现了什么?

研究人员发现,如果让机器人每时每刻都疯狂地调整这些连接(就像爵士乐手每秒钟都换一种风格),机器人就会变得不稳定,甚至走起路来像喝醉了一样,因为它的“肌肉记忆”还没形成就被打断了。

为了解决这个问题,他们引入了两个关键技巧,就像给机器人装上了**“双速调节器”“记忆缓冲池”**:

  1. 双速调节(Dual-timescale)

    • :机器人的动作控制非常快(比如每秒 50 次),这就像乐手的手指在快速跳动。
    • :学习(调整连接)的速度要慢得多。就像乐手不会每跳一个音符就重新写乐谱,而是跳完一段旋律后,再花点时间思考刚才哪里弹得好,哪里需要微调。
    • 效果:这种“慢学习”让机器人有机会把刚才的经验沉淀下来,而不是被瞬间的噪音干扰。
  2. 记忆缓冲(Averaging)

    • 机器人不会只根据“这一瞬间”的感觉来学习,而是会平均过去几秒钟的感觉。
    • 比喻:就像你判断一个人是否生气,不会因为他皱了一下眉就下结论,而是看他几分钟内的整体表情。这种“平滑”处理让机器人学得更稳。

两种神奇的“状态”

通过调整“学习速度”和“记忆长度”,研究人员发现了机器人两种截然不同的“大脑状态”:

  1. 振荡状态(Limit Cycles)—— 像钟摆

    • 场景:当学习速度较快时。
    • 表现:机器人的“肌肉连接”会随着它的走路节奏不停地摆动。就像钟摆一样,它必须不停地动才能维持平衡。
    • 比喻:这就像骑自行车,你必须不停地微调把手才能保持不倒。如果突然停止微调(停止学习),车就会倒。这种状态适合应对突发的小变化,比如路面突然有点滑。
  2. 固定点状态(Fixed-point Attractors)—— 像磁铁

    • 场景:当学习速度慢、且记忆时间长时。
    • 表现:机器人先快速尝试,然后迅速找到一个最完美的姿势,并“锁定”在这个状态。就像磁铁吸在铁板上,无论怎么推,它都会回到那个位置。
    • 比喻:这就像你学会了骑自行车后,身体形成了一种肌肉记忆。即使路面有点颠簸,你的身体会自动微调,但整体的骑行姿态是稳定不变的。这种状态非常稳健,即使遇到大干扰(比如被推了一下),它也能迅速回到那个完美的“锁定状态”。

实验结果:真的有用吗?

研究人员在模拟的**四足机器人(Unitree Go1,类似机器狗)**上做了测试:

  • 普通机器人:如果腿断了或者受了伤,它就走不动了,因为它背的乐谱是固定的。
  • HAN 机器人
    • 振荡状态下,它能灵活地适应各种奇怪的走路姿势。
    • 固定点状态下,它不仅能走得稳,而且当遇到意外(比如被推了一下,或者腿受了伤)时,它能迅速调整并自动恢复到那个最稳定的走路姿势,就像弹簧被压弯后弹回来一样。

总结

这篇论文的核心贡献是告诉我们要控制学习的节奏

  • 以前我们要么让机器人死记硬背(固定权重),要么让它胡乱尝试(快速学习)。
  • 现在,通过**“慢学习 + 平均记忆”**,我们能让机器人进化出两种超能力:
    1. 像钟摆一样灵活,适应不断变化的环境。
    2. 像磁铁一样稳定,在遇到干扰时自动回归正轨。

这就好比我们人类,既能在紧张时快速反应(振荡),也能在熟练后形成肌肉记忆(固定点)。这篇论文让机器人也拥有了这种**“生物般的适应性”**,让它们在未来的真实世界中(比如地震救援、火星探索)能更聪明、更皮实地工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →