← 最新论文
🤖 machine learning

Foundations of Reinforcement Learning and Control:Connections and New Perspectives

本教程通过引入自适应控制和演员-评论家算法,将强化学习与控制理论联系起来,展示了将两者的结合应用于运动控制问题,旨在促进这两个领域之间的相互理解与数据驱动型决策。

原作者: Claire Vernade, Onno Eberhard, Martha White, Florian Dörfler, Csaba Szepesvári, Miroslav Krstic, Michael Muehlebach

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Claire Vernade, Onno Eberhard, Martha White, Florian Dörfler, Csaba Szepesvári, Miroslav Krstic, Michael Muehlebach

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一只机器狗如何在田野上奔跑。你有两位截然不同的老师来担任这项工作。第一位老师是一位控制理论学家(Control Theorist)。他们就像一位细致入微的工程师,非常了解机器狗腿部的构造。他们为机器狗打造了一套安全护具和一套规则,以确保即使在泥泞的地面或腿部变得有些僵硬时,机器狗也不会绊倒。他们的主要目标是安全与稳定;他们希望机器狗无论何时都能站稳或走直线,而不会摔倒。第二位老师是一位强化学习(RL)专家。他们更像是一位爱玩的教练,并不关心机器狗的解剖结构。相反,他们直接把机器狗扔进田野里并说:“跑起来!如果你跑得快,就有奖励;如果你摔倒了,就什么也得不到。”通过数百万次的尝试,机器狗通过试错法学会了如何跑得飞快。

几十年来,这两位老师一直在各自独立的学校里工作。工程师们担心“爱玩的教练”太危险,可能会弄坏机器人;而“爱玩的教练”则认为工程师们过于死板,无法教会机器人任何花哨的动作。但现在,这两个领域都意识到他们需要彼此。未来的机器人需要既快速又聪明,但也需要具备安全性,并且在环境变化时不会散架。这篇论文是一本友好的指南手册,解释了如何让这两位老师互相认识,展示了他们不同的风格如何能够结合在一起,造就一个既是冠军选手又是安全旅行者的机器人。


这篇论文的核心思想:将安全护具与爱玩的教练结合起来

这篇由来自德国、加拿大和美国大学及研究机构的专家团队撰写的论文,充当了控制理论强化学习这两个世界之间的桥梁。作者们认为,尽管这些领域有着不同的历史和语言,但它们实际上都在解决同一个问题:即当我们在不知道机器如何运作的所有细节时,如何让机器进行智能的移动和行动。

为了解释这一点,作者使用了一个运行示例:一个名为 Half-Cheetah(半猎豹) 的模拟机器人。想象一只拥有六个关节(如膝盖和髋部)的机器人猎豹,它需要尽可能远、尽可能快地奔跑。

两种方法
论文首先分解了每个领域通常是如何处理这个 Half-Cheetah 的:

  1. 控制理论的方法(模型参考自适应控制,简称 MRAC):
    可以将其理解为给机器人一个“目标步态”。工程师说:“你的左腿应该这样移动,右腿应该那样移动。”他们构建了一个“参考模型”——一个关于机器人应该如何运动的完美、虚构的版本。如果真实的机器人因为关节变滑或变重而开始摇晃,MRAC 系统就像一个智能自动驾驶仪。它会不断检查真实机器人与完美模型之间的差异,然后实时调整电机以进行修正。它擅长保持机器人的稳定性并追踪特定的路径,即使机器人的重量发生变化或地面变得湿滑也是如此。然而,它是为**低层自适应(low-level adaptation)**设计的,这意味着它擅长通过调整力量来达到目标,但它本身并不会发明高层的策略或复杂的跑步风格。

  2. 强化学习的方法(演员-评论家算法,Actor-Critic Algorithms):
    这是“爱玩的教练”方法。在这里,机器人(“演员”)尝试奔跑,而一个“评论家”在一旁观察并说:“做得好!”或者“太慢了。”机器人从零开始学习,没有任何关于如何移动腿部的预设规则。它发现了复杂的、高速的跑步风格,而人类工程师可能从未想过这些风格。在论文的模拟中,一种名为 Soft Actor-Critic (SAC) 的著名算法学会了让 Half-Cheetah 跑得非常快。但问题在于:如果机器人的环境突然发生变化(例如,如果其关节的摩擦力减半),SAC 机器人就会感到困惑并开始踉跄,因为它学习的是一种仅在旧的、“粘性”地面上有效的特定跑步方式。

新的混合解决方案
论文的主要贡献是一种结合这两位老师的新方法。作者建议使用强化学习进行“高层”思考,并使用自适应控制进行“低层”肌肉控制

以下是他们在实验中运作的方式:

  • 高层大脑(RL): SAC 算法学习一种策略。它不再是精确地告诉机器人要对电机施加多少扭矩(力),而是学习去选择一组关节的期望角度。这就像教练说:“我希望你的膝盖弯曲 45 度,”而不是“用 5 牛顿的力量推电机。”
  • 低层肌肉(MRAC): 一旦大脑决定了期望的角度,MRAC 系统就会接管。它充当了肌肉记忆。它负责计算出实现该角度目前究竟需要多少力量,即使关节现在很滑或很重。如果摩擦力发生了变化,MRAC 系统会立即调整力量,以确保关节仍能达到目标角度。

他们的发现
在模拟中,作者在 Half-Cheetah 上测试了这个混合系统。

  • 首先,他们训练 SAC 机器人在正常表面上奔跑,机器人学会了一种优秀的跑步风格。
  • 然后,他们将学到的策略部署到环境中。在机器人运行了 120 万步后,他们突然改变了物理特性:他们让关节变得更加湿滑(将阻尼系数降低了 2 倍)。
  • 结果: 纯 RL 机器人(单独使用 SAC)崩溃并表现糟糕,因为它不知道如何处理湿滑的关节。纯自适应控制器(单独使用 MRAC)虽然可以追踪简单的路径,但无法跑得快或进行复杂的动作。
  • 混合系统胜出: 组合系统(SAC + MRAC)保持了平稳的运行。由于“大脑”持续选择着同样优秀的跑步角度,而“肌肉”(MRAC)自动调整了力量来应对新的湿滑条件,机器人没有崩溃,而是继续奔跑。

为什么这很重要
论文指出,我们不必在“安全、刻板的工程学”和“智能、灵活的学习”之间做选择。通过将它们分层叠加,我们可以获得两者的精华。RL 部分可以学习复杂的、高层的策略(如如何跑得快或爬坡),而自适应控制部分则处理物理世界中混乱且多变的事实(如风力、湿滑的地板或损坏的零件)。

作者谨慎地指出,这目前是在计算机模型上的模拟,而非在真实实验室里运行的物理机器人。他们还指出,虽然这种混合方法在他们的特定测试中表现良好,但它并不是解决所有问题的万灵药。例如,RL 部分仍然需要先学习策略,而自适应部分需要一个良好的参考模型来进行追踪。

最终,这篇论文是对两个领域的科学家发出的行动号召,呼吁他们停止闭门造车。它表明,通过理解彼此的工具——例如如何将“李雅普诺夫函数”(一种证明稳定性的数学方法)与“价值函数”(一种衡量成功程度的数学方法)联系起来——我们可以制造出不仅聪明快速,而且足以应对不可预测的现实世界的机器人。他们认为,未来的机器人技术在于这种协作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →