Adaptive Outer-Loop Control of Quadrotors via Reinforcement Learning
本文提出了一种用于四旋翼飞行器的自适应外环控制架构,该架构将深度强化学习策略与残差动力学预测器及在线校准机制相结合,旨在无需依赖过度保守的域随机化,即可在严重动态干扰和模型不确定性下实现鲁棒且高精度的轨迹跟踪。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在训练一架微型超敏捷无人机(大小如咖啡杯),让它能在风暴中完美飞行。目标是让它沿着特定路径飞行而不发生晃动,即使风向改变、在它身上挂上重物,或者重物开始像钟摆一样摆动。
本文提出了一种利用**强化学习(RL)**训练无人机实现这一目标的新方法。强化学习就像用零食训练狗:无人机尝试各种动作,飞得好时获得“奖励”,撞毁时受到“惩罚”,最终学会最佳的飞行方式。
以下是他们方法的分解,采用简单的类比说明:
1. 问题:“过度偏执”的飞行员
通常,工程师在计算机模拟中训练无人机以应对现实世界的混乱时,会使用一种称为**域随机化(Domain Randomization)**的方法。
- 类比:想象训练一名飞行员,将他扔进一个模拟器,其中风速、飞机重量和发动机强度每秒都在随机变化。
- 结果:飞行员学会了极度谨慎。他们变成了一位“偏执”的飞行员,对一切反应过度。在现实世界中,这会让无人机变得 jittery(抖动)且不稳定,就像一位神经质的司机,每遇到路上的小石子就猛踩刹车。这种方法虽然有效,但不够平稳或高效。
2. 解决方案:“侦探”无人机
作者提出了一种更智能的系统。他们不是训练无人机对所有事情都偏执,而是教它成为一名侦探,能够准确判断此刻发生了什么并相应调整。
他们构建了一个三部分系统:
部分 A:“神谕”(The Teacher,教师)
首先,他们在计算机中训练了一个“完美”版本的无人机。这个版本拥有一个神奇的“神谕”,能在每一毫秒告知它确切的风速、有效载荷的确切重量以及作用在它身上的确切力。
- 结果:这架无人机飞行完美,因为它确切知道哪里出了问题并立即修正。
- 局限:现实中的无人机没有这些魔法传感器。它们无法“感知”风速或确切的重量变化。因此,这个完美版本无法在现实世界中飞行。
部分 B:RDP(The Detective,侦探)
为了解决“无传感器”的问题,他们添加了一个残差动力学预测器(Residual Dynamics Predictor, RDP)。这是一个小型人工智能大脑(神经网络),充当侦探。
- 工作原理:它观察无人机的历史:“一秒钟前我在哪里?我移动得有多快?我刚刚向电机发送了什么指令?”
- 类比:想象你正在开车,突然感觉到车子向左拉扯。你不需要传感器告诉你“轮胎被石头击中了”。你可以推断出发生了这种情况,因为车子向左拉扯且方向盘变硬了。RDP 对无人机做同样的事情。它查看电机指令和运动历史来猜测:“啊,左边一定挂着一个沉重的袋子,”或者“有一股阵风在把我向上推。”
- 神奇之处:它不需要特殊的力传感器。它仅利用无人机已有的数据(速度、位置、电机信号)来推测不可见的力。
部分 C:“校准桥”(The Translator,翻译器)
当他们将人工智能从计算机迁移到真实无人机时,存在轻微的失配。计算机世界是完美的;而现实世界存在微小的缺陷(例如略微磨损的电机或电量未满 100% 的电池)。
- 类比:这就像将一本书从英语翻译成法语。单词是一样的,但口音略有不同。
- 修复:他们不是重新训练整个 AI(这需要很长时间),而是使用了一个“线性校准桥”。他们让无人机飞行几秒钟,比较 AI认为发生的情况与实际发生的情况,然后应用一个简单的数学修正。这就像调节收音机的音量旋钮以获得完美的声音。这仅需几秒钟的数据即可完成。
3. 结果:表现如何
他们在真实的微型无人机(Crazyflie)上测试了这架“侦探无人机”,涵盖了三种艰难场景:
- 增加重量:他们在无人机上悬挂了重物。
- 旧方法:随着重量增加,无人机变得晃动并最终坠毁。
- 新方法:侦探推测重量变重了,请求更多动力,从而平稳飞行。
- 不均匀的重量:他们仅在一只臂上悬挂了重物。
- 旧方法:无人机因无法处理扭转而失控旋转。
- 新方法:侦探意识到“我被向左扭转了”,并调整电机以完美抵消这种扭转。
- 摆动载荷:他们用绳子悬挂了一个重物(像钟摆一样)。
- 挑战:随着无人机移动,重物来回摆动,产生不可预测的力。
- 结果:即使重物剧烈摆动,无人机也能完美追踪"8"字形路径。侦探 AI 能够“看到”摆动运动并实时抵消它。
核心结论
该论文证明,你不需要一位期待最坏情况的“偏执”飞行员。相反,你可以构建一位智能、自适应的飞行员,它能够:
- 观察此刻正在发生的事情。
- 推测不可见的力(风、重量、摆动),仅使用标准数据。
- 即时调整以保持平稳飞行。
这种方法训练速度更快,使用的计算资源更少,且比以前的方法飞行更平稳,同时无需在微型无人机上安装昂贵且沉重的传感器。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。