想象一下,你有两架只有蜂鸟大小的微型无人机(被称为 Crazyflies),它们需要协同工作,搬运一个悬挂在绳索上的沉重摆动物体。这不仅仅是一个简单的抬升过程;这个重量会像钟摆一样摆动,绳索可能会变松然后突然拉紧。
这篇名为 CrazyMARL 的论文描述了研究人员是如何通过一种特殊的“团队训练”——强化学习(Reinforcement Learning)——来教会这些微型无人机完成这项工作的。研究人员并没有编写死板的规则,而是让无人机在超快速的视频游戏模拟中通过试错法进行学习,最终教会了它们如此出色的飞行技巧,使它们无需任何人工帮助就能应对现实世界。
以下是他们实现这一目标的详细分解,使用了简单的类比:
1. 挑战:“摇晃吊灯”问题
通常,当机器人搬运物体时,它们会假设物体像背包一样固定在自己身上。但在这里,负载是悬挂在缆绳上的。
- 问题所在: 如果无人机移动太快,重量就会摆动。如果缆索变松,重量就会掉落;如果缆索突然拉紧,会猛烈地拽动无人机。这就像是在有人推你、狂风肆虐的情况下,试图提着一盏吊灯在蹦极绳上移动。
- 旧方法: 以前的方法试图用复杂的数学公式(如刚性杆)来解决这个问题。它们假设缆索是坚硬且不变的。这种方法在风平浪静时表现尚可,但在情况变得混乱或缆索变松时,表现会极其糟糕。
2. 解决方案:“肌肉记忆”法
研究人员没有为无人机编写说明书。相反,他们使用了强化学习(RL)。
- 类比: 想想训练狗的过程。你不会告诉狗:“把左腿向前迈 3 英寸。”你是在它做得对的时候说“好孩子!”,在它搞砸时说“不!”,通过这种方式,狗逐渐学会了正确动作的“感觉”。
- 训练过程: 无人机在视频游戏(模拟器)中进行了数百万次的练习。每当它们掉落重量或撞机时,都会得到一个“低分”。每当它们保持重量稳定时,就会得到一个“高分”。
- 速度: 他们使用了一台强大的计算机(GPU),在短短 70 分钟内完成了 20 亿步的训练。这就像是在一个下午的时间里,看完了别人一辈子的练习。
3. 核心秘诀:“直接肌肉控制”
大多数机器人的“大脑”告诉“脊柱”该做什么,然后“脊柱”告诉“肌肉”(电机)该做什么。而这篇论文跳过了“脊柱”。
- 类比: 想象一位钢琴家。普通的机器人就像是在读乐谱的人,思考着音符,然后再告诉手指如何移动。CrazyMARL 则像是一位爵士乐手,能感受到节奏,手指自然而然地知道该去哪里。
- 结果: AI 直接与电机对话,频率高达每秒 250 次。它直接向电机发送原始电信号(PWM)。这使得无人机能够瞬间对阵风或突然的推力做出反应,在不坠毁的前提下,在物理极限边缘进行操作。
4. “魔术技巧”:从模拟到现实的迁移 (Sim-to-Real Transfer)
通常,在视频游戏中训练的机器人在进入现实世界时会失败,因为游戏中的物理法则并不完美。
- 技巧: 研究人员使用了领域随机化(Domain Randomization)。他们不仅在一个完美的虚拟世界中训练无人机,还在成千上万个略微“破碎”的世界中进行训练:
- 有时电机动力较弱。
- 有时风力极大。
- 有时缆绳过长或过短。
- 有时无人机从地面或倒置状态开始。
- 结果: 因为他们在如此混乱、多变的环境中进行了训练,无人机学会了一种适用于任何地方的“超级技能”。当它们被安装到真实的 Crazyflie 无人机上时,不需要任何重新训练,直接就能投入使用。这被称为零样本迁移(Zero-Shot Transfer)。
5. 结果:他们究竟取得了什么成就
论文声称取得了以下具体且令人印象深刻的结果:
- 扰动抑制: 当研究人员用力推搡无人机或吹送强风(3.5 米/秒的风速)时,无人机的恢复成功率达到了 80%。而旧方法仅为 44%。
- 灵活性: 无人机可以从地面起飞,提起重量,并进行“8 字形”飞行,即使在重量剧烈摆动的情况下也能做到。
- 去中心化团队协作: 两架无人机不需要互相交谈,也不需要一个中央指挥官。每架无人机都有自己的“大脑”(策略),观察自身的传感器和队友的位置,然后它们就能自动实现协调。
总结
简而言之,CrazyMARL 是一个系统,它通过让微型无人机在混乱、高速的视频游戏中进行练习,从而教会它们如何搬运摆动的负载。通过教它们直接控制电机,并在各种灾难场景下进行训练,研究人员创造了一支能够协同飞行、应对强风并比以往任何方法都能更好地从碰撞中恢复的无人机团队,而且整个过程完全不需要人类来操控。
技术摘要:CrazyMARL
问题陈述
由无人机(UAV)团队协同运输缆绳悬挂载荷具有显著潜力,可提高载荷能力并适应不规则负载。然而,控制此类系统具有挑战性,因为存在复杂的摆动动力学、张力耦合以及“松弛”与“紧绷”缆绳模式之间的转换。现有的控制策略面临特定局限性:
- 基于模型的方法 通常依赖于将缆绳视为刚性杆的假设,这无法捕捉混合动力学(松弛-紧绷转换)并限制了灵活性。集中式方法面临可扩展性瓶颈和单点故障问题,而分布式模型控制方法可能缺乏性能保证或难以处理迭代通信。
- 强化学习(RL)方法 在单智能体场景和某些多智能体任务中已展现出潜力,但以往关于多无人机载荷运输的研究主要依赖于刚性连杆假设,或采用需要通信开销的集中式训练、分布式执行(CTDE)架构。
- 硬件约束: 大多数现有方法并未解决在资源受限的机载微控制器(如 Crazyflie 2.1)上控制多个机器人时的问题,这些设备在接近其驱动极限时,由于低推重比会导致频繁处于电机饱和状态。
方法论
作者提出了 CrazyMARL,这是一个专为具有真实缆绳动力学的协同航空运输设计的分布式多智能体强化学习(MARL)框架。
1. 框架与架构
- 算法: 系统采用带有参数共享的独立近端策略优化(IPPO)。这遵循完全分布式的执行机制,每个智能体根据局部观测进行行动,无需进行机器人间的通信,从而避免了可扩展性瓶颈。
- 训练流水线: 训练通过 JAX 和 MuJoCo MJX 在 GPU 上进行端到端训练,支持数千个并行环境。这种高吞吐量设置使得在短时间内进行大规模领域随机化(DR)成为可能(在 70 分钟内完成 20 亿步训练)。
- 观测空间: 每个智能体 i 接收局部观测 oti,包括:
- 载荷误差 (etP) 和速度 (vtP)。
- 智能体的相对位置 (δti)、朝向 (Rti) 以及速度 (vti,ωti)。
- 智能体前一时刻的动作 (at−1i)。
- 队友的相对位置 ({δtj}j=i) 用于协同。
- 动作空间: 智能体直接输出映射到 250 Hz 脉冲宽度调制(PWM) 占空比的归一化电机指令。该策略绕过了低层级级联控制器(如 PID 或推力混合),直接映射到电机驱动,以便在物理极限附近有效运行。
2. 仿真与动力学
- 混合缆绳模型: 与以往使用刚性杆的研究不同,本仿真采用 MuJoCo tendon(腱模型)来模拟仅在紧绷时产生张力、在松弛时产生零力的缆绳。这捕捉了对于敏捷机动至关重要的混合松弛-紧绷动力学。
- 领域随机化 (DR): 为了确保从仿真到现实(sim-to-real)的稳健迁移,训练过程整合了以下随机化:
- 初始状态(包括地面启动和松弛缆绳)。
- 执行器参数(推力上限、时间常数、电机偏移)。
- 观测噪声和随机外部扰动(风、推力)。
- 目标位置。
3. 奖励设计
使用模块化、复合的奖励函数 r=rtrack⋅rstable+rsafe:
- 追踪 (rtrack): 最小化载荷误差并将载荷速度与目标对齐。
- 稳定性 (rstable): 惩罚过度的摆动、倾斜和速度,同时鼓励保持缆绳紧绷。
- 安全性 (rsafe): 鼓励平滑的动作、平衡的电机推力以及碰撞规避。
奖励项被限制在 [0, 1] 范围内,以促进平滑梯度并防止智能体学习提前终止回合。
核心贡献
- 端到端分布式控制: 首次展示了用于多无人机缆绳悬挂运输的完全分布式 MARL 策略,该策略直接输出电机 PWM 指令而不经过低层级级联,专门针对 Crazyflie 2.1 等资源受限平台进行了优化。
- 混合缆绳动力学: 该框架显式地建模并学习控制缆绳在松弛与紧绷模式之间的转换,这一能力在以往通常假设刚性连杆的多无人机语境中尚未得到解决。
- 零样本(Zero-Shot)虚实迁移: 在真实硬件(Crazyflie 2.1)上成功部署了学习到的策略而无需微调,证明了其对风力、外部推力和严苛初始条件的鲁棒性。
- 高吞吐量训练流水线: 一个 GPU 并行化的 JAX/MJX 流水线,能在数分钟内训练复杂的机器人策略,与传统方法相比显著加速了迭代周期。
实验结果
仿真
- 扰动抑制: 在严苛的恢复场景(随机化初始状态,包括地面启动和松弛缆绳)中,CrazyMARL 策略实现了 80% 的恢复率(797/1000 次试验),显著优于基准模型控制器的成功率(44%)。
- 敏捷性: 学习到的策略维持了 0.58 m/s 的平均速度,而基准策略仅为 0.27 m/s,且能更快地抑制载荷摆动并实现更直接的轨迹。
- 泛化能力: 策略在缆绳长度、载荷质量和观测噪声的变化下表现出良好的泛化性,但在极长缆绳(>1m)或极端噪声规模下性能有所下降。
- 可扩展性: 系统成功从 1 台扩展到 3 台四旋翼无人机。虽然 6 台四旋翼团队显示出协调限制(导致提前终止),但该框架在小型团队中展示了有效的负载分配和恢复能力。
硬件(现实世界)
- 平台: 部署在两台携带 10g 载荷的 Crazyflie 2.1 四旋翼无人机上。
- 性能: 系统执行了自主起飞,并在平均 3.5 m/s 的风速下保持稳定飞行。
- 精度: 在有风条件下,该策略维持的位置保持均方根误差(RMSE)为 0.077 m,较无风条件下的 0.064 m RMSE 仅有轻微增加。
- 鲁棒性: 机器人成功从强烈的外部推力中恢复,并能带着载荷完成“8”字形轨迹,这些能力是基准控制器无法实现的。
意义与主张
论文声称 CrazyMARL 为非结构化环境中的协同航空操作提供了一种可扩展、具韧性的解决方案。通过将分布式执行与直接电机控制以及真实的混合缆绳动力学相结合,该工作使无人机团队能够在接近其物理驱动极限的同时抵御扰动。作者将其定位为迈向能够执行复杂载荷任务的自主团队的重要一步,在这些任务中,传统的基于模型的控制器往往因建模误差和通信开销而难以应对。在低推重比机器人的真实场景中实现成功的零样本迁移,凸显了高频端到端 RL 策略在现实应用中的可行性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。