✨ 要点🔬 技术摘要
大局观:在起飞前教会无人机如何“做梦”
想象一下你正在教一个孩子如何骑自行车。
传统方式: 你告诉他:“踩踏板,然后转动车把,然后再踩踏板。”如果他犯了一个微小的错误(比如轻微晃动了一下),而你根据这个晃动不断给出指令,指令会变得越来越糟糕,直到他摔倒。这就是目前大多数机器人控制器的运作方式。它们试图预测每一个精确的下一步,而微小的误差会像滚下山的雪球一样不断堆积。
SkyJEPA 的方式: 你不是在预测每一次微小的晃动,而是教会孩子理解平衡的“感觉”。你教会他们识别脑海中“平稳行驶”与“摔倒撞击”之间的“形状”差异。即使他们稍微晃动了一下,他们内在的平衡感也会让他们保持在正轨上。
这篇论文介绍了 SkyJEPA ,一种教无人机(四旋翼飞行器)飞行的新方法。它让无人机能够通过视频游戏(模拟器)进行学习,然后无需重新教学或清理传感器,就能在现实世界中完美飞行。
他们解决的三个主要问题
1. “传声筒游戏”问题(长时程预测)
问题所在: 大多数 AI 模型试图通过猜测下一秒,然后利用这个猜测去猜下一秒,以此类推来预测未来。这就像“传声筒游戏”(传话游戏):A 对 B 说了一句话,B 传给 C,最后到 Z 的时候,信息已经变得面目全非。SkyJEKPA 的解决方案: SkyJEPA 不再传递精确的信息(无人机的精确位置),而是教会无人机在压缩的“梦境空间”(潜空间)中预测未来的“大意”或“感觉”。
类比: 想象你在预测一部电影。与其试图描述每一帧画面(这会变得非常混乱),不如预测剧情梗概。即使你在梗概中错过了一些细节,整体故事依然能保持连贯。这防止了误差在长距离飞行中不断累积。
2. “黑盒”问题(可解释性)
问题所在: 深度学习模型通常是“黑盒”。它们知道如何飞行,但无法告诉你“为什么”,也无法给出像“我正以每秒 5 米的速度移动”这样的具体数值。你不能把一个“黑盒”放入安全控制器中,因为控制器需要真实的数字来判断是否即将撞墙。SkyJEPA 的解决方案: 他们添加了一个特殊的翻译器,称为**“受物理启发探测器”(Physics-Inspired Prober)**。
类比: 想象无人机的脑子是一个只说“风味语言”(抽象的梦境空间)的大厨。而“探测器”是一个了解物理规则(如重力和推力)的翻译员。翻译员将大厨的“风味语言”转化为带有精确测量值的食谱(米、度、速度)。这让无人机的安全系统能够准确理解正在发生的一切。
3. “危险实地考察”问题(数据收集)
问题所在: 要教机器人飞行,通常需要在现实世界中通过多次坠毁来从错误中学习。这既昂贵又危险,而且浪费硬件。SkyJEPA 的解决方案: 他们构建了一个“神奇模拟器”,可以自动生成数千种不同的飞行场景。
类比: 与其带一名学员去交通繁忙的高速公路进行实地驾驶教学(在那里可能会发生车祸),不如把他们放在驾驶模拟器中。但这个模拟器很特别:它会为每一次课程随机改变汽车的引擎、路况、风力以及汽车的重量。
通过在这个混乱且随机化的模拟器中进行训练,无人机学会了应对任何现实情况。当它最终在户外飞行时,它就像一位经验丰富的司机,已经在模拟器中经历过所有可能的天气状况和车辆故障。
它是如何在现实中运作的
研究人员在真实的户外场地对无人机进行了测试。以下是发生的情况:
零样本迁移(Zero-Shot Transfer): 他们仅 在计算机模拟中训练无人机。他们从未向无人机展示过任何现实世界的真实数据。当他们把无人机带到户外时,它立即就能完美飞行。无需重新训练,也无需微调。
“如果……会怎样”的情景测试: 他们测试了三种棘手的情况:
正常飞行: 它能跟随复杂的路径,如“8”字形飞行。
载荷变化: 他们在无人机上挂了一个重物(改变了重量)。无人机瞬间做出了调整。
螺旋桨更换: 他们将螺旋桨更换成了不同的型号(改变了电机的工作方式)。无人机依然飞行平稳。
结果: 使用旧方法的无人机与 SkyJEPA 无人机相比,表现出更高的准确性和稳定性。它没有坠毁,也没有在重量或零件改变时感到困惑。
核心总结
SkyJEPA 就像是给了无人机一种对物理规律的“直觉”。
它通过一种压缩的、具有抗误差能力的(潜空间)方式进行“做梦”学习。
它拥有一个能将这些“梦境”转化为现实世界数字的翻译器(探测器)。
它在混乱且随机化的视频游戏中训练,因此做好了应对现实世界任何情况的准备。
其结果是,即便从未见过现实世界,只要它完美掌握了“游戏规则”,它就能在现实世界中实现敏捷、安全且精准的飞行。
技术摘要:SkyJEPA:用于四旋翼无人机零样本 Sim-to-Real 控制的长时程世界模型学习
问题陈述
准确的动力学模型对于敏捷飞行器至关重要,特别是对于需要对未来系统演化进行推理的模型预测控制。然而,现有的神经网络动力学模型面临显著局限性:
长时程不稳定性: 大多数方法使用自回归编码器-解码器架构,通过递归地将预测结果作为输入反馈。这种机制会随时间放大微小的单步误差,导致随着预测时界的增加,出现漂移、不稳定以及物理上不合理的轨迹。
缺乏可解释性: 许多学习模型在抽象潜空间中运行或重建完整观测值,未能暴露实现控制器约束和安全边界所需的具有物理意义的量(如位置、速度、姿态)。
数据依赖性与泛化能力: 收集多样化、具有信息量的真实世界数据成本高昂、风险大且耗时费力。此外,针对特定平台或任务训练的模型在面对新配置(如载荷变化、螺旋桨更换)时,往往无法进行泛化而需要重新训练。
实时性约束: 在资源受限的嵌入式硬件上进行高频控制,要求模型能够以低延迟进行重复评估,这对于复杂的基于重建的模型来说是一个挑战。
本文旨在解决核心问题:我们能否学习一种高效的无人机动力学模型,使其提供准确的长时程预测、具有物理可解释性的展开、具备实时控制能力,并在减少对高风险真实世界数据采集依赖的同时,实现跨任务的零样本泛化?
方法论
作者提出了 SkyJEPA ,一个基于联合嵌入预测架构(JEPA)并专为实时四旋翼控制定制的框架。该方法由四个主要部分组成:
JEPA 式潜动力学模型: 该模型并非自回归地预测未来状态或观测值,而是学习预测紧凑潜空间中的未来表示。它获取长度为 H H H 的历史状态 (X t X_t X t ) 和动作 (A t A_t A t ),将其编码为潜表示 (s t , z t s_t, z_t s t , z t ),并根据未来的动作预测下一个潜状态 (s ~ t + 1 \tilde{s}_{t+1} s ~ t + 1 )。这种形式通过在结构化的潜空间中运行,避免了自回归状态预测中固有的误差累积问题。
训练目标 (SIGReg): 模型使用两项损失进行训练:
预测一致性 (L p r e d L_{pred} L p r e d ): 最小化展开的潜预测与编码的未来状态之间的距离。
抗坍缩正则化 (SIGReg): 使用草图各向同性高斯正则化(Sketched Isotropic Gaussian Regularization)来防止表示坍缩。它通过将潜分布的随机一维投影与标准高斯分布进行比较,鼓励潜嵌入匹配各向同性高斯分布。这在不需要复杂的梯度停止机制或多项损失项的情况下促进了多样性。
物理启发式探测器 (Physics-Inspired Prober): 为了使潜预测可用于控制,探测器网络将冻结的潜展开映射到具有物理意义的度量状态。这是一个两阶段过程:
首先训练潜动力学模型。
冻结编码器和预测器,随后训练一个轻量级探测网络,根据潜状态预测残差修正项(平移和角加速度)。
这些残差被集成到一个可微运动学模型中(使用 $SO(3)$ 指数映射处理姿态),以重建完整的状态轨迹。这确保了输出具有可解释性并遵循物理约束。
自动化数据合成与领域随机化: 为了消除对大量真实世界数据采集的需求,作者提出了一套完全在仿真中生成多样化训练数据的流水线:
参考生成: 利用高斯过程生成平滑、随机化的参考轨迹,以覆盖广泛的飞行包络面。
闭环跟踪: 跟踪控制器(结合 NMPC 和 MPPI)在仿真中执行这些参考轨迹,从而产生物理上可行的状态-动作对。
领域随机化: 每个展开过程都使用随机化的物理参数(质量、惯量、阻尼、电机时间常数等)进行模拟,使模型接触到一个系统族而非单一标称模型。
基于采样的控制 (MPPI): 学习到的模型被集成到模型预测路径积分 (MPPI) 控制器中。控制器采样动作序列,使用潜动力学模型和探测器进行展开,评估轨迹代价,并更新控制输入。该过程完全在嵌入式硬件(NVIDIA Orin NX)上以高频率运行。
核心贡献
用于实时控制的 JEPA: 引入了首个用于实时四旋翼控制的端到端训练的 JEPA 式潜动力学模型,超越了高层运动学规划。
物理启发式探测: 一种新颖的机制,通过结构化运动学积分器将冻结的潜表示映射到可解释的度量状态,从而实现具有物理依据的长时程预测。
零样本 Sim-to-Real 迁移: 证明了完全在领域随机化仿真数据上训练的模型,可以在无需特定任务微调的情况下,在真实硬件上实现鲁棒控制。
自动化数据集流水线: 一种利用高斯过程和领域随机化进行自动化数据集生成的原则性程序,降低了对不安全真实世界数据采集的依赖。
结果
该框架通过开环预测和在 1.3 kg 四旋翼上的室外闭环实验进行了评估。
长时程准确性: 在开环展开中,SkyJEPA 显著优于自回归预测基准模型。它表现出更低的复合比(相对于教师强制预测的误差增长)以及在长时程(高达 60 步)内更低的误差增长率。
可解释性: 物理启发式探测器极大地改善了度量状态的恢复。与标准 MLP 探测器相比,PI 探测器在开环测试中将位置 RMSE 从 ~5.56m 降至 ~1.43m,并将姿态误差从 ~40° 降至 ~4.7°。
零样本 Sim-to-Real 迁移: 在真实世界实验中,所提出的控制器在多种轨迹(圆周、8 字形、旋轮线)下,其位置和姿态跟踪误差均低于基准模型(带有预测模型的 MPPI)。例如,在圆周轨迹上,位置 RMSE 从 0.39m(基准)降低到了 0.24m。
鲁棒性: 系统在无需重新训练的情况下,在显著的平台变化(包括增加 300g 载荷和更换螺旋桨)下仍能保持性能。在这些非标条件下,它始终优于基准模型。
数据质量: 使用轨迹分布质量 (TDQ) 分数的分析显示,数据集多样性/覆盖范围与预测误差之间存在强烈的负相关性,验证了领域随机化数据合成方法的有效性。
实时性能: 轻量化模型(约 9K 参数)和优化的推理过程允许在 10ms 的控制预算内于嵌入式硬件上实时执行。
意义
论文声称 SkyJEPA 满足了对有用的航空机器人世界模型所要求的四个关键属性:准确的长时程预测、可解释性、实时推理以及零样本任务泛化。
其主要意义在于证明了当配合适当的学习框架时,仅通过仿真训练结合领域随机化足以实现鲁棒的现实世界控制 。通过利用潜预测避免自回归误差累积,并通过物理结构对输出进行落地,该方法实现了纯预测模型无法达到的泛化水平和稳定性。作者指出,该框架为成本高昂的真实世界数据采集和手动系统辨识提供了一种可扩展的替代方案,使敏捷飞行机器人在不确定性和变化的环境中能够可靠运行。未来的工作建议将此扩展到高维视觉输入,并纳入显式的安全约束。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。