太空并非一个物体只是在其中永恒漂浮的寂静、空虚的真空。它是一个由无形力量支配的动态环境,这些力量塑造着其中万物的运动。卫星和航天器不断受到地球引力的牵引、阳光压力的推动,并受到高层大气微弱阻力的减速。几十年来,工程师们不得不在这两者之间做出选择:是模拟机器人手臂复杂的翻滚运动,还是模拟航天器在轨道上的长期旅程。现有的工具要么能很好地完成其中一项,但在另一项上表现不佳。机器人模拟器可能会将太空视为不存在引力的完美真空,这在几分钟内运行良好,但无法维持数小时;而空间模拟器虽然能完美追踪卫星的路径,却无法模拟机器人抓取漂浮碎片的过程。这种差距使得设计和测试未来任务所需的自主机器人变得困难,例如维修卫星、清除太空垃圾或在轨道上组装结构。
来自麻省理工学院和瑞典皇家理工学院的研究团队开发了一种新工具来弥合这一分歧。他们创建了一个名为 mjorbit 的仿真框架,该框架将现代机器人软件的高速、详细物理特性与航天旅行所需的精确轨道力学结合在一起。该系统允许工程师模拟机器人在长时间内与其环境的交互,准确捕捉轻微的触碰或微小的推进器点火如何改变航天器在数小时或数天内的路径。通过在现实场景中测试该系统,研究人员证明了它能够处理太空作业中复杂的、涉及接触的任务,同时运行速度足以训练人工智能。
该团队解决的核心挑战在于同时模拟两种截然不同的运动尺度之难。航天器可能在轨道上飞行数千公里,而机器人手臂仅移动几米。当这些尺度在计算机模拟中混合时,微小的舍入误差会不断累积,导致整个模型偏离现实,尤其是在使用现代图形处理器中常见的快速单精度数学运算时。研究人员通过改变模拟器观察世界的方式解决了这个问题。他们不再追踪航天器在空间中的绝对位置,而是将模拟过程锚定在一个跟随航天器预期路径的移动参考点上。然后,他们计算机器人及其部件相对于这个移动锚点的微小相对运动。这种被称为使用“轨道跟随坐标系”的方法,防止了计算机丢失精度。它允许系统在强大的图形卡上运行(这些显卡可以同时模拟数千个场景),而不会随着时间的推移导致结果变得不准确。
为了证明他们的方法有效,团队在几个现实任务中测试了 mjorbit。在一项测试中,他们模拟了一个带有机器人手臂的自由漂浮卫星,该卫星必须通过改变内部重量来旋转整个航天器,这一任务需要对动量进行精确的协调。在另一项测试中,他们模拟了一个重型航天器自主对接一个巨大的被动目标,这一动作需要毫米级的精度。他们还模拟了一个服务机器人捕捉漂移载荷并保持其稳定的过程。在这些测试中,研究人员将他们的新系统与旧有的成熟模拟器进行了对比。他们发现,传统工具运行单个场景可能需要数小时,而他们的新系统在相同时间内可以运行数千次模拟。更重要的是,他们展示了忽略轨道物理学会导致失败。在一项测试中,当机器人尝试将捕获的物体指向地球时,一个忽略引力和轨道力的模拟器无法保持物体稳定,导致其剧烈摆动。而新系统由于考虑了引力的微妙拉力,成功地使物体在两个小时内保持了正确的指向方向。
研究人员还证明了该框架已准备好用于训练人工智能。通过在单个图形卡上运行 1,024 个并行模拟,他们训练了一个机器人飞向漂移的货运模块,抓取它并保持稳定。该机器人仅用一分钟的计算机时间就学会了这项复杂任务,并在所有模拟世界中实现了 88% 的成功率。这种速度意味着工程师现在可以使用机器学习来开发以前难以测试的太空机器人控制策略。该系统是开源的,这意味着其他研究人员可以使用它来构建自己的工具以进行太空探索。虽然当前版本侧重于刚性物体的物理运动,尚未包含摄像头或激光雷达等先进传感器,但它为下一代太空机器人提供了坚实的基础。这项工作证实,通过仔细管理物理计算的方式,可以创建一个既足够快以进行学习,又足够精确以应对现实任务的太空“数字孪生”。
技术摘要:mjorbit —— 空间机器人仿真框架
问题陈述
未来的空间任务涉及轨道上服务、碎片清除和空间组装,这些任务要求机器人在动态轨道环境中执行富接触交互。这些任务将轨道运动、姿态动力学、关节多体机构、驱动器、传感器以及长时程内的间歇性接触耦合在一起。
现有的仿真工具无法高效地解决这一完整范畴:
- 天体力学框架(如 GMAT、Basilisk)擅长轨道传播和环境建模,但通常缺乏关节多体机构和接触动力学,且往往不支持硬件加速。
- 机器人仿真器(如 MuJoCo、Drake)提供高效的、经 GPU 加速的接触和刚体动力学,但通常忽略了轨道力学和环境摄动,并假设处于局部惯性系(零重力)中。
- 混合方法虽然存在,但通常是闭源的、针对特定任务的,或者缺乏现代策略学习和控制合成所需的超高吞能效。
因此,目前缺乏一个通用的、高效且准确的框架,能够将轨道动力学与富接触机器人仿真相结合,特别是能够为强化学习(RL)和模型预测控制(MPC)提供大规模运行能力。
方法论
1. 轨道与机器人动力学的耦合
本文提出了 mjorbit,这是一个基于 MuJoCo 物理引擎(及其 GPU 优化变体 MJWarp)构建的框架。它通过以下方式扩展了 MuJoCo:
- 轨道状态变量:一个与多体系统耦合的中心天体轨道传播器。
- 航天器特性:包括推进器、反作用轮、控制力矩陀螺(CMG)、磁力矩线圈以及传感器(磁强计、太阳传感器)的模型。
- 环境力:实现了 J2 摄动、大气阻力、太阳辐射压力(SRP)和磁力矩。
2. 数值稳定性与参考系
一个核心技术挑战是在模拟米级接触动力学与千公里级轨道之间的数值病态问题,特别是在单精度算术(GPU 中常见)下。作者通过以下方式解决了这一问题:
- 恩克克法(Encke's Method):与其直接减去两个巨大的重力向量(g0(rc+ρ)−g0(rc))导致单精度下的灾难性抵消,该框架使用一种代数重构形式(恩克克法)来精确计算微分重力,而不损失有效数字。
- 参考系选择:作者对三种参考系进行了实证比较:
- ECI(地球中心惯性系):需要绝对位置;在单精度下存在尺度问题。
- LVLH(局部垂直局部水平系):旋转参考系;引入了依赖速度的科里奥利力和离心力项,这会破坏简单积分器的辛结构。
- OF(轨道跟随系):一个与 ECI 平行的平移参考系。
- 结论:选择 OF 系作为最优解。它保留了局部条件性(通过恩克克法),维持了仅位置相关的保守加速度(允许进行辛积分),并避免了旋转补偿项。
3. 仿真流水线
每个时间步的仿真遵循四个阶段的流水线:
- 力汇集:在 OF 系中计算外部力矩(微分重力、阻力、SRP、驱动器力),并将其映射为广义力。
- 动力学求解:MuJoCo 求解受约束的多体动力学。
- 状态传播:推进驱动器状态并传播参考轨道状态。
- 缓存刷新:为下一步更新环境缓存(如太阳方向、大气密度)。
4. 后端实现
- CPU 后端:用于实时控制循环的低延迟 C++ 实现。
- GPU 后端 (mjorbit-warp):使用 MJWarp 内核的高吞吐量实现,可并行运行数千个世界,专为 RL 训练和数据集生成而优化。
- API:其 Python API 与 MuJoCo 的
MjoModel(不可变规范)和 MjoData(可变状态)结构保持一致。
核心贡献
- 通用框架:一个灵活的框架,用于将现有机器人仿真器与轨道动力学耦合,专为策略学习和控制量身定制。
- 双后端架构:同时支持低延迟 CPU 控制和高吞吐量 GPU 并行仿真。
- 数值鲁棒性:证明了通过结合 OF 系、恩克克法和适当的积分器,可以在单精度 GPU 算术下实现精确的长时程仿真。
- 开源实现:发布了包含实时控制和策略训练示例的代码库。
结果与验证
精度 vs. 吞吐量
该框架通过在低地球轨道(LEO)中使用双臂自由飞行机械臂,针对 Basilisk(成熟的航天器仿真器)进行了验证。
- 精度:使用双精度 4 阶龙格-库塔(RK4)积分器,mjorbit 的相对位置误差与 Basilisk 相比在 ∼10−7 m 以内。在单精度(GPU)下,RK4 保持 ∼10−3 m 的精度,而一阶隐式积分器会出现显著漂移(∼1 m)。
- 吞吐量:mjorbit 的吞吐量比 Basilisk 高出 2–3 个数量级。
- CPU (8 线程):~0.55M 至 1.6M 步/秒。
- GPU (RTX 3080):~1.7M 至 6.5M 步/秒。
- Basilisk:由于 Python GIL 序列化限制,仅约为 ~1,000 步/秒。
案例研究
论文展示了 mjorbit 在四个现实场景中的应用:
- 多体姿态控制:一个带有机械臂的自由漂浮母星通过交换角动量进行重新定向,利用模型预测路径积分(MPPI)控制来应对 J2 和阻力带来的动量变化。
- 自主对接:一艘 Soyuz 级追逐器利用推进器和反作用轮与一艘质量巨大的 ISS 级目标进行对接,并在 120 秒的周期内成功锁紧。
- 捕获与天底指向:服务机器人捕获一个载荷,并利用被动重力梯度力矩(通过机械臂运动)来维持天底指向。
- 关键发现:使用轨道耦合动力学训练的规划器成功维持了 2 小时天底指向。而使用零重力近似的规划器在 5 次试验中有 4 次失败,这表明忽略轨道物理会导致长时程性能下降。
- Astrobee 抓取:在 GPU 后端(1,024 个并行世界)训练了一个强化学习策略,使其能够完成对自由漂浮货物模块的脱靶、接近和抓取,达到了 88% 的成功率。
意义与主张
论文声称 mjorbit 弥合了差距,即连接了高保真天体力学与高效机器人仿真。其主要意义在于实现了:
- 长时程精度:正确模拟轨道摄动随时间的累积,这对于诸如碎片清除或长期服务等任务至关重要。
- 可扩展的学习:提供高吞吐量的并行仿真,为复杂、富接触的空间环境中的强化学习策略训练提供支持。
- 面向实机(Sim-to-Real)的就绪性:提供类似于 MuJoCo 的 API,便于集成到现有的控制和学习流水线中。
作者保持了谦逊的态度,指出目前的验证是 sim-to-sim(针对 Basilisk),未来的工作需要在硬件和实际轨道上验证策略。他们也承认了一些局限性,例如缺乏丰富的感知传感器(相机、LiDAR)以及依赖一阶积分器以换取速度,并建议未来开展关于变分方案和感知集成的研究。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。