← 最新论文
💻 computer science

SCoCaT: Success Conditioned Constrained Reinforcement Learning for Spacecraft Docking

本文通过引入一个通过辅助价值评论家实现的稠密成功信号,确保在不损害安全约束的前提下实现高任务完成率,识别并解决了基于终止条件的航天器对接约束强化学习中存在的“可行性崩溃”问题,即智能体为了维持安全性而避开目标区域的问题。

原作者: Aman Arora, Ricard Marsal I Castan, Matteo El-Hariry, Miguel Olivares-Mendez

发布于 2026-09-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Aman Arora, Ricard Marsal I Castan, Matteo El-Hariry, Miguel Olivares-Mendez

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

航天器对接是现代工程领域中最精密的动作之一。它要求航天器在真空环境下飞行,向一个移动的目标导航,并轻柔地锁定目标而不发生碰撞。这项任务不仅仅是到达目的地,更是在遵守一套严格安全规则的前提下完成任务。航天器不得移动过快,不得失控旋转,也绝不能与目标发生碰撞或偏离其指定的飞行路径。如果违反了这些规则,任务就会失败,硬件也会损毁。几十年来,工程师们一直依赖经典控制系统来管理这些任务,但面对复杂的、重叠的安全限制时,这些系统往往显得力不从心。近年来,研究人员转向了一种被称为“强化学习”的人工智能技术,在这种技术中,计算机程序通过试错来进行学习。然而,标准的学习方法对于太空环境来说往往过于鲁莽;它们可能会找到一种虽然能到达目标但却违反了安全规则的方式,或者可能学会停留在危险区域之外进行悬停以规避惩罚,从而永远无法真正完成任务。

卢森堡大学的一个研究小组开发了一种新方法来解决这一特定问题,使人工智能能够安全且成功地学习如何对接航天器。他们的工作聚焦于安全导向型学习算法中的一个已知失效模式。在这些系统中,计算机被告知:违反安全规则的代价如此之高,以至于实际上会提前结束学习阶段。这在许多任务中行之有效,但对于对接任务而言,这创造了一个悖向。航天器必须抵达以实现成功的区域,恰恰也是安全规则最严苛的区域。由于进入该区域的惩罚极高,学习算法会判定留在目标稍远之外是更安全的做法,这样它既能保持“存活”,又永远无法完成任务。研究人员将这种状态称为“可行性崩溃”(feasibility collapse),即AI处于一种虽然绝对安全但完全无用的状态。

为了解决这个问题,该团队引入了一种名为“成功条件约束强化学习”(Success-Conditioned Constrained Reinforcement Learning)的新方法。他们意识到,AI需要一种方式来理解:到达目标是首要目标,这应与对违反安全规则的恐惧区分开来。他们在学习过程中增加了第二层反馈。虽然第一层仍然会对航天器违反安全限制的行为进行惩罚,但第二层会在航天器处于正确位置和姿态时,无论其是否已在技术上“赢得”了该阶段,都给予一个持续的正向信号。这创造了一种双重动力:AI既学会了避免那些会阻碍其进展的惩罚,又被处于正确位置所带来的奖励所吸引向前推进。这一简单的改进打破了导致AI原地悬停的僵局。

研究人员在两种不同类型的航天器模拟器上测试了这种方法。第一个是他们实验室中的一个漂浮平台,利用气垫轴承在空气垫上滑动,以模拟零重力环境下卫星的运动。第二个是6U立方体卫星(CubeSat)的数字模型,这是一种大约鞋盒大小的小型卫星,具有更复杂的六自由度运动模式。在模拟中,标准的以安全为导向的方法在几乎所有尝试中都未能成功对接航天器,使其停留在目标区域之外。然而,新方法则允许航天器进入对接走廊并成功保持位置。在漂浮平台上,新方法实现了接近100%的成功率,同时保持了超过98%的安全合规率。这相比之前的旧方法是一个巨大的进步,因为旧方法的成功率不足1%。

该团队并未止步于计算机模拟。他们将训练好的软件直接部署到了物理漂浮平台上,而没有进行任何进一步的调整。这种“零样本”(zero-shot)迁移意味着AI在一个环境中学习,并在另一个环境中完美运行,这对于机器人系统来说是一项艰巨的任务。物理测试证实,航天器可以接近目标、减速,并将位置保持在10毫米和0.1弧度的旋转容差范围内。虽然标准的仅安全方法设法避免了碰撞,但它从未进入目标区域。而新方法不仅进入了该区域,还成功在那里保持了位置,证明了实现安全与成功并行是可能的。

研究人员还探讨了旧方法为何会发生如此剧烈的失败。他们通过数学证明,问题不在于奖励系统本身的缺陷,而在于安全惩罚与目标之间相互作用的结构性问题。当进入目标区域的惩罚很高时,AI会计算出停留在区域外侧才是实现生存最大化的逻辑选择。通过将“保持安全”的信号与“取得成功”的信号分离,新方法允许AI采取必要的风险以完成任务,而不忽视安全约束。研究结果表明,对于像航天器对接这样失败后果不可逆转的关键任务,人工智能系统需要一个清晰、独特的信号,告诉它们何时取得了成功,且该信号应独立于对失败的恐惧。这种方法为在安全与精度同样不可或缺的环境中部署自主机器人提供了一条前进的道路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →