← 最新论文
⚡ electrical engineering

Deep Reinforcement Learning for Reach-Avoid-Stay Problems

本文提出了一种两阶段深度强化学习框架,该框架共同学习最大鲁棒的“到达-规避-停留”(Reach-Avoid-Stay)集合及相应的切换控制策略,证明了在有界扰动下,与现有方法相比,该框架在确保系统安全到达并保持在目标集合内方面具有更高的准确性和性能。

原作者: Gabriel Chenevert, Jingqi Li, Achyuta kannan, Sangjae Bae, Donggun Lee

发布于 2026-09-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Gabriel Chenevert, Jingqi Li, Achyuta kannan, Sangjae Bae, Donggun Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在机器人技术和自主机器人的世界中,安全不仅仅是避免碰撞;它关乎于精确了解一台机器可以去哪里,以及更重要的,它必须在哪里停下。想象一辆自动驾驶汽车或一架送货无人机正在繁忙的城市中穿行。工程师们使用数学工具来绘制“安全区域”的图谱,以确保如果机器从某个特定位置出发,它能够到达目的地而不撞到任何东西。然而,这些安全地图的一个常见缺陷在于,它们通常只告诉机器如何到达目标,却未能告诉它如何留在那里。车辆可能会到达停车位,但由于风力或突然的速度变化,可能无法减速到足以保持停驻的状态,从而导致其漂出安全区并陷入危险之中。这种“到达”与“停留”之间的差距,长期以来一直是计算机科学家试图让机器在不可预测的环境中实现真正可靠运行时面临的一个难题。

为了解决这个问题,来自北卡罗来纳州立大学和德克萨斯大学奥斯汀分校的研究团队开发了一种新方法,教导机器如何到达目标并在任何干扰下守住阵地。他们专注于一个被称为“到达-规避-停留”(reach-avoid-stay)的具体挑战。简单来说,这个问题是在问:从哪些起点出发,机器可以安全地到达目标、避开所有障碍物,并且即使在风吹或路面湿滑的情况下,也能永远留在该目标区域内?以往的方法之所以难以应对,是因为它们要么依赖于难以为复杂机器设计的复杂数学设计,要么基于不切实际的假设(例如假设车辆可以瞬间停止)。研究人员提出了一种使用被称为“深度强化学习”的 AI 技术进行的两步学习过程,在这种学习中,计算机通过在模拟世界中的试错来学习。

该团队的方法运作起来就像一段两阶段的旅程。首先,计算机学习识别目标区域内的一个特殊内部区域。这个内部区域是机器无论面临何种干扰都能永远安全停留的地方。研究人员称之为“鲁棒可行性核”(robust viability kernel)。为了找到它,AI 会学习一种策略(即一套规则),使机器的运动方式始终不会让其漂出这个安全的内圈。一旦计算机掌握了这种“停留”行为,它就会进入第二步。在这里,它学习如何尽可能快地将机器从任何起点引导至该安全内圈,同时在此过程中避开所有障碍物。研究人员在数学上证明,如果一台机器能够到达这个内圈并停留在那里,它就成功完成了整个任务。通过将这两种学习到的行为结合成一个单一的切换系统,机器便能明确知道何时应该驶向目标,以及何时应该切换到保持原地不动的模式。

研究人员在多种不同的场景中测试了这种方法,范围从简单的二维轨道小车到复杂的、高维度的垂直起降飞行出租车在城市中飞行的模拟,再到拖拉机从移动的联合收割机中卸载农作物的模拟。在简单小车的案例中,他们将这种新方法与一种使用复杂数学函数的老技术进行了对比。他们的新方法识别出的安全起始区域比老方法找到的区域大了近十五倍,这意味着它允许机器从更多位置出发而不会面临失败风险。在涉及飞行出租车和拖拉机的更复杂的模拟中,该新方法即便在学习过程中包含典型的计算机训练误差时,仍能以超过 95% 的准确率识别出安全起始区域。

结果显示,使用旧方法训练的机器与使用这种全新两步框架训练的机器之间存在显著差异。在对飞行出租车的测试中,仅关注如何到达目标的旧有的“到达-规避”方法在执行“停留”任务时完全失败,成功率为零。相比之下,新方法成功率达到了 93%。同样,在拖拉机场景中,新方法成功率为 99.3%,而旧方法仅为 73.5%。研究人员发现,旧方法往往会将机器以全速驶入目标区域,导致其没有办法减速并停驻。而新方法则学会了提前减速,确保机器以能够无限期停留的速度进入安全内圈。

尽管模拟实验非常成功,但研究人员指出,他们的系统依赖于在训练开始前对环境和机器物理特性有精确的理解。如果现实世界的表现与计算机模型不同——例如,风力比预测的更强,或者地面比预测的更湿滑——那么训练好的机器可能无法保证安全性。团队表示,未来的工作需要整合现实世界的传感器数据来处理这些未知因素。目前,这个两步学习框架提供了一个重要的进步,它提供了一种不仅教导机器如何到达,还教导其如何停留的方法,将理论上的安全保证转化为了复杂现实应用中的实用工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →