← 最新论文
⚡ electrical engineering

Physics-informed Reinforcement Learning for Stochastic Reach-Avoid Analysis

本文提出了一种物理信息强化学习(PIRL)框架,该框架将时差(temporal-difference)Actor-Critic 学习与渐进式 PDE 残差强制执行相结合,旨在克服传统方法在处理高维随机到达-规避(reach-avoid)分析时存在的计算与精度局限性。

原作者: Hikaru Hoshino, Yorie Nakahira

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Hikaru Hoshino, Yorie Nakahira

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在工程领域,保持系统的安全往往是一场概率的游戏。当一辆汽车自动驾驶或一架无人机在风暴中飞行时,它运行在一个充满不可预测的噪声和突然变化的各种环境之中。工程师不仅需要知道机器是否能够到达目的地,还需要知道它有多大的概率到达而不撞向危险物体。这被称为“可达-规避”(reach-avoid)问题:即寻找一组起始点,使得系统能够成功到达目标点,同时避开危险区域。对于简单的机器,数学家们早已拥有计算这些安全区域的工具。但随着系统变得更加复杂,拥有许多同时相互作用的运动部件和变量,数学计算变得异常沉重,甚至连最快的超级计算机也无法在合理的时间内解决它。众所周知,当变量数量增加时,描述这些安全极限的方程极其难以破解。

为了应对这一挑战,研究人员转向了人工智能,特别是名为“强化学习”的方法。想象一个数字智能体通过试错来学习驾驶,它因留在路面上而获得奖励,因撞墙而受到惩罚。随着时间的推移,这个智能体会学习一个“价值函数”,即一张心理地图,告诉它在任何给定情况下处于何种安全程度。然而,这种基于经验的学习方法有一个盲点:它只能看到智能体实际行进过的路径。它可能会错过从未访问过的危险角落,或者可能学到一个在特定路径上看起来很好,但违反了支配该系统的基本物理定律的捷径。另一方面,另一种名为“物理信息神经网络”的人工智能技术试图通过强制计算机遵守物理定律来解决问题。但这种方法经常陷入僵局,找到一个在数学上看起来正确但在物理上毫无意义的解,比如一辆在平直线上行驶完美,但一旦转弯就会从世界边缘跌落的汽车。

一组研究人员现在开发了一种结合了两者优点的新方法,创建了一个避免了各自缺陷的混合系统。他们称之为“物理信息强化学习”。其核心思想是让 AI 首先从经验中学习,基于实际驾驶路径建立一个粗略但可靠的安全地图。只有在奠定了这个基础之后,他们才引入严格的物理规则来完善地图并填补空白。这种“调度式”的方法防止了 AI 在尚未学习到实际安全路径是什么样之前,就被复杂的数学逻辑搞混。通过从智能体的自身经验开始,并逐渐叠加物理定律,该系统学习到了一张既准确又符合现实情况的安全地图。

研究人员在两个截然不同的挑战上测试了这种方法。首先,他们使用了一个已知正确答案的简单一维问题。在这项测试中,标准的纯物理方法反复失败,陷入了数学看起来很美但解决方案却毫无用处的死胡同。仅靠经验的方法虽然运行可靠,但精度较低。然而,新的混合方法每次都成功了,它既达到了最佳纯物理尝试的精度,又保留了基于经验学习的可靠性。这证明了调度策略有效地引导了 AI 远离错误解。

第二个测试则更具挑战性:控制一辆正在进行高速漂移的车辆。这是一个极其困难的操作,汽车侧向滑动,在失去控制的边缘寻求平衡。系统必须学习如何在保持车辆处于特定漂移状态的同时避免碰撞,同时还要考虑到随机的颠簸和路面抓地力的变化。车辆的状态由八个不同的变量描述,这种复杂度会令传统的计算方法不堪重负。研究人员使用一种课程学习法来训练他们的 AI,从靠近漂移中心的微小、简单的修正开始,逐渐扩展到更极端的状况。他们发现,混合方法学习到的安全地图正确识别了状态空间的“可恢复”区域。当他们模拟数千个随机场景时,AI 的预测与汽车实际运动的结果相吻合。系统正确识别出,有些路径在二维视图下看起来是安全的,但由于其他变量的变化方式,实际上注定会失败。

这项研究表明,通过仔细安排引入物理定律的时机,工程师可以创造出既理解行为的直接后果,又理解其所处世界深层规律的人工智能。研究人员展示了这种方法不仅适用于简单的例子,也适用于复杂的、对安全性至关重要的现实世界控制问题。虽然这项工作是通过计算机模拟进行的,但其结果为设计从自动驾驶汽车到电网的控制器提供了一条充满前景的路径,在这些领域,了解不确定性下的精确安全极限至关重要。核心发现是,你并不需要在从经验中学习和遵守物理定律之间做出选择;有了正确的调度,AI 可以两者兼顾。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →