Adaptive GR(1) Specification Repair for Liveness-Preserving Shielding in Reinforcement Learning
本文提出了一种用于强化学习的自适应屏蔽框架,该框架利用归纳逻辑程序设计在检测到环境假设违规时,在运行时自动修复 GR(1) 规范,从而在确保安全性与活性性的同时,保持了与静态方法相比接近最优的智能体性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,机器正越来越多地通过试错法来学习做出决策,这种方法被称为强化学习。想象一个数字智能体正在探索一个新环境,尝试不同的动作以观察哪些动作能带来奖励,就像一个孩子通过跌倒并重新站起来来学习骑自行车一样。这种方法已经产生了能够玩复杂游戏和操控机器人的系统,但也带来了显著的风险:机器可能会为了实现目标而做出危险或被禁止的行为。为了防止这种情况,工程师使用了一种称为“屏蔽器”(shield)的安全机制。可以将屏蔽器想象成一个警觉的监督者,它注视着智能体提议的动作,并拦截任何会违反规则的动作,从而允许智能体仅在安全区域内自由学习。多年来,这些监督者一直是静态的,建立在一套关于世界运作方式的固定规则之上。它们假设环境的表现完全符合预期,就像一张永不改变的地图。然而,在现实世界中,条件会发生变化,传感器会失效,意外事件也会发生。当环境打破了屏蔽器所建立的规则时,监督者往往会变得瘫痪或过度谨慎,导致停止智能体执行任何有用的操作,或者更糟的是,因为其地图不再符合现实,从而无法防止灾难的发生。
伦敦帝国理工学院和布宜诺斯艾利斯大学的研究人员开发了一种处理这一问题的新方法,创建了一种能够在其假设被证明错误时进行学习和适应的安全系统。他们的工作是在最近的一次神经符号学习会议上展示的,重点研究一种特定的逻辑框架,该框架允许这些安全监督器进行自我修复。该系统不是依赖于一套僵化、不可更改的指令,而是实时监测环境。如果环境的行为与原始规则相矛盾——例如,矿井泵遇到了此前被认为不可能发生的危险气体情况——系统就会检测到错误。随后,它使用一种专门的学习技术来重写自己的规则,寻找一种既能保证安全性又能让智能体完成任务的新方法。这一过程确保了即使在世界表现不如预期的情况下,智能体仍能保持安全且高效,弥合了形式化安全的严谨逻辑与现实世界学习的不可预测性之间的鸿沟。
这项创新的核心在于研究人员如何处理“活性”(liveness)的概念,即系统持续前进并最终实现目标的能力,而不仅仅是避免眼前的危险。在实验中,他们测试了两种截然不同的场景。第一个是模拟矿井泵系统,这是一个经典的难题:控制器必须将水从矿井中抽出来,但如果检测到甲烷气体,必须立即停止以避免爆炸。原始的安全规则假设高水位和甲烷气体永远不会同时发生。然而在现实世界中,这种假设可能会被违反。当研究人员将这种“不可能”的情况引入模拟时,旧的静态安全控制器完全失效了。它们要么完全停止泵送,导致矿井被淹;要么允许泵运行,从而冒着爆炸的风险。相比之下,新的自适应系统注意到了这种矛盾。它意识到关于水和气体永不混合的规则是错误的。然后,它更新了自己的逻辑,变为:“如果存在气体,则不泵水;但如果水位高且不存在气体,则泵水。”这种微小的逻辑修复使得系统能够继续安全且高效地运行,而静态系统则陷入了停滞。
第二个测试是在一个名为《Seaquest》的高风险视频游戏环境中进行的,智能体在该环境中控制一艘潜艇。这里的安全规则基于氧气水平会以稳定、可预测的速度下降的假设。在测试中,研究人员改变了游戏,使氧气在达到某个低水平后会下降得更快,这是一个原始安全屏蔽器未曾预料到的场景。基于旧的、较慢氧气流失率的静态屏蔽器变得困惑了。它们要么阻止潜艇在需要移动时移动,要么未能防止氧气完全耗尽。然而,自适应屏蔽器检测到氧气消失的速度比预期更快。它立即调整了其内部的世界模型,削弱了关于潜行在水下能维持多久的预期,同时保持了氧气绝不会归零的绝对保证。这使得潜艇能够继续进行游戏,营救潜水员并收集分数,尽管环境已经变得比原始规则允许的更加恶劣。
这些实验的结果是清晰且可衡量的。在矿井泵场景中,自适应系统实现了完美的安全性合规,并保持了高水平的性能,获得的奖励几乎与那些允许失败的优秀静态系统一样高。在《Seaquest》游戏中,自适应屏蔽器让智能体在几乎所有的尝试中都取得了成功,而未受屏蔽的智能体和带有静态屏蔽器的智能体在环境改变时频繁失败。研究人员发现,该系统仅需偶尔进行干预,在矿井泵测试中,它将智能体提议的动作替换为安全动作的步数不足20%,在游戏中甚至更少。这种低干预率表明,系统不需要不断地进行微观管理;它只在环境打破规则时介入,并且是通过更新其对规则的理解来进行干预。
这种方法之所以特别强大,是因为它并不只是猜测概率或试图学习一个完美的世界模型(这在复杂情况下可能是无法实现的)。相反,它专注于安全规则本身的逻辑结构。当违规发生时,系统使用一种称为“归纳逻辑程序设计”(inductive logic programming)的方法,寻找使该情况重新变得可能的、对规则最简单的修改。这意味着这些变化是透明且可理解的;人类工程师可以查看新规则,并准确看到系统为何决定调整其行为。研究人员证明,这种方法保留了智能体学习和优化其性能的能力,避免了陷入安全措施使智能体过于谨慎以至于无法履行职责的陷阱。通过允许安全屏蔽器随环境共同演化,该系统维持了严格安全与实际有效性之间的平衡。
该研究还强调了现有方法的局限性。研究人员表明,依赖固定的、手工编写的规则是一种脆弱的策略。当环境偏离设计假设时,静态控制器通常会变得毫无用处,要么阻断所有行动,要么无法防止伤害。自适应方法证明,构建能够应对这些意外变化且不牺牲学习能力的系统是可能的。然而,研究人员指出,这种方法目前最适用于可以用清晰、离散步骤描述的环境,例如矿井泵或特定的视频游戏机制。在具有连续、流体动力学的世界中,所需的逻辑抽象可能更难定义。此外,修复规则的过程需要时间,对于非常庞大或复杂的系统,这种修复速度可能会成为瓶颈。尽管存在这些挑战,这项工作仍为使人工智能更安全、更可靠迈出了重要的一步。它预示着一个未来,在那里的安全系统不仅是僵化的屏障,更是智能的伙伴,能够理解世界的变化并相应地调整其保护措施,从而确保机器即使面对未知也能安全运行。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。