← 最新论文
🤖 machine learning

Adaptive Probabilistic Shielding by Learning MDPs for Safe Reinforcement Learning

本文提出了一种用于安全强化学习的自适应概率屏蔽框架,该框架通过整合在线模型学习,从初始未知的马尔可夫决策过程(MDP)中估计转移概率,从而动态地计算并更新安全约束。

原作者: Astrid Horn Brorholt (Aalborg University, Aalborg, Denmark), Maris F. L. Galesloot (Radboud University, Nijmegen, Netherlands), Nils Jansen (Radboud University, Nijmegen, Netherlands), Kim Guldstrand
发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Astrid Horn Brorholt (Aalborg University, Aalborg, Denmark), Maris F. L. Galesloot (Radboud University, Nijmegen, Netherlands), Nils Jansen (Radboud University, Nijmegen, Netherlands), Kim Guldstrand Larsen (Aalborg University, Aalborg, Denmark), Christian Schilling (Aalborg University, Aalborg, Denmark)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,机器通过尝试各种方法来学习如何做出决策,就像孩子通过跌倒并重新站起来来学习走路一样。这种被称为“强化学习”的过程,允许软件智能体通过与环境交互并从良好的选择中获得奖励,从而发现解决问题的最佳方式。然而,在现实世界中,一步错可能导致灾难性的后果。自动驾驶汽车无法承担为了测试某种危险动作是否可行而进行的尝试;医疗机器人也不能在摸索最安全路径的过程中冒着伤害患者的风险。这造成了一种根本性的张力:为了有效地学习,智能体必须进行探索;但为了保持安全,它必须避开未知。多年来,研究人员一直试图通过构建一个“屏蔽器”(shield)来解决这个问题——即一个能够拦截智能体可能采取的任何可能导致灾难的行为的安全卫士。问题在于,传统的屏蔽器需要一个完美的、预先存在的世界地图,包括对每种可能结果的精确概率。在充满变数的物理现实世界中,在智能体开始学习之前,这种完美的地图几乎并不存在。

一组研究人员开发出了一种处理这一困境的新方法,创建了一个让安全屏蔽器随智能体同步学习和适应的系统。该方法并不等待完美的地图,而是假设智能体了解环境的总体布局——即它可以去哪些地方以及可以采取哪些行动——但并不知道这些行动会导致何种结果的具体概率。随着智能体的探索,它会收集关于移动时实际发生了什么的资料。随后,一个计算机程序利用这些新鲜的数据来构建对世界规则的估计,从而填补缺失的概率。基于这种估计,系统构建了一个安全屏蔽器。最初,由于数据稀缺,屏蔽器非常谨慎,会拦截许多行动以确保万无一失。但随着智能体积累更多经验,估计变得更加精准,不确定性随之缩小,屏蔽器也会放宽限制,允许智能体进行更高效的冒险。这创造了一种伙伴关系,即智能体和它的安全卫士共同进步,确保智能体在学习如何变得高效的同时保持安全。

研究人员在几个模拟世界中测试了这个想法,范围涵盖了从避免与其他飞机碰撞的飞机到在捕食者周围导航的蚂蚁。在这些环境中,智能体必须在避开特定危险的同时达到目标,而此时发生滑倒或失败的具体概率对其而言是隐藏的。他们将这种自适应方法与另外两种方法进行了对比:一种是完全没有安全卫士的智能体,另一种是基于已知完整世界的完美屏蔽器。结果显示,这种自适应方法表现得非常成功。它学习到的策略几乎与完美屏蔽器一样安全,同时避免了没有卫士保护时频繁发生的危险碰撞。在某些情况下,这个自适应系统甚至找到了比完美屏蔽器更好的路径,因为其早期的谨慎探索引导它发现了被静态、预先计算的屏蔽器所忽略的有益路径。

一个关键发现是,当新数据进入时定期更新安全屏蔽器,系统效果最佳。如果屏蔽器更新得太慢,智能体会陷入过度谨慎的状态,无法利用已获得的知识;如果更新得太频繁,系统会花费过多时间在重新计算安全性上,而不是学习。研究人员发现了一个平衡点,即每隔一千个学习周期更新一次屏蔽器,这使得智能体能够在不停滞进度的情况下精炼其对世界的理解。他们还发现,系统估计概率的方式至关重要。一些假设未知数据处于最坏情况的方法往往过于保守,而一些稍微乐观一点的方法则允许智能体更自由地探索。最有效的方法采用了一种平衡策略,既保持安全,又不会仅仅因为数据尚不完美就阻碍潜在的有益行动。

这项研究还强调了一个关于智能体如何探索的微妙但重要的细节。当智能体决定尝试一个随机行动以学习新知识时,系统允许它从所有可能的行动中进行选择,即使是那些当前屏蔽器认为不安全的行动。这看似违反直觉,但它防止了智能体被困在世界的某个狭小、安全的角落里。通过偶尔涉足屏蔽器当前限制之外的区域,智能体能够收集到证明这些限制可以被安全扩展所需的资料。如果没有这种探索未知的自由,屏蔽器就永远无法学会变得不再那么保守。研究人员观察到,在复杂的环境中,这种承担计算风险的意愿对于找到最佳路径至关重要。

最终,这项工作表明,安全与学习并不一定是敌人。通过将安全屏蔽器视为一个并非固定围墙、而是随智能体经验不断演进的“活指南”,我们可以在事先没有完美地图的情况下导航危险环境。该系统证明,只要安全机制足够灵活,能随着智能体对世界理解的加深而成长,智能体就可以学会在保持安全的同时变得精通。这种方法为在规则尚不完全明确的现实场景中部署智能系统提供了一条切实可行的路径,确保了通往精通的旅程不会以牺牲安全为代价。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →