← 最新论文
🤖 AI

Robust Shielding for Safe Reinforcement Learning

本文介绍了一种针对鲁棒马尔可夫决策过程的新颖、完备且最优的屏蔽框架,该框架在结合采样方法以通过学习模型提供概率近似正确(PAC)安全保证的同时,保证了强化学习智能体在最坏情况转移不确定性下的安全性。

原作者: Edwin Hamel-De le Court, Thom Badings, Alessandro Abate, Francesco Belardinelli, Francesco Fabiano

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Edwin Hamel-De le Court, Thom Badings, Alessandro Abate, Francesco Belardinelli, Francesco Fabiano

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人玩电子游戏,比如吃豆人,或者驾驶汽车。你希望机器人学会如何获得最高分或尽可能快地到达目的地。这被称为强化学习(Reinforcement Learning)。机器人通过尝试来学习:它移动、观察结果,并根据好的动作获得“奖励”(分数),或根据坏的动作受到“惩罚”。

问题在于,为了学习,机器人必须进行探索(Explore)。它必须尝试一些冒险的动作,以观察是否奏效。但在现实世界中,一个冒险的动作可能意味着机器人撞墙,或者自动驾驶汽车撞到行人。我们不能让机器人在可能导致灾难的尝试和错误中进行学习。

问题所在:“现实”的黑盒

通常,为了保持机器人的安全,我们需要一个“盾牌”——一个安全卫士,用来阻止机器人做出危险的动作。但要构建一个完美的盾牌,你需要知道世界的精确规则(物理定律、交通法规、游戏机制)。

在现实世界中,我们并不知道这些精确的规则。我们只有来自过去运行过程或模拟器的部分数据。如果我们基于有限的数据去猜测规则,我们可能会出错。如果我们的盾牌是建立在错误的猜测之上,它可能会无法阻止灾难发生。

解决方案:“最坏情况”下的雨伞

这篇论文介绍了一种新型盾牌,专门用于我们不了解确切规则的情况。与其猜测一种规则,作者将未知的世界视为两个玩家之间的游戏:

  1. 机器人(智能体): 试图获得高分。
  2. “小精灵”(对手): 一个淘气的力量,它试图通过为机器人每一个动作选择最坏的结果来让机器人失败。

作者称之为鲁棒马尔可夫决策过程(Robust MDP)。你可以这样理解:

  • 旧方法: “根据我的数据,这座桥有 90% 的概率能承重。我允许机器人通过。”(如果桥实际上断了,机器人就会掉下去)。
  • 新方法(本论文): “我不知道这座桥的确切强度,但我知道它在‘弱’和‘强’之间。我会构建一个假设桥是最弱的盾牌。如果机器人在桥很弱的情况下也能安全通过,那么在桥很强的情况下它肯定也是安全的。”

它是如何运作的:“安全预算”

论文使用了一个涉及**安全预算(Safety Budget)**的巧妙技巧。

想象机器人有一个钱包,里面装有特定金额的“安全资金”(假设为 100 美元)。每当机器人走一步时,都有极小的风险会损失一些钱。

  • 盾牌会计算每种可能动作导致丢钱的最坏情况概率。
  • 如果某个动作面临的丢钱风险超过了机器人钱包里剩余的钱,盾牌就会拦截该动作。
  • 如果某个动作足够安全,不会让钱包破产,盾牌就会允许机器人执行该动作。

这个“钱包”是实时更新的。随着机器人对世界了解得越多(通过收集更多数据),“小精灵”就变得不再那么可怕。不确定性缩小了,“最坏情况”变得不再那么严重,机器人也就获得了采取能带来更高回报的风险的更多自由。

“盾牌”在行动中

论文描述了一个三步过程:

  1. 学习不确定性: 机器人从环境中收集数据。它不再说“掉落的概率是 5%”,而是说“掉落的概率在 2% 到 8% 之间”。这个范围就是“鲁棒”的部分。
  2. 构建盾牌: 利用这些范围,盾牌被构建出来,以确保即使在概率处于可怕的一端(8%)时也能保证安全。
  3. 让机器人开始玩: 机器人开始玩游戏。盾牌监视着每一个动作。如果机器人试图做一些可能不安全的动作(即使它只是在最坏情况下才不安全),盾牌就会介入并强制执行一个更安全的选项。

结果:既安全又聪明

作者在吃豆人和带有“彩色炸弹”的网格世界等游戏中测试了该方法。

  • “猜测”法(旧方法): 如果你仅仅根据数据来猜测规则,机器人往往会获得高分,但会因为你的猜测稍有偏差而撞上幽灵或炸弹。
  • “鲁棒盾牌”法(新方法):
    • 起初: 当机器人数据很少时,盾牌非常严格。它会说“不,你不能去那里,那可能很危险!”机器人玩得非常谨慎,得分较低。
    • 随着数据增长: 随着机器人学习得越来越多,“不确定性范围”变得越来越小。盾牌意识到:“噢,那个动作其实并没有那么危险!”于是它放宽了规则。
    • 最终结果: 机器人保持了 100% 的安全(它从未撞车),但最终学会在玩游戏时表现得几乎和那些预先知道所有规则的机器人一样出色。

总结类比

想象你在教一个孩子骑自行车。

  • 旧方法: 你告诉孩子,“我觉得路面很平坦,所以你可以骑快点。”如果路上其实有一个隐藏的坑洼,孩子就会摔倒。
  • 新方法(本论文): 你不知道路面是平坦还是颠簸。所以,你给自行车装上了辅助轮(即盾牌)。你告诉孩子,“我们会假设路面到处是坑洼。如果你能在带辅助轮的情况下在颠簸的路面上安全骑行,那你就是安全的。”
    • 起初,辅助轮很沉重,孩子移动得很慢。
    • 但随着你骑着车经过这段路,意识到路面其实很平滑,你会慢慢地撤掉辅助轮。
    • 孩子从不摔倒(保证安全),但最终他们骑行的速度就像早就知道路面很平滑一样快。

这篇论文从数学上证明了这种方法是有效的:它保证了即使在对世界存在不确定性的情况下,机器人也不会做出任何危险的行为,并且随着它获取更多信息,它能学会变得更高效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →