← 最新论文
🤖 machine learning

Contract-Based Compositional Shielding for Safe Multi-Agent Reinforcement Learning

本文提出了一种用于多智能体强化学习的基于契约的组合屏蔽框架,该框架通过利用非平稳多臂老虎机选择器来认证局部线性时序逻辑(LTL)义务元组,从而在确保确定性安全保证的同时,在去中心化执行下恢复团队最优行为。

原作者: Omar Adalat, Edwin Hamel-De le Court, Francesco Belardinelli

发布于 2026-06-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Omar Adalat, Edwin Hamel-De le Court, Francesco Belardinelli

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在训练一支机器人团队协同工作,就像是一群负责运送包裹的无人机编队,或者是在仓库里整理物品的机器人。目标是让它们学习如何尽可能快速、高效地完成工作。然而,这里有一个难点:如果它们犯了错,可能会互相碰撞或损坏物品。

问题在于,什么是对一个机器人而言“安全”的,往往取决于其他机器人在做什么。如果机器人 A 向左移动,那是安全的。但如果机器人 B 在同一时间也向左移动,它们就会相撞。

旧方法:过度保护的家长

传统上,为了保证机器人的安全,研究人员会使用一个“中央屏蔽器”(central shield)。这就像是一个盯着整个团队的严厉家长。家长观察每一个可能的动作,并说:“好吧,你可以向左移动,但前提是你必须绝对确定没有其他人也会向左移动。”

为了确保万无一失,这个家长往往会过于谨慎。他们可能会说:“我不能让任何人向左移动,以防万一,”因为他们无法完美地预测其他机器人的行为。这会导致机器人无法进行那些能让工作高效完成的巧妙协作动作。这就像一位家长告诉一群孩子:“别玩捉迷藏了,因为可能会有人摔跤,”于是孩子们就只能坐着不动。他们很安全,但他们无法学习,也玩得不开心。

新方法:“契约”系统

这篇论文介绍了一种更聪明的方法,可以在不那么具有限制性的情况下保持团队安全。他们称之为基于契约的组合式屏蔽(Contract-Based Compositional Shielding)

它是这样运作的,用一个简单的类比来说明:

1. 团队契约
与其使用一本大规则书,不如让团队达成一系列局部契约

  • 机器人 A 说: “我承诺始终留在房间的左侧。”
  • 机器人 B 说: “我承诺始终留在房间的右侧。”

这些是“局部义务”。它们是每个机器人对自己行为做出的简单承诺。

2. 魔法检查(认证)
在机器人开始学习之前,一台计算机也会检查这些承诺是否能协同工作。它会问:“如果机器人 A 遵守它的承诺,且机器人 B 也遵守它的承诺,它们是否永远不会相撞?”

  • 如果答案是**“是”**,则该契约被“认证”通过。
  • 如果答案是**“否”**,则该契约会被废弃。

这就是“循环”的部分。机器人 A 依赖于机器人 B 的承诺,而机器人 B 也依赖于机器人 A 的承诺。只要计算机证明这两个承诺结合在一起能保证安全,那么这个团队就可以出发了。

3. 局部屏蔽器
一旦契约得到认证,每个机器人都会获得自己的微型“屏蔽器”(过滤器)。

  • 机器人 A 的屏蔽器只观察机器人 A 的动作。它会说:“你可以向左、向右或向前移动,只要你保持在左侧即可。”它不需要知道机器人 B 在做什么,因为它信任机器人 B 的契约。
  • 机器人 B 也会获得类似的屏蔽器。

因为这些屏蔽器是基于这些受信任的承诺,所以机器人 A 被允许做出那些旧有的“严厉家长”会禁止的行为。机器人 A 可以向左移动,因为它知道机器人 B 已经承诺留在右侧。这使得团队能够执行那些以往无法实现的、高速度的协调动作。

学习过程:“游戏节目”选择器

论文还描述了机器人如何学习挑选最佳契约。
假设机器人拥有一套不同的契约库(例如,“留在左侧”、“留在右侧”、“慢速移动”、“快速移动”)。

  • 它们尝试运行一个契约一段时间。
  • 它们观察表现如何(是否拿到了包裹?是否发生了碰撞?)。
  • 一个“选择器”(就像游戏节目的主持人一样)会挑选出目前为止效果最好的契约,并坚持使用它。
  • 如果某个契约不再奏效,它们就会从库中切换到另一个新契约。

至关重要的一点是,它们只会切换到那些已经被认证为安全的契约。它们绝不会去尝试一个未经检查的“盲目猜测”型契约。这意味着它们可以在从未面临碰撞风险的情况下,学习并提高速度。

实验结果

作者在六个不同的机器人场景(如仓库机器人和无人机群)中测试了该方法。他们发现:

  1. 安全性: 机器人从未发生碰撞,因为契约在数学上被证明是安全的。
  2. 性能: 与旧有的“严厉家长”方法相比,机器人学会了更好地协同工作。它们找回了那种被旧方法视为理所当然而舍弃掉的“最优”(最佳)协作方式。

总结

简而言之,这篇论文解决了这样一个问题:“我们如何在不需要中央控制器时刻监控的情况下,让机器人团队进行复杂的协作?”

  • 旧方法: “除非我确定对所有人来说都是 100% 安全的,否则不要动。”(太慢,太保守)。
  • 新方法: “你承诺做 X,我承诺做 Y。如果我们都遵守承诺,我们就是安全的。让我们快点把工作做完吧!”(快速、协调,且依然安全)。

论文证明了这种“契约”方法允许机器人团队在无需中央控制器每秒钟都在监视的情况下,学习复杂的、安全的团队协作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →