← 最新论文
💻 computer science

Learning Safe Behaviour via Justified Human Preferences and Hypothetical Queries

本文介绍了 JPAL-HA,这是一种用于安全关键环境的安全学习模型,它利用人类行为解释来生成假设性查询,从而在显著提高安全性和样本效率的同时,减轻了人类的训练负担。

原作者: Ilias Kazantzidis, Timothy J. Norman, Yali Du, Christopher T. Freeman

发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Ilias Kazantzidis, Timothy J. Norman, Yali Du, Christopher T. Freeman

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个全新的机器人如何在一个棘手的岛屿上导航。这个岛上有干地、墙壁、目标点,还有一个致命的水坑(护城河)。如果机器人踩进水里,它就会“死亡”,整个教学过程也就毁了。

在过去,我们使用一种叫做**强化学习(Reinforcement Learning)**的方法来训练机器人。这就像是让一个蹒跚学步的孩子在一个摆满玻璃花瓶的房间里乱跑。当孩子没有打破任何东西时,你会说“做得好!”;当他们打破东西时,你会说“做得不好!”。问题在于?孩子必须打破一个(或两个,甚至十个)花瓶,才能学会哪里有危险。在现实世界中,机器人可能会撞车或伤人,我们承担不起这种“试错法”带来的代价。

这篇论文介绍了一种教导机器人的新方法,叫做 JPAL-HA。它就像是雇佣了一位非常耐心、非常聪明的家长,这位家长不仅会说“好”或“坏”,还会解释为什么,并帮助孩子在危险发生之前就预见到它们。

这个新方法的两大超能力

作者 Ilias Kazantzidis 及其团队基于两个核心理念构建了这个系统,这使得机器人的训练更加安全且高效。

1. “为什么”(正当化偏好 - Justified Preferences)
通常,当人类教导机器人时,他们会在两个动作之间做选择:“我更喜欢向左移动,而不是向右移动。”
新方法增加了一个维度:“我更喜欢向左,因为向右会害死你。”
人类在表达偏好的同时,还会提供一个简单的“警告”(是/否)。

  • 类比: 想象一个孩子问:“我可以从屋顶跳下去吗?”家长说:“不行,我更希望你留在地面上。”在旧方法中,孩子只知道“留在地面 = 好”。但在这种新方法中,家长补充道:“留在地面是因为跳跃是不安全的。”这小小的一块额外信息帮助机器人更快地理解了危险,而不仅仅是偏好。

2. “那如果……呢”(假设性动作 - Hypothetical Actions)
这是真正的魔术。当机器人提出一个问题,而家长说“警告!那个动作很危险”时,机器人并不会就此停止。它会立即追问:“好吧,那如果我尝试还没试过的另外一个动作呢?那个安全吗?”

  • 类比: 这就像是犯罪现场的侦探。如果他们发现一个线索说“凶手往左边去了”,他们不会就此止步。他们会立即追问:“好吧,那后门呢?后门锁了吗?窗户开着吗?”他们在一次性地勾勒出整个“危险区域”,而不是每隔五分钟就请侦探回来回答一个新问题。

这篇论文实际发现了什么

研究人员首先在“岛屿导航”游戏的计算机模拟中进行了测试,随后使用一个真实的小型移动机器人(Thymio)在真实房间内进行了测试。

模拟实验的结果:

  • 安全性: 旧方法(如 Q-learning)表现得很糟糕。在测试中,机器人在学会正确路径之前,平均要“死亡”(踩进水里)16.54 次
  • 新方法: 使用 JPAL-HA,机器人平均仅死亡 0.02 次。这几乎等于零。
  • 速度: 机器人仅用 3 个回合(尝试次数)就找到了完美路径。旧方法需要 22.9 个回合才能达到,而且在过程中一直在不断“死亡”。
  • 人类精力: 你可能认为询问“为什么?”和“那如果……呢?”会干扰人类。令人惊讶的是,论文发现新方法实际上减少了人类被中断的次数。因为机器人在处于危险位置时,会通过一连串的“那如果……呢”问题进行集中提问,因此人类不需要在之后反复被干扰。

真实人类实验的结果:
团队招募了 40 人(学生、教职员工和公众)来训练真实的机器人。

  • 时间: 使用新方法训练机器人大约耗时 5 分钟
  • 对比: 当人类适应了该系统后,使用 JPAL-HA 的训练时间几乎与旧的、更简单的方法(Parenting)持平,但机器人在学习过程中的安全性要高得多。
  • “那如果……呢”的成本: 研究人员测量了人们回答问题所需的时间。回答一个简单的“这安全吗?”大约需要 1.15 秒。回答“如果我做另一个动作会怎样?”则需要稍长一点的时间,约为 2.45 秒。即便有了这些额外的时间,大多数人的总训练时间仍保持在 4 分钟以内。

论文明确表示它“不是”什么

作者非常清楚他们的这种方法不是什么:

  • 它不是应对所有情况的万能钥匙。 他们承认,在非常复杂的现实场景中(比如驾驶直升机),你可能仍然需要人类专家进行持续监督。
  • 它不是所有安全规则的替代品。 他们明确指出,他们并不是在解决所有可能环境下的“安全探索”问题。他们提供的是一种在特定、受控设置下最小化危险的方法。
  • 它不是一个“奖励”系统。 他们反对传统的给机器人行为打分的做法。相反,他们完全依赖于人类的直接反馈(偏好和警告)。

他们有多大的把握?

论文对其数据非常有信心,但他们在实验室证明的内容与模拟实验之间划定了界限。

  • 模拟实验: 关于机器人死亡次数从 16.54 次降至 0.02 次的说法,是基于 1,000 次模拟试验得出的。这是计算机模型中一个非常强的统计结果。
  • 现实世界: 关于使用真实人类训练需 4 到 5 分钟的说法,是基于 40 名真实人类一台真实机器人的实验得出的。
  • “那如果……呢”的益处: 关于假设性问题节省时间的观点,是通过测量真实机器人实验得出的,结果显示即使回答这些问题的额外时间较长,也能让总训练时间保持在较低水平。

总结

这篇论文表明,如果你想在不破坏物品的情况下教会机器人如何保持安全,你不应该只问它“哪个动作更好?”你应该问:“哪个动作更好,以及为什么另一个动作是危险的?”并且当人类说“危险!”时,机器人应该立即追问:“好吧,那如果我做这个动作会怎样?”

通过这样做,机器人能更快地绘制出危险地图,人类受到的干扰更少,而机器人也能保持干爽。这是一种更聪明的教学方式,将一场危险的“猜猜看”游戏变成了一场安全的引导之旅。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →