← 最新论文
🤖 machine learning

Learning When to Stop: Selective Imitation Learning Under Arbitrary Dynamics Shift

本文介绍了 SeqRejectron,这是一种选择性模仿学习算法,它通过构建具有可证明样本复杂度保证的无视野停止规则,使智能体能够在任意动态偏移下安全地选择暂停行动。

原作者: Surbhi Goel, Jonathan Pei, James Wang

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Surbhi Goel, Jonathan Pei, James Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人驾驶汽车。你向它展示了数千小时的视频,内容是一位完美的人类驾驶员在阳光明媚、干燥的城市中驾驶。机器人学会了规则:“看到停车标志就停下,看到绿灯就通行。”

现在,想象你把这个机器人派往一座新城市。但这座新城市有所不同:正在下雪,道路结冰,交通信号灯的颜色也不同。由于机器人只见过晴天,它可能会像在干燥路面上那样,在冰面上尝试急转弯。撞车了。

这就是本文要解决的问题。标准的人工智能训练假设“测试”环境与“训练”环境完全一致。当两者不一致时,人工智能往往盲目继续行动,犯下它自己都不知道是错误的问题。

核心思想:“知道何时停止”

作者提出了一种名为选择性模仿学习(Selective Imitation Learning)的新训练方法。与其强迫机器人在每一刻都做出决策,不如给它第三个选项:“我不知道该怎么做。我要停下来等待。”

这就像学生参加考试:

  • 标准人工智能:学生猜测每一个答案,即使是那些他们从未见过的题目。如果考题很怪异,他们的得分就会很差。
  • 选择性人工智能:学生只回答他们确定的问题。如果看到一道看起来完全陌生的题目(比如用他们不懂的语言写的数学题),他们会留空并举手说:“我需要帮助。”

目标是做到完备(在“家乡”环境中几乎回答所有问题)和可靠(在“陌生”环境中绝不给出错误答案;如果不确定,就停止)。

工作原理:“验证者”团队

机器人如何知道何时停止?本文介绍了一个巧妙的技巧,即使用一个**“验证者”**团队。

想象机器人有一个“基础驾驶员”(主人工智能)和一个小团队的“检查员”(验证者)。

  1. 设置:基础驾驶员尝试驾驶,检查员们密切观察。
  2. 一致:只要所有检查员都同意基础驾驶员的操作,车辆就继续行驶。
  3. 停止:一旦哪怕一个检查员与基础驾驶员的意见不一致,车辆立即靠边停车。

神奇之处:本文证明,你不需要庞大的检查员大军。你只需要一个出人意料的小团队就能捕捉到几乎每一个危险情况。这就像让一小群多样化的朋友检查你的工作;如果他们全都同意,你大概率是安全的。如果其中一人说:“等等,那看起来不对”,你就停下来重新思考。

三种场景

本文在三种不同情境下测试了这一想法:

1. 确定性情况(“规则遵循者”)

  • 场景:机器人遵循严格且不变的规则(如国际象棋计算机)。
  • 结果:这个小规模的验证者团队运作完美。机器人学会了在恰当时机停止,而无需海量数据。它是“无视界”的,意味着无论行程是 5 分钟还是 5 小时,安全保证都成立。

2. 随机性情况(“赌徒”)

  • 场景:机器人进行概率性猜测(如人类驾驶员可能会稍微向左或向右变道)。在这里,两名驾驶员可能在单次操作上没有分歧,但他们的整体风格可能会随时间逐渐偏离。
  • 解决方案:验证者不再检查单个“错误”操作,而是追踪“累积漂移”。想象一张记分卡。每当机器人的风格哪怕有一点点偏离专家,分数就会上升。如果分数过高,机器人就会停止。
  • 结果:这很有效,但需要更多数据来确保安全。本文还证明了一个“下界”,表明学习速度存在根本限制;你无法在数学上作弊。

3. “规格不符”情况(“不完美的老师”)

  • 场景:如果机器人试图模仿的“专家”实际上并不完美怎么办?或者,如果机器人的“大脑”(其策略类)不够聪明,无法完美模仿专家怎么办?
  • 解决方案:系统设计为能够优雅降级。如果专家有缺陷,机器人不会撞车;它只是会比平时更频繁地停止,但依然保持安全。它会承认:“我无法完美模仿这个人,所以我会格外谨慎。”

文中提到的现实世界示例

作者使用了一些具体示例来解释为何这很重要:

  • 自动驾驶汽车:一辆在阳光明媚的加州道路上训练的汽车,可能会在芝加哥遭遇暴风雪。它不会撞车,而是识别出“结冰”条件超出了其训练数据范围,并安全地靠边停车。
  • 医疗(败血症治疗):在配备全套传感器的高科技重症监护室(ICU)中训练的医生人工智能,可能会被部署到传感器较少的乡村诊所。如果人工智能无法看到做出安全剂量决策所需的数据,它会停止并将控制权交给人类,而不是猜测一个危险的剂量。
  • 股票交易:一个在拥有完整交易日志访问权限的历史市场数据上训练的模型,可能会面临一个新的经济危机,此时只有公开头条新闻可用。当“游戏规则”发生太大变化以至于无法信任其旧训练时,它会停止交易。

结论

本文介绍了SeqRejectron,这是一种不仅教人工智能做什么,还教它何时放弃的算法。

它通过给人工智能提供一个安全阀,解决了“环境偏移”(即世界发生变化)的问题。它利用一个小型、智能的验证者团队来检测人工智能何时偏离进入危险、未知的领域。这确保了即使人工智能出错,它也会在造成灾难之前停止,为现实世界中的人工智能提供了一个数学上保证的安全网。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →