← 最新论文
🤖 machine learning

Utility-Constrained Policy Optimization

本文介绍了一种针对效用约束马尔可夫决策过程(UCMDPs)的实用方法论,该方法能够实现风险敏感型约束以及在无需额外训练成本的情况下对约束限制进行灵活的训练后调整,同时在 Safety Gymnasium 基准测试中达到了最先进的性能。

原作者: Mehrdad Moghimi, Bernardo Avila Pires

发布于 2026-06-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Mehrdad Moghimi, Bernardo Avila Pires

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人开车。你的目标是让机器人尽可能快地到达目的地(最大化奖励)。然而,你有一个严格的规则:机器人不能耗尽汽油或撞到东西(最小化成本)。

在人工智能的世界里,这通常由一种叫做 CMDP(约束马尔可夫决策过程)的系统来处理。你可以把它想象成一位严厉的老师,说:“平均而言,你只能使用 25 加仑汽油。”

旧方法的问题(风险中性)

旧方法有一个狡猾的漏洞。因为它只关心平均值,机器人可能会产生一种疯狂的策略:

  • 99% 的时间里,它开得非常慢且小心,几乎不消耗汽油。
  • 1% 的时间里,它鲁莽驾驶,撞上一堵墙并消耗了 2,000 加仑汽油。

从数学上讲,这个平均值可能仍然低于 25 加仑。所以机器人通过了测试。但这正是作者所说的“风险中性”方法:它忽略了分布的“尾部”(即那些罕见但灾难性的事件)。

新的解决方案:效用约束策略 (UCP)

作者引入了一种新方法——效用约束策略 (UCP)。它不再仅仅观察平均值,而是观察风险的形状。它会问:“最坏的情况会有多糟?”

以下是他们利用三个巧妙的技巧解决问题的方法:

1. “背包”类比(存量增强)

想象机器人背着一个背包。每当它走一步,它就会往背包里添加一点点“已使用的汽油”。

  • 旧方法: 机器人只看它当前的位置。它不知道在这次特定的行程中,到目前为止已经使用了多少汽油。
  • 新方法 (UCP): 机器人观察它的背包。它确切地知道自己还剩多少汽油。
    作者称之为“存量增强”(stock augmentation)。通过给机器人一个关于过去成本的记忆(背包),它可以做出更明智的决策。如果背包变得越来越重,机器人就知道在耗尽汽油之前应该减速,而不是等到平均值计算告诉它出问题了才反应过来。

2. “灵活预算”技巧

通常当你训练一个机器人时,你必须设定一个特定的预算(例如,“你有 25 加仑”),然后训练它数周。如果你以后想把预算改为 30 加仑,你必须从头开始重新训练整个机器人。

UCP 方法就像是在训练一个变色龙机器人。

  • 在训练期间,研究人员随机给了机器人不同的背包大小(有的容量为 10 加仑,有的为 30 加仑)。
  • 因为机器人学会了观察自己的背包并实时调整驾驶风格,你现在可以告诉它:“好吧,今天你有 25 加仑,”或者“今天你有 15 加仑,”而无需重新训练它。
  • 机器人只需观察它的背包,看到限制,然后据此驾驶。

3. “安全网”(风险敏感型约束)

该方法不仅仅是说“不要超过 25 的平均值”,而是说“不要超过 25,如果超过了,惩罚会变得极其严重”。

  • 结果: 机器人停止了那些疯狂的“1% 撞车”冒险行为。它变得稍微保守了一些,但它消除了灾难性的失败。
  • 惊喜: 作者发现,通过更加谨慎地对待这些罕见风险,机器人的驾驶速度反而更快,得分也更高。事实证明,避免了“撞车”场景后,机器人可以在安全区域内驾驶得更加高效。

他们测试了什么

他们在一组类似视频游戏的驾驶和导航任务(称为 Safety Gymnasium)中测试了这一点。

  • 比赛: 他们将这种新的机器人 (UCP) 与现有的最佳机器人进行了对比。
  • 结果: 在几乎所有任务中,新机器人都达到了或超过了其他机器人。
  • 视觉证明: 在他们的图表中,你可以看到旧机器人的成本具有“长尾”现象(偶尔发生碰撞),而新机器人的成本则紧密聚集在安全限制附近。

总结

这篇论文提出了一种让 AI 智能体变得更安全、更聪明的方法。

  1. 给它们一个记忆(背包/存量),这样它们就知道自己的当前状态。
  2. 在许多不同的限制下进行训练,这样它们就可以即时适应而无需重新训练。
  3. 惩罚罕见的灾难,从而阻止它们拿安全性进行赌博。

其结果是,这种 AI 不仅仅是在纸面上满足规则(平均而言),而且在现实世界中表现得非常安全,能够避开那些罕见但危险的“碰撞”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →