← 最新论文
🤖 machine learning

Model-Based Proactive Cost Generation for Learning Safe Policies Offline with Limited Violation Data

本文介绍了 PROCO,这是一种基于模型的离线安全强化学习框架,它利用大语言模型将自然语言知识锚定到保守的成本函数中,从而能够生成反事实的不安全样本,并在训练数据缺乏已观测违规的情况下学习安全策略。

原作者: Ruiqi Xue, Lei Yuan, Kainuo Cheng, Jing-Wen Yang, Yang Yu

发布于 2026-05-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruiqi Xue, Lei Yuan, Kainuo Cheng, Jing-Wen Yang, Yang Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教机器人开车。通常教机器人的方法是让它四处行驶、犯错、撞向物体,并从这些碰撞中学习。但在现实世界中,你不能为了让机器人看看会发生什么,就让它撞墙或撞向行人。那太危险了。

因此,取而代之的是,你给机器人提供一个由人类驾驶员收集的驾驶日志数据集,这位人类驾驶员非常谨慎,并且从未发生过碰撞。机器人只看到“安全”的驾驶。

问题:“差点撞车”的陷阱
这里有个棘手之处:仅仅因为机器人在数据中从未见过碰撞,并不意味着它知道碰撞在发生前看起来是什么样。

想象一辆车正朝墙壁驶去。在数据集中,人类驾驶员总是在即将撞上墙壁前的那一刻踩下刹车。机器人看到的是汽车安全停下。但机器人没有意识到,如果它没有踩刹车,两秒钟后就会撞车。它会想:“哦,以这个速度开没问题!”因为它从未见过碰撞。

这就是本文要解决的核心问题:当你没有危险的例子,只有人们勉强避开危险的例子时,如何教授安全性?

解决方案:PROCO(“如果……会怎样”模拟器)
作者提出了一种名为PROCO的新方法。把它想象成一个安全教练,它使用两个主要工具:水晶球(一个描述世界如何运作的模型)和安全手册(由超级智能 AI 编写)。

以下是其工作原理,分步说明:

1. 水晶球(动力学模型)

首先,机器人从安全的驾驶日志中学习一个“水晶球”。这并非魔法;它是一个数学模型,用于预测:“如果我在这里,并以这种方式转动方向盘,下一秒我会在哪里?”

  • 类比:这就像飞行模拟器。机器人学习汽车的物理特性,从而能够想象未来的场景,而无需实际驾驶它们。

2. 安全手册(大语言模型成本函数)

接下来,机器人需要知道什么是“不安全”。由于没有碰撞数据,研究人员请大语言模型(LLM)——一种能够阅读和理解人类语言的超级智能 AI——来编写一本“安全手册”。

  • 提示词:他们告诉 LLM:“规则是:不要撞墙。但请务必格外谨慎。如果你靠近墙壁,就把它当作已经撞上了。”
  • 结果:LLM 编写了一个计算机函数(一段代码),作为“成本函数”。它不仅对撞墙赋予高“惩罚分数”,对危险地靠近墙壁也赋予高惩罚分数。这就创建了一个“安全缓冲区”。

3. “如果……会怎样”游戏(主动推演)

现在到了巧妙之处。机器人利用其水晶球,从它拥有的安全数据出发模拟向前行驶。它会问:“如果我从这个安全点继续直行,会发生什么?”

  • 由于安全手册的存在,模拟器知道靠近墙壁是危险的。
  • 模拟器运行这些“如果……会怎样”的场景,并生成虚假的碰撞数据。它创建了成千上万个“差点撞车”和“碰撞”的示例,这些在现实中从未实际发生,但在数学上被预测为会发生。

4. 从虚假数据中学习

最后,机器人在这个新的混合数据集上进行训练:

  • 原始的真实安全数据。
  • 由水晶球生成并由安全手册标记的模拟“碰撞”数据。

通过在这些模拟的危险中进行训练,机器人学会了识别“危险区域”(即会导致碰撞的状态),并学会远离它们,即使它在现实生活中从未真正撞过车。

为什么这更好?

  • 旧方法:如果你只向机器人展示安全数据,它可能会认为“在墙边快速行驶是安全的”,因为它从未见过碰撞。当部署时,它可能会漂入危险区域并发生碰撞。
  • PROCO 方法:它主动创建它需要从中学习的危险场景。它实际上是在说:“我知道我还没撞车,但我的水晶球告诉我,如果我现在不减速,我就会撞车。”

结果

作者在 17 个不同的机器人任务(如驾驶汽车、移动机械臂或游泳)上测试了这种方法。

  • 他们将 PROCO 与其他试图从同样的“仅安全”数据中学习安全性的先进方法进行了比较。
  • 结果:PROCO 的表现显著更好。在许多情况下,与其他方法相比,它将安全违规(碰撞)减少了超过400%。它学会了更可靠地保持安全,因为它能够“看到”其他方法无法看到的未来危险。

简而言之:PROCO 是一种通过让机器人利用模拟器和智能语言指南玩“如果……会怎样”游戏来教导机器人保持安全的方法,从而使它学会避免那些它从未真正经历过的灾难。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →