← 最新论文
💻 computer science

Position: A Three-Layer Probabilistic Assume-Guarantee Architecture Is Structurally Required for Safe LLM Agent Deployment

本立场论文认为,大语言模型代理的安全部署在结构上需要一种基于三层、基于合同的概率架构,以分别保障语义意图、环境有效性和动态可行性这三个不同的安全维度,因为没有任何单一抽象层能够同时保证这三者。

原作者: S. Bensalem, Y. Dong, M. Franzle, X. Huang, J. Kroger, D. Nickovic, A. Nouri, R. Roy, C. Wu

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: S. Bensalem, Y. Dong, M. Franzle, X. Huang, J. Kroger, D. Nickovic, A. Nouri, R. Roy, C. Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和创意类比对该论文的解读。

核心问题:一道安全护栏远远不够

想象你正在雇佣一位非常聪明但稍显不可预测的机器人管家来打理你的家。你给它列出了一份任务清单:“去厨房,拿水,然后带给奶奶。”

论文认为,试图仅靠一道安全检查(比如一个单一的“停止”标志或一本单一的规则手册)来确保这个机器人的安全,在结构上是不可能的。无论你让这道检查变得多么智能,它总会在某个时刻失效,因为该机器人在三个不同的时间点面临着三种不同类型的危险。

这就像机场的三级安检通道。你无法在同一瞬间检查乘客的护照、行李以及他们驾驶飞机的能力。你必须按顺序逐一进行。

三层安全架构

作者提出,我们需要三个 distinct 的“安全层”,每一层在不同的时间检查不同的事物。他们将其称为三层概率架构

1. 用户层:“意图检查”(在机器人移动之前)

  • 检查内容:计划是否合理?是否有礼貌?是否遵守了规则?
  • 类比:想象一位人类编辑在你发布故事之前阅读它。他们会检查:“你让机器人去拿水了吗?是的。你让它伤害奶奶了吗?没有。这个计划合乎逻辑吗?”
  • 为何需要独立的一层:机器人尚未移动。它不知道走廊是否被堵塞,也不知道外面是否在下雨。它只知道你说了什么。这一层能阻止机器人甚至开始执行一个糟糕的计划(例如“带着摄像头进入浴室”)。

2. 操作层:“世界检查”(在机器人行动之前)

  • 检查内容:此时此刻,这个世界对该计划是否安全?
  • 类比:想象一位交通指挥官正在查看实时雷达。编辑已经批准了“开车去厨房”的计划,但交通指挥官看到一棵大树倒在了走廊里。他们会说:“停下!你现在不能去那里。”
  • 为何需要独立的一层:编辑(第 1 层)看不到那棵树,因为在制定计划时它还不存在。机器人需要观察当前的世界(传感器、摄像头),以确认是否安全可行。

3. 功能层:“动作检查”(在机器人移动过程中)

  • 检查内容:机器人此刻的移动是否安全?
  • 类比:想象车内的安全带和安全气囊系统。即使计划是好的,道路也是畅通的,一阵突如其来的狂风也可能把车推偏。这一层是能够瞬间纠正机器人移动以避免碰撞的物理机制。
  • 为何需要独立的一层:交通指挥官(第 2 层)无法预测机器人此刻是否会突然打滑,或者是否有人突然走到机器人面前。这一层会对物理现实做出即时反应。

为何不能将它们合并

论文提出了一个强有力的数学主张:你不能将这三层合并为一层。

  • “时间旅行”问题:要检查“世界”(第 2 层),你需要看到世界。但要检查“意图”(第 1 层),你需要在看到世界之前完成检查。如果你试图同时做这两件事,你要么是在检查意图时太晚了(机器人可能已经开始移动),要么是在检查世界时太早了(在你真正知道世界看起来像什么之前)。
  • “黑盒”问题:机器人(大语言模型)是不可预测的。它可能会产生幻觉或犯错。如果你依赖一张巨大的安全网,而这张网有一个洞,整个系统就会失败。通过设置三张独立的网,如果其中一张有洞,其他的网仍可能 catches 住错误。

“契约”系统

作者建议这些层之间应通过契约进行交互。

  • 第 1 层签署一份契约,承诺:“我保证该计划在思考层面是安全的。”
  • 第 2 层签署一份契约,承诺:“我保证该世界在进入层面是安全的。”
  • 第 3 层签署一份契约,承诺:“我保证该动作在执行层面是安全的。”

如果第 1 层违反了契约,第 2 层甚至无需进行检查。如果第 2 层违反了契约,第 3 层会立即停止机器人。这就形成了一个安全链条,其中总安全性是三层协同工作的乘积。

剩余的挑战

论文承认,这是一份蓝图,而非成品。在将其投入实际应用之前,还有三大障碍需要解决:

  1. 概率计算:很难计算出每一层“有多安全”的确切数学值,因为机器人的行为每次都在变化(它不像抛硬币那样固定)。
  2. 规则漂移:如果机器人的环境发生变化(例如家具移动了),安全规则可能需要优雅地调整,而不会破坏整个系统。
  3. 团队协作:该系统是为单个机器人设计的。如果你有一个机器人团队彼此交流,它们可能会互相欺骗,而我们目前还没有针对这种情况的安全层。

总结

论文指出:停止尝试为 AI 机器人构建一个巨大的“安全盾牌”。 相反,应构建三个独立的、专业化的盾牌,并按特定顺序工作:

  1. 检查计划(这个想法好吗?)
  2. 检查世界(环境安全吗?)
  3. 检查动作(移动安全吗?)

只有将这些检查分开,我们才能真正保证 AI 机器人不会伤害任何人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →