← 最新论文
🤖 AI

AgentBound: Verifiable Behavioral Governance for Autonomous AI Agents

AgentBound 是一个运行时治理框架,通过将提议的动作与委托授权、所有者签署的宪章以及站点合约进行评估,从而确保对自主 AI 智能体进行可验证的行为监督,并生成可用于独立验证与问责的加密审计收据。

原作者: Anuj Kaul, Qianlong Lan, Pranay Gupta

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Anuj Kaul, Qianlong Lan, Pranay Gupta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一个非常聪明、能力极强的机器人助手来管理你的业务。你给了它一张进入大楼的门禁卡(身份识别)以及一份它被允许进入的房间列表(授权)。

问题所在:
即使有了门禁卡和房间列表,机器人仍可能做出愚蠢或危险的行为。例如,它被允许进入“财务室”并操作“退款机”,但它可能因为被一条奇怪的信息搞混了,竟然在凌晨3点给一个陌生人退款了一百万美元。它并没有违反关于“去哪里”的规则,但它违反了你指令的“初衷”。

目前的安全系统只检查门禁卡和房间列表。它们不会询问:“现在做这件事是个好主意吗?”

解决方案:AgentBound
这篇论文介绍了一种名为 AgentBound 的新式“智能保镖”,它站在机器人与行动之间。它并不试图教会机器人变得更聪明;它只是在机器人的每一个动作发生之前进行检查。

以下是它的工作原理,使用了一个创意类比:

三位法官

当机器人想要执行某项操作时(比如发送电子邮件或转账),AgentBound 会将请求发送给三位不同的“法官”,由他们进行投票:

  1. 守门人(委托授权): 这位法官检查身份。“你有正确的钥匙吗?你被允许接触这台机器吗?”如果答案是否定的,行动会立即停止。
  2. 主人的意志(行为宪章): 这是一份由你(人类老板)签署的数字文档。它规定了诸如“未经我允许,绝不发送超过500美元的款项”或“周末绝不发布新闻”之类的内容。这位法官会询问:“这项行动是否符合老板的真实意图?”
  3. 场所守护者(站点行动契约): 这位法官观察机器人试图使用的特定机器或网站。它会询问:“这个动作对这个特定的系统来说安全吗?它是可逆的吗?它是否破坏了这个特定网站的规则?”

判决

这三位法官独立投票。AgentBound 使用一套严格的规则手册来整合它们的投票结果:

  • 如果任何一位法官说“否”(拒绝),该行动就会被拦截。
  • 如果守门人说“是”,但主人的意志说“等待人类确认”,那么机器人必须暂停并等待你的批准。
  • 只有当所有法帽都认为该行动安全且被允许时,机器人才能获得执行行动的绿灯。

“神奇收据”(治理收据)

这是最重要的一部分。在过去,如果出了问题,你会看到一份日志,上面仅写着“机器人在凌晨3点发送了款项”。你无法知道系统为什么会让它发生。

AgentBound 会创建一份 治理收据(Governance Receipt)。你可以把它想象成一个数字公证印章。每当机器人采取行动时,它都会得到一份收据,证明:

  • 究竟检查了哪些规则。
  • 使用了你哪一个版本的“主人意志”。
  • 三位法官确实进行了投票。
  • 该行动已获得批准。

这份收据是经过加密签名的。这意味着没有人可以伪造它,也没有人可以事后更改它。如果机器人做错了事,你可以查看收据并说:“啊,守门人说可以,但主人的意志说不行。系统未能阻止它。”或者,“系统运作完美,收据证明机器人确实遵循了规则。”

“常驻委托”(针对永不眠的机器人)

有些机器人24/7全天候工作,在你睡觉时也会做出决策。通常,如果你想更改这些机器人的规则,你必须叫醒它们并重新发放钥匙。

AgentBound 使用了 常驻委托(Standing Delegation)。想象一下,你给了机器人一把有效期为一年的“万能钥匙”,但它只能打开有效期仅为10分钟的“任务门”。

  • 每10分钟,机器人会请求一把新的“任务门”钥匙。
  • 当它请求时,系统会检查你当前的规则。如果你在昨天改变了主意,说“周一不退款”,那么新的10分钟钥匙会自动反映这一变化。
  • 通过这种方式,机器人无需你不断地重新授权,就能始终保持规则的最新状态。

总结

AgentBound 是一个为 AI 智能体增加“常识”和“问责制”的系统。

  • 旧方式: “你有钥匙,所以你可以进去。”(对上下文视而不见)。
  • AgentBound 方式: “你有钥匙,但你检查规则了吗?老板批准了吗?这对机器安全吗?这里有份签名收据,证明我们检查了所有这一切。”

它将 AI 治理从一种你必须去“信任”的东西,变成了你可以**“验证”**的东西。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →