← 最新论文
🤖 AI

The Importance of Out-of-Band Metadata for Safe Autonomous Agents: The Redpanda Agentic Data Plane

本文介绍了红熊猫代理数据平面(ADP),这是一种通过完全独立于代理读写路径的确定性带外元数据通道来强制执行安全策略、数据范围界定和防篡改审计追踪,从而确保自主代理安全运行的架构。

原作者: Tyler Akidau, Tyler Rockwood, Johannes Brüderl, Marc Millstone

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Tyler Akidau, Tyler Rockwood, Johannes Brüderl, Marc Millstone

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一位才华横溢、速度极快的数字员工来管理公司的资金。这位员工(一个 AI 智能体)可以读取你的银行账户、做出投资决策,并瞬间执行交易。

问题在于,这位员工有点不可预测。有时它会“产生幻觉”(编造内容),有时会被棘手的指令搞糊涂,有时甚至可能被黑客欺骗。如果你告诉这位员工“只看账户 A",而它不小心查看了账户 B,或者被黑客欺骗去查看账户 B,就会造成巨大的安全漏洞。

这篇论文认为,如果规则写在员工正在阅读的同一本笔记本上,你就无法信任员工会遵守这些规则。

核心问题:“带内”与“带外”

旧方式(带内):
想象你给员工一张写在纸上的指令清单:“只交易低于 1,000 美元的股票。”

  • 风险: 如果员工感到困惑,它可能会忽略这张便条。如果黑客将纸张换成一张写着“交易任何股票”的新纸,员工就会遵循新指令。规则位于员工的“头脑”(或提示词)内部,因此它们可能被更改、忽略或误解。

新方式(带外):
作者提出了一种名为红熊猫智能体数据平面(Redpanda Agentic Data Plane, ADP)的系统。你可以将其理解为在你的员工周围建造一个安全、自动化的工厂

你不是给员工一份规则清单,而是构建一套员工看不见也摸不着的、不可穿透的墙壁和交通信号灯。

“带外”系统的三大超能力

论文描述了该系统通过三种具体方式确保安全,并使用了“工厂”类比:

1. 隐形守门人(限定数据访问)

  • 类比: 想象员工在一栋有许多房间的大楼里工作。在旧方式下,你告诉员工“不要进入 B 房间”。但员工可以直接走进去。
  • ADP 解决方案: 大楼本身装有智能门。当员工试图开门时,门本身会检查他们的 ID 徽章。如果徽章显示“仅限 A 房间”,门就会直接锁住,无法打开。员工甚至不知道 B 房间的存在。规则不在员工的头脑中,而是在门的硬件里。

2. 交通警(受限操作)

  • 类比: 员工想要发送一个包裹(交易订单)。在旧方式下,你告诉他们“不要发送超过 1,000 美元的包裹”。但如果他们感到困惑,可能会发送一个 10,000 美元的包裹。
  • ADP 解决方案: 包裹必须经过一条带有秤的传送带。秤连接着一名交通警。如果包裹重量超过 1,000 美元,交通警(基础设施)会停止传送带,并扣留包裹,等待人类经理批准。员工无法覆盖秤的读数;秤在他们的控制范围之外。

3. 无法伪造的摄像头(防篡改审计)

  • 类比: 在旧方式下,你要求员工写日记记录他们做了什么。如果他们做错了事,他们可以撕掉那一页,或者编造一条虚假记录说“我没做那件事”。
  • ADP 解决方案: 工厂装有安全摄像头,记录一切。员工永远看不到摄像头,也无法关闭它们。录像保存在员工无法触及的安全服务器中。如果员工试图掩盖错误,摄像头录像将确切证明发生了什么。

现实生活中的运作方式(演示)

论文通过一个财富管理系统(为客户管理资金)演示了这一点。

  • 设置: 有三个 AI 智能体协同工作:一个负责研究市场,一个负责决定购买什么,一个负责执行交易。
  • 魔法: 这些智能体通过一个充当安全邮局的 messaging 系统相互通信。
    • 当“决策智能体”说“为客户端 A 买入 100 股”时,它实际上并没有告诉系统是客户端 A。
    • **邮局(基础设施)**查看智能体的 ID 徽章,看到它属于客户端 A,并自动在订单上盖上“客户端 A"的印章。
    • 智能体从未看到印章。它无法更改印章。它无法冒充客户端 B。
    • 如果订单过大,邮局会自动将其扣留,等待人类处理。智能体无法强行通过。

为什么这很重要

论文总结道,随着 AI 智能体变得更加强大和快速,我们不能再依赖它们根据所阅读的指令来“表现良好”。我们需要将规则移至智能体之外

通过构建一个“数据平面”,让规则由基础设施(门、秤、摄像头)而非智能体的大脑来执行,我们创建了一个系统,其中:

  1. 困惑的智能体无法意外违反规则。
  2. 被黑客攻击的智能体无法绕过规则。
  3. 监管机构可以看到所有发生之事的完美、不可更改的记录。

简而言之:不要信任员工会遵守规则。要建造一个由墙壁本身执行规则的房间。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →