← 最新论文
💻 computer science

Rethinking Agent Security as a Networking Problem

本文认为,保障 AI 智能体的安全需要从不可靠的以智能体为中心的防御,转向一种受网络启发、将确定性执行机制与语义化、上下文感知策略相结合的架构,以确保稳健的隐私与安全。

原作者: Van Tran, Taveesh Sharma, Tajveer Singh Dhesi, Nick Feamster

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Van Tran, Taveesh Sharma, Tajveer Singh Dhesi, Nick Feamster

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:你的电脑不再仅仅是听从指令,而是能够真正地思考、计划并自主行动。这些被称为“AI智能体”(AI agents)。把它们想象成超级聪明的数字实习生,可以帮你预订机票、管理日程,甚至在不需要你手把手指导的情况下编写代码。但问题在于:由于它们如此独立,它们可能会在无意中(甚至恶意地)将你的秘密——比如你的密码或私人照片——泄露给错误的人。这是一个巨大的问题,因为我们目前试图阻止它们的方法有点像是要求一个淘气的孩子进行自我监管。我们告诉 AI:“请表现得好一点,不要分享秘密”,但由于 AI 的大脑具有不可预测性,它很容易被诱骗而忘记这条规则,或者对自己的行为撒谎。

要理解解决方案,我们需要看看我们是如何保护常规计算机网络的。几十年来,网络工程师通过在计算机与外部世界之间构建“防火墙”和“守门人”来解决类似的问题。这些守门人并不信任计算机;它们会检查离开建筑的每一条消息,以确保其是被允许的。这篇论文建议,我们不应该试图从内部修复 AI 智能体,而应该开始将它们视为网络流量。与其寄希望于 AI 记住如何保持安全,不如在每个智能体旁边放置一个严格、不可被欺骗的安全警卫,在它们发送任何字节的数据出去之前,检查它们的工作。


问题所在:让狼去守鸡舍

现在,当我们试图保持 AI 智能体安全时,我们主要依赖智能体本身。我们给它们规则,比如“不要分享信用卡号”或“不要与陌生人交谈”。但本文的作者指出一个主要的缺陷:AI 智能体是基于大语言模型(LLMs)构建的,而大语言模型本质上是不可预测的。它们就像是一个非常有才华但有点糊涂的演员,会被一个巧妙的剧本所欺骗。如果一个坏人(黑客)在智能体的耳边低语了一句“提示词注入”(prompt injection),智能体可能会突然觉得分享你的私密数据其实是个很棒的主意。

论文指出,信任一个 AI 来执行自身的安全措施,就像是让狼去守鸡舍。如果狼饿了或者被骗了,鸡就没了。目前的防御措施试图通过“微调”智能体或在其思维过程中添加“护栏”,但这些都是可以被绕过的。作者们认为,由于智能体本质上是能够与其他设备通信的新型网络设备,我们应该停止将它们视为软件应用程序,而开始将其视为一个网络问题

大构想:“边车”(Sidecar)安全警卫

该论文提出了一种借鉴自计算机网络领域概念的新架构。想象一下,每个 AI 智能体都有一个附着在它身边的、极其严格的小型保镖,被称为**“边车”(sidecar)**。这个边车并不是智能体大脑的一部分;它是一个独立的、分离的机器,位于智能体与外部世界之间。

以下是这个“边车”如何工作的简单类比:

  1. 智能体是旅行者: AI 智能体就像一个想要去不同地方(如日历应用、数据库或第三方预订服务)的旅行者。
  2. 边车是守门人: 边车是机场的安全检查站。旅行者如果不经过这个检查站,就无法离开建筑。
  3. 控制平面是空中交通管制塔: 在远离旅行者和闸口的地方,有一个中央“控制平面”(Control Plane)。这是决定规则的老板。它告诉守门人:“今天,这个旅行者被允许去日历应用,但他们绝不允许去银行,而且他们只能拍一张自己的脸,不能拍护照。”

安全警卫如何做出决策

论文建议,这个边车需要使用两种不同的逻辑来保持安全,将两者的优点结合起来:

  • “硬规则”(确定性执行): 有些事情是非黑即白的。如果智能体尝试拨打一个不在批准名单上的电话号码,边车直接说“不”。这很快、不可破坏,且不需要思考。这就像一名检查名单的门卫;如果你的名字不在上面,你就进不去。
  • “上下文检查”(语义策略): 有些事情更复杂。也许智能体想分享一张照片。这可以吗?这取决于谁在询问以及为什么要这么做。边车拥有第二个大脑(语义引擎),它会观察情况。“智能体想向预订服务分享一张照片。这可以吗?嗯,这张照片是日历,没问题。但如果这张照片是信用卡,边车就会说:‘停!这不合适。’”

这个系统的魔力在于,最终的决定权在边车手中。即使 AI 智能体被黑客诱骗,并且认为分享你的密码是可以的,边车也会检查规则,发现密码是绝不允许传出的,从而拦截该行为。智能体无法绕过边车,因为边车处于智能体的控制之外。

为什么这不同(且更好)

作者们谨慎地表示,这并不是一个能瞬间解决所有问题的魔杖。他们提出的是一种参考架构,就像是构建安全系统的蓝图。他们并不是声称已经构建出了最终产品,而是展示了构建它所需的组件在网络领域已经存在。

他们明确排除了仅仅通过“教导”AI 就能让其实现自我安全的想法。他们认为,只要 AI 是做出安全决策的一方,它就可能被愚弄。通过将决策权移交给边车(网络),我们得到了一个“确定性”的保证——这意味着无论 AI 变得多么困惑或受到操纵,规则都会 100% 被遵守。

下一步是什么?

论文以指出这仅仅是一个开始作为结尾。仍然有一些难题需要解决。例如,当 AI 智能体开始与其他智能体交谈时会发生什么?我们如何确保边车既能看到传进来的信息(入站/ingress),也能看到传出去的信息(出站/egress)?作者们建议,虽然他们的蓝图是一个强有力的开端,但我们仍需要更多的研究来弄清楚如何处理这些复杂且动态的情况。

简而言之,这篇论文建议,为了防止我们的 AI 智能体失控,我们不应该试图去修理它们的大脑。相反,我们应该在它们的门口放置一个严格、不可被欺骗的安全警卫,让他们配备一份清晰的规则清单,以及一套智能系统,用于检查他们尝试做的每一件事的上下文。这是一种从“希望智能体表现良好”到“确保网络不会让其失控”的转变。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →