Securing Agentic AI: From Per-Action Checks to Trajectory Assurance
本文概述了一份全面的自主智能体安全路线图,认为安全性必须从验证单个动作转向确保整个行为轨迹的完整性,涵盖从单智能体输入到多智能体委托,再到系统级供应链溯源的完整智能体技术栈。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个计算机不仅仅是回答问题,而是真正能够“做事”的世界。它们不只是告诉你天气,还会为你预订机票、订购杂货并管理你的银行账户。这些被称为“自主智能体”(autonomous agents)。可以将它们想象成由大语言模型(LLM)驱动的超级聪明的数字实习生——这种大脑极其发达的 AI 可以写诗或编写代码。但与需要老板检查工作的真人实习生不同,这些智能体可以自主进行规划、推理并使用工具。它们甚至可以与其他智能体交谈,组成团队来处理巨大的、复杂的任务。
大家都在问的一个重大问题是:“当这些数字实习生‘失控’时会发生什么?”如果人类犯了错,我们通常能发现;但如果一个 AI 智能体在一秒钟内做了上千个微小的决定,而其中只有一个出了偏差,它可能会在无意中违反法律、掏空银行账户或导致电网崩溃。我们过去认为安全仅仅是确保每一个单独的步骤都是安全的,就像检查门是否锁好一样。但这篇论文认为,这已经不够了。这就像检查城堡里的每一块砖是否都是好石材;但这并不能保证如果砖块堆叠顺序不对,整个城堡就不会坍塌。真正的危险不仅在于一个错误的步骤,而在于一段看起来每一步都安全,最终却走向灾难现场的整个旅程。
这篇论文是为一次顶尖的 AI 领袖集会撰写的,它充当了保障这些数字智能体安全的路线图。作者们是一群计算机科学家,他们认为我们不能再将安全视为对单个动作的简单“清单式检查”,而应该开始关注“轨迹”(trajectory)——即智能体从开始到结束所走的整个路径。他们将问题分解为几个层面,从智能体如何记忆事物到它如何与其他智能体交流。
首先,他们研究了“单智能体表面”(Single-Agent Surface)。想象一个智能体是一名侦探,它阅读线索(提示词)、记住过去的案件(记忆),并使用放大镜或数据库等工具。论文警告说,坏人可能会混入“被投毒”的线索。例如,黑客可以在看似无害的电子邮件或网页中隐藏一条秘密指令。智能体可能会阅读它,认为这是故事的正常部分,然后执行窃取数据的指令。更糟糕的是,如果智能体的“记忆”被投毒,它可能会被误导做出错误的决策,这种影响可能持续数月甚至数年,远在最初的诡计之后。同样,智能体使用的工具也可能被替换为恶意版本,就像技工把扳手换成了一个会弄坏引擎的假扳手。
接下来,论文探讨了“多智能体表面”(Inter-Agent Surface),这就像是一个智能体见面并交换任务的数字广场。它们使用一种称为 A2A(智能体对智能体)的协议进行交谈。作者指出,这个广场目前的规则非常松散。一个智能体可能会冒充他人,或者一群智能体可能会无意中(或故意地)协作来耗尽资源,从而制造出一种“钱包拒绝服务”(denial-of-wallet)攻击,即它们仅通过交谈就能花光所有的钱。这就像一群朋友商量着买披萨,但他们不断地追加订单,直到信用卡额度用尽,而没有人意识到错误,直到为时已晚。
接着是“模型路由”(Model Routing)层,它是决定哪个“大脑”(AI 模型)应该处理特定任务的交通指挥官。论文指出,黑客可能会欺骗这个交通指挥官,让它将一个危险的请求发送给一个更“笨”或安全性更低的 AI 模型,仅仅是为了省钱或绕过安全检查。这就像博物馆的保安被骗了,因为有人告诉他,针对那个特定的走廊可以使用更便宜、训练程度较低的安全摄像头,从而让小偷进入了 VIP 室。
论文最关键的部分是关于“行为轨迹控制”(Behavioral Trajectory Containment)。这个概念是指:一个智能体可以做一千件在各自看来都完全合法的行为,但当你把它们按特定顺序组合在一起时,它们却违反了一项重大规则。想象一个医院里的机器人被允许办理出院手续。如果它让一名患者出院,这没问题;如果它让十名患者出院,也没问题。但如果它因为被某种模式搞混了,在一小时内让五十名患者出院,它就可能违反了关于同时出院人数的安全性规定。论文认为,目前的安全性工具只检查单个步骤,而不检查整个故事。我们需要一种能够观看“整部电影”而非仅仅是“每一帧画面”的方法。
最后,论文提到了“供应链”和“问责制”。就像汽车是由许多不同工厂的零件制造而成一样,一个 AI 智能体也是由来自许多不同来源的模型、工具和指令构建而成的。如果其中一个零件是伪造的或稍后被黑客入侵,整个智能体就会受到威胁。作者说,我们需要追踪每一个零件,就像为智能体使用的每样东西都准备一份数字收据。他们还强调,当事情出错时,我们需要能够查看“黑匣子”,看清楚到底是什么智能体做了什么,是谁告诉它这么做的,以及为什么要这样做。
简而言之,这篇论文并没有提供一个今天就能解决所有问题的魔术方案。相反,它建议我们看待 AI 安全的方式已经过时了。我们不能仅仅是修补漏洞;我们需要重新设计整个系统,以确保 AI 智能体的“整个旅程”都是安全、可靠且受控的。这是一个呼吁:从检查单个步骤转向保证整个路径的安全。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。