← 最新论文
🤖 AI

ClawSentry: A Progressive Multi-Tier Security Monitor for Safeguarding Autonomous LLM Agents

ClawSentry 是一个开源、与框架无关的安全网关,通过在技能准入、调用、执行和动作后阶段实现多层级、渐进式的审查系统,来缓解自主 LLM 智能体中的渐进式风险,在显著降低攻击成功率的同时,保持合法任务的高吞吐量。

原作者: Kai Wang, Zeming Wei, BiaoJie Zeng, Chang Jin, An Wang, Xiaokun Luan, Zhixiao Lin, Jingjing Qu, Xia Hu, Xingcheng Xu

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Kai Wang, Zeming Wei, BiaoJie Zeng, Chang Jin, An Wang, Xiaokun Luan, Zhixiao Lin, Jingjing Qu, Xia Hu, Xingcheng Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:计算机不再仅仅是回答问题,而是开始能够自主执行任务。它们可以编写代码、打开你硬盘上的文件,并向其他服务发送消息以完成一项任务。这些被称为“自主智能体”(autonomous agents),它们代表了从被动工具到主动劳动者的跨越。然而,这种新的能力也带来了一种新型的危险。如果一名“工人”被诱骗去拿起一件恶意工具,或者在它正在阅读的文档中被植入了隐藏指令,计算机可能会被迫窃取秘密、删除重要数据,或将其影响力扩散到其他系统。这种风险不仅仅是单一的错误,而是一种连锁反应,其中一个错误的决策就可能导致一连串的破坏。安全专家的核心挑战在于,这些攻击是巧妙且多变的。一个坏指令可能隐藏在文件中,伪装成正常的请求,或者被拆解成若干个看似无害的小步骤,只有组合在一起时才会变得危险。

上海人工智能实验室的研究人员开发了一种新系统,旨在这些攻击造成伤害之前将其阻止。他们将其称为 ClawSentry。该系统并不试图在每个错误动作发生后去拦截,而是扮演着一个“守门人”的角色,监控计算机智能体工作的整个生命周期。研究人员意识到,危险可以在四个不同的阶段进入:当一个新工具首次被引入时、当智能体决定使用它时、在工具实际运行期间,以及在工具完成工作并产生结果之后。以往的安全方法通常只关注其中一个阶段,比如检查用户输入的文字或观察计算机运行的代码。团队发现这还不够,因为攻击者可以简单地尝试另一种方式,通过使用不同的工具或改变请求的措辞,来绕过单一的检查点。

为了解决这个问题,研究人员构建了一个位于计算机智能体与外部世界之间的框架,监控智能体尝试进行的每一项操作。他们设计了一个分层工作的系统,非常类似于一支安保团队:首先检查访客的身份证件,然后观察其行为,最后审查其访问的结果。第一道防线发生在任何新工具被使用之前。系统会读取该工具的完整代码包以寻找隐藏的危险。如果代码看起来可疑,工具会被立即拦截。这防止了智能体在最初阶段就加载危险程序。如果一个工具通过了初步检查,系统随后会监视智能体采取的每一个动作。它使用一套简单、快速的规则来捕捉明显的危险,例如尝试删除关键系统文件。如果某个动作并非明显危险但也不完全安全,系统会将决策升级给一个更高级的计算机模型,该模型能够理解请求背后的上下文和意图。

该系统的一个关键部分是它能够记住已经拦截的内容。如果一个智能体试图窃取文件并被阻止,系统会记录下这个特定的目标。如果智能体稍后尝试使用不同的工具或通过将请求拆分为较小的步骤再次尝试,系统会识别出这只是同一个坏目标的变相伪装,并再次予以拦截。这防止了智能体通过尝试多种不同方法来消耗防御系统的耐性。系统还会观察动作完成后发生的情况。有时,危险仅出现在工具返回的结果中,例如包含后续步骤隐藏指令的文件。系统会审查这些结果,并在出现问题时提醒人类操作员,从而允许他们在造成更多损害前停止进程。

研究人员使用几种不同类型的计算机智能体对该系统进行了测试,发现其非常有效。在测试中,智能体暴露在各种危险工具和隐藏指令之下,系统将攻击成功率从接近一半的尝试率降低到了极小的比例。具体而言,在一套标准的安全性测试中,系统将攻击成功率从 33.5% 至 49.7% 的范围降低到了 9.09% 至 15.03% 之间。与此同时,该系统并没有阻止智能体进行正常的、有益的工作。当智能体被赋予安全任务时,它们几乎总能成功完成任务,成功率达 98.7%。这表明该系统能够区分真实的失误与恶意攻击,而不会干扰有用的工作。

研究还探讨了该系统如何处理不同类型的计算机模型,并发现其保护机制无论哪种特定的人工智能在进行思考,都能发挥作用。安全规则和门禁过程与智能体本身是分离的,这意味着相同的安全系统可以保护多种不同类型的智能体。研究人员还发现,阻止攻击最有效的方法是在智能体有机会使用危险工具之前将其拦截。一旦坏工具被加载到智能体的内存中,即使系统在捕捉坏行为方面表现出色,也很难阻止造成的破坏。这表明,最稳妥的防御是在最初阶段就严格限制哪些工具被允许进入系统。

通过结合严格的初始检查、对每项行动的多层审查以及对过往尝试的记忆,这个新系统为自主计算机创造了一个更加安全的环境。它应对的是攻击并非单一事件,而是寻找突破口持续进行的现实。研究结果表明,通过适当的监督,我们可以让计算机承担复杂任务,而不必将控制权交给恶意行为者。该系统并不依赖于某种单一的技巧或完美的模型;相反,它采用一种结构化的方法,在多个点位捕捉威胁,确保即使一层被绕过,另一层也能准备好拦截危险。这项工作为如何安全地将强大的、独立的计算机智能体整合到我们的日常生活和工作环境中提供了一个实用的蓝图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →