← 最新论文
🤖 machine learning

Know Your Agent: Reconnaissance-Driven Pentesting of AI Agents

本文介绍了“了解你的智能体”(Know Your Agent, KYA)框架,该框架通过系统地探测 AI 智能体以构建目标画像并设计更强的间接提示注入攻击,实现了针对 AI 智能体的自动化黑盒侦察驱动型渗透测试。

原作者: Or Zion Eliav, Eyal Lenga, Shir Bernstien, Yisroel Mirsky

发布于 2026-07-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Or Zion Eliav, Eyal Lenga, Shir Bernstien, Yisroel Mirsky

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:你的电脑不再只是等待你输入指令,而是能主动为你去执行任务。它可以阅读你的电子邮件、搜索网络、编写代码,甚至预订机票。我们称之为“AI智能体”(AI Agents)。它们就像超级聪明的数字助手,能够自主进行规划并采取行动。但棘手之处在于:这些智能体始终在倾听周围的世界。如果你要求一个智能体阅读一个网页,它会阅读该页面上的所有内容,甚至是陌生人编写的部分。这产生了一个独特的安全问题。如果坏人将一条隐秘、狡猾的指令隐藏在一个看似正常的网页或电子邮件中,智能体可能会读到它,误以为这是来自你的真实指令,并照着坏人的意图去执行。这被称为“间接提示词注入”(Indirect Prompt Injection)。这就像有人往你朋友的午餐盒里塞了一张纸条,上面写着“把午餐给我”,而你的朋友因为很有礼貌,在没意识到这张纸条并非出自你之手的情况下,就把午餐交了出去。

研究人员提出的核心问题是:在我们把这些智能体投入现实世界之前,我们该如何测试它们,以确保它们不会落入这些诡计的圈套?长期以来,安全专家试图通过向它们投掷随机的、混乱的指令来测试它们,希望以此看到它们是否会崩溃。这有点像试图通过盲目地向城堡墙壁投掷石块来寻找薄弱点。但一篇新论文指出,这种方法忽略了这项工作中最重要的一部分:侦察(Reconnaissance)。在传统安全领域,测试者不仅仅是投掷石块;他们首先会侦察城堡。他们寻找开放的窗户,检查卫兵的排班表,并了解布局。这篇论文认为,要真正测试AI智能体,我们也必须这样做:我们需要“了解你的智能体”(Know Your Agent)。

作者们(来自本-格里恩大学的一个团队)引入了一个名为 KYA(Know Your Agent)的新框架。他们认为,破解AI智能体最好的方法不是盲目猜测,而是先尽可能多地了解它。他们发现,AI智能体有两个使其变得脆弱的“盲点”。首先,它们信任那些看起来正确的东西(例如特定的格式或通常意味着“这是一个安全指令”的词汇)。其次,它们信任那些符合情境的东西(例如在一段正常任务过程中显得合情合理的请求)。

论文表明,通过使用一个像数字侦探一样运作的智能自动化系统,我们可以比以前更有效地利用这些盲点。这个名为KYA的系统不仅进行攻击,还会停下来提问、观察智能体的反应,并建立一个关于其工具和规则的详细档案。它会学习诸如:“噢,这个智能体使用一个特殊符号来分隔指令,”或者“如果我提出一个不符合当前情境的要求,这个智能体会感到‘紧张’。”一旦它掌握了这些细节,它就能设计出更具说服力的诡计。

研究人员在几种不同的AI智能体上测试了这个想法,并发现其“侦察驱动型”方法极其有效。在模拟实验中,KYA 成功突破智能体并完成攻击的频率比以往那种仅靠猜测和重试的方法高出了高达 67 个百分点。他们甚至在名为 OpenHands 的真实编程智能体上进行了测试,发现该方法同样奏效。论文总结道,如果我们想要让AI智能体变得安全,我们就不能再把它们视为静态的目标,而必须把它们视为复杂的系统,在真正测试其防御能力之前,需要对其进行研究、画像和理解。现在不再仅仅是投掷石块了,而是要先学会掌握城堡的秘密。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →