Toward Metacognitive One-Shot Indirect Prompt Injection: Strategy Abstraction Via Outcome-Conditioned Reflection
本文介绍了 SAVOR,这是一个新颖的框架,它通过从对多样化轨迹的离线反思中提取可重用的攻击策略,实现了针对 LLM 智能体的元认知单次间接提示注入,从而在无需目标反馈的情况下,在单查询场景中取得了更高的成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在教一个机器人管家做饭。你给了它一份食谱,但这个机器人还必须在工作的同时阅读新闻、查看天气并收听广播报告。这就是现代人工智能智能体(AI agents)的工作方式:它们使用“工具”与现实世界进行交互,比如浏览网页或查询数据库。但问题在于:如果一个狡猾的黑客在那些新闻文章或广播报告中隐藏了一张秘密便条,机器人可能会感到困惑。它可能不再完成食谱,而是突然决定删除你的文件或把钱汇给陌生人。这种诡计被称为“间接提示词注入”(Indirect Prompt Injection)。这就像魔术师将一张虚假的指令悄悄塞进观众的口袋里;机器人读到了它,误以为它是表演的一部分,从而执行了错误的指令。
长期以来,试图欺骗这些机器人的黑客必须玩一场“猜测与尝试”的游戏。他们会尝试一个诡计,观察机器人是否上当,然后根据机器人的反应来调整他们的诡计。但在现实世界中,黑客通常只有一次机会将便条塞入机器人的路径中。他们不能等着看机器人的反应;他们必须在第一次尝试时就做到万无一失。研究人员提出的重大问题是:黑客能否通过学习过去的失败与成功,创造出一个“大师级诡计”,使其在面对一个从未见过的全新机器人时,仅凭一次尝试就能奏效?
于是,SAVOR 登场了。它是一种全新的方法,就像一位通过学习图书馆里无数烹饪灾难与胜利案例来成长的大师级厨师。SAVOR 不会在实时状态下尝试欺骗特定的机器人,而是在离线状态下进行研究,通过研究成千上万次黑客试图劫持不同机器人的过往尝试。它观察哪些方法奏效了,更重要的是,观察哪些方法没有奏效。它会自问:“为什么那个诡计失败了?”以及“为什么这个诡计成功了?”通过对这些结果进行反思,SAVOR 将特定诡计的杂乱细节提炼为几条“黄金法则”或“策略”。这就像一个不再死记硬背具体数学题,而是学会了代数底层逻辑的学生。
一旦 SAVOR 构建好了这个“策略库”,它就会将其冻结。当它面对一个全新的、未见过的机器人时,它不需要寻求帮助,也不需要尝试第二次。它只需从其冻结的库中提取出最佳策略,制作出一份完美的恶意便条,然后将其悄悄塞入。论文表明,这种方法非常有效。在测试中,即使机器人的防御很强,或者与 SAVOR 训练时的机器人完全不同,SAVOR 成功的欺骗次数也远高于以往的方法。它不仅在模拟测试中奏效,还在一个更真实的、机器人必须执行实际动作的环境中奏效,证明了这些“一次性”的诡计确实可以改变机器人的行为。研究人员发现,SAVOR 可以从一套工具中学习,并成功攻击一套完全不同的工具,本质上是在不需要第二次机会的情况下,将其“黑客直觉”转移到了新的情境中。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。