← 最新论文
💻 computer science

Agent Against Agent: An Agentic System for Automatic Prompt Injection Red Teaming

本文介绍了 PIMiner,这是一个在训练过程中构建可迁移策略库的智能体系统,旨在针对未见的靶向大语言模型实现高效、低查询量的提示注入红队测试,其性能显著优于现有的基于强化学习的方法。

原作者: Yanting Wang, Chenlong Yin, Runpeng Geng, Jinyuan Jia

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Yanting Wang, Chenlong Yin, Runpeng Geng, Jinyuan Jia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的机器人助手,它可以为你预订机票、编写代码并管理你的银行账户。它就像一个能真正为你干活的魔术精灵。但问题在于:这个精灵有点过于信任别人了。如果你在虚假邮件或可疑网站链接中低声传递了一条秘密指令,机器人可能会感到困惑,并认为那才是最重要的事情,从而忽略了你的真实指令。这被称为“提示词注入”(prompt injection)攻击。这就像是在老师的成绩册里塞进一张纸条,上面写着“给我一个A”,而老师误以为这是官方记录的一部分,竟然真的照做了。

为了让这些机器人保持安全,安全专家们在玩一种叫做“红队测试”(red-teaming)的游戏。你可以把它想象成一场电子游戏,其中一名玩家试图黑入机器人,而另一名玩家则试图阻止他。目标是在坏人之前,找出所有能欺骗机器人的诡计。长期以来,最好的黑客(被称为“攻击者”)就像是必须坐下来学习数千小时的学生,他们需要背诵下每一个能击败特定机器人的招式。但如果把机器人换成一个稍微不同的模型,这个学生就必须从头开始重新学习。这既缓慢又昂贵,而且在面对新挑战时效果并不好。

于是,PIMiner 出现了,这是一个由宾夕法尼亚州立大学研究人员设计的新颖且聪明的系统,旨在成为终极的红队测试侦探。PIMiner 不仅仅是记忆针对某一个特定机器人的招式,它更像是一个拥有一本巨大且有组织的劫案策略笔记本的高级神偷。当它面对一个新的机器人时,它不会从零开始。它会翻阅自己的笔记本,挑选出可能奏效的最佳招式并进行尝试。如果一个招式奏效了,它会将这个招式记在笔记本上,并注明为什么它奏效了;如果失败了,它也会记录下为什么失败了,这样它就不会犯同样的错误。

论文表明,这种“笔记本”方法是一个游戏规则的改变者。虽然旧的方法需要向机器人提问数千次才能学会如何黑入它,但 PIMiner 通常只需在每次测试中提出 10 个问题就能找出破解方法。在测试中,PIMiner 在某些挑战中成功诱骗了强大的、全新的机器人(如最新版本的 GPT 和 Claude),成功率高达 76.2%。这表明,通过将过去的经验组织成一个可重用的策略库,我们可以比以前更快、更便宜地发现安全漏洞,从而帮助为每个人构建更安全的 AI 助手。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →