想象一下,你拥有一个超级聪明的机器人助手,它可以为你预订机票、编写代码并管理你的银行账户。它就像一个能真正为你干活的魔术精灵。但问题在于:这个精灵有点过于信任别人了。如果你在虚假邮件或可疑网站链接中低声传递了一条秘密指令,机器人可能会感到困惑,并认为那才是最重要的事情,从而忽略了你的真实指令。这被称为“提示词注入”(prompt injection)攻击。这就像是在老师的成绩册里塞进一张纸条,上面写着“给我一个A”,而老师误以为这是官方记录的一部分,竟然真的照做了。
为了让这些机器人保持安全,安全专家们在玩一种叫做“红队测试”(red-teaming)的游戏。你可以把它想象成一场电子游戏,其中一名玩家试图黑入机器人,而另一名玩家则试图阻止他。目标是在坏人之前,找出所有能欺骗机器人的诡计。长期以来,最好的黑客(被称为“攻击者”)就像是必须坐下来学习数千小时的学生,他们需要背诵下每一个能击败特定机器人的招式。但如果把机器人换成一个稍微不同的模型,这个学生就必须从头开始重新学习。这既缓慢又昂贵,而且在面对新挑战时效果并不好。
于是,PIMiner 出现了,这是一个由宾夕法尼亚州立大学研究人员设计的新颖且聪明的系统,旨在成为终极的红队测试侦探。PIMiner 不仅仅是记忆针对某一个特定机器人的招式,它更像是一个拥有一本巨大且有组织的劫案策略笔记本的高级神偷。当它面对一个新的机器人时,它不会从零开始。它会翻阅自己的笔记本,挑选出可能奏效的最佳招式并进行尝试。如果一个招式奏效了,它会将这个招式记在笔记本上,并注明为什么它奏效了;如果失败了,它也会记录下为什么失败了,这样它就不会犯同样的错误。
论文表明,这种“笔记本”方法是一个游戏规则的改变者。虽然旧的方法需要向机器人提问数千次才能学会如何黑入它,但 PIMiner 通常只需在每次测试中提出 10 个问题就能找出破解方法。在测试中,PIMiner 在某些挑战中成功诱骗了强大的、全新的机器人(如最新版本的 GPT 和 Claude),成功率高达 76.2%。这表明,通过将过去的经验组织成一个可重用的策略库,我们可以比以前更快、更便宜地发现安全漏洞,从而帮助为每个人构建更安全的 AI 助手。
技术摘要:PIMiner —— 一种用于自动提示词注入红队测试的智能体系统
问题陈述
提示词注入攻击对大语言模型(LLM)智能体构成了严重的安全性威胁,即攻击者将恶意指令嵌入到不可信的上下文来源(如工具输出、检索到的文档)中,以操纵智能体的行为。有效的红队测试对于评估这些漏洞并为防御措施生成训练数据至关重要。
现有的最先进红队测试方法分为两类,两者都存在显著局限性:
- 基于强化学习(RL)的方法: 如 RL-Hammer 和 PISmith 等方法通过训练攻击者模型来生成有效的攻击。虽然功能强大,但它们需要巨大的交互预算(数万次查询),并且生成的模型对新的、未见过的目标 LLM 迁移能力较差。
- 基于搜索的方法: 如 TAP 和 PAIR 等方法针对每个样本独立优化攻击,无需训练。虽然成本较低,但缺乏随时间积累知识的能力,导致其攻击成功率(ASR)明显低于基于 RL 的方法。
核心挑战在于弥合这两种范式之间的性能差距:在实现基于 RL 方法的高效性的同时,避免其高昂的成本和较差的迁移性,并使基于搜索的方法能够学习并复用攻击知识。
方法论:PIMiner
作者提出了 PIMiner,这是一个旨在通过层次化记忆机制积累并复用攻击知识的智能体系统。与训练单一模型的 RL 方法不同,PIMiner 通过与一系列(数据集、目标模型)对进行交互,从零开始构建一个策略库(Strategy Library)。
系统架构
PIMiner 通过四个主要组件运行:
- 策略库(Strategy Library): 一个存储攻击策略的长期记忆,以结构化 Markdown 文件的形式保存。每个文件定义了策略的范围(目标 LLM、任务类型)、注入模板、上下文示例以及失败条件。
- 策略路由(Strategy Router): 一个路由智能体,针对每个测试样本,根据目标模型和任务上下文从库中选择前 K 个最相关的策略。这防止了上下文窗口膨胀并降低了推理成本。
- 迭代攻击模块(Iterative Attack Module): 一个在有限迭代次数内(例如 Nmax=10)不断精炼提示词的攻击者智能体。它利用三个层级的记忆:
- 长期记忆: 来自策略库的路由策略。
- 数据集内记忆(Intra-dataset memory): 同一数据集-模型对中先前攻击样本的浓缩经验。
- 样本内记忆(Intra-sample memory): 当前样本的即时反馈历史。
- 经验消化器(Experience Digester): 一个分析完整攻击运行结果的学习组件。它通过以下方式更新策略库:
- 向现有策略中添加新的上下文示例。
- 如果发现新模式,则扩大策略的适用范围。
- 为新的机制创建新的策略文件。
- 根据失败的攻击精炼失败条件。
操作流程
在训练期间,PIMiner 处理样本,将其路由至相关策略,执行迭代攻击,然后消化结果以更新策略库。在测试阶段,学习到的策略库可以无须额外训练即可迁移到未见过的目标 LLM。该系统支持“测试时训练”范式,即新的经验可以进一步更新库。
核心贡献
- 智能体红队测试系统: PIMiner 被提出作为一种新型系统,它将攻击历史转化为可复用的、人类可读的攻击知识,有效地弥合了基于搜索和基于 RL 的红队测试之间的性能差距。
- 层次化记忆机制: 引入了三层记忆系统(策略库、数据集内记忆、样本内记忆),使系统能够在保持成本效率的同时,跨数据集和模型积累知识。
- 强迁移性: 研究表明,学习到的策略可以有效地迁移到未见过的目标 LLM 和不同的攻击者模型,消除了对昂贵的、特定于目标的训练的需求。
- 成本效率: 与基于 RL 的方法(通常 >10,000 次查询)相比,PIMiner 对目标智能体的查询次数显著减少(例如每个样本约 10 次),这使得测试昂贵的尖端模型变得可行。
实验结果
作者在 IPIArena 和 AgentDojo 两个基准测试上对 PIMiner 进行了评估,测试对象包括 GPT-5、GPT-5.1、Claude-Sonnet-4.5 和 Gemini-2.5-Pro 等尖端 LLM。
- 性能: PIMiner 实现了极高的攻击成功率(ASR)。在 IPIArena 上,针对 Gemini-2.5-Pro 达到了 76.2% ASR,针对 GPT-5.1 达到 61.9%,针对 Claude-Sonnet-4.5 达到 42.9%。在 AgentDojo 上,针对 Gemini-2.5-Pro 达到了 86.7%。
- 与基准方法的对比:
- PIMiner 显著优于静态和传统的基于搜索的攻击(如 TAP、PAIR),后者在面对强模型时往往 ASR 接近于零。
- PIMiner 的性能与最先进的基于 RL 的方法(如 PISmith 和 RL-Hammer)相当,但无需针对特定目标的训练。例如,在 InjecAgent 上,PIMiner 达到了与 RL-Hammer 和 PISmith 相同的 1.0 ASR。
- 与 RL 方法不同,PIMiner 的策略可以直接迁移到未见过的目标(例如,将从 GPT-5-nano 获得的知识应用于 GPT-5.1),而无需重新训练。
- 消融实验: 移除长期策略库或数据集内记忆都会显著降低性能,证实了这些记忆组件之间的互补性质。研究显示,策略路由在保持或提高 ASR 的同时,减少了 43–61% 的输入 Token 长度。
- 跨模型迁移: PIMiner 学习到的策略库(使用 Claude 模型)显著提升了 PAIR 算法在使用多样化攻击者模型(Gemini、GPT、DeepSeek)时的表现,证明了所捕获的知识是与模型无关的。
意义与主张
论文声称 PIMiner 代表了红队测试方法论的一种转变,它证明了基于搜索的智能体可以通过知识积累达到 RL 级别的有效性。
- 可解释性: 生成的策略库由人类可读的 Markdown 文件组成,提供了对攻击机制(如“伪造程序门控”、“伪造对话轮次”)的洞察,这对于审计智能体系统非常有用。
- 可扩展性: 通过避免 RL 训练所需的巨大计算预算,PIMiner 使对昂贵尖端模型的红队测试变得可行。
- 防御生成: 成功的攻击和结构化的策略为训练护栏(Guardrails)和改进骨干 LLM 的对齐提供了高质量的数据。
作者强调,他们的工作侧重于评估内部对齐的 LLM 的内在鲁棒性,而非外部防御机制,从而为自主智能体的安全性提供了一个严谨的基准。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。