← 最新论文
💬 NLP

A Self-Evolving Multi-Agent Framework Defense against LLM Jailbreak Attacks

本文提出了一种自演进、无参数的多智能体防御框架,该框架利用持久的跨交互规则记忆将成功的越狱尝试抽象为可泛化的方法级规则,从而使大语言模型能够在不损害良性效用或增加过度拒绝的情况下,动态适应不断演进的攻击策略。

原作者: Tongyan Hu, Bryan Hooi

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Tongyan Hu, Bryan Hooi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型是强大的工具,能够编写故事、解决问题并回答问题,但它们有一个显著的弱点:它们可能会被诱骗而忽略自身的安全规则。想象一位受过高度训练的助手,他被教导绝不能提供危险指令,例如如何制造武器或绕过安全系统。然而,一个聪明的骗子仍然可以通过将危险请求包裹在一个复杂的伪装中(例如假装成故事中的角色,或将请求隐藏在计算机代码中)来让这位助手服从。这些被称为“越狱”(jailbreaks)的诡计利用了模型遵循指令的欲望,使得有害的想法得以绕过其防御机制。多年来,保护这些模型的标准方法是建立一个固定的屏障,比如一个静态的禁用词列表或一套编程进入系统的僵化指令集。然而,正如窃贼最终可以破解他们所研究过的锁一样,攻击者不断发明新的伪装方式,而这些静态屏障无法识别这些伪装,导致模型面临不断演变的威胁。

新加坡国立大学的研究人员针对这一问题提出了另一种方法,这种方法允许防御系统随着时间的推移进行学习并变得更加强大。他们没有依赖于一套永不改变的固定规则,而是构建了一个将每一次违反安全规则的失败尝试都视为一次教训的系统。当系统遇到一种成功绕过其防御的新型诡计时,它不仅仅是拦截该次请求并继续运行,而是会分析该诡计的结构,剥离掉特定的有害主题,并创建一个新的、可重用的规则,旨在针对用于伪装请求的方法。这个新规则会被存储在一个持久的记忆库中,就像保安记录下小偷穿着的特定制服一样,以便保安将来能够识别出任何穿着相同制服的人,无论他们试图偷窃什么。

该系统通过四个专门的组件协同工作,在每次交互过程中共同运作。首先,一个分类器会对传入的请求进行检查,看它是否使用了已知的诡计。如果请求是无害的,则正常回答。如果请求看起来像是一个诡计,系统会检查其记忆库中是否存在匹配该特定伪装风格的规则。如果存在匹配的规则,系统会立即执行严格的拒绝或提供安全的替代响应。如果请求是一种系统从未见过的全新类型的诡计,它最初会被允许通过。如果模型随后不小心产生了有害答案,一个反思代理(reflection agent)就会介入。该代理会分析失败的原因,识别攻击的结构模式,并将一条新规则写入记忆库。这条新规则随后将可用于防御未来所有使用相同结构模式的请求,从而有效地将一次失败转化为针对一整类相似攻击的永久盾牌。

研究人员在包括开源程序和无法直接修改的强大商业系统在内的多种不同模型上测试了这种自我进化的防御系统。他们让这些模型接受了四种不同类型的越狱攻击测试,其中包括角色扮演、代码混淆和多步操纵等方法。结果显示,随着系统遇到更多攻击并向其记忆中添加更多规则,其拦截攻击的能力显著提升。在初始阶段,当记忆为空时,系统是脆弱的;但在仅学习了几个示例后,它就将这些攻击的成功率降低到了接近于零。至关重要的是,这种学习过程并没有改变底层模型的“大脑”;系统只是通过向其记忆中添加外部笔记,使其在处理输入时变得更加聪明。

该研究的一个关键发现是,这种方法不会使系统变得过度谨慎或无礼。研究人员检查了不断增长的规则列表是否会导致模型拒绝无害的请求,即所谓的“过度拒绝”(over-refusal)问题。他们发现,即使记忆库中充满了来自不同类型攻击的规则,系统仍能准确地区分危险诡计与安全问题。系统仅拒绝那些符合其所学攻击特定结构模式的请求。这表明该防御是精准的,它针对的是攻击的方法而非对话的主题。研究还表明,即使攻击者试图结合不同的诡计来规避检测,该系统依然保持稳健,这说明基于记忆的方法可以适应复杂的、不断演变的威胁。

这项工作代表了从静态保护向动态适应的转变。以往的防御就像是一扇如果找到了合适的工具就能被撬开的锁,而这个新框架则更像是一个在每次入侵后都会更新观察名单的安保团队。通过将失败转化为可重用的知识,该系统构建了一种随着测试增加而变得更强大的防御。研究人员证明,这种方法适用于不同类型的模型和攻击风格,为在攻击者不断发明绕过规则的新方法的世界中,如何让人工智能变得更加安全提供了一条充满希望的路径。研究结论指出,虽然没有完美的系统,但赋予模型实时从错误中学习的能力,提供了一种静态防御无法实现的韧性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →