← 最新论文
🤖 AI

SHIELD: An Auto-Healing Agentic Defense Framework for LLM Resource Exhaustion Attacks

本文介绍了 SHIELD,这是一个多智能体、自动修复的框架,它集成了语义检索、模式匹配和 LLM 推理,以有效地检测并针对不断演变的 LLM 资源耗尽(海绵)攻击进行自适应防御。

原作者: Nirhoshan Sivaroopan, Kanchana Thilakarathna, Albert Zomaya, Manu, Yi Guo, Jo Plested, Tim Lynar, Jack Yang, Wangli Yang

发布于 2026-01-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Nirhoshan Sivaroopan, Kanchana Thilakarathna, Albert Zomaya, Manu, Yi Guo, Jo Plested, Tim Lynar, Jack Yang, Wangli Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下一家受欢迎的高级餐厅厨房(即大语言模型,或称 LLM),它负责接收顾客的订单。通常情况下,这个厨房运作得非常高效。但现在出现了一种新型的恶作剧者——“海绵攻击者”(Sponge Attacker)。

这些恶作剧者不仅仅是点一个简单的汉堡,他们会点一份需要厨师切一万个洋葱、搅拌一锅汤长达10小时,或者写一部关于盐的历史的小说的餐点。这些订单表面上看完全正常(语法正确且逻辑通顺),但其设计目的是为了让厨房过度劳累直至崩溃,从而导致没有精力为真正的顾客服务。这就是一种“拒绝服务”(Denial of Service)攻击。

长期以来,餐厅门口的保安一直试图阻止这些恶作剧者,他们主要使用两种方法:

  1. “怪词”检测器: 他们寻找乱码或奇怪的、无意义的词汇。这对于明显的恶作剧有效,但当恶作剧者使用完美的英语时,这种方法就失效了。
  2. “静态规则手册”: 他们为保安(一个 AI)准备了一份固定的指令清单。但恶作剧者不断变换花样,而规则手册的更新速度跟不上他们的变化。

于是,SHIELD 诞生了。

论文的作者构建了一个名为 SHIELD 的新型智能安全系统。不要把它仅仅看作一个静态的守卫,而是一个具备自愈能力的、三层结构的安保团队,它能在工作中不断学习。

三层安全检查

当一位顾客带着订单(提示词/Prompt)进来时,SHMIELD 会通过三个快速检查:

  1. “形似性”扫描(语义相似度): 系统会询问:“这个订单看起来像我们以前见过的某种已知恶作剧吗?”它会将订单与过去恶意订单的数据库进行对比。如果匹配,则立即拦截。
  2. “关键词”扫描(子字符串匹配): 如果订单看起来很正常,系统会扫描冗长乏味的句子中是否隐藏着微小的、特定的“不良短语”。这就像是在一封长信中检查是否存在某个可疑的代码词。
  3. “智能侦探”(LLM 推理): 如果订单看起来仍然没问题,它会被送往一位高智商的 AI 侦探。这位侦探会阅读订单并询问:“这个请求的意图是否是为了让厨房工作过度?”这能捕捉到那些设计精巧、措辞得体的恶作剧。

只有通过了所有三项检查的订单才能进入厨房。

“自愈”的魔力

这是最重要的部分:SHIELD 每被愚弄一次,就会变得更聪明。

想象一下,如果一名恶作剧者终于溜过了安保团队,导致厨房开始崩溃(攻击成功)。SHIELD 不会只是陷入恐慌,它会启动其自动修复循环(Auto-Healing Loop)

  • 调查员(知识更新代理): 这个代理会抓取恶作剧者的订单并进行分析。它会询问:“究竟是什么导致了厨房的崩溃?”它会隔离出导致问题的那个极其细微且具有恶意的部分。
  • 图书管理员: 调查员会为这个特定的恶作剧编写一段新的描述,并将其添加到“不良订单”库中。
  • 教练(提示词优化代理): 这个代理会重写“智能侦探”(第三层的 AI)的指令。它会说:“嘿,下次如果你看到长得像这样的订单,千万别让它通过!”

结果: 下次类似的恶作剧者尝试进入时,系统会在第一层或第二层就将其拦截,甚至在他们到达昂贵的“智能侦探”之前。系统通过每一次入侵实现自我修复,并建立起更坚固的围墙。

为什么这很重要

论文表明,SHIELD 比旧方法要优秀得多。

  • 它能捕捉“隐形”攻击: 它能阻止那些使用完美、礼貌的语言来掩盖恶意意图的恶作剧者。
  • 它很快: 通过在前两层拦截大部分不良订单,它将昂贵的“智能侦探”留给了最困难的情况。
  • 它在进化: 它不需要人类对其进行重新训练或重写。它能自动从错误中学习。

简而言之,SHIELD 不仅仅是一个守卫,它是一个会学习、会适应、并且每当有人试图闯入时都会变得更强大的安全系统,确保厨房能为所有人持续开放。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →