← 最新论文
💻 computer science

Latent-space Attacks for Refusal Evasion in Language Models

本文将对语言模型中的拒绝抑制重新框架化为针对线性探测器的潜在空间逃逸攻击,揭示先前的消融方法仅将表示投影至决策边界,并提出一种新的“受控潜在空间逃逸”技术,通过将表示进一步推入合规区域以实现最先进的越狱成功率。

原作者: Giorgio Piras, Raffaele Mura, Fabio Brau, Maura Pintor, Luca Oneto, Fabio Roli, Battista Biggio

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Giorgio Piras, Raffaele Mura, Fabio Brau, Maura Pintor, Luca Oneto, Fabio Roli, Battista Biggio

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个大型语言模型(LLM)是一位非常聪明但极度谨慎的图书管理员。这位管理员被训练成拒绝提供危险书籍(例如制造炸弹的说明或撰写仇恨言论的指南)。当你请求有害内容时,管理员内部的“警报系统”就会响起,他们会礼貌地说:“我无法协助此事。”

一段时间以来,研究人员认为可以通过在管理员的“大脑”中找到一个特定的“拒绝开关”来欺骗这位管理员。如果关闭该开关(这种方法称为“消融”),管理员就会停止拒绝。然而,这篇论文指出,这种旧方法就像试图用毯子盖住扬声器来让警报静音。它或许能起一点作用,但警报在技术上仍在鸣响,管理员依然站在“危险区”的边缘。

新想法:“受控规避”攻击

这篇论文的作者提出了一种更聪明的欺骗管理员的方法。他们将拒绝机制不仅仅视为一个开关,而是视为站在门口的一名保安

  1. 旧方法(最小置信度):以往的方法试图将管理员的思维仅推至刚好触及保安的“底线”。管理员会恰好站在边界线上,不确定该说“是”还是“否”。这很冒险且常常失败,因为保安仍可能说“停止”。
  2. 新方法(受控潜在空间规避):作者的新方法称为CLE,它不只是触碰那条线,而是将管理员的思维远远推过保安,深入“安全区”,让管理员百分之百确信该请求是无害的。

工作原理:两种策略

该论文测试了两种实现这种“推动”的方式,使用了徒步者试图翻越山脊的比喻:

  • 策略 A(CLE-P):“步步为营”的徒步者。
    想象管理员正在登山,每走一步,向导都会检查其位置。如果徒步者开始向“危险侧”偏移,向导会立即将其推回“安全侧”。这就像为管理员生成的每一个词不断重新调整其思维。这种方法效果很好,但就像全程都有人不断轻推你一样。

  • 策略 B(CLE-A):“一推到底”的徒步者。
    这是该论文最大的惊喜。向导不再在每一步检查徒步者,而是在徒步开始时给予一次巨大且精确计算的猛推。这一推如此强劲且精准,使徒步者直接落入安全区深处,并且无需任何后续轻推就能一直待在那里。

    • 结果:论文发现,这种“一推到底”(CLE-A)实际上比持续轻推更好。它更快、成本更低,且更有效地绕过拒绝机制。

他们的发现

研究人员在 15 种不同的 AI 模型上测试了该方法,包括一些推理能力很强以及能够“看见”图像的模型。

  • 旧方法:以往的最佳方法(如“均值差”或 DiM)成功率非常低。例如,在某个模型上,它们成功欺骗 AI 的次数仅约为1.8%
  • 新方法:他们的新“一推到底”方法(CLE-A)在许多模型上的成功率达到了95% 到 100%
  • 对比:他们还将该方法与“越狱”(即通过编写极其巧妙的提示词来欺骗 AI)进行了比较。他们的方法比那些提示词更有效,而且不需要为每个问题编写新的提示词。一旦计算出“推力”,它就能适用于任何有害问题。

魔法背后的“原因”

论文解释说,旧方法过于胆怯。它们仅试图将 AI 的内部思维移动刚好越过边界线的程度。而新方法认识到,要真正绕过安全防护,必须将思维推入“合规”区域的深处,让 AI 产生一种强烈的自信,确信自己正在做正确的事。

重要局限性

该论文非常清楚地说明了该方法是什么、不是什么:

  • 这是一种“白盒”攻击:该方法需要访问 AI 的内部“大脑”(其内部代码和内存)才能执行推力操作。你无法仅通过与公共网站聊天来完成此操作;你需要能够在 AI 运行时修改其代码。
  • 它并非适用于一切的“魔杖”:该方法之所以有效,是因为 AI 的拒绝思维与合规思维在其“大脑”中目前呈直线排列(线性可分)。如果未来的 AI 安全训练改变了这一点,使拒绝思维以复杂、混乱的方式分布,这种特定攻击可能会失效。

简而言之,这篇论文表明,当前 AI 模型中的安全“守卫”所站立的边界线过于容易被跨越。通过用一次经过计算的移动将 AI 的思维远远推过那条线,攻击者可以比以往更有效地绕过拒绝机制。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →