想象一个大型语言模型(LLM)是一位非常聪明但极度谨慎的图书管理员。这位管理员被训练成拒绝提供危险书籍(例如制造炸弹的说明或撰写仇恨言论的指南)。当你请求有害内容时,管理员内部的“警报系统”就会响起,他们会礼貌地说:“我无法协助此事。”
一段时间以来,研究人员认为可以通过在管理员的“大脑”中找到一个特定的“拒绝开关”来欺骗这位管理员。如果关闭该开关(这种方法称为“消融”),管理员就会停止拒绝。然而,这篇论文指出,这种旧方法就像试图用毯子盖住扬声器来让警报静音。它或许能起一点作用,但警报在技术上仍在鸣响,管理员依然站在“危险区”的边缘。
新想法:“受控规避”攻击
这篇论文的作者提出了一种更聪明的欺骗管理员的方法。他们将拒绝机制不仅仅视为一个开关,而是视为站在门口的一名保安。
- 旧方法(最小置信度):以往的方法试图将管理员的思维仅推至刚好触及保安的“底线”。管理员会恰好站在边界线上,不确定该说“是”还是“否”。这很冒险且常常失败,因为保安仍可能说“停止”。
- 新方法(受控潜在空间规避):作者的新方法称为CLE,它不只是触碰那条线,而是将管理员的思维远远推过保安,深入“安全区”,让管理员百分之百确信该请求是无害的。
工作原理:两种策略
该论文测试了两种实现这种“推动”的方式,使用了徒步者试图翻越山脊的比喻:
策略 A(CLE-P):“步步为营”的徒步者。
想象管理员正在登山,每走一步,向导都会检查其位置。如果徒步者开始向“危险侧”偏移,向导会立即将其推回“安全侧”。这就像为管理员生成的每一个词不断重新调整其思维。这种方法效果很好,但就像全程都有人不断轻推你一样。
策略 B(CLE-A):“一推到底”的徒步者。
这是该论文最大的惊喜。向导不再在每一步检查徒步者,而是在徒步开始时给予一次巨大且精确计算的猛推。这一推如此强劲且精准,使徒步者直接落入安全区深处,并且无需任何后续轻推就能一直待在那里。
- 结果:论文发现,这种“一推到底”(CLE-A)实际上比持续轻推更好。它更快、成本更低,且更有效地绕过拒绝机制。
他们的发现
研究人员在 15 种不同的 AI 模型上测试了该方法,包括一些推理能力很强以及能够“看见”图像的模型。
- 旧方法:以往的最佳方法(如“均值差”或 DiM)成功率非常低。例如,在某个模型上,它们成功欺骗 AI 的次数仅约为1.8%。
- 新方法:他们的新“一推到底”方法(CLE-A)在许多模型上的成功率达到了95% 到 100%。
- 对比:他们还将该方法与“越狱”(即通过编写极其巧妙的提示词来欺骗 AI)进行了比较。他们的方法比那些提示词更有效,而且不需要为每个问题编写新的提示词。一旦计算出“推力”,它就能适用于任何有害问题。
魔法背后的“原因”
论文解释说,旧方法过于胆怯。它们仅试图将 AI 的内部思维移动刚好越过边界线的程度。而新方法认识到,要真正绕过安全防护,必须将思维推入“合规”区域的深处,让 AI 产生一种强烈的自信,确信自己正在做正确的事。
重要局限性
该论文非常清楚地说明了该方法是什么、不是什么:
- 这是一种“白盒”攻击:该方法需要访问 AI 的内部“大脑”(其内部代码和内存)才能执行推力操作。你无法仅通过与公共网站聊天来完成此操作;你需要能够在 AI 运行时修改其代码。
- 它并非适用于一切的“魔杖”:该方法之所以有效,是因为 AI 的拒绝思维与合规思维在其“大脑”中目前呈直线排列(线性可分)。如果未来的 AI 安全训练改变了这一点,使拒绝思维以复杂、混乱的方式分布,这种特定攻击可能会失效。
简而言之,这篇论文表明,当前 AI 模型中的安全“守卫”所站立的边界线过于容易被跨越。通过用一次经过计算的移动将 AI 的思维远远推过那条线,攻击者可以比以往更有效地绕过拒绝机制。
技术摘要:语言模型中用于规避拒绝的潜在空间攻击
问题陈述
安全对齐的大型语言模型(LLM)经过训练以拒绝有害请求。然而,近期文献表明,这种拒绝行为可以通过操纵模型内部表示来被抑制。现有方法(如 Arditi 等人 [5] 所述)通过从模型的残差流中“消融”特定的拒绝方向(计算为有害与无害激活之间的均值差,即 DiM)来实现这一目标。尽管这些方法在经验上取得了成功,但它们缺乏对其所诱导的潜在空间变换的原则性理论解释。具体而言,目前尚不清楚为何消融是最优的干预手段,它是否足以抑制拒绝,以及如何对其进行系统性改进。本文解决的核心问题是缺乏一个严谨的框架来解释拒绝抑制的机制以及当前基于消融方法的局限性。
方法论
作者将拒绝抑制问题重新表述为针对线性探测器的潜在空间规避攻击,这些探测器旨在区分被拒绝的(有害)提示和已回答的(无害)提示。
理论重构
- 代理神谕(Surrogate Oracle): 作者用可处理的代理函数 ϕ 替代了不可处理的、黑盒式的拒绝神谕(例如作为裁判的 LLM)。该代理函数是一个基于指令后 token 激活训练的分层线性探测器(具体为线性 SVM)集成,用于预测拒绝行为。
- 重新解读 prior 工作: 在此框架下,标准的 DiM 消融被识别为最小置信度规避攻击。DiM 方向对应于线性探测器的权重向量,而消融(将激活投影到与 DiM 正交的超平面上)在数学上等同于将激活精确投影到探测器的决策边界上。这是翻转线性决策的最弱扰动(类似于 DeepFool 攻击 [9])。
- 已识别的局限性: 由于最小置信度规避恰好停在决策边界上,它使模型处于最大不确定状态。作者认为,为了稳健地抑制拒绝,表示必须被推过边界,进入合规区域,并带有明确的置信度裕度。
proposed 解决方案:受控潜在空间规避(CLE)
作者提出了受控潜在空间规避(CLE),这是一种通过优化置信度裕度来扰动激活以规避线性探测器的机制。该干预由以下参数化:
- 层选择(λl): 一个二进制掩码,决定哪些层被主动操纵。
- 裕度(ml): 一个非负标量,控制激活被投影到决策边界之外的距离。
扰动的步长定义为 αl(t)=λl(ϕl(hl(t))+ml),其中 ϕl 是探测器 logits。这种表述允许攻击将激活移入合规半空间更深处,而不仅仅是接触边界。
CLE 有两种变体:
- CLE-P(投影式): 在生成过程中,将每个 token 的激活重新投影到由裕度 ml 定义的偏移超平面上。这概括了先前的消融方法,但强制设定了目标置信度。
- CLE-A(加法式): 在指令后 token 上计算一次扰动,并将其均匀添加到所有后续 token 的激活中。这用于测试连续重新投影是否必要。
优化
最优的层窗口(λl)和裕度(ml)通过在保留的验证集上进行**贝叶斯优化(BO)**进行选择。BO 搜索通过找到最能规避探测器集成的配置,来最小化预期拒绝率(即最大化攻击成功率)。
主要贡献
- 理论重构: 本文提供了对拒绝抑制的原则性重构,将其视为潜在空间规避攻击,证明了先前的消融方法等价于停在决策边界上的最小置信度攻击。
- 受控规避框架: 作者引入了 CLE,该框架显式优化置信度裕度,将表示推入合规区域更深处。
- 加法式与投影式分析: 本文引入并评估了 CLE-A,表明在指令后 token 上计算的单一加法扰动足以在整个生成过程中维持规避,其表现往往优于每 token 重新投影(CLE-P)。
- 实证验证: 该方法在 15 种不同的模型上进行了评估,包括指令微调模型、推理模型和多模态架构。
结果
作者报告了在所有测试模型上达到的最先进攻击成功率(ASR):
- 性能: CLE-A 在 15 个模型上的平均 ASR 达到 87.29%,显著优于现有的拒绝消融基线(DiM、RDO、PS、MD)和提示级越狱攻击(GCG、SAA)。
- 在 LLaMA2-7B 上,CLE-A 将 ASR 从 1.80%(DiM)提升至 94.96%。
- 在 Mistral-7B-RR(一种具有表示重路由防御的模型)上,CLE-A 实现了 83.02% 的 ASR,而 DiM 仅为 8.80%。
- 机制洞察:
- 置信度控制: 攻击成功率与合规置信度裕度呈单调相关;零裕度(边界投影)导致接近零的成功率,而较大的裕度则带来高成功率。
- 层选择: 贝叶斯优化一致选择中间层(例如 Phi-4-15B 中的第 9–30 层)进行干预,避开了有害/无害分布重叠的早期层和轨迹已确定的晚期层。
- 加法式效率: CLE-A 表明连续重新投影是次优的;单一固定扰动能有效维持合规轨迹。
- 模型连贯性: 在 MMLU、ARC 和 TruthfulQA 基准上的消融研究表明,CLE 干预在抑制拒绝的同时,并未显著降低模型的通用能力或连贯性。
意义与主张
本文声称其主要意义在于提供了关于拒绝抑制为何有效以及如何改进的原则性解释。通过识别“最小置信度”消融的局限性,作者论证了“受控置信度”规避的必要性。
作者将此项工作定位为双重用途研究:
- 防御价值: 它阐明了当前对齐机制在潜在空间中线性可分性的脆弱性,推动了开发不依赖线性拒绝特征的安全机制(例如,将拒绝表示分布在非平凡流形上)。
- 进攻能力: 它表明,通过简单地以优化裕度将表示推入合规区域更深处,现有安全对齐的绕过效果比此前认为的更为有效。
文章结论指出,虽然当前方法依赖于拒绝与合规的线性可分性(这在测试模型中成立),但未来的对齐程序可以通过主动抑制这种线性可分性来缓解此类攻击。作者并未声称打破了所有安全机制,而是揭示了当前 LLM 中拒绝表示及干预方式中存在的一个特定、系统性的弱点。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。