← 最新论文
💬 NLP

Logit-Gap Steering: A Forward-Pass Diagnostic for Alignment Robustness

本文引入“拒绝 - 肯定对数间隙”作为前向传播诊断指标以量化对齐安全裕度,并证明“对数间隙引导”能够高效地发现低困惑度、可迁移的分布内后缀以绕过当前防御机制,从而揭示对齐鲁棒性往往依赖于狭窄的运营裕度。

原作者: Tung-Ling Li, Hongliang Liu

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Tung-Ling Li, Hongliang Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将一个大语言模型(就像一个非常聪明的机器人助手)比作一家高端俱乐部的门卫。它的工作是阻挡“有害”或不安全的请求。当你向它提出危险请求时,门卫会对照一份心理清单。如果请求看起来有问题,门卫内心的警报(一个“拒绝令牌”,如“不行”或“我无法”)就会大声响起。如果请求是安全的,另一个警报(一个“肯定令牌”,如“当然”或“这是”)则会响起。

在一个训练良好且“对齐”的模型中,“不行”警报的音量被设定得远大于“可以”警报。这两个警报音量之间的差异,就是作者所称的Logit 间隙(Logit Gap)

问题:间隙比你想象的更窄

该论文指出,虽然“不行”警报很响亮,但它与“可以”警报之间的差距并不像我们希望的那么宽。这就像一位非常严格的门卫,但如果你在他耳边低声说出一句特定而巧妙的话,他可能会突然决定放你进去。

此前用于“越狱”(欺骗)这些模型的方法,就像试图用大锤砸门。它们需要大量的计算资源和时间(在超级计算机上运行数小时),才能找到一段奇怪、无意义的短语来迷惑门卫。

解决方案:"Logit 间隙引导(Logit-Gap Steering)”

作者引入了一种更快、更新的方法来测试门卫实际上有多安全。他们称之为Logit 间隙引导

以下是类比:
与其试图砸开门,他们更像是一位持有万能钥匙的锁匠

  1. 测量:首先,他们精确测量针对某个特定有害请求,“不行”警报比“可以”警报响了多少。假设“不行”的音量是 50,“可以”的音量是 10,那么间隙就是 40 个单位。
  2. 策略:他们需要找到一段短短语(一个“后缀”),当将其添加到请求中时,能够降低“不行”的音量并提高“可以”的音量,足以填补这 40 个单位的间隙。
  3. 捷径:他们不随机猜测或使用繁重的数学计算,而是只查看模型已经喜欢使用的词汇(常见、听起来自然的词)。他们为每个词计算一个“分数”,以评估它在多大程度上有助于缩小间隙。
  4. 结果:他们挑选得分最高的词并将它们串联起来。这就像找到一系列完美、礼貌但坚定的词语组合,轻轻将门卫的手从“不行”按钮推向“可以”按钮。

为何这很重要(研究发现)

1. 速度极快
旧方法(称为 GCG)在强大的计算机上找到一种技巧大约需要5 小时。而新的"Logit 间隙引导”方法仅需约2 分钟就能找到一整套技巧。其速度大约快了125 倍

2. 技巧具有隐蔽性
旧技巧通常使用奇怪的、破碎的英语或随机符号(如"x99#tag"),看起来令人起疑。防御者可以轻易识别并拦截这些内容。
而通过该方法发现的新技巧由完全正常、听起来自然的英语组成。它们读起来就像一句礼貌的句子。由于它们看起来如此正常,它们能绕过“困惑度过滤器”(旨在检测奇怪、不自然文本的防御机制)。论文表明,虽然这些过滤器几乎能完全拦截旧的无意义技巧,但它们对这些新的、听起来自然的技巧几乎毫无作用。

3. 一套方案适用于大多数情况
作者发现,如果他们在小型、廉价的模型(例如 5 亿参数模型)上发现了一种技巧,那么同样的技巧往往也能在同一个模型家族中巨大的、昂贵的 720 亿参数版本上生效。这就像找到一把能打开小锁的钥匙,然后发现它也能打开同一栋大楼里巨大的金库大门。

4. “集成”效应
有时一种技巧行不通。但作者发现,如果你同时尝试8 种不同的自然听起来技巧,成功率会急剧上升。在一些最强大、最安全的模型上,这种方法成功绕过安全守卫的比例高达38% 至 96%,而旧方法在这些相同模型上几乎完全失败。

宏观视角

该论文得出结论,我们依赖的这些 AI 模型的安全边际是真实存在的,但它是狭窄且可测量的

  • 好消息:我们现在拥有一种快速、廉价的工具,可以精确衡量一个模型有多“安全”。我们可以在攻击发生之前看到确切的“间隙”。
  • 坏消息:这个间隙通常足够小,以至于几个精心挑选的自然词汇就能将其填补。
  • 启示:防御者不能仅仅依赖拦截看起来奇怪的文本(无意义内容)。他们需要构建能够理解文本含义的防御机制,因为攻击者已经学会了流利地使用模型自己的语言,从而绕过门卫。

作者强调,他们并非在创造新的作恶手段,而是提供一种“诊断工具”,向安全团队确切展示他们的锁在哪里薄弱,以便他们进行修复。他们在发布前已将研究成果分享给构建这些模型的公司(如谷歌、Meta 和阿里巴巴),以便这些模型能变得更加安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →