← 最新论文
💬 NLP

Abliteration Mitigation via Refusal Aliases

本文介绍了 AMRA,这是一种通过秩-kk 更新和激活混淆来掩盖拒绝方向,从而减轻“消融”(abliteration)攻击的权重编辑防御方法,该方法在显著提高 Llama-3-8B 和 Gemma-2-9B 拒绝保留能力的同时,对模型效用的影响极小。

原作者: Nathan Truong

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Nathan Truong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能飞速发展的世界里,大语言模型已成为能够进行推理、写作和解决复杂问题的强大工具。为了确保这些系统保持安全且有用,开发者训练它们拒绝可能导致伤害的请求,例如制造武器的指令或生成仇恨言论。这种安全训练通常被称为“对齐”(alignment),它教会模型识别危险话题并礼貌地拒绝。然而,研究人员发现了一个令人惊讶的漏洞:这种拒绝机制并非一个复杂的、隐藏的堡垒,而是模型内部运作中一个简单且可识别的模式。通过找到这个特定的模式——即模型数学空间中一个标志着“不要回答”的独特方向——攻击者可以从数学上将其抹除,从而通过几次简单的调整,有效地关闭模型的安全制动器。这个过程被称为“消融”(abliteration),它会让模型功能完好,但却失去了防护,能够产生其原本被设计为拒绝的有害内容。

一位研究人员现在提出了一种新方法来应对这种特定类型的攻击,其核心不是建造更坚固的墙,而是让目标变得无法被发现。他们的方法被称为“通过拒绝别名进行的消融缓解”(Abliteration Mitigation via Refusal Aliases),其原理是:如果攻击者无法定位安全信号,他们就无法将其移除。研究人员发现,这些模型的拒绝行为集中在网络的特定层中,即模型在传递信息之前处理信息的层。他们开发了一种技术,通过微妙地改变这些层的权重,有效地扰乱了安全信号。该方法不再让模型在遇到有害请求时产生清晰、一致的“不”,而是将这种特定的反应替换为随机的、低方差的噪声。对于模型自身的逻辑而言,这种噪声随后会被后续层修正,从而使模型在处理安全问题时能继续正常运行,但攻击者寻找的那种清晰、可提取的模式却消失了。

研究人员在两个流行的开源模型 Llama-3 和 Gemma-2 上测试了这种方法,以观察它是否能抵御用于剥离安全特征的标准技术。在实验中,他们首先对模型应用了这种模糊化技术,然后尝试进行常规的“消融”攻击。结果显示,该防御显著提高了模型维持拒绝能力的能力。对于 Llama-3 模型,在尝试攻击后,该防御将拒绝得分提高了 2.16 分,与未受保护的模型相比,这是一个实质性的提升。至关重要的是,这种安全性提升几乎没有损失模型的通用智能或回答无害问题的能力。研究人员测量了模型在标准知识和推理基准上的表现,发现其效用下降微乎其微,在一项主要的知识测试中下降不到半个百分点。

当应用于 Gemma-2 模型时,结果甚至更加显著,但也更为复杂。在这里,该防御在攻击尝试后将拒绝得分提高了 14.70 分,有效地缩小了受保护模型与完全安全的基准模型之间的差距。虽然攻击仍然在一定程度上降低了模型的拒绝行为,但这种模糊化处理使得攻击的效果远低于针对未受保护版本时的效果。然而,这种对 Gemma-2 更强的保护也带来了更高的代价。研究人员观察到,模型的数学解题能力和整体知识保留能力出现了更明显的下降。他们将此归因于保护 Gemma 架构所需的特定设置,这涉及对模型内部结构的更大幅度修改。尽管存在这种权衡,但该方法被证明是唯一成功加固模型以抵御定向攻击,同时保持有害输出率较低的测试方法。

这项工作的核心在于其对“提取过程”本身的关注。以往的防御措施往往试图强化拒绝信号,或在对话过程中引导模型远离有害输出。研究人员认为,这些方法之所以失败,是因为它们没有解决根本原因:即拒绝方向极易被发现和移除。通过将拒绝信号替换为一个随机的别名,并随后修补模型的下游部分以忽略该噪声,研究人员使安全机制对用于拆解它的工具变得不可见。这种方法旨在作为对模型权重的一次性修改,供开发者在向公众发布模型前应用。一旦权重被修改,模型既不需要额外的计算能力来维持其安全性,也不需要重新训练。

这项研究强调了安全与效用之间的关键平衡。虽然该方法成功阻碍了拒绝方向的提取,但它并非适用于所有模型架构的完美护盾。研究人员发现,防御的有效性在很大程度上取决于所保护模型的具体设计。对于某些模型,这种保护几乎是无缝的;而对于另一些模型,则需要一种折中方案,即模型必须在一定程度上牺牲复杂的推理能力以维持安全性。作者建议,未来的工作可以优化这些设置以减少对效用的影响,或者将这种模糊化方法与其他加强拒绝信号本身的方法相结合。最终,这项研究表明,通过遮蔽攻击者赖以生存的特征签名,可以使大语言模型在面对那些本可以剥夺其安全护栏的尝试时,表现出更强的韧性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →