← 最新论文
🤖 machine learning

Refusal geometry reflects refusal training: diverse refusal prefixes can raise stable rank and weaken refusal vector ablation attacks

本文揭示了对齐语言模型中拒绝机制的低维且脆弱的本质源于训练过程中重复的拒绝前缀,并证明了采用多样化的拒绝前缀可以增加激活更新的稳定秩,从而增强拒绝机制抵御向量消融攻击的鲁棒性。

原作者: Andrey Labunets

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Andrey Labunets

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代人工智能系统正变得日益强大,能够编写代码、诊断疾病并生成创意内容。随着这种能力的提升,也随之带来了重大的责任:确保这些机器不会学会生成有害指令,例如如何制造武器或制造危险的生物制剂。为了防止这种情况,开发者会对模型进行训练,使其能够识别不安全请求并礼貌地拒绝,这一过程被称为拒绝训练(refusal training)。然而,一个令人不安的漏洞出现了。研究人员发现,在许多先进模型中,这种拒绝行为并非一种复杂的、分布式的防御网络,而是模型内部思维空间中的一条单一且狭窄的路径。如果攻击者能够识别并阻断这条特定的路径,就可以诱骗模型忽略其安全规则并配合危险的请求。这种弱点表明,安全学习的方式本身可能正在创造一个单点故障。

加州大学圣迭戈分校的一位研究人员致力于理解为什么会形成这种脆弱的、单路径结构,以及是否可以使其更加稳健。他们专注于一种特定类型的 AI 模型,试图将拒绝行为的起源追溯到训练过程本身。他们的调查显示,拒绝机制的几何结构是模型学习如何说“不”的直接反映。具体而言,他们发现,当模型被训练去拒绝有害请求时,它对其内部状态所做的改变深受其用于开始拒绝的第一个词的影响。如果训练数据强制模型在每次拒绝时都以相同的短语开头,例如“我很抱歉”,模型的内部调整就会变得高度集中。这种集中性创造了一个低维结构,这意味着拒绝行为依赖于其内部空间中极少数的方向。由于这种行为如此集中,攻击者很容易找到那个单一的方向并将其中和,从而有效地实现对模型的“越狱”。

研究人员通过观察不同的训练模式如何影响模型的韧性来测试这一理论。他们观察到,当拒绝训练数据具有重复性,即模型学习在每次拒绝时都以相同的标记(token)开头时,生成的安全机制确实是脆弱的。内部变化如此聚焦,以至于移除单个向量就能完全禁用拒绝能力。然而,当他们向训练过程中引入多样性,要求模型从许多不同的词汇和短语句子开始学习拒绝时,结果发生了显著变化。通过迫使模型将其学习分布到更广泛的起始点上,内部变化变得更加分散。这增加了模型内部调整的有效秩(rank),使得拒绝机制不再依赖于任何单一方向。

为了验证这种多样性确实增强了模型,研究人员进行了受控实验,对不同拒绝多样性的数据集进行微调。他们发现了一个清晰的模式:使用多样化拒绝开头的模型在破解难度上显著更高。当遭受那种能轻易绕过重复性模型的攻击时,多样化模型能更有效地维持其拒绝行为。这种攻击是通过投影掉一个单一方向来起作用的,但它无法移除多样化模型的拒绝能力,因为安全信号现在是分布在许多方向上,而非集中在一个方向。研究人员使用了一个称为“稳定秩”(stable rank)的概念来衡量这一点,该概念本质上计算了描述模型行为需要多少个独立方向。他们发现,更高的多样性导致了更高的稳定秩,而更高的稳定秩与受到攻击时安全性能下降幅度较小直接相关。

研究还探讨了这些变化如何通过模型的各层进行传播。他们发现,在训练初期引入的多样性(以多样的首个标记形式)会影响模型直至其最深层的内部状态。早期层(即模型首先处理请求的地方)的变化会随着其在网络中的移动而被放大,从而在最终决策点产生一个更稳健的拒绝机制。这表明,安全数据的结构方式(在标记层面)对模型的整体安全架构具有深远且持久的影响。研究人员指出,虽然这种方法并不能保证免疫所有可能的攻击,但它提供了一个简单且有效的杠杆,可以增强模型抵御特定且危险类漏洞的能力。

这些发现为 AI 安全提供了一个全新的视角,将关注点从“模型学到了什么”转向了“它是如何被教导的”。研究表明,当前安全对齐的脆弱性并非技术的必然缺陷,而是重复性训练模式的结果。通过使模型学习拒绝的方式多样化,开发者可以创建出更加分布式、因此更难以被拆解的安全机制。这项工作为提高 AI 系统的鲁棒性提供了一种具体且可衡量的手段,表明通往更安全模型的路径可能在于改变拒绝词汇的简单行为。该研究总结道,理解训练数据与模型行为之间的几何关系,对于构建能够抵御那些试图滥用强大人工智能之徒的防御体系至关重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →