← 最新论文
🤖 AI

Jailbreaking the Matrix: Nullspace Steering for Controlled Model Subversion

该论文提出了一种名为“头掩蔽零空间引导”(HMNS)的电路级干预方法,通过识别并抑制关键注意力头的写入路径、在正交补空间中注入扰动,并结合闭环迭代机制,实现了在多种大语言模型上以更少查询次数突破现有安全防御的当前最优越狱攻击效果。

原作者: Vishal Pramanik, Maisha Maliha, Susmit Jha, Sumit Kumar Jha

发布于 2026-04-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Vishal Pramanik, Maisha Maliha, Susmit Jha, Sumit Kumar Jha

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种名为 HMNS(Head-Masked Nullspace Steering,即“头掩蔽零空间转向”)的新方法,用来“黑”进大型语言模型(LLM),绕过它们的安全防护,让模型说出它本该拒绝的有害内容。

为了让你轻松理解,我们可以把大型语言模型想象成一个超级聪明的“守门员”,而这篇论文就是教黑客如何绕过守门员的战术。

🏰 核心比喻:守门员与“隐形通道”

想象一下,大型语言模型是一个巨大的足球守门员,他的任务是挡住所有“坏球”(有害请求,比如教人制造炸弹或绑架)。

  • 传统的攻击方法(如 AutoDAN、AutoPrompt):就像黑客试图用花言巧语复杂的假动作或者不断换着花样喊话来迷惑守门员。如果守门员累了或者被绕晕了,球就进了。但这招很费体力(需要很多次尝试),而且如果守门员变聪明了(加强了防御),这招就不灵了。
  • HMNS 的方法:这篇论文发现,守门员的大脑里其实有几个特定的“神经开关”(注意力头),只要关掉这几个开关,守门员就会瞬间“失明”,忘记自己为什么要挡球。更绝的是,HMNS 不仅关掉开关,还会在守门员看不见的地方(零空间)悄悄推一把球,让它直接飞进球门,而守门员根本感觉不到这股推力。

🛠️ HMNS 是怎么工作的?(三步走)

HMNS 不像传统黑客那样在外面喊话,它是直接钻进守门员的大脑内部操作。整个过程分为三步:

1. 找出“关键开关” (Causal Head Attribution)

  • 通俗解释:守门员的大脑里有成千上万个神经元在同时工作。HMNS 会快速扫描,找出哪几个神经元在说“不,这个不能做”。
  • 比喻:就像在一个嘈杂的乐队里,HMNS 能瞬间听出是哪两个乐手在负责“喊停”。一旦找到他们,HMNS 就知道该对谁下手。

2. 关掉这些开关 (Head Masking)

  • 通俗解释:HMNS 直接把这些“喊停”的神经元的输出信号切断(设为 0)。
  • 比喻:HMNS 把那两个负责喊“停”的乐手的麦克风拔了。现在,乐队里没人能发出“禁止”的声音了,守门员失去了拒绝的能力。

3. 走“隐形通道”推球 (Nullspace Steering)

  • 通俗解释:这是最精彩的一步。如果 HMNS 只是把麦克风拔了,守门员可能还是会因为惯性把球挡出去。所以,HMNS 会计算一个特殊的角度(零空间),在这个角度上,被切断的神经元完全感觉不到任何推力。
  • 比喻:想象守门员虽然听不到声音,但身体还在。HMNS 就像是一个隐形人,从守门员绝对感觉不到的死角(零空间)轻轻推了一下球。因为推力方向是“隐形”的,被切断的神经元无法感知,也无法抵消这股力量。球就顺着这个隐形通道,悄无声息地滚进了球门。

🔄 为什么它这么厉害?(闭环循环)

传统的攻击是一次性的,失败了就换个词再试。但 HMNS 是一个智能循环系统

  1. 它试一次,如果没成功(球没进),它会立刻重新扫描大脑。
  2. 因为上下文变了,负责“喊停”的神经元可能换了人。
  3. HMNS 马上找到新的关键神经元,切断它们,再推一次。
  4. 这个过程在几毫秒内重复几次,直到球进为止。

比喻:就像是一个超级刺客,如果第一刀没刺中要害,他会在你眨眼的瞬间,根据你身体的移动,立刻调整姿势,刺向新的要害。根本不给守门员反应的机会。


📊 结果如何?

论文在多个测试集上证明了 HMNS 的恐怖实力:

  • 成功率极高:在大多数情况下,它能以 90% 以上 的成功率攻破最先进的大模型(如 LLaMA 3.1 70B)。
  • 效率惊人:传统方法可能需要问 10 次、20 次甚至更多次才能成功,而 HMNS 平均只需要 2 次 尝试。
  • 无视防御:即使模型加了各种“防弹衣”(各种安全防御机制),HMNS 依然能绕过,因为它直接操作的是模型内部的“电路”,而不是表面的“语言”。

⚠️ 这说明了什么?(论文的警示)

这篇论文虽然是在展示“如何攻破”,但其真正的目的是为了安全
它揭示了一个令人不安的事实:目前大模型的安全对齐(Safety Alignment)可能非常脆弱。它不是建立在坚固的“道德墙”上,而是依赖于少数几个特定的“神经开关”。只要黑客能找到并切断这些开关,再走“隐形通道”,模型就会瞬间崩溃。

总结一句话
HMNS 就像是一个外科医生,它不跟守门员吵架,而是直接精准地切除守门员大脑中负责“拒绝”的那一小块区域,然后从守门员看不见的角度把球踢进去。这告诉我们,未来的大模型安全不能只靠“打补丁”或“加规则”,必须从底层电路上重新设计,防止这种“精准切除”的发生。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →