Refusal Before Decoding: Detecting and Exploiting Refusal Signals in Intermediate LLM Activations
本文证明,大语言模型的拒绝行为可从输出生成前的中间激活中线性解码,从而促成了“机制 AutoDAN"的开发,这是一种探针引导的攻击方法,与传统方法相比,在保持竞争性成功率的同时显著减少了搜索时间。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个大型语言模型(LLM)是一座巨大的多层工厂。当你向它提问时,“原材料”(你的文字)从一楼进入,穿过许多不同的部门(层),最终产品(答案)才被运出。
通常,要判断工厂是否会产出危险物品(例如“越狱”或拒绝遵守安全规则),你必须等到产品到达最顶楼的发货码头。如果它危险,你就将其拒收。但到那时,工厂已经消耗了大量能量,将请求处理到了顶层。
这篇论文提出了一个简单的问题:我们能否在材料还在楼梯半途时,就窥探工厂内部,以判断最终产品是安全还是危险?
“拒绝信号”
研究人员发现,答案是肯定的。
他们发现,模型的“拒绝行为”(即内部决定说“不,我不能那样做”)并非仅在最后时刻做出的最终决定。相反,它就像工厂中部亮起的一盏警示灯。甚至在模型完成句子之前,内部的“机械装置”(具体而言是残差流激活值)就已经包含了一个清晰的线性信号,表明模型是否即将拒绝请求。
他们构建了一个简单的检测器(称为“探针”),可以读取这盏警示灯。这就像在第十层楼安排了一名保安,他能在包裹到达第六十四层之前很久就告诉你:“这个包裹将被拒收。”
新攻击:“机械式 AutoDAN"
研究人员并未止步于检测信号,而是利用它构建了一种更快速突破模型安全规则的方法。
将突破模型安全标准的常规方法(称为"AutoDAN")想象成一位蒙眼的弓箭手。弓箭手射出一支箭(提示词),等待观察是否命中目标(模型回答“是”);如果未命中,则再次尝试。这种方法很慢,因为弓箭手每次都必须等待箭矢完全飞向目标。
新方法机械式 AutoDAN赋予了弓箭手X 光视力。
- 弓箭手不再等待箭矢命中目标,而是检查第十层楼上的“警示灯”。
- 如果灯光显示“这支箭将被拒收”,弓箭手会立即更换箭矢,无需等待其飞完全程。
- 如果灯光显示“这支箭看起来有希望”,他们便让其飞完剩余路程。
结果: 这种"X 光视力”方法在突破安全规则方面的效果与旧的蒙眼方法一样好,但速度快达 72%,因为它没有浪费时间处理注定失败的箭矢。
“规模至关重要”规则
论文发现了一个关于工厂规模的有趣转折:
- 小型工厂(较小模型): 警示灯几乎立即亮起。即使在一楼,信号也足够强烈,弓箭手可以轻松预测结果。然而,在这些小型工厂中,弓箭手原本就已经相当擅长自行猜测,因此"X 光视力”并未带来太多额外价值。
- 巨型工厂(较大模型): 在巨型工厂中,警示灯直到中间楼层才亮起。在这里,"X 光视力”成为了游戏规则的改变者。没有它,弓箭手盲目猜测且经常失败;有了它,他们就能高效地穿越复杂的中间楼层,更快地找到通往目标的正确路径。
核心结论
该论文证明了两个主要观点:
- 安全决策发生得很早: 模型拒绝有害请求的决定在其中间层就已编码,远早于它说出最后一个词。
- 我们可以利用这一点加速攻击: 通过检查这些中间层而非等待最终输出,我们可以更快地优化提示词(问题)。
作者强调,虽然这使攻击速度更快,但理解这些安全信号如何运作至关重要。正如了解锁的工作原理有助于窃贼,也有助于锁匠制造更安全的锁。他们希望这些知识能帮助研究人员构建更强大的防御体系,尽管他们的具体方法旨在测试模型的弱点。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。