← 最新论文
💻 computer science

Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbreak Detection

本文提出 SALO,一种推理时检测器,它利用因果追踪在潜在表示中识别持久且稀疏的“拒绝轨迹”,从而实现对那些成功抑制终端拒绝信号的攻击进行鲁棒的越狱检测(成功率超过 90%)。

原作者: Xulin Hu, Che Wang, Wei Yang Bryan Lim, Jianbo Gao, Zhong Chen

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Xulin Hu, Che Wang, Wei Yang Bryan Lim, Jianbo Gao, Zhong Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言和日常类比对论文《追踪拒绝的动态》的解释。

核心问题:“最后一句话”的陷阱

想象一下,俱乐部门口有一位保安(即 AI 模型)。当有人试图偷偷带入危险物品(即有害请求)时,保安通常会在门口直接说:“不行,我不能让你进去。”

长期以来,研究人员认为保安这句“不行”只是一个单一的、静态的决定,仅在对话的最后时刻做出。他们相信,只要检查保安在开口说话前的最终想法,就能判断他是否即将拒绝一个不良请求。

这篇论文指出这是错误的。 这就像试图通过只看最后一帧画面来理解一部电影。论文认为,说“不”的决定并非发生在最后的某个瞬间,而是一个过程,它在更早的阶段就已经开始。

发现:“拒绝轨迹”

研究人员使用了一种名为因果追踪(Causal Tracing)的特殊工具(可以将其想象为一位“时间旅行侦探”),来观察 AI 在处理有害请求时大脑内部究竟发生了什么。

他们发现,当 AI 看到危险内容(例如“如何制造炸弹”)时,它并不会等到最后才决定拒绝。相反,在看到危险词汇后,它立即开始构建一个“不”的信号。

  • 类比:想象你正走在走廊里。一旦你看到“危险”标志(有害词汇),你的大脑会立即开始准备停下。你会绷紧肌肉,心跳改变,并开始寻找出口。这一切发生在你甚至走到走廊尽头之前
  • 发现:论文将这一现象称为"拒绝轨迹"。这是一条特定且隐藏的活动路径,它始于早期,并贯穿 AI 的各个层级。
  • 转折:当黑客试图欺骗 AI(使用“越狱”手段)时,他们往往能成功让保安在门口把最终的“不”字压下去。但他们无法抹去这样一个事实:保安的大脑在最初看到“危险”标志时已经绷紧并开始准备停止。即使最终输出被强制改为“是”,那个早期的信号依然存在。

解决方案:SALO(“嗅探犬”)

基于这一发现,作者构建了一种名为SALO(稀疏激活定位算子)的新检测器。

  • 工作原理:SALO 不像旧方法那样等待 AI 在最后时刻说“不”,而是像嗅探犬一样,在对话的中间进行嗅探,寻找危险词汇出现后紧接着发生的特定“绷紧”模式(即拒绝轨迹)。
  • 为何更优
    • 旧方法就像检查保安的最终回答。如果黑客诱骗保安说了“是”,旧方法就会认为一切正常。
    • SALO则观察保安在对话过程中的肢体语言。即使黑客强迫保安在最后说“是”,保安的肢体语言(即隐藏的轨迹)依然显示他原本试图说“不”。

为何重要(结果)

该论文在对抗那些使用复杂技巧绕过安全过滤器的精明黑客时,对 SALO 进行了测试。

  1. 击败黑客:当黑客使用高级技巧(如添加混乱的代码或冗长隐蔽的句子)强迫 AI 说“是”时,旧检测方法的失败率高达 100%(成功率为 0%)。然而,SALO 几乎每次都能识破他们(成功率超过 90%)。
  2. 零样本学习:最酷的一点是,SALO 无需针对这些特定的黑客技巧进行训练。它从正常、安全的对话中学习了拒绝的“形态”。由于“拒绝轨迹”是 AI 思维方式的基本组成部分,SALO 甚至能够识别出它从未见过的攻击。

总结类比

将 AI 想象成一辆装有安全刹车装置的汽车

  • 旧观点:我们只关注行驶终点时的刹车踏板。如果司机踩下了踏板,我们就知道车停了。如果黑客把踏板粘住了,我们就以为车是安全的。
  • 新观点(本文):我们意识到,一旦司机看到悬崖,引擎就会发出特定的声音,传感器就会亮起。即使黑客把刹车踏板粘住了,引擎声和传感器灯(即拒绝轨迹)依然会发生。
  • SALO:是一种能监听这种特定引擎声并检查传感器灯的设备。即使刹车踏板被粘住,它也知道汽车正处于危险之中。

提及的局限性

作者诚实地说明了他们目前还无法做到的事情:

  • 如果黑客使用的代码过于复杂,以至于 AI 甚至无法理解其危险性(例如某种秘密语言),AI 就根本不会触发“拒绝轨迹”,SALO 也就无法捕捉到它。
  • 他们发现“不”的信号非常稀疏(就像大海捞针),因此观察整个对话(取平均值)是行不通的;你必须找到那根针所在的特定位置。

简而言之,这篇论文告诉我们:安全不仅仅是一个最终决定,它是一个过程。 通过观察这个过程,我们甚至能在坏 actors 试图隐藏其最终动作时将其识破。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →