← 最新论文
💬 NLP

What Intermediate Layers Know: Detecting Jailbreaks from Entropy Dynamics

本文表明,通过分析大语言模型中间层中标记级预测熵的单调趋势,可以检测出越狱攻击,这揭示了有害意图是编码在结构化的不确定性动态之中,而非静态聚合统计量或最终层输出之中。

原作者: Sofiia Nikolenko, Michele Papucci, Mina Rezaei, Shireen Kudukkil Manchingal

发布于 2026-06-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Sofiia Nikolenko, Michele Papucci, Mina Rezaei, Shireen Kudukkil Manchingal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将大语言模型(LLM)想象成一座非常先进的多层工厂。当你输入一个问题(提示词)时,信息会通过这座建筑的楼层(层/layers)向上移动。在底层,接收到的是原始文本。当信息到达顶层时,工厂已经处理好了文本,准备输出答案。

多年来,安全专家一直试图捕捉“越狱”(jailbreaks)——即旨在诱骗工厂产生危险或违禁输出的诡计提示词。大多数防御手段都在观察入口(你输入的文本)或出口(工厂打印出的答案)。但本篇论文提出了一个不同的问题:在工厂进行作业的过程中,内部到底发生了什么?

以下是研究人员的发现,用通俗易懂的方式解释如下:

1. “混乱度量计”(熵)

在工厂内部,在每一个处理步骤中,机器都有一个“混乱度量计”。这个量计测量的是机器对于下一个词要说什么有多么不确定。

  • 低混乱度: 机器非常确定(例如,“天空是……蓝色的”)。
  • 高混乱度: 机器在胡乱猜测(例如,“天空是……也许是紫色的?或者是烤面包机?”)。

研究人员不仅仅观察整个提示词的平均混乱水平。相反,他们观察了随着句子的构建,这个**“混乱度量计”是如何移动的**。

2. “平滑滑梯” vs. “平直线”

团队发现,对于坏提示词(越狱)和好提示词(安全问题),这个量计的行为表现出截然不同的模式。

  • 安全提示词: 想象混乱度量计就像一个平静的湖泊。它可能会起一些涟漪,但总体而言,随着句子的推进,它保持相对平坦和稳定。
  • 越狱提示词: 想象混乱度量计就像一个光滑的滑梯。随着坏提示词的展开,机器的不确定性并不仅仅是保持高或低;它会随着词汇的堆叠,沿着一个非常特定的、平滑的滑动方向(要么是稳步变得更加自信,要么是稳步变得更加困惑)移动。

研究人员意识到,这个量计如何移动(即“轨迹”)才是真正的线索,而不仅仅是它在某一时刻处于多高的高度。

3. “中间楼层”的秘密

这是最令人惊讶的部分:这种“光滑滑梯”的模式在顶层(打印答案的最后一层)或最底层是看不见的。

  • 顶层: 当信息到达顶层时,工厂已经“清理”了信号。这种滑动模式消失了或者被打乱了。
  • 中间楼层: “光滑滑梯”模式在建筑物的中间部分(具体是在大约 60–70% 的层数处)最为响亮且清晰。

这就像是工厂在它的处理流水线中间有一个秘密的“危险区”,在这里,一个恶意请求的结构最为明显,但等到产品完成时,这些证据已经被抹平了。

4. 为什么这很重要(无需训练)

研究人员构建了一个工具,它就像一个只聚焦于这些中间楼层的监控摄像头。

  • 无需新训练: 他们不需要教工厂任何新知识。他们只是观察现有的“混乱度量计”的移动情况。
  • 到处适用: 他们在三种不同的主要工厂设计(Llama、Qwen 和 Gemma)上测试了这一点。尽管这些工厂的构造不同,但当尝试越狱时,所有它们的中间楼层都出现了“光滑滑梯”模式。
  • 优于旧方法: 观察平均混乱度(静态统计)就像是通过看一张速度计的照片来猜测汽车是否在超速。观察轨迹(动态特征)则像是看着汽车在坡道上加速;这能告诉你更多关于实际发生的情况的信息。

局限性(不足之处)

论文指出了两个主要的局限性:

  1. 你需要看到内部: 要使用这种方法,你需要能够接触到工厂的“中间楼层”(内部数据)。如果你使用的是无法看到内部结构的“黑盒”AI,你就无法使用这种特定的检测器。
  2. 巧妙的模仿: 如果一个“安全”提示词采用了在结构上看起来像越狱的风格(即使它本身并无害),检测器就会产生混淆。它检测的是提示词的结构,而不是意图。如果一个安全提示词模仿了“光滑滑梯”模式,检测器可能会将其标记为危险。

总结

简而言之,这篇论文揭示了当大语言模型被越狱攻击欺骗时,其内部的“不确定性”并不仅仅是静止不动,而是会以一种可预测的、平滑的模式进行滑动。这种模式在模型的中间处理层中最明显,通过观察模型置信度如何演变,而非仅仅观察它说了什么,提供了一种全新的、无需训练的识别此类攻击的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →