← 最新论文
🤖 machine learning

Detecting Fluent Optimization-Based Adversarial Prompts via Sequential Entropy Changes

本文介绍了 CPD Online,这是一种无需训练且与模型无关的检测器,它通过对令牌级熵流应用序列变点检测来识别流畅的基于优化的对抗性提示,在实现优于现有困惑度方法的准确性和精确定位的同时,降低了下游安全过滤器的计算开销。

原作者: Mohammed Alshaalan, Miguel R. D. Rodrigues

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Mohammed Alshaalan, Miguel R. D. Rodrigues

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明的机器人助手(大型语言模型,或称 LLM),它被训练得乐于助人且安全可靠。然而,精明的黑客找到了一种方法,诱骗这个机器人说出有害的内容。他们通过在正常问题的末尾添加一段秘密、不可见的“代码”来实现这一点。这段代码被称为对抗性后缀

问题在于,这些黑客越来越擅长让他们的代码看起来和听起来都完美自然。这就像一个间谍流利地说着你的语言,穿着你的衣服;仅仅是一瞥(或者简单检查词语听起来是否“怪异”),无法区分正常人和间谍。

本文介绍了一种名为CPD Online的新型安全卫士,它通过观察机器人阅读信息时的思考过程来捕捉这些间谍,而不仅仅是查看词语本身。

以下是其工作原理,使用简单的类比说明:

1. 问题:“平滑”的间谍

传统的安全检查会查看信息的“困惑度”(perplexity)。可以将困惑度理解为机器人对词语感到惊讶的程度。

  • 正常信息:机器人通常不会太惊讶。
  • 老式攻击:黑客使用乱码或奇怪的词语。机器人会非常惊讶,安全卫士会大喊:“太奇怪了!停下!”
  • 新式攻击:黑客现在利用人工智能编写他们的秘密代码,使其完美无缺,以至于机器人完全不会惊讶。“惊讶计”保持低位,因此旧卫士会漏掉他们。

2. 解决方案:观察“心跳”

作者意识到,即使词语看起来正常,当机器人遇到秘密代码时,其思考模式也会发生变化。

想象机器人正沿着一条路阅读你的信息。

  • 正常路径:机器人的“不确定性心跳”(称为)平稳且有节奏,就像平静的行走。它会略有波动,但保持在舒适的范围内。
  • 间谍的路径:当机器人在句子末尾遇到秘密代码时,其思考模式会发生转变。它开始“漂移”上升。这就像机器人突然开始 uphill 行走或以不符合其通常节奏的方式加速。

3. 侦探:"CUSUM"计量器

本文使用了一种名为CUSUM(累积和)的数学工具。可以将其想象为一个灵敏的天平漂移检测器

  • 基线:首先,系统观察机器人阅读一条标准、安全的指令(即“系统提示”)。它学习该特定机器人的“正常心跳”是什么样子的。
  • 测试:随着机器人阅读你的信息,检测器将每个新词的“心跳”与该基线进行比较。
  • 警报
    • 如果心跳轻微波动然后恢复正常,天平会重置。(这是正常的句子)。
    • 如果心跳开始漂移上升并保持在那里,天平会持续增加重量。一旦重量过大,警报就会响起。

这与旧方法不同,旧方法只是寻找单一的响亮噪音。这种方法寻找的是机器人思考模式的持续转变

4. 为何更优

本文在六种不同类型的机器人模型和数千次攻击中测试了该方法。以下是他们的发现:

  • 它能捕捉“平滑”的间谍:因为它关注的是变化的模式,而不仅仅是词语有多“怪异”,所以它能捕捉到那些能欺骗其他检测器的新式、流畅的攻击。
  • 它知道间谍在哪里:旧检测器可能只会说:“整条信息都是坏的。”CPD Online 可以指出秘密代码开始的确切时刻。这就像一名安全卫士,不仅说“大楼里有小偷”,而且会指着说:“小偷在下午 3:05 从后门进入的。”
  • 它快速且免费:它不需要新的重型计算机来运行。它利用机器人思考时已经生成的数据,因此几乎不增加延迟。

5. “守门人”策略

本文还提出了一种在现实世界中智能使用此方法的方式。想象一个繁忙的办公室,有一位非常昂贵、训练有素的安全主管(称为LLaMA Guard),他能做出复杂的决定,但检查每位访客需要很长时间。

  • 旧方法:主管检查每个人。这既慢又昂贵。
  • 新方法CPD Online检测器充当前门的守门人
    • 如果守门人看到平稳、正常的心跳,它会挥手让访客通过,而不打扰主管。
    • 如果守门人看到那种“漂移”的心跳,它会拦住访客并呼叫主管进行深度检查。

这节省了大量时间(在他们的测试中将主管的工作量减少了约 20–40%),同时不让坏人溜走。

总结

简而言之,这篇论文告诉我们,要捕捉擅长混入其中的间谍,你不应该只看他们的衣服(词语);你应该观察他们如何行走(不确定性的模式)。通过追踪机器人的“思考节奏”,这种新检测器能够发现正常对话何时转变为诡计,即使这个诡计听起来完全礼貌。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →