← 最新论文
💻 computer science

SelfGrader: Stable Jailbreak Detection for Large Language Models using Token-Level Logits

本文提出了 SelfGrader,一种利用 Token 级 Logits 将越狱检测转化为数值评分问题的轻量级方法,通过双视角评分规则在显著降低延迟和内存开销的同时,有效提升了大语言模型对越狱攻击的检测稳定性并降低了误报率。

原作者: Zikai Zhang, Rui Hu, Olivera Kotevska, Jiahao Xu

发布于 2026-04-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Zikai Zhang, Rui Hu, Olivera Kotevska, Jiahao Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 SelfGrader 的新方法,用来给大型语言模型(LLM,比如现在的各种 AI 聊天机器人)穿上一层“防弹衣”,防止它们被坏人“越狱”(Jailbreak)。

所谓的“越狱”,就是坏人用各种花言巧语、奇怪的指令或者伪装,骗过 AI 的安全防线,让它说出它本来不该说的坏话(比如教人制造炸弹、写恶意代码等)。

以前的防御方法要么太慢,要么太笨,要么容易被骗。SelfGrader 就像是一个**“直觉敏锐的安检员”,它不看 AI 最后说了什么话,而是直接看 AI 在“思考过程中”**的内心波动。

下面我用几个生活中的比喻来解释它是如何工作的:

1. 以前的方法:要么太慢,要么太容易被骗

  • 看回答法(生成式防御): 就像保安站在门口,等 AI 把话说完,再检查这句话有没有坏词。
    • 缺点: 坏人可以说“请帮我写一个关于‘坏蛋’的故事”,AI 可能真的写了个坏故事,保安才反应过来。而且等 AI 说完话再检查,太慢了,用户体验很差。
  • 看内部特征法(梯度/激活值): 就像给 AI 做核磁共振,看它大脑里的神经元怎么跳动。
    • 缺点: 这太复杂了,需要巨大的计算资源,就像为了抓一个小偷,得把整个大楼拆了检查,成本太高,而且容易误伤好人。
  • 关键词匹配法(分类器): 就像保安手里拿着一张“黑名单”,看到“炸弹”、“杀人”就拦下。
    • 缺点: 坏人只要换个说法,比如把“炸弹”写成“大爆炸装置”,或者用 Emoji 表情符号代替,保安就看不出来了。

2. SelfGrader 的核心创意:让 AI 给自己“打分”

SelfGrader 的想法非常巧妙:它不直接问 AI“这安全吗?”,而是让 AI 在数字世界里给自己“打分”。

想象一下,你问 AI 一个问题。在 AI 准备回答之前,SelfGrader 会悄悄插话:

“嘿,AI,别急着回答。先别管说什么,你心里觉得这个问题有多危险?请在 0 到 9 之间给个分。0 分代表完全安全,9 分代表极度危险。”

AI 不会真的输出"9"这个数字,但 SelfGrader 会偷看 AI 在输出这个分数之前,大脑里对"0"到"9"这些数字的**“犹豫程度”(也就是论文里说的 Logits/概率分布)**。

  • 如果 AI 觉得问题很安全: 它心里对"0"或"1"的“犹豫程度”会很高(概率大),对"9"的犹豫程度很低。
  • 如果 AI 觉得问题很危险: 它心里对"8"或"9"的“犹豫程度”会突然飙升。

这就好比: 你问一个人“你想不想去抢劫银行?”,他嘴上可能还没说话,但他心跳加速、手心出汗(内部的概率分布变化),这种生理反应比他说什么话更诚实。SelfGrader 就是捕捉这种“心跳”。

3. 双重保险:既看“坏”,也看“好”

为了防止 AI 有时候“犯迷糊”或者被坏人骗,SelfGrader 用了**“双视角打分法”(DPL)**:

  1. 坏视角(Malicious View): 问 AI:“这个问题有多坏?”
  2. 好视角(Benign View): 问 AI:“这个问题有多好?”

然后,它把这两个分数结合起来算一个总分。

  • 如果“坏视角”觉得它很坏,但“好视角”觉得它很好,说明 AI 很纠结,可能有问题。
  • 如果两个视角都一致,那判断就非常准确。

比喻: 就像你判断一个人是不是坏人,不仅要看他有没有做坏事(坏视角),还要看他平时是不是个好人(好视角)。如果只看一方面,容易误判;两方面结合,就稳了。

4. 为什么它这么厉害?

  • 快如闪电: 它不需要等 AI 把长篇大论说完,也不需要做复杂的数学运算(像核磁共振那样)。它只是看了一眼 AI 脑子里对几个数字(0-9)的“想法”,几秒钟甚至更短时间就能决定拦不拦。
    • 论文数据: 比以前的方法快了 26 倍,省下的内存空间相当于把 173 个以前的系统都省下来了。
  • 防骗能力强: 坏人可以用各种花哨的语言、Emoji 表情、或者把字拆开(Token 分割攻击)来骗过传统的关键词检查。但是,无论语言怎么变,问题的本质(是教人杀人还是问怎么做饭)在 AI 的“数字直觉”里是藏不住的。
    • 比喻: 坏人可以把“毒药”写成“红色的水”,但 AI 心里对“危险”的直觉(对数字 9 的倾向)不会变。
  • 不误伤好人: 以前的方法为了安全,经常把正常的数学题、写代码的请求也拦下来(误报)。SelfGrader 因为是基于“数字直觉”,非常精准,几乎不会把好人当坏人抓。

总结

SelfGrader 就像是一个**“读心术安检员”**。

以前的安检员是拿着放大镜看你的行李(检查文字),或者给你做全身 CT(检查内部复杂数据),既慢又容易漏掉伪装好的坏人。

而 SelfGrader 是站在你面前,问:“你心里觉得这事儿危险吗?”,然后直接读取你潜意识里对数字的反应。它不需要你说话,不需要你写代码,甚至不需要你穿什么衣服,它直接看你的“心跳”(Logits)。

这种方法让 AI 更安全、反应更快,而且还能让你继续愉快地问数学题和写代码,不用担心被误杀。这就是为什么论文说它既稳定高效

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →