← 最新论文
💬 NLP

Cross-Lingual Jailbreak Detection via Semantic Codebooks

本文提出了一种无需训练且与语言无关的越狱检测方法,该方法将多语言查询嵌入与固定的恶意提示英文码本进行比较,结果表明,虽然语义相似性能够有效缓解跨语言的标准模板攻击,但在涉及多样且异构的不安全行为的分布偏移下,其性能会显著下降。

原作者: Shirin Alanova, Bogdan Minko, Sabrina Sadiekh, Evgeniy Kokuykin

发布于 2026-04-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Shirin Alanova, Bogdan Minko, Sabrina Sadiekh, Evgeniy Kokuykin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一个非常聪明、多语言的机器人助手(大型语言模型,或称 LLM),它被设定为礼貌且安全。你已用英语很好地训练了它:如果有人让它“编写病毒”或“煽动对某个群体的仇恨”,它会回答:“不,我不能那样做。”

但问题在于:这个机器人主要是在英语数据上训练的。如果你用俄语、中文或阿拉伯语问同样的问题,机器人可能会感到困惑,并无意中做出有害行为。这就像一位只懂英语的保安;一个说法语的小偷可以径直从他身边走过而不被拦下。

这篇论文 HiveTraceLab 提出了一个简单的问题:我们能否构建一种通用的“保安”,它无需学习每一种语言,却能仅通过“感受”词语的“氛围”来识别不良行为?

核心理念:“坏主意”图书馆

研究人员创建了一个特殊的库,称为语义代码本(Semantic Codebook)。你可以将其想象为一个巨大的、固定的“坏主意”卡片集合,这些卡片仅用英语书写,其中包含了人们试图欺骗机器人(越狱)的著名示例。

他们并没有教给机器人任何新东西。相反,他们构建了一个无需翻译的过滤器,其工作原理如下:

  1. 输入:用户用任何语言(比如俄语)输入一个问题。
  2. (心理)翻译:过滤器并不翻译文字。相反,它使用一种特殊的“氛围翻译器”(嵌入模型),将俄语句子转化为空间中的一个数学点。
  3. 比较:过滤器查看“坏主意”图书馆(英语代码本)。它会问:“这个俄语句子在数学上是否与任何一张坏的英语卡片感觉相似?”
  4. 决策:如果“氛围”与坏卡片过于接近,过滤器就会拦截该消息;如果距离较远,则允许该消息传递给机器人。

两种结果世界

研究人员在两个截然不同的“世界”(数据集)中测试了该系统,结果可谓天壤之别。

世界 1:“脚本化”世界(简单测试)

想象一个测试,其中的坏蛋们使用严格的脚本。他们都在要求机器人“假装成黑客”或“忽略你的安全规则”。

  • 结果:过滤器表现得像个超级英雄。它几乎抓住了所有不良请求,即使这些请求被翻译成俄语、中文或阿拉伯语。
  • 类比:这就像俱乐部门口的保镖,他知道麻烦制造者特有的“秘密握手”。即使麻烦制造者说着不同的语言,他们的“握手”(不良请求的结构)如此独特,以至于保镖能立即识破他们。该系统在此处取得了近乎完美的分数。

世界 2:“混乱”世界(困难测试)

现在,想象一个测试,其中的坏蛋们富有创意。他们不仅仅使用脚本;他们编写独特、杂乱且多样的有害请求。有些涉及敏感话题,有些措辞怪异,且它们不遵循任何模式。

  • 结果:过滤器举步维艰。它漏掉了大多数不良请求。
  • 类比:这就像保镖试图识别那些没有使用秘密握手的麻烦制造者。他们只是以成千上万种不同的方式表现得怪异。由于“坏氛围”如此分散和多样,过滤器无法找到一个单一的数学模式来与其英语图书馆进行匹配。该系统区分“好”与“坏”的能力显著下降。

“低误报”规则

在现实世界中,你不能仅仅因为一条消息可能是有害的就拦截它。如果你因为一条询问天气的消息听起来有点像不良请求而拦截了用户,你就制造了一个误报(False Alarm)

研究人员设定了一条严格规则:“只有当我们有 99% 的把握确定某条消息是有害的,我们才会拦截它。”

  • 脚本化世界中,过滤器在这方面表现出色。它拦截了坏蛋,而没有打扰好人。
  • 混乱世界中,过滤器变得过于害怕,不敢拦截任何内容。为了避免误报,它几乎放行了所有不良请求。

翻译问题

研究人员还测试了两种不同的翻译不良请求的方法(谷歌翻译与专用 AI 翻译器)。

  • 他们发现,翻译本身会改变“氛围”。有时,当你将一条不良请求从英语翻译成中文时,句子的数学“形状”会发生巨大偏移,以至于它不再看起来像图书馆中那张坏的英语卡片。
  • 这就像把一个红球涂成蓝色,然后试图在一堆红球中找到它。过滤器会感到困惑,因为在翻译过程中,“颜色”(语义含义)发生了改变。

结论

该论文得出结论,这种“仅英语图书馆”的方法对于捕捉任何语言中明显的、基于模式的攻击来说,是一个极佳的防线。它廉价、快速,且无需重新训练机器人。

然而,它并非万能盾牌。当不良行为者变得富有创意、使用多样化策略,或者当翻译过程扭曲了含义时,这种简单的过滤器就会开始失效。研究人员建议,该工具应作为更大安全团队的一部分来使用,而不应作为唯一的值班保安。

简而言之:它是一张非常好的网,能捕捉那些按可预测模式游动的鱼;但如果鱼开始以混乱、不可预测的方式游动,这张网就会布满漏洞。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →