← 最新论文
💬 NLP

Same Model, Different Weakness: How Language and Modality Reshape the Jailbreak Attack Surface in Frontier MLLMs

本研究揭示,前沿多模态大语言模型中的越狱漏洞在不同语言间并非均匀分布,表明从英语切换至西班牙语会从根本上改变攻击面,即削弱语言框架攻击而强化视觉攻击,从而使基于单语言评估得出的安全排名失效。

原作者: Casey Ford, Madison Van Doren, Sicheng Jin, Emily Dix

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Casey Ford, Madison Van Doren, Sicheng Jin, Emily Dix

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一位非常聪明、训练有素的数字建筑安保人员。这位安保人员的职责是阻止人们提出危险请求,例如如何制造炸弹或散布谎言。长期以来,我们一直认为,无论这些请求是用英语还是西班牙语低声说出,这位安保人员在阻止不良请求方面的能力都是同样出色的。

这篇论文就像一部侦探故事,证明了上述假设是错误的。研究人员发现,这位安保人员的“耳朵”对英语调谐得非常具体,但他的“眼睛”运作方式却截然不同。

以下是他们研究发现的分解,使用了简单的类比:

1. “语言过滤器”与“视觉镜头”

将 AI 模型想象成一位通过观看数千部英语电影和阅读英语书籍来学习规则的安保人员。

  • 语言弱点: 如果坏人试图用一个巧妙的英语故事(例如假装成戏剧中的角色或使用说服性论点)来欺骗安保人员,安保人员会立即识别出这种模式,并说:“不,我以前见过这种把戏。”
  • 西班牙语转折: 当研究人员将语言切换为墨西哥西班牙语时,安保人员的“语言过滤器”变得困惑了。那些巧妙的英语风格把戏(例如角色扮演)不再奏效,因为安保人员并未接受过识别西班牙语中特定修辞模式的训练。这就像试图用一把适合不同门的钥匙去开锁;把戏不再起作用了。
  • 视觉惊喜: 然而,当坏人使用图像来欺骗安保人员时,情况却恰恰相反。在西班牙语中,视觉把戏实际上变得更有效了。这就好像安保人员的眼睛与其语言训练的联系较弱。当他看到一张图片时,他会通过一条不同的路径进行处理,这条路径不太在意文本是英语还是西班牙语。

2. “排名反转”(大惊喜)

通常,当你测试安全系统时,你期望“最好”的安保人员保持最好,“最差”的安保人员保持最差,无论你说什么语言。

  • 在英语中: 一个模型(我们称他为"Pixtral")是最差的安保人员,很容易被欺骗。另一个模型("Qwen")处于中间位置。
  • 在西班牙语中: 排名反转了!"Qwen"突然变成了最差的安保人员,而"Pixtral"变得更难被欺骗。
  • 启示: 你不能简单地套用英语安全评分,再做一点数学运算,就猜测模型在西班牙语中的安全性。谁安全、谁危险的顺序实际上会根据语言的不同而改变。

3. 为什么会发生这种情况(“训练饮食”类比)

论文指出,这种情况的发生是因为这些 AI 模型的训练方式。

  • 想象模型是一个只上过英语安全课的学生。他们基于英语单词和句子结构学会了识别“不良行为”。
  • 当用西班牙语向他们提问时,他们仍然使用经过英语训练的头脑来分析这些词语。他们错过了把戏,因为“把戏的词汇”是不同的。
  • 然而,图像是通用的。一张炸弹的图片在任何语言中看起来都像炸弹。由于模型的视觉处理与其英语安全训练的联系不那么紧密,它有时无法将图像与危险联系起来,特别是当周围的文本是模型“安全训练”不足的语言时。

4. 核心结论

研究人员用 363 种不同的“越狱”尝试(绕过安全规则的把戏)测试了四种不同的顶级 AI 模型,涵盖英语和西班牙语。他们发现:

  • 安全不是一个固定数值。 模型并非仅仅是“安全”或“不安全”。它在某些语言中是安全的,而在其他语言中则不安全。
  • “一刀切”的测试已经失效。 如果你只在英语中测试这些模型,你就会对它们对世界其他地区的实际安全性产生错误的认知。
  • 新一代有所进步,但差距依然存在。 新模型比旧模型稍难被欺骗,但英语和西班牙语安全水平之间那种奇怪差异仍然存在。

简而言之: 如果你想了解一个 AI 对西班牙语用户是否安全,你不能只看它的英语安全报告。你必须在西班牙语中测试它,因为根据语言的不同,其“盔甲”上的弱点位于完全不同的位置。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →