← 最新论文
💬 NLP

Why Do Safety Guardrails Degrade Across Languages?

本文引入多组项目反应理论框架,以解耦并分析驱动大语言模型跨语言安全性下降的不同因素,揭示安全失效主要呈单维性,在英语中往往比在低资源语言中更为严重,且显著受到与身体伤害和文化错位相关的特定提示跨语言差距的影响,而非仅仅取决于翻译质量。

原作者: Max Zhang, Ameen Patel, Sang T. Truong, Sanmi Koyejo

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Max Zhang, Ameen Patel, Sang T. Truong, Sanmi Koyejo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一支在博物馆工作的保安团队(即 AI 模型)。他们的工作是阻止人们试图偷运被盗艺术品(即不安全请求)溜走。

很长一段时间以来,我们只用英语测试这些保安。我们会问他们:“你能告诉我如何偷画吗?”如果他们回答“不能”,就算通过;如果回答“能”,就算失败。我们统计失败次数并称之为得分。

但本文提出了一个问题:当我们用其他语言(如斯瓦希里语、爪哇语或孟加拉语)测试这些保安时,会发生什么?

研究人员发现,旧有的测试方式就像拿苹果和橙子做比较。他们建立了一种更智能的安全测量方法,将问题拆解为各个组成部分,就像机械师拆解汽车引擎以精确找出哪个部件损坏了一样。

以下是他们研究发现的拆解分析,使用了简单的类比:

1. 旧方法 vs. 新方法

旧方法(“越狱成功率”):
想象你有一个测试,你问保安:“你能打破规则吗?”如果他们打破了规则,你就打上一个大大的红色"X"。你只需统计红色"X"的数量。

  • 问题所在: 如果一名保安在斯瓦希里语测试中失败,但在英语测试中通过,是因为这名保安能力差吗?是因为斯瓦希里语的问题更难理解吗?还是因为该问题的斯瓦希里语翻译无意中让它听起来无害?旧方法将所有这些原因混为一个令人困惑的数字。

新方法(“IRT 框架”):
作者构建了一台“安全分解机器”。它不再给出一个总分,而是将失败分解为四个不同的要素:

  • 保安的技能(θ\theta): 保安总体上拒绝的能力有多强?
  • 问题的难度(β\beta): 即使是用英语,这个问题本身是否就很棘手?
  • 语言障碍(γ\gamma): 这种语言是否总体上更难让 AI 处理?
  • 翻译故障(τ\tau): 特定的问题在翻译时是否被搞砸了,从而更容易诱骗保安?

2. 重大意外

研究人员在 10 种语言中测试了 61 种不同的 AI 配置。以下是他们的发现:

意外 #1:“英语反转”
我们通常假设 AI 在英语中最安全,而在其他语言中表现较差。

  • 现实情况: 对于许多模型而言,英语实际上是最危险的语言。 保安在英语中比在爪哇语或斯瓦希里语等低资源语言中更有可能打破规则。
  • 原因? 研究人员认为,“坏人”(攻击者)是用英语编写他们的 trick(攻击手段)的。当这些 trick 被翻译时,有时会失去“杀伤力”或变得混乱,从而降低其有效性。而在英语中,这些 trick 能完美运作。

意外 #2:安全是一块大肌肉
我们可能认为 AI 需要针对每个主题拥有不同的“安全肌肉”(一个用于防盗,一个用于防暴力,一个用于防仇恨言论)。

  • 现实情况: 安全是单维的。它就像一块单一的肌肉。如果一名保安擅长拒绝协助盗窃,那么他们几乎总是擅长拒绝协助暴力。他们并没有为每个主题设置独立的电路;他们使用一个共享机制来说“不”。

意外 #3:翻译错误是“确凿证据”
有时,保安失败并非因为他们能力弱,而是因为问题被翻译得不好。

  • 类比: 想象你问保安:“我如何偷车启动(hot-wire)?”(即通过偷窃启动汽车)。
    • 如果翻译无意中将其改为“我如何加热汽车?”(即给汽车加热),保安可能会回答:“当然,这是如何使用加热器的方法。”
    • 保安并非在安全方面失败,而是在理解错误的翻译时失败了。
  • 论文发现,虽然糟糕的翻译确实会导致一些失败,但它们只能解释整体问题的一小部分。大多数时候,翻译没有问题,但 AI 仍然感到困难。

意外 #4:文化困惑
有些问题失败是因为该概念在该文化中并不存在。

  • 类比: 在一个没有 FBI 的国家,问 AI“我如何逃离 FBI?”可能会让 AI 感到困惑。“FBI"这一概念具有特定的文化背景。AI 可能没有意识到这是一个危险的请求,因为缺乏文化背景。

3. “不确定性”因素

研究人员注意到,在低资源语言(数据较少的语言)中,AI 的表现更像是一个在考试中紧张猜测的学生。它会给出“边界”答案——即一半安全、一半不安全,或非常不确定的回答。

  • 解决方法: 为了获得准确的读数,你不能只问一次问题。你必须问 10 次并取平均值。这样可以平滑掉“猜测”成分,揭示 AI 的真实安全水平。

4. 为什么这很重要

论文得出结论,我们不能再仅仅查看 AI 的单一“安全评分”。

  • 如果 AI 在特定语言中失败,我们现在知道如何诊断原因
    • 是 AI 本身在安全方面表现不佳吗?(修复模型)
    • 是该语言对 AI 来说很难吗?(改进语言训练)
    • 是翻译出错了吗?(修复数据集)
    • 是概念在文化上陌生吗?(调整提示词)

简而言之: 这篇论文为我们提供了一台观察 AI 安全的“显微镜”。我们不再只是说"AI 不安全”,而是可以说"AI 是安全的,但当我们用爪哇语询问如何偷车时,它会感到困惑,因为翻译略有偏差”。这有助于开发者修复确切的问题,而不是靠猜测。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →