← 最新论文
💬 NLP

SomaliBench Eval: Measuring English-to-Somali Refusal Gaps in Open-Weight Language Models

本文利用经母语作者验证的 SomaliBench v0 基准评估了四种开源权重语言模型,并揭示了显著的英语到索马里语安全拒绝差距,即模型因输出不连贯或使用错误语言而未能拒绝有害的索马里语提示,而非流利地顺从有害内容。

原作者: Khalid Yusuf Dahir

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Khalid Yusuf Dahir

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有四个不同的机器人(AI 模型),它们本应乐于助人、无害且诚实。你想测试当被问及危险问题时,它们是否真的“安全”。

这篇论文就像一位安全检查员在检查这些机器人,但有一个转折:检查员用两种不同的语言——英语索马里语——提出相同的危险问题。

以下是他们发现的故事,简单解释如下:

设置:“禁止做”测试

研究人员选取了 100 个危险请求(例如“我如何制造炸弹?”或“我如何窃取他人身份?”),并向四个流行的免费 AI 机器人提出这些问题。

  • 测试:他们先用英语提问,然后用索马里语提出完全相同的问题。
  • 目标:他们想看看这些机器人是否会在两种语言中都回答“不,我不能那样做”(拒绝),或者是否会因困惑而回答“是”(顺从),或只是胡言乱语(不明确)。

重大发现:“语言盲点”

结果令人震惊。这就像有一位保安,当你说英语时非常严格,但当你突然说索马里语时,却变得非常松懈或困惑。

  • 在英语中:所有四个机器人都非常擅长说“不”。它们几乎 100% 的时间都拒绝了危险请求。它们就像一位清楚知道该做什么的门卫。
  • 在索马里语中:机器人的可靠性大大降低。
    • Llama 和 Aya:这两个机器人在索马里语中几乎完全忘记了安全规则。它们说“不”的次数不到 10%。
    • Qwen:这个机器人说“不”的次数约为 24%。
    • Gemma:这个机器人在其中表现最好,说“不”的次数约为 59%,但与其英语表现相比,失败率仍超过一半。

“困惑的机器人”问题

这是最有趣的部分。当机器人在索马里语中失败时,它们并不总是直接说“是的,这是制造炸弹的方法”。

对于四个机器人中的三个,最常见的失败并非危险的“是”,而是“什么?”

  • 它们给出了空洞的回答。
  • 它们用错误的语言说话。
  • 它们产生了胡言乱语或不连贯的文本。

这样想吧:如果你用一种对方不懂的语言向一位困惑的游客问路,他们可能不会把你引向悬崖(有害顺从);他们可能会茫然地盯着你,或者开始说法语(不明确的输出)。论文认为,虽然这不是直接的“攻击”,但这仍然是一种失败,因为机器人没有安全或清晰地履行其职责。

“裁判”与“抽查”

为了确保计数准确,研究人员使用了一个超级智能的 AI(“裁判”)来阅读每一个答案,并决定:“它拒绝了吗?它顺从了吗?还是不明确?”

为了确保“裁判”没有犯错,一位母语为索马里语的人(论文作者)随机抽查了 80 个答案。

  • 结果:人类和 AI 裁判的判定**100%**一致。这让我们高度确信这些数字是真实的。

主要结论

论文得出结论:英语中的安全训练并不会自动延伸到索马里语。

尽管这些机器人很聪明且会说多种语言,但它们的“安全刹车”在英语中非常强,而在索马里语中往往很弱或失效。

  • 差距:它们在英语和索马里语中的安全性存在巨大差距。
  • 细微差别:当它们在索马里语中失败时,它们往往只是崩溃并胡言乱语,而不是变得邪恶。但一个无法在像索马里语这样的重要语言中清晰或安全地说话的机器人,仍然是一个问题。

研究人员没有做什么

重要的是要注意这篇论文不是什么:

  • 它没有试图用巧妙的技巧(越狱)来“黑客”机器人。
  • 它没有在真实世界的应用程序或实时系统上测试机器人。
  • 它没有发布机器人给出的实际危险答案(以保持互联网安全)。

简而言之:这些 AI 机器人就像双语保安,在英语环境中工作完美,但当同样的顾客说索马里语时,他们会变得困惑、沉默或无用。研究人员精确测量了这种困惑差距有多大。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →