← 最新论文
💬 NLP

Multilingual Refusal Alignment for Safer Large Language Models

本文介绍了 RefusEU,一个包含 12 种欧洲语言的多语言拒绝数据集,并通过直接偏好优化(Direct Preference Optimization)实验证明,仅在英语上进行大语言模型对齐无法确保跨语言安全性,而多语言训练则能在不损害通用知识能力的情况下,有效增强跨语言的安全性。

原作者: Aleksandra Krasnodębska, Wojciech Kusa, Aldo Lipani

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Aleksandra Krasnodębska, Wojciech Kusa, Aldo Lipani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,大型语言模型(LLMs)是才华横溢、精通多语种的大厨。这些大厨可以用几十种语言烹饪出答案,但有一个问题:如果用某些语言提问,他们有时会端出“有毒的菜肴”(有害或危险的建议),即便他们在用英语回答时会拒绝这样做。

这篇题为**《面向更安全的大语言模型的跨语言拒绝对齐》(Multilingual Refusal Alignment for Safer Large Language Models)*的论文,就像是一份针对这些大厨的安全检查报告。研究人员想要弄清楚为什么这些大厨的表现并不一致,以及如何训练他们在每一种*语言中都保持安全,而不仅仅是在英语中。

以下是使用简单类比对他们研究结果的拆解:

1. 问题所在:“仅限英语”的安全网并不奏效

研究人员提出了一个可怕的想法:他们拿走了一个本应安全的模型,并故意“关闭”了它的安全开关(这个过程他们称之为消融/ablation)。这就像是把一座建筑里的火警和洒水器全部拆除,以观察火灾发生时情况会变得多么糟糕。

他们发现,当他们用不同的语言询问这个“不安全”的模型有关危险建议的问题(比如如何实施犯罪)时,它会乐于配合。但这里有一个重大发现:训练模型在英语中说“不”,并没有教会它在其他语言中也说“不”。

  • 类比: 想象你教一只看门狗,只有当入侵者说英语时才对入侵者吠叫。如果入侵者说德语、法语或波兰语,这只狗可能就会坐在那里,任由他们进入。这篇论文证明了,在一种语言中教授安全性,并不会自动将其转移到其他语言。

2. 解决方案:一本新的“安全手册”(RefusEU)

为了解决这个问题,团队创建了一个名为 RefusEU 的新数据集。你可以把它看作一本庞大的、多语言的训练手册。

  • 它包含 12 种欧洲语言(包括英语、德语、波兰语、西班牙语等)。
  • 对于用这些语言提出的每一个危险问题,该手册都提供了两个答案:
    1. “被选中的”答案: 一个礼貌但坚定的拒绝(“我无法提供帮助”)。
    2. “被拒绝的”答案: 模型不应该给出的那个危险、有害的回答。

他们使用这份手册通过一种称为**直接偏好优化(DPO)**的方法来重新训练模型。这就像是向大厨展示成千上万个“好的拒绝”与“坏的回答”的例子,并告诉他:“始终选择那个好的拒绝。”

3. 实验:哪些方法有效,哪些无效

研究人员运行了几场“烹饪课程”(训练实验),以观察哪种方法能产生最安全的大厨:

  • “仅限英语”班: 他们只用英语安全数据来训练模型。
    • 结果: 模型在英语方面变得安全,但在其他语言中仍然很危险。这就像只教那只看门狗英语;它仍然会无视说德语的人。
  • “仅限高资源语言”班: 他们针对主要语言(英语、法语、德语等)进行训练,但忽略了较小的语言。
    • 结果: 比仅限英语的效果要好,但仍有漏洞。
  • “平衡多语言”班: 他们在所有 12 种语言上进行均衡训练。
    • 结果: 这是获胜者。 模型在各个方面都变得安全。它学会了像在英语中一样,在波兰语中也能拒绝危险的要求。

4. 权衡:安全性会让大厨变笨吗?

一个常见的担忧是,让模型变得更安全可能会让它变得不那么聪明或说话能力下降。研究人员使用“通用知识”测试(Global MMLU)测试了这一点。

  • 大型模型(70B 参数): 这些是大师级大厨。当它们接受多语言安全手册训练时,它们变得安全,同时没有丧失任何烹饪技能。 它们依然同样聪明且流利。
  • 小型模型(8B 参数): 这些是初级大厨。当接受安全训练时,它们有时会在较小语言的流利度上表现得有些吃力,尤其是如果它们仅接受过英语训练。然而,研究人员发现,对于这些较小的模型,结合多种语言以及一些翻译技巧可以帮助它们保持敏锐。

5. 核心要点

  • 安全性不会自动迁移: 你不能仅仅训练模型在英语中是安全的,就期望它在其他地方也安全。你必须在它所使用的特定语言中对其进行训练。
  • 越大越好: 更大的模型(如 70B 版本)能够完美处理多语言安全训练,在学习说“不”的同时保持其智能水平。
  • 数据集是英雄: 这个全新的 RefusEU 数据集是一个至关重要的工具。它是首个专门针对训练模型拒绝有害请求而涵盖 12 种欧洲语言的数据集,填补了 AI 安全研究中的巨大空白。

简而言之,该论文认为,为了拥有真正面向全球的安全 AI,我们不能只对它说英语。我们需要在它所说的每种语言中都教会它安全的规则,而最好的方法就是通过这种平衡的多语言训练方案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →