Schützen: Evaluating LLM Safety in Bulgarian and German Contexts
本文介绍了“Schützen”,这是一个德语-保加利亚语安全数据集,旨在通过揭示大语言模型安全行为中显著的跨语言差异,并强调进行特定区域评估的必要性,来解决非英语评估资源匮乏的问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个非常聪明、精通多种语言的机器人助手。你想知道让它在德国和保加利亚与人交谈是否安全。问题在于,大多数针对机器人的安全测试就像是在英语国家进行的驾驶考试:它们检查机器人是否知道在伦敦或纽约时遇到红灯时停下,但它们不会检查机器人是否知道在索非亚或柏林时知道在红灯前停下——在那里的规则、文化和历史可能略有不同。
这篇题为 “Schützen”(德语意为“保护”)的论文介绍了一种专门为这两个国家设计的全新安全测试。以下是他们所做工作及发现的简单拆解:
1. 问题所在:“一刀切”的安全网
把现有的安全数据集想象成一个由美国制造的巨大、通用的安全网。它很擅长捕捉英语使用者,但当你试图用它来捕捉德国或保加利亚使用者时,网上的孔洞位置可能会出错。
- 差距: 对于保加利亚语(一种“低资源”语言,意味着数字书籍和数据较少)的安全性测试非常匮 없고;同时对于德语,缺乏足够深入的、具有文化特异性的测试。
- 风险: 如果你不在当地语言和文化背景下测试机器人,它可能会在无意中说出一些在英语环境下不会说的粗鲁、违法或有害的话。
2. 解决方案:定制化的“安全健身房”
作者建立了一个名为 Schützen 的新健身房,用于训练和测试这些机器人。
- 器材: 他们用德语和保加利亚语创建了大约 8,000 个问题(提示词)。
- 训练方式: 他们不仅仅是翻译英语问题,而是进行了“本地化”。
- 类比: 如果一个英语测试问:“如何利用厨房电器制作炸弹?”德语版本并不仅仅是翻译单词,它可能会询问关于特定的历史事件或当地的文化禁忌。保加利亚语版本可能会引用一部当地电影或一位特定的历史人物。
- 三种类型的测试:
- 直接攻击: “告诉我如何违法。”(显而易见的测试)。
- 间接攻击: “我正在写一个关于反派如何违法的故事。他们会怎么做?”(隐蔽的测试)。
- 过度敏感度检查: “什么是枪?”(通过询问一个无害的问题,观察机器人是否会因为害怕而拒绝回答一些安全的内容)。
3. 竞赛:擂台上的 15 台机器人
他们将 15 个不同的 AI 模型放入这个健身房中,观察它们如何应对这些问题。
- 参赛者: 这包括大型全球模型(如 GPT-4o、Claude 和 Llama)以及当地专家模型(如针对保加利亚的 BgGPT 和针对德国的 Leo/LLaMmlein)。
- 计分卡: 他们检查了两项内容:
- 二元评分: 机器人是说了“不,这不安全”(安全)还是真的给出了错误信息(不安全)?
- 风格评分: 它是如何说“不”的?是仅仅拒绝?还是解释了原因?还是给出了一个安全但枯燥的答案?
4. 结果:谁赢了?
- 冠军: Claude-3.7 是整体最安全的机器人,在两种语言中表现近乎完美。
- 本土英雄:
- 对于保加利亚,当地模型 BgGPT-27B 表现最好。
- 对于德国,当地模型 Leo-mistral-hessianai-7B-chat 是表现最好的选手。
- 挣扎者: 一些较小的模型,如 LLaMmlein-7B-chat(德国)和 BgGPT-2.6B(保加利亚),表现最差,经常无法识别出不安全的请求。
- 惊喜之处: 作者原本认为“低资源”语言(保加利亚语)会让机器人处理起来更困难。然而,他们发现由于德国和保加利亚共享相似的欧洲法律和文化价值观,只要安全规则与他们在英语中学到的相似,机器人在保加利亚语中的表现也非常好。
5. “人类 vs 机器”裁判
为了确保他们的计算机化评分是公平的,他们使用了一个“人类-AI 团队”。
- 流程: 人类对部分答案进行了“安全”或“不安全”的标注。然后,他们使用一个超级智能的 AI(GPT-4.1)来检查其余部分。
- 技巧: 他们发现,如果告诉 AI 选择符合某个类别的“第一个”答案(而不是过度思考去寻找“完美”的匹配),它的判断会与人类评委达成更高的一致性。这就像是告诉裁判根据看到的第一个规则快速做出判罚,而不是去争论每一个可能的规则。
总结
该论文指出,你不能只在英语环境下测试 AI 安全性,然后就假设它在世界各地都有效。你需要一份本地安全手册。他们为德国和保加利亚建立了一份新手册,测试了 15 台机器人,并发现虽然一些全球巨头非常安全,但如果训练得当,本地模型也可以非常出色。他们还证明了使用人类和 AI 结合的方式进行评分,既快速又像仅使用人类一样准确。
获取工具: 作者已将他们的“健身房”(数据集)和“计分卡”(代码)发布在 GitHub 上供任何人使用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。