Lost in Localization: Building RabakBench with Human-in-the-Loop Validation to Measure Multilingual Safety Gaps
本文介绍了 RabakBench,这是一个针对新加坡语言环境、经人工验证的多语言安全性基准测试,揭示了最先进的大语言模型防护机制在处理如新加坡英语(Singlish)、中文、马来语和泰米尔语等低资源语言时存在的显著性能差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一名非常聪明、训练有素的建筑保安。这名保安非常擅长识别“标准英语”中的麻烦。他能准确识别出什么是粗鲁的评论、威胁或危险的想法。
但现在,想象同一名保安被要求去监管一个繁忙且多元文化的社区,那里的人们说着混合语言、俚语和地方方言。突然间,保安感到困惑了。他可能会因为某个词汇隐藏在当地笑话中而漏掉真正的威胁;也可能因为不理解某种文化用语而错误地逮捕了一位无害的邻居。
这篇名为 RABAKBENCH 的论文,旨在构建一种全新的“测试”,用以观察这些 AI “保安”在处理这种混乱、真实的现实世界时表现如何。这个研究中的“社区”是新加坡——一个人们不断将英语与中文、马来语和泰米尔语混合在一起(这种混合被称为“Singlish”)的地方。
以下是研究人员如何构建这项测试以及他们的发现,通过简单的解释呈现:
1. 问题所在:“本地化盲点”
目前的 AI 安全系统就像是只读过标准英语教科书的保安。当面对以下情况时,他们会失效:
- 语码混合 (Code-mixing): 在句子中频繁切换不同语言。
- 俚语 (Slang): 含义随语境变化的本地词汇。
- 方言 (Dialects): 不是“规范”英语的地域性表达方式。
研究人员发现,这些 AI 保安经常犯两种大错:
- 漏报 (False Negatives): 他们会漏掉实际的仇恨言论或威胁,因为那些词汇在他们看来像是无害的俚语。
- 误报 (False Positives): 他们会将无害的文化笑话标记为危险,从而有效地让正常的对话陷入沉默。
2. 解决方案:构建“RABAKBENCH”
为了解决这个问题,团队构建了一个名为 RABAKBENCH(名字取自一个意为“极端”或“强烈”的本地词汇)的大规模测试场。你可以把它看作是一个 AI 安全的模拟器。
他们并非仅仅亲手编写这些测试句子,而是使用了一个精巧的三步“工厂化”流程:
- 第一步:“红队”攻击(生成)
想象一群黑客试图欺骗 AI 保安。研究人员利用 AI 生成了数千个棘手的、真实的 Singlish 案例,包括那些听起来危险但实际安全的例子,以及那些听起来安全但实际上具有毒性的例子。他们甚至使用了一个“批评者”AI 来帮助“攻击者”AI 更好地寻找漏洞。 - 第二步:“超级标注员”(标注)
手动标注这些复杂的句子既昂贵又困难。因此,研究人员测试了几种不同的 AI 模型,以观察哪些模型最擅长理解人类的判断。他们发现有三款“明星”AI 模型在与人类专家的共识度上达到了 70–80%。他们使用这些 AI 模型来标注数据,但在过程中保留了人工审核环节,以确保文化细微差别得到正确处理。 - 第三步:“文化翻译官”(翻译)
他们将 Singlish 测试案例翻译成了中文、马来语和泰米尔语。但关键在于:标准的翻译工具通常会“净化”脏话以使其变得礼貌。研究人员构建了一个特殊的翻译过程,确保毒性保持不变。如果一个句子在 Singlish 中是恶意的,那么它在马来语或泰米尔语中的翻译也必须同样具有恶意,从而保留原始的“风味”和意图。
结果如何?他们得到了一个包含超过 5,000 个示例的数据集,涵盖四种语言,并详细标注了为什么某项内容是不安全的(例如:它是仇恨言论吗?仅仅是侮辱吗?还是威胁?)。
3. 结果:保安们没能通过测试
研究人员选取了全球 13 个顶尖的 AI 安全系统(既包括像 Google 和 OpenAI 这样的商业系统,也包括开源系统),并将它们带入这项新测试中运行。
结论很严厉:
- 性能大幅下降: 在标准英语测试中得分 80% 以上的系统,在这一本地化测试中的得分往往跌破 50%。
- “泰米尔语差距”: 表现尤其糟糕的是泰米尔语,许多系统的得分甚至低于 30%。
- “一刀切”行不通: 研究表明,你不能只针对英语进行训练,然后指望它在任何地方都能工作。他们需要针对本地文化的专门训练。
4. 为什么这很重要
论文指出,如果我们希望 AI 对每个人都是安全的,我们就不能仅仅依赖标准英语规则。我们需要构建能够理解“本地风味”的安全系统。
核心要点:
RABAKBENCH 就像是 AI 安全领域的多元文化环境驾驶执照考试。它证明了目前的 AI 司机在高速公路上(标准英语)表现出色,但在城市街道(地方方言)中却表现糟糕。研究人员已经向公众发布了他们的测试题和答案,以便其他开发者能够为未来构建更具文化意识的安全保障。
本文****并不声称:
- 它并不声称已经修复了 AI 系统;它只是构建了这个测试来展示它们存在缺陷。
- 它并不建议将这些测试用于临床或医疗安全。
- 它并不承诺未来的 AI 会自动变得完美;它只是提供了一个衡量和改进它们的路线图。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。