Safety Alignment Illusion: The Cross-Lingual Safety Gap in LLMs
本文介绍了 INCLUDE,一个评估六种语言中以印度为中心的社会文化偏见的跨语言基准测试,揭示了当前大语言模型中以英语为中心的安全性对齐如何造成了关键的跨语言安全差距,即非英语输出(尤其是孟加拉语和闭源模型)表现出比其英语对应版本显著更高的偏见。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:电脑助手的语音在印度的乡村小镇和伦敦繁忙的办公室里一样流利且公正。多年来,这些助手背后的技术主要针对英文文本进行训练,通过一种被称为“安全对齐”的过程来学习识别有害的刻板印象并拒绝冒犯性的请求。这种训练就像一个过滤器,旨在阻止机器重复关于种族、宗教或社会地位的偏见。然而,一个关键问题一直悬而未决:如果这个过滤器只理解英语,那么当用户使用印地语、孟加拉语或英语与印地语的混合语时,它是否同样有效?如果过滤器只理解英语,那么数以亿计使用其他语言的人就会暴露在这些本应被技术防止的偏见之中。这正是这项研究调查的核心关切:在印度多样化的语言景观中,人工智能的安全承诺是否真实成立。
由 Namya Bhatnagar 领导的研究人员致力于通过创建一个名为 INCLUDE 的专门测试来衡量这一差距。该基准测试旨在观察不同的人工智能模型在面对六种不同语言(英语、印地语、孟加拉语、马拉地语、泰米尔语以及日常对话中常用的印英混杂语 Hinglish)的文化特定刻板印象提示时表现如何。为了构建这项测试,团队首先定义了偏见经常出现的六个领域,例如种姓、宗教和地域。随后,他们召集了由二十名专家(包括教师和大学教职人员)组成的评审小组,对数千个问题进行审查和完善。这些问题的设计非常巧妙,听起来十分自然,要求模型完成句子,从而揭示它们是倾向于有害的刻板印象还是拒绝此类倾向。团队将这些提示词翻译成五种印度语言,确保所有版本的含义和刻板印象的强度保持一致。
该研究评估了十种不同的人工智能模型,将其分为两组:一组是任何人都可以检查和修改的开源模型,另一组是属于大型科技公司的闭源系统。当研究人员测试开源模型时,发现了一个清晰且令人不安的模式。与英文提示相比,当提示词使用印度语言编写时,这些模型产生带有偏见和刻板印象回答的可能性显著更高。在这些印度语言中,孟加拉语触发了最高水平的偏见,紧随其后的是印地语。令人惊讶的是,英文提示在这些开源模型中导致的偏见得分实际上是最低的,这表明安全过滤器对英语使用者运作良好,但对其他语言使用者却失效了。这创造了一种安全的幻象:用户在说英语时可能会感到受保护,但在使用母语时却变得脆弱。
对于通常用于驱动语音助手搜索和检索功能的闭源模型,研究结果则呈现出一个完全不同且更为复杂的故事。在这组模型中,模式发生了彻底的反转:当提示词为英文时,模型表现出最强的偏见关联,而印度语言的偏见得分较低。这种反转表明,问题的根源并非单一因素。对于开源模型而言,问题似乎在于安全训练主要是在英语中进行的,导致其他语言处于无人看管的状态。对于闭源模型而言,偏见似乎源于它们最初训练时所使用的海量英文文本,这已将强烈的刻板印象植入了它们对世界的底层理解中。
关于 Hinglish(印度数百万人使用的代码混合语言)的研究结果之一最为显著。研究发现,Hinglish 并没有获得英语带来的安全益处。尽管它包含英文单词,但模型在统计学上将其视为与其他低资源印度语言相同的语言,将其归类为印地语和泰米尔语,而非英语。这意味着依靠这种混合语言进行语音交互的用户,并未获得与纯正英语使用者同等的保护。研究人员还指出,虽然偏见得分各异,但这些差异并非随机产生的;它们具有足够的连贯性,足以被视为这些系统构建过程中的一次真实的、可衡量的失败。
研究结论认为,人工智能的安全在不同语言之间并不统一。研究揭示了当前的模型训练方法造成了一种鸿沟:英语使用者受到保护免受有害刻板印象的影响,而其他语言的使用者则不然。研究结果表明,仅仅将安全规则从英语进行翻译是不够的;模型的学习方式及其对齐方式本身就需要改变,以考虑到不同文化和语言的细微差别。通过识别这些差距,研究人员希望为开发者提供一份路线图,帮助他们构建真正公平的系统,无论用户使用何种语言。这项工作强调,实现真正的人工智能公平性,需要超越主流语言,去关注这些技术所部署的具体文化语境。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。