Who Pays More for Safety? Measuring the Disparate Cost of Safety Alignment across Languages
本文引入了一个“安全成本”指标,旨在证明安全对齐对非英语语言造成了不成比例的惩罚,即与英语相比,这些语言面临更大的效用损失和更弱的保护,从而揭示了当前安全实践中存在的系统性不平等。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,大语言模型是驱动聊天机器人、翻译器和助手的数字引擎。在这些机器能够造福人类之前,它们必须经历一个被称为“对齐”(alignment)的严格训练过程。可以将这想象成一段求学时期,模型不仅学习如何回答问题,还学习如何安全地回答问题,即遵循人类价值观,并拒绝生成诸如暴力指令或非法行为等有害内容。这种安全性训练至关重要,但它也伴随着一个隐藏的代价。正如一辆刹车过于敏感的汽车可能会因为微小的障碍物而过快停止一样,一个过于谨慎的人工智能可能会变得不再好用,从而拒绝回答无害的问题,或者提供含糊、平庸的回答。这种可用性的丧失被称为“效用成本”(utility cost)。多年来,研究人员一直知道安全性训练会降低模型的整体性能,但一个关键问题一直悬而未决:这种成本是平等地分摊在每个人身上的,还是某些语言承受的代价更大?
一组研究人员着手调查安全性对齐的负担是否在全球语言之间得到了公平的分担。他们专注于一个特定的现象,即模型可能会仅仅因为请求听起来略带风险就拒绝处理安全的请求,这种行为被称为“过度拒绝”(over-refusal)。为了衡量安全性的真实成本,该团队设计了一种巧妙的比较方法。他们获取了功能强大的、经过安全性对齐的模型,并为同一套软件创建了“未对齐”的版本。这些未对齐的版本并非旨在变得危险;相反,研究人员通过手术式的方法,精准地移除了导致模型拒绝请求的特定安全机制,同时保留了模型的其余知识和表达能力。通过将安全性对齐的模型与其针对同一问题的未对齐双胞胎版本的回答进行对比,研究人员可以精确隔离出仅由安全性训练导致的有用性损失。他们在英语及其他五种语言(包括中文、阿拉伯文、韩文、越南文和泰文)上进行了测试,使用了一组旨在无害但可能触发安全警报的问题。
结果揭示了一种显著且系统性的不平等。研究人员发现,非英语用户为安全性支付的代价始终高于英语使用者。在许多情况下,安全过滤器在保护非英语使用者免受实际伤害方面的效果较差,然而这些用户在面对无害问题时,收到的回答却明显更差、缺乏帮助。研究确定了导致这种差异背后的三种不同模式。首先,许多语言都陷入了“双重惩罚”区:它们在抵御真实危险方面的保护较弱,同时在回答质量方面遭受的下降却更为严重。其次,在某些情况下,某种语言之所以表现出较低的安全成本,是因为安全过滤器根本没有启动,导致用户暴露在有害内容面前而模型却毫无察觉。第三,即使是像中文这样拥有海量训练数据的资源丰富型语言,实现与英语同等安全水平所付出的成本也显著更高。效用损失不仅仅在于模型在应该说“是”的时候说了“不”。研究人员发现,即使模型回答了,其响应往往也显得单薄、缺乏细节且事实精度较低。安全性训练悄然剥夺了深度和细微差别,使得人工智能在用户甚至尚未意识到原因的情况下,变得不再那么好用。
这项工作表明,目前使人工智能变得安全的方法在不同文化和语言之间并未得到公平的校准。安全性训练深受英语数据和规范的影响,在无意中造成了一种结构性差距,导致非英语使用者获得更差的体验。研究人员认为,这并非使人工智能安全过程中不可避免的副作用,而是当前实施安全性方式的一种缺陷。通过衡量每种语言中具体的安全性成本,这项研究揭示了技术中存在的一种根本性的不平等。它表明,当英语使用者能够获得安全且有帮助的回答时,另一种语言的使用者得到的回答可能是不安全的,或者是无意义且含糊的,而这一切都是因为安全机制并未针对其特定的语言语境进行调整。这些发现呼吁一种新的安全性对齐方法,确保安全的代价能够得到均匀的分配,从而使人工智能带来的益处不会因所使用的语言不同而受到削减。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。