Language-Specific Gaps in AI Safety Training Datasets
本文揭示了人工智能安全训练数据集在低、中、高资源语言中的来源、标注以及危害分类覆盖方面存在的关键且往往未被重视的缺陷,证明了这些结构性不足——特别是在非洲语言和特定危害类别方面——削弱了多语言安全性的主张,并导致了针对多轮越狱攻击的持续脆弱性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网是一个巨大的、繁忙的图书馆,书里用各种各样的语言写就。长期以来,图书管理员(开发人工智能的人)主要讲英语,因此他们把所有的安全规则和“禁止入内”的告示都用英语写了出来。最近,他们意识到需要欢迎说其他语言的读者,于是开始翻译这些告示。但问题在于:仅仅因为一家图书馆声称其拥有 20 种语言的安全规则,并不意味着这些规则真的存在,或者在这些语言中是否合乎逻辑。这篇论文深入探讨了计算机科学中的“人工智能安全”领域。它研究了我们如何教计算机变得礼貌、安全且乐于助人,并专门检查用于教导它们的训练材料是否真的足以让非英语使用者受益。核心问题是:我们只是在告示牌上贴了一张翻译贴纸,还是真的为每个人编写了一本全新的、符合文化背景的规则手册?
这篇论文的作者决定扮演侦探。他们并没有仅仅听信人工智能公司的说辞,认为他们的模型对所有人都是安全的。相反,他们进入档案库,审计了 21 个不同的安全数据集合(用于训练人工智能的“规则手册”),涵盖了 25 个不同的语言切片。他们重点关注了三种语言,以代表不同的资源水平:豪萨语(低资源,就像一个小村庄的图书馆)、斯瓦希里语(中等资源,就像一个城镇的图书馆)和法语(高资源,就像一座大型城市的图书馆)。
以下是他们的发现,这有点像是发现“安全”专区在小村庄图书馆里几乎是空的,而城市图书馆的专区虽然书架满满,却只是从英语书籍那里复印过来的。
“翻译陷阱”
最大的惊喜是,许多数据集声称是“原生”的(由在那种语言环境下成长的人编写),但当作者仔细观察时,发现它们实际上是从英语机器翻译过来的。这就像一家餐厅声称提供“正宗当地美食”,但当你窥视厨房时,却发现一个机器人正在翻译一份来自异国的菜单,并把它粘在一盘菜上。对于低资源语言(豪萨语),几乎所有的安全数据要么是翻译过来的,要么是计算机生成的,而不是由母语使用者编写的。更糟糕的是,在某些情况下,翻译质量甚至低于研究人员设定的最低可接受标准。一个测试了豪萨语和斯瓦希里语的具体流程显示:斯瓦希里语版本轻松通过了测试,但即使使用完全相同的流程,豪萨语版本却失败了。这证明了问题不在于翻译这种语言很“难”,而在于针对特定语言的处理过程不够细致。
“缺失章节”问题
作者还检查了安全规则是否覆盖了所有危险话题。他们发现了一个巨大的鸿沟:对于他们研究的非洲语言,几乎没有任何关于自残或性内容的原生规则。这就像图书馆有一个关于“不要偷窃”和“不要打斗”的完整章节,但“不要伤害自己”和“保护隐私”的架子上却是空空如也。这是一个彻底的空白,而不仅仅是微小的缺口。对于法语,这些话题得到了覆盖,但对于豪达语和斯瓦希里语,这些数据在原生形式下根本不存在。这意味着如果用户用他们的母语询问人工智能关于这些敏感话题的内容,人工智能可能无法理解其中的文化细微差别,或者可能会给出危险的答案,因为它从未被教授正确的规则。
“重复计数”的幻象
作者揭露的另一个诡计是“重复计数”。想象一个图书馆声称拥有 1 万本独特的书。但如果你仔细观察,你会发现他们只是把同样的 1,000 本书换了个封面,然后就把它们当作新书来计数。研究人员发现,对于斯瓦希里语,许多数据集只是将相同的原始推文或帖子由不同群体进行重新标注(重新分类)。这使得看起来好像有大量的数据可用,但实际上,“多样性”只是一种幻象。这就像一个播放列表声称有 500 首歌,但实际上只是把同样的 50 首歌反复播放,只是换了名字而已。
为什么“低资源”标签并非全部故事
你可能会想:“好吧,小村庄图书馆的书当然比大城市图书馆少。”论文对此表示认同,低资源语言确实数据较少,但作者认为,问题不仅在于有“多少”数据,还在于数据的“种类”。他们发现,有时中等资源语言(斯瓦希里语)在特定任务上的质量得分甚至比低资源语言(豪萨语)还要差;有时高资源语言(法语)在某些领域存在缺口,而中等资源语言在这些领域却有强大的原生覆盖。这表明,问题不仅仅是缺乏资金或计算机,而是关于研究社区如何确定优先级。如果一个社区非常关心选举虚假信息,他们就会构建出极好的相关数据。如果他们不关心,那么即便该语言多么“丰富”,这些数据也不会存在。
现实世界的后果
为什么这很重要?论文将这些缺失或劣质的数据差距与现实的安全问题联系起来。研究人员发现,虽然人工智能模型在应对简单的、单句式的“越狱”(诱导人工智能说出坏话的技巧)方面,在非洲语言上表现得越来越好,但在应对复杂的、多轮对话时仍然失败。作者认为,这是因为用于这些复杂对话的训练数据大多是合成的(由计算机生成)和翻译过来的,而非原生的。这就像教一名司机在红灯前停车(简单的一步),但从未教他如何在突发暴雨或路面湿滑的情况下驾驶(复杂的、多步骤的过程)。人工智能可以处理简单的套路,但一旦对话变得复杂,它就会崩溃。
总结
这篇论文并不是说我们应该停止尝试让人工智能服务于每一个人。相反,它是在说,我们要停止假装“多语言”的说法就意味着一切太平无事。仅仅因为一个数据集声称覆盖了 14 种语言,并不意味着这些语言的安全性规则真的已经到位。作者建议创造者们需要诚实:如果一个语言切片是翻译过来的,请说明它是翻译的。如果某个话题缺失了,请承认它缺失了。他们希望我们停止只看“标题”上的数字,转而开始观察每一块“饼”的个体情况。在我们做到这一点之前,人工智能可能对英语使用者是安全的,但对于许多其他人来说,它仍是在一个书架空缺、标识破损的图书馆中艰难航行。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。