'Ghaib in Translation' aka Unseen Harm: Measuring Cross-Script Safety Inconsistency with 'Missed-in-Urdu' Scores in LLM Hate Speech Detection
本文揭示了大型语言模型在检测不同脚本下的乌尔都语仇恨言论时,表现出显著的安全不一致性和“在乌尔都语中被遗漏”的比例,凸显了由于过去九年主要的人工智能安全研究进展中完全缺失乌尔都语,从而导致的内涵审核可靠性方面的关键差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
互联网是一个庞大且嘈杂的市场,每秒钟都有数十亿人在其中分享思想、笑话和不满。为了维护这一空间的安全性,科技公司依赖自动化系统充当数字门卫,在仇恨言论和威胁造成现实世界的伤害之前对其进行扫描。这些系统通过海量文本进行训练,学习识别其最擅长的语言中的虐待模式。然而,世界说着多种语言,而这些数字门卫理解这些语言的能力并不平等。像英语这样的语言在这些系统学习的数据中得到了充分体现,而其他语言则经常被忽视。当一个系统无法识别特定语言中的仇恨言论时,就会产生一个盲点,导致伤害在不受约束的情况下蔓延,即便同样的系统如果面对的是另一种语言编写的内容,也能成功拦截该种伤害。这种差距不仅仅是一个技术故障;它是一种安全失败,让数百万语言的使用者变得脆弱。
由伦敦布鲁内尔大学和德国哈索·普拉特纳研究所的研究人员开展的一项近期研究,揭示了这些显著盲点中最重要的一个:乌尔都语。乌尔都语是世界上使用人数第十多的语言,在巴基斯坦、印度以及英国和美国的大型社区中拥有 2.46 亿使用者。尽管乌尔都语社区记录了大量的在线虐待行为,但研究人员发现,在线安全研究领域几乎完全忽略了这种语言。在对九年间致力于在线虐待的主要学术会议进行的全面回顾中,该团队发现,竟然没有一篇论文是专门针对乌尔都语的。这种缺失是令人震惊的,尤其是因为 2022 年的一个主要研讨会曾明确呼吁加强对该语言的研究。研究人员着手调查这种关注度的缺乏是否会对目前使用的安全工具产生可衡量的后果。
为了测试这一点,该团队检查了当今最先进的五种人工智能模型。他们向这些模型输入了一大批包含仇恨言论、威胁和正常对话的文本,但他们以不同的方式呈现这些内容。一些文本使用的是原始的乌尔都语脚本(即纳斯塔利克体,Nastaliq),这种字体从右向左流动。另一些文本则是罗马化乌尔都语(Roman Urdu),即使用英文字母拼写出乌尔都语单词,这是社交媒体上的一种常见做法。研究人员还提供了相同信息的英文翻译。通过比较模型对不同格式内容的反应,他们可以观察这些安全系统是真的理解了内容,还是仅仅在对字母的形状做出反应。
结果显示出一种令人不安的不一致性。当模型阅读英文形式的有害内容时,它们能正确识别其具有攻击性。然而,当完全相同的信息以原始的乌尔都语脚本呈现时,模型往往无法将其标记为危险。在所测试的不同模型中,平均而言,约有 18% 的有害信息会根据其是在乌尔都语还是英文呈现而产生不同的标签结果。简单来说,如果一个人用乌尔都语发布威胁,系统可能会将其视为普通帖子放行;但如果同样的威胁被翻译成英文,系统则会立即拦截。这种“在乌尔都语中漏检”的比例——即有害内容仅因其书写脚本的不同而逃脱监管——取决于所使用的具体模型,范围大约在 2% 到近 10% 之间。
研究还强调,并非所有人工智能模型在面对这个问题时都同样脆弱。最先进的大规模模型(通常被称为前沿模型)表现出了更好的连贯性,错误较少。然而,较小的开源模型表现出了更高的失败率,在处理乌尔都语时会漏掉近三分之一的有害内容。这表明这些系统的安全功能并不是统一的;它们分布不均,为某些语言的使用者提供更强的保护,却让另一些人暴露在风险之中。研究人员还注意到存在一个结构性的数据缺口:目前还没有专门用于混合乌尔都语和英语(这是人们在网上交流的一种常见方式)的仇恨言论数据集。没有这种特定类型的数据,就无法充分测试这些系统如何处理现代社交媒体中复杂的、混合语言的现实情况。
最终,这项工作证明了目前的安全工具提供的是一面不均匀的盾牌。一个能够可靠检测英语仇恨言论、却无法识别相同程度乌尔都语言论的系统,对于说这种语言的数百万人来说并不是真正的安全。研究结果证实,乌尔都语在安全研究中的缺失不仅仅是一个学术疏忽;它对内容审核有着真实且可衡量的后果。在这些缺口通过更好的数据和跨不同脚本的更严格测试得到填补之前,全球很大一部分在线人口仍将处于脆弱状态,面临着那些本应保护他们、却根本看不见伤害的系统所带来的威胁。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。