← 最新论文
💬 NLP

Auditing demographic bias in AI-based emergency police dispatch: a cross-lingual evaluation of eleven large language models

本文提出了一种跨语言审计框架,揭示出用于紧急警务调度的大型语言模型中的人口统计偏见在模糊事件中系统性显现,在性别、种族和宗教外貌方面存在显著差异,并在英语与汉语之间表现出独特的不对称性,从而凸显了在现实世界部署前进行情境感知且针对特定语言的模型评估的必要性。

原作者: William Guey, Wei Zhang, Pierrick Bougault, Yi Wang, Bertan Ucar, Vitor D. de Moura, José O. Gomes

发布于 2026-05-05
📖 1 分钟阅读☕ 轻松阅读

原作者: William Guey, Wei Zhang, Pierrick Bougault, Yi Wang, Bertan Ucar, Vitor D. de Moura, José O. Gomes

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名在繁忙十字路口执勤的交通警察。你的工作是决定派遣援助的紧急程度:是需要立即派遣全副武装的特种战术小组(SWAT),还是稍后派遣一辆普通巡逻车,或者根本不需要派人?

现在,想象你雇佣了一个超级聪明的机器人(人工智能)来协助你做出这些决定。你所询问的这篇论文就像是对这些机器人进行的一次“压力测试”。研究人员想要看看,即使紧急呼叫的内容听起来完全一样,这些机器人是否会根据它们认为呼叫者的身份(种族、性别或宗教)而区别对待。

以下是他们所做的工作和发现,使用简单的类比进行分解:

实验:“双胞胎”测试

研究人员创建了 15 种不同的紧急场景(例如公园里的斗殴、地铁里的可疑包裹,或有人被尾随回家)。

对于每种场景,他们制作了两个“双胞胎”:

  • 双胞胎 A:故事内容相同,但呼叫者提到了涉及人员的某个具体细节(例如:“嫌疑人戴着头巾”、“嫌疑人是一名黑人男子”或“嫌疑人是一名女性”)。
  • 双胞胎 B:故事内容完全相同,但去掉了那个具体细节,或者将其改为中性的描述。

他们将这些故事输入到 11 个世界上最先进的人工智能机器人(大型语言模型)中,并要求它们分配优先级,范围从“无需行动”到“立即派遣援助”。他们在英语和中文两种语言下都进行了这项测试。

主要发现

1. “雾窗”效应

最重要的发现是,机器人只有在情况不明朗时才会表现出偏见。

  • 清晰危险:如果故事说“有人质持刀劫持事件”,无论嫌疑人被描述为谁,每个机器人都会大喊“立即派遣援助!”偏见消失了。
  • 模糊危险:如果故事很模糊,比如“一名男子在纪念碑附近站了 30 分钟”,机器人就会开始根据人口统计细节做出假设。
  • 类比:这就像透过雾窗看东西。如果一辆车明显在撞车(清晰危险),无论发生什么你都能看见。但如果你在雾中看到模糊的形状(模糊危险),你的大脑(或机器人的大脑)就会根据刻板印象填补空白。偏见只发生在雾中。

2. “宗教与种族”的意外

研究人员发现,机器人对不同类型的线索反应不同:

  • 宗教外貌:这导致了最大的判断波动。如果故事提到伊斯兰服饰(如头巾或面纱),与中性故事相比,机器人更有可能改变其优先级。
  • 性别:机器人在这方面表现出特定的模式。如果受害者被描述为女性,机器人倾向于比受害者为男性时更快地派遣援助。
  • 种族:这是最令人惊讶的部分。在美国语境(英语)下,当呼叫者明确说“黑人男子”时,机器人在某些情况下实际上降低了紧急程度。这与我们通常担心的(它们会具有攻击性)恰恰相反。就好像机器人如此努力地表现出种族主义,以至于不小心变得过于谨慎。

3. “语言切换”问题

机器人在英语和中文中的表现并不相同。

  • 性别偏见:中文中的性别偏见强度是英语中的两倍
  • 种族偏见:英语中的种族偏见强度是中文中的两倍
  • 类比:想象一个人在英语中非常礼貌,但在西班牙语中非常直率。如果你只在英语中测试他,你就会忽略他的直率。该论文警告说,仅用一种语言测试人工智能,会让你无法全面了解其偏见的真实程度。

4. “不一致的机器人”

机器人并不总是遵循简单的“坏刻板印象”规则。

  • 有时,提到穆斯林名字会让机器人认为情况危险(升级)。
  • 其他时候,提到同样的事情会让机器人认为情况较不危险(降级)。
  • 结论:这不仅仅是简单的“机器人讨厌 X"。机器人的反应取决于故事和线索的具体组合。有时它反应过度;有时它反应不足。

为什么这很重要(根据论文)

该论文得出结论,我们不能简单地说"AI 有偏见”或"AI 是公平的”。这取决于:

  1. 紧急情况的清晰程度:当危险显而易见时,偏见会隐藏;但当情况令人困惑时,偏见就会出现。
  2. 使用了哪种人口统计线索:宗教、性别和种族会引发不同的反应。
  3. 使用的语言:机器人可能在英语中公平,但在中文中不公平,反之亦然。

作者建立了一个“游乐场”(一个开源工具),以便警察部门在购买自己的 AI 之前进行测试。他们希望确保当这些机器人在现实生活中被使用时,不会仅仅因为 911 报警电话中模糊的描述,就错误地将援助派送给错误的人。

简而言之:机器人很聪明,但在雾中会感到困惑。当情况不明朗时,它们开始根据人们是谁来进行猜测,并且根据它们使用的语言不同,猜测的结果也不同。在让它们驾驶警车之前,我们需要仔细测试它们。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →