← 最新论文
🤖 machine learning

Decoding Islamophobic Discourse: Using LLMs to Identify Tropes and Semi-Coded Hate Speech

本文利用大型语言模型和主题建模分析来自极端主义平台的大规模数据,表明大型语言模型能够有效识别半编码的伊斯兰恐惧症侮辱性言论,同时揭示此类仇恨言论在各种政治运动中普遍存在,且其毒性评分往往高于其他形式的仇恨言论。

原作者: Raza Ul Mustafa, Roi Dupart, Gabrielle Smith, Noman Ashraf, Nathalie Japkowicz

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Raza Ul Mustafa, Roi Dupart, Gabrielle Smith, Noman Ashraf, Nathalie Japkowicz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象互联网是一个巨大而嘈杂的城镇广场。近年来,广场里的一群人开始向穆斯林大声辱骂,但他们学会了一种棘手的新把戏:不再大声喊出明显的侮辱性词汇,而是使用“秘密代码词”。

这篇论文就像一支侦探团队,试图查明现代人工智能(特别是大型语言模型,或称 LLM)能否破解这些代码,在仇恨蔓延之前将其制止。

以下是他们调查的分解,使用了简单的类比:

1. 问题:仇恨的“伪装”

过去,仇恨言论就像一个人穿着印有“我恨你”字样的鲜红色衬衫。这很容易被发现。

现在,仇恨者穿上了迷彩服。他们使用的词汇看起来无害,或者听起来像普通的名字,但在极端主义论坛(如 4Chan 或 Gab)的语境下,它们意味着可怕的内容。

  • “泥污”(Mudslime)把戏:想象一下把“穆斯林”(Muslim)这个词中的"M"换成“泥”(Mud),再加上“污”(slime)。听起来既恶心又具有非人化色彩,但如果你脱离语境只读这个词,它看起来就像一个奇怪的自造名。
  • “阿卜杜勒”(Abdul)陷阱:“阿卜杜勒”是一个常见且正常的穆斯林名字。但在这些平台上,仇恨者将其用作通用侮辱,类似于有人用一个通用名字来嘲笑整个群体。
  • “穆斯林鼠”(Muzrat)混合:这是"Muzz"(一个约会应用)和“鼠”(Rat)的混成词。其设计目的是将穆斯林描绘成害虫,但写法上试图绕过自动过滤器。

研究人员将这些称为“词汇表外”(OOV)或“半编码”术语。它们相当于披着羊皮的狼的数字版。

2. 调查:人工智能能看穿伪装吗?

研究人员要求一个非常聪明的人工智能(GPT-4)阅读这些帖子并判断:“这是仇恨言论吗?”

  • 好消息:人工智能在识破“披着羊皮的狼”方面出奇地出色。当研究人员将包含mudslimepislammuzrat等词汇的帖子输入给它时,人工智能在大多数情况下都能正确识别出这些词汇具有仇恨性。它明白,即使这些词汇看起来奇怪或中性,其意图也是恶意的。
  • 坏消息:人工智能有时会被语境搞糊涂。如果一篇帖子使用了“阿卜杜勒”这个名字而没有其他仇恨词汇,人工智能可能会想:“哦,那只是个名字”,从而忽略了仇恨。它需要更多线索才能确定。

3. 毒性测试:这种仇恨有多“毒”?

研究人员将针对穆斯林的仇恨言论与针对犹太人的仇恨言论(反犹太主义)进行了比较。他们使用了一个名为Google Perspective API的工具,它就像一个“毒性计”。

  • 结果:该计器显示,针对穆斯林的仇恨言论比针对犹太人的仇恨言论具有显著更高的毒性(更粗鲁、更具攻击性、更辱骂性)。
  • 类比:如果反犹太主义像一把锋利的刀,那么本研究中针对穆斯林的仇恨言论就像一把大锤。它的语言更沉重、更响亮、更暴力。

4. “陈词滥调”谜题:人工智能能理解故事吗?

仇恨言论通常依赖于陈旧、重复的故事或“陈词滥调”(刻板印象)。研究人员要求人工智能将仇恨言论归入五个具体类别:

  1. 种族主义:基于肤色或种族攻击人们。
  2. 移民:声称穆斯林正在“窃取”国家。
  3. 宗教:攻击伊斯兰教作为一种信仰体系。
  4. 先知:侮辱先知穆罕默德。
  5. 压迫:声称穆斯林妇女受到压迫或受到恶劣对待。
  • 结果:人工智能在识别针对先知的侮辱(因为词汇非常具体且明显)以及针对宗教的攻击方面是大师。
  • 困境:人工智能难以区分种族主义移民压迫。它经常将这些混淆。这就像一名侦探能轻易发现凶器,却难以弄清楚犯罪发生的原因或使用了哪种具体的动机。

5. 结论:正在进行的工作

该论文得出结论,虽然人工智能在识别这些“秘密代码词”方面变得越来越好,但尚未完美。

  • 有效之处:人工智能能判断mudslime是一个坏词。
  • 无效之处:当仇恨很微妙,或者当它试图弄清楚具体使用了哪种刻板印象时,人工智能有时会错过深层含义。

底线
研究人员正在告诉社交媒体平台:“你们不能再只寻找明显的坏词了。你们需要教导你们的人工智能理解这些新的、奇怪的、编码的词汇,否则仇恨言论将继续从裂缝中溜走。”他们还指出,由于这种仇恨极具毒性,需要紧急关注,以保持在线城镇广场的安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →