← 最新论文
💬 NLP

Improving Implicit Hate Speech Detection via a Community-Driven Multi-Agent Framework

本文介绍了一种由社区驱动的多智能体框架,该框架利用一个中央调节智能体(Moderator Agent)和动态构建的社区智能体(Community Agents)来整合社会文化语境,从而在 ToxiGen 数据集上,与现有的提示方法相比,显著提高了隐性仇恨言论检测的准确性和公平性。

原作者: Ewelina Gajewska, Katarzyna Budzynska, Jarosław A Chudziak

发布于 2026-01-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Ewelina Gajewska, Katarzyna Budzynska, Jarosław A Chudziak

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网是一个巨大且繁忙的城镇广场。在这个广场上,人们不断地发出各种信息。大多数信息是友好的,但也有一些人试图使用隐晦、带有编码性质的语言来伤害他人,这些语言表面上听起来无害,实际上却充满了仇恨。

问题在于,目前的“保安”(用于审核这些帖子的计算机程序)往往过于刻板。它们就像是只会在有人大声叫嚣露骨脏话时才进行逮捕的保安。如果有人使用微妙的笑话或历史典故来侮辱某个群体,保安们就会漏掉。由于它们非常害怕误捕无辜者(假阳性),导致许多真正的霸凌者逍遥法外(假阴性)。

以下是华沙理工大学的研究人员提出的解决办法,他们使用了一个“社区驱动型”的 AI 智能体团队。

旧方法:孤狼保安

目前,大多数系统使用单个 AI(就像一个孤零零的保安)来阅读帖子并判断其是否属于仇恨言论。为了让这个保安变得更聪明,研究人员尝试给它不同的“说明书”(提示词):

  • 零样本学习 (Zero-shot): 仅仅告诉保安:“这是仇恨言论吗?”
  • 少样本学习 (Few-shot): 先给保安看几个仇恨言论的例子。
  • 思维链 (Chain-of-Thought): 要求保安在做出决定之前,“大声思考”出每一步的过程。

研究发现,虽然这些方法有所帮助,但这个“孤狼保安”仍然难以应对那些复杂的、带有编码性质的语言。由于缺乏理解笑话所需的特定文化背景,它们经常会漏掉仇恨言论。

新方法:“咨询式市政厅”

作者提出了一个新的系统,它不再像一个孤零零的保安,而更像是一个市政厅会议

  1. 审核智能体(首席保安): 这个 AI 首先阅读帖子。如果帖子明显是仇恨性的或明显是无害的,它会快速做出决定。
  2. “犹豫”时刻: 如果帖子很微妙、模糊或使用了编码语言,首席保安就会按下“暂停”键。它会承认:“我对这个不太确定。”
  3. 社区智能体(邻里专家): 这是最神奇的部分。系统不会盲目猜测,而是会自动召集一个社区智能体团队。
    • 假设有一条针对特定群体(例如,关于亚洲人的微妙笑话)的帖子。系统会立即召唤出一位“亚洲社区智能体”。
    • 它们如何知道该说什么? 这些智能体并非凭空猜测。系统通过从维基百科中提取关于该特定群体的历史、文化和挣扎的真实、事实性信息来构建这些智能体。
    • 类比: 这就像首席保安询问一位当地历史学家:“嘿,我看到了这个短语。它在你们社区的历史中是否有隐藏含义?”
  4. 最终裁决: 首席保安会倾听专家的建议,结合自身的观点,做出一个更明智的最终决定。

为什么这很重要(研究结果)

研究人员在名为 ToxiGen 的数据集上测试了这个系统,该数据集充满了针对黑人、亚洲人、穆斯林、犹太人、女性和 LGBTQ+ 群体的微妙且含蓄的仇恨言论示例。

结果如下:

  • 更好的检测能力: 与旧有的“孤狼保安”方法相比,新系统捕捉到了显著更多的实际仇恨言论。它不仅仅是在猜测,它理解了语境。
  • 公平性: 旧系统非常擅长判定“这是安全的”(真阴性),但在判定“这是仇恨”(真阳性)方面表现糟糕。新系统平衡了这一点。它在识别仇恨的同时,能更好地避免误罚无辜的人。
  • “消融实验” (Ablation Test): 研究人员尝试在没有“社区智能体”(仅保留首席保安)的情况下运行系统。结果显示性能大幅下降,这证明了“专家咨询”是成功的关键。

论文中的现实案例

论文给出了一个很好的例子,解释了为什么这行得通:

  • 帖子内容: “如果你最近去了电影院,你会注意到大多数在零食柜台工作和清理的人都是亚洲人。”
  • 旧版保安: 可能会认为:“这只是一个观察结果。没有仇恨词汇。安全。”
  • 新系统: “亚洲社区智能体”(配备了关于历史刻板印象的知识)识别出这是一种对“亚洲人只适合从事服务业”这一观念的微妙强化。它将其标记为仇恨言论,因为它理解的是社会语境,而不仅仅是文字本身。

核心结论

这篇论文并不声称解决了所有的互联网问题,但它为我们如何检测隐藏的仇恨提供了一个具体且实用的升级方案。通过构建一个能够向理解被攻击者特定历史与文化的“数字社区专家”寻求帮助的系统,我们可以让网络空间变得更加安全和公平。它使 AI 从一个僵化的规则执行者,转变为一个深思熟虑、具备语境感知能力的参与者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →