← 最新论文
🤖 AI

SPAR-Hate: An Auditor-Guided Multi-Agent Framework for Bilingual Hate Speech Parsing

本文介绍了 SPAR-Hate,这是一个由审计员引导的多智能体框架,它通过将文档分解为从句级单元、从受害者、调节者和文化旁观者视角生成基于证据的判断、以及通过仲裁解决冲突,从而改进了双语仇恨言论解析,并在结构化提取基准测试中取得了最先进的结果。

原作者: Yifan Lyu, Dianqing Lin, Xinran Li, Jiaqi Qiao, Xiujuan Xu

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Yifan Lyu, Dianqing Lin, Xinran Li, Jiaqi Qiao, Xiujuan Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

互联网是一个广阔而嘈杂的人类表达市场,在这里,一句话对一个人来说可能是一个无伤大雅的玩笑,对另一个人来说却可能是一种排斥性的武器。多年来,计算机一直试图监管这一空间,但它们往往显得笨拙,仅仅是在寻找简单的脏话,而不是理解这些词汇出现的复杂社会语境。它们难以区分朋友之间友好的戏谑与针对个人身份的真实攻击,尤其是在攻击隐藏在地方俚语、文化引用或微妙的刻板印象之后时。这就是仇恨言论检测的核心挑战:它不仅仅是寻找冒犯性的词汇,而是要理解谁是被攻击的对象,争论的内容是什么,以及为什么这会造成伤害。当语言不是英语,或者当仇恨是以只有特定文化人群才能识别的方式进行编码时,这种难度会进一步增加。

一组研究人员提出了一种解决这一问题的新方法,不再依赖于一个试图做出快速判断的单一计算机程序。相反,他们构建了一个模仿人类专家小组的系统,其中不同的“智能体”(agents)从不同的角度观察同一段文本,然后在得出最终结论之前进行讨论。他们的工作在中文和英文文本上都进行了测试,结果表明,将长篇帖子拆分为较小的部分,并让多种视角进行辩论,可以更准确地理解正在发生的情况。该系统不仅仅是在猜测;它迫使计算机解释其推理过程、检查其证据,并在对一段文本贴上仇恨标签之前解决分歧。

由 Yifan Lyu 及其同事领导的研究人员引入了一个名为 SPAR-Hate 的框架。这个名字代表了一个结构化的过程,该过程始于将长文档切割成较小的、易于处理的句子或从句。这一点至关重要,因为一篇帖子可能会以三种不同的方式攻击三个不同的群体,而试图一次性阅读全文的计算机往往会感到困惑,混淆被攻击的对象与所说内容。通过将文本拆分为微小的单元,系统可以专注于一个特定的主张。一旦隔离出一小段文本,系统不会要求单个人工智能来决定它是否属于仇恨言论。相反,它会要求三个不同的虚拟智能体来阅读它,每个智能体都扮演特定的角色。

第一个智能体是“受害者”(Victim)。这一视角旨在对伤害、排斥和被针对的感觉保持高度敏感。它寻找微侵略、刻板印象以及让一个群体感到不安全或非人化的语言。第二个智能体是“版主”(Moderator),它充当社交媒体平台的规则手册。该智能体寻找明确违反安全政策的行为,如露骨的诋毁、暴力威胁或直接骚扰,同时忽略那些未跨越虐待界限的主观分歧。第三个智能体是“文化旁观者”(Cultural Bystander),即局部语境的专家。该智能体经过训练,能够识别编码语言、谐音梗以及在外部人士看来看似无害但在特定社区内具有深度冒犯性的地区俚语。在中文版本的系统中,该智能体甚至配备了一个专门的本地仇恨词汇表,以帮助其发现隐藏的侮辱。

在三个智能体阅读完同一小段文本后,它们经常会出现分歧。一个可能认为这是无害的,而另一个则看到了明显的攻击。这正是该系统最重要的创新所在:一个“审计员”(Auditor)。第四个智能体并不只是简单地计票。相反,它扮演着法官的角色,审视由三个智能体提供的证据。它会检查它们的说法是否基于实际文本,是否符合规则,以及是否在文化语境中合乎逻辑。如果“版主”漏掉了“旁观者”捕捉到的微妙文化侮辱,审计员可以覆盖版主的观点。如果“受害者”对中性陈述过于敏感,审计员可以进行纠正。系统强制要求智能体提供具体的文本引用来支持其主张,从而确保最终决定是基于证据而非模糊的感觉。

研究人员在两个主要的基准测试(一个针对英文,一个针对中文)上测试了这种方法,这些是用于衡量计算机理解仇恨言论能力的标准数据集。对于英文基准,由于公开数据集仅提供测试集,研究人员确定性地对其进行了重新洗牌和划分,以创建用于本研究的训练和测试子集。他们将这个多智能体系统与其他方法进行了比较,包括要求单个人工智能完成任务的简单提示词以及其他复杂的推理框架。结果显示,SPAR-Hate 系统始终优于其他方法,尤其是在处理最困难的任务时。它在正确识别攻击的具体目标、所使用的论据的具体词汇以及伤害的正确标签方面表现得更好。这种改进在评估非常严格时最为明显,即要求计算机同时准确识别目标、论据和标签。这表明该系统不仅是在更频繁地做出正确猜测,而且实际上更好地理解了仇恨言论的结构。

一个非常显著的发现是,即使没有经过专门针对该数据的训练,该系统依然表现良好。研究人员使用了一个并未针对此特定任务进行微调的大型语言模型,而是依靠其多智能体框架的结构和编写的提示词质量。这具有重要意义,因为它表明,解决问题的方法——即通过拆解问题并使用多样化的视角——比拥有更大或更专门的模型更为重要。该系统还显示出它可以被“蒸馏”到更小、更快的模型中。通过教导一个较小的计算机去模仿这个大型团队的逐步推理过程,研究人员创造了一个准确度几乎相当但效率更高的版本,证明了该系统的逻辑可以转移到更简单的技术上。

研究还强调了当前技术的局限性。即使使用了这种先进的框架,系统有时仍会在论据的边界处理上遇到困难,偶尔会将过多的文本包含在“攻击”的定义中。然而,研究人员发现,该系统在处理那些会让其他模型出错的文化细微差别方面表现得尤为出色。例如,在处理中文文本时,系统通过利用其“文化旁观者”智能体的专门知识,成功识别了谐音诋毁——即那些听起来像无害词汇但写法不同的侮辱性词汇。在英文方面,它更擅长区分社区内部使用的“回收俚语”(reclaimed slang)与外部人士将其作为武器使用的同类词汇。

这项工作并不声称已经完全解决了仇恨言论检测的问题。研究人员承认,他们的系统目前仅限于中文和英文,并且尚未针对每种可能的语言或文化环境进行测试。他们还指出,任何旨在标记有害内容的系统都存在被误用于审查或监视的风险。论文强调,虽然他们的方法使决策过程更加透明和可追溯,但现实世界的部署仍需要人工监督、申诉机制以及持续的监控,以确保其不会不公平地针对特定群体。

最终,这篇论文展示了我们如何看待教授计算机理解人类冲突的方式的转变。研究人员建议,与其试图构建一个无所不知的单一完美算法,不如采用一种协作式的方法,即对不同的专业视角进行权衡和平衡,这种方法更为有效。通过模拟人类式的辩论和仲裁过程,该系统能够以以往方法所缺乏的精确度,应对仇恨言论这种混乱、主观且依赖于文化语境的特性。研究结果表明,内容审核的未来可能不在于更大的模型,而在于如何以更聪明、更有结构化的方式来使用我们现有的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →