← 最新论文
💬 NLP

Counter with Evidence! A Multi-Agent Memory Efficient Reasoning Framework for Hate Category Informed Counterspeech Generation

本文介绍了 FIRE,这是一个通过将辱骂分为五种不同类型并将其映射到针对性策略来改进仇恨言论反驳生成的多智能体框架,该框架得到了新数据集 (FactualCS) 的支持,并证明了其与现有基准相比具有更高的事实准确性和更低的毒性。

原作者: Sujoy Nath, Aswini Kumar, Tanmoy Chakraborty

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Sujoy Nath, Aswini Kumar, Tanmoy Chakraborty

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

网络仇恨言论是一个普遍存在的问题,它毒化了数字对话,给弱势群体造成了真实的心理伤害。虽然社交媒体平台连接了世界,但它们也经常被武器化以传播虐待性言论。为了应对这一问题,研究人员长期以来一直在寻求一种生成“反驳言论”(counterspeech)的方法——即通过礼貌、基于事实的回应来中和敌意,而不是简单地删除违规内容。挑战在于,仇恨言论并非单一、统一的存在。它有许多种形式:有些帖子传播可证伪的谎言,有些依赖有害的刻板印象,还有些利用阴谋论或非人化的语言来剥夺人们的尊严。将所有这些都视为同一种问题会导致应对措施乏力。一个用于拆穿虚假统计数据的回复,无法解决残酷的侮辱问题,正如道德论证无法修正事实错误一样。该领域科学家面临的核心问题是,如何构建一个能够区分这些不同类型的虐待行为,并针对每种类型采取特定策略进行回应的系统。

印度理工学院德里分校的一个研究小组开发了一种新方法来解决这个问题,他们不再追求构建一个单一、全能的计算机程序。相反,他们创建了一个名为 FIRE 的系统,代表“事实驱动的多智能体推理框架”(Factuality Informed Multi-Agent REasoning Framework)。FIRE 并没有试图强迫一个大型计算机模型同时完成所有任务,而是将任务分解为更小的、专业化的步骤。它的运作方式就像一个小型专家团队在协同工作。首先,一个“仇恨言论分析师”会检查虐待性信息,以确定其仇恨的具体类型。它是刻板印象?阴谋论?还是谎言?一旦确定了类型,系统就会决定最佳的反击方式。如果仇恨言论包含虚假主张,系统会自动在互联网上搜索真实证据以证明其错误。最后,“反驳言论生成器”利用这些分析结果和收集到的证据,撰写出针对特定情况量身定制的回应。

为了教导这个系统如何运作,研究人员不得不创建一种新型的训练材料,因为现有的数据集不够详细。他们策划了一个名为 FactualCS 的集合,其中包含近 4,800 个仇恨言论与高质量反驳言论配对的示例。这个数据集的独特之处在于,每一个示例都经过了仔细的标注,标明了仇恨的具体类别、选择该回应背后的逻辑推理,以及支持反驳所使用的实际证据。这使得系统不仅能学习“说什么”,还能学习“为什么”特定的回应对于特定类型的虐待是有效的。研究人员使用非常小的计算机模型来训练他们的系统,每个模型的参数都少于 20 亿,这与当今人工智能中常用的庞大模型相比微不足道。尽管规模较小,但由于受到 FIRE 框架结构化步骤和丰富信息的引导,这些模型仍能进行复杂的推理。

当研究人员将他们的系统与其他领先方法进行对比测试时,结果令人瞩目。FIRE 系统在生成既符合事实又适用于特定仇恨言论类型的回应方面,显著优于现有工具。它将识别正确回应策略的准确度提高了约 11%,并将回复的事实正确性提高了约 12%。或许最重要的一点是,FIRE 生成的回应比其他系统更少毒性且更具尊重感。在人类专家对比输出结果的测试中,他们一致认为 FIRE 的回应优于那些规模更大、功能更强大的模型。该系统在实现这些成果的同时,使用的计算能力要少得多,这证明了聪明、有序的方法比单纯使用更大、更昂贵的计算机更有效。

研究人员还测试了移除系统中的各个部分会对结果产生什么影响,以观察每个部件的重要性。当他们撤掉那个用于搜索网络证据的工具时,系统的真实性表达能力大幅下降,这表明拥有获取真实事实的能力对于拆穿谎言至关重要。当他们移除有助于系统记忆过往案例的记忆功能时,生成的回应变得缺乏连贯性且更加重复。这证实了该项目的成功依赖于所有部分的结合:分析问题的能力、寻找证据的能力以及有效表达的能力。这项研究表明,通过将对抗仇恨这一复杂任务分解为更小、更易管理的步骤,并通过证据来支撑每一次回应,我们可以创造出更安全、更有效的现实应用工具。虽然该系统并不完美,在处理极具歧义的语言或文化细微差别方面仍面临挑战,但它代表了在创建自动化工具以智能、基于事实且以人为本的方式应对网络仇恨方面迈出的重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →