Self-Explaining Hate Speech Detection with Moral Rationales
本文介绍了监督道德理性注意力(Supervised Moral Rationale Attention, SMRA),这是一种新颖的自解释框架,通过基于道德基础理论(Moral Foundations Theory)将模型注意力与专家标注的道德理性进行对齐,以提高仇恨言论检测的鲁棒性和可解释性,并由新发布的巴西葡萄牙语 HateBRMoralXplain 数据集提供支持。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正走在一个巨大、嘈杂的数字城镇广场上,人们在那里大声叫喊、开玩笑、争论,有时还会说一些可怕的话。在计算机科学领域,特别是一个被称为“自然语言处理”(这只是一个让“教计算机理解人类语言”听起来更高级的说法)的领域中,科学家们正试图打造数字保镖。这些算法被称为“数字保镖”,旨在识别“仇恨言论”——即那些针对人们身份特征而发出的恶意、有害且危险的叫嚣。但棘手之处在于,计算机通常并不擅长理解某件事“为什么”是恶意的。它们就像是记住了“脏话表”的孩子,却分不清朋友间的玩笑式嘲讽与真正的威胁之间的区别。如果计算机只寻找特定的坏词,它可能会被讽刺、文化梗或伪装巧妙的仇恨所迷惑。这是一个大问题,因为如果数字保镖犯了错,它可能会让无辜的人噤声,或者让危险的仇恨从缝隙中溜走。为了解决这个问题,研究人员正试图教会计算机不仅要识别“什么”值得标记,还要理解“为什么要”标记它,他们使用了一个叫做“道德推理”的概念——基本上就是让计算机像人类一样去思考公平、伤害和忠诚。
这时,一支新的研究团队决定不再靠猜测,而是开始教计算机像道德哲学家一样思考。他们引入了一个聪明的新系统,叫做监督式道德理由注意力机制(SMRA)。把 SMRA 想象成一个数字侦探的培训计划。与其只是给侦探一份要寻找的“坏词”清单,训练员(人类专家)会向其展示特定的句子并说:“看这里!这一部分很坏,因为它伤害了别人的感情,”或者“这一部分很坏,因为它违反了公平原则。”计算机学会了去关注这些特定的“道德线索”,而不是仅仅扫描表层的关键词。为了使这种训练成为可能,该团队还创建了一个庞大的新示例库,名为 HateBRMoralXplain。这不仅仅是一份坏评论的列表;它是从巴西收集的 7,000 条真实 Instagram 评论,由专家进行了仔细标注,并解释了究竟违反了哪条道德规则以及原因。这就像是给了侦探一本充满真实案例的教科书,并在页边空白处写满了专家的手写笔记。
当他们对这个新侦探进行测试时,结果令人振奋。SMRA 系统不仅在识别仇恨言论方面变得更加出色,而且更擅长解释它为什么判定该言论为仇恨。在测试中,该系统提高了发现仇恨言论的准确性,更重要的是,提高了指出哪些词汇使评论变得有害的能力。论文指出,通过专注于这些深层的道德理由,计算机就不太容易被虚假关联所误导(例如,仅仅因为一个词经常出现在其他坏词附近就认为它是坏词),并且更有可能理解实际的语境。有趣的是,团队发现,虽然计算机在寻找“道德”理由方面做得更好,但它并不一定在所有方面都变得更“公平”,这表明教计算机具备道德感是一个复杂的旅程,而非一个神奇的开关。他们还尝试使用庞大且强大的 AI 模型(如大语言模型/LLM)来完成这项工作,但发现即使是这些超级智能的模型,除非给予非常具体的指令和正确的语境,否则仍难以理解道德上的细微差别。
研究人员还发现了关于“为什么”的一个迷人现象。当他们将这种以道德为核心的侦探与一个仅关注“仇恨”词汇的侦探进行比较时,发现前者在与人类判断保持一致方面表现得更好。然而,他们注意到,解释变得更加简洁——更短促有力——这虽然是好事,但有时也意味着计算机可能会错过一些微小的细节(即“全面性”略有下降)。论文认为,这种权衡是值得的,因为这些解释更忠实于模型的实际思考过程。最后,团队总结道,虽然他们的新方法并不是解决所有问题的完美方案,但它是向前迈出的重要一步。它表明,如果我们希望计算机成为优秀的数字公民,我们需要教会它们关注言语的道德分量,而不只是言语本身。论文以一个警示结束:这仍处于早期研究阶段,尽管结果令人鼓舞,但关于如何让这些系统在不同文化和语言中运作而不引入新的偏见,我们仍有很多需要学习的地方。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。