Leveraging LLMs for Context-Aware Implicit Textual and Multimodal Hate Speech Detection
本文证明,利用大语言模型生成辅助背景上下文,并通过嵌入拼接将其引入,可以显著提升文本及多模态场景下隐性仇恨言论的检测效果,其表现优于零上下文基准模型及现有的实体链接方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
互联网是一个庞大且嘈杂的人类表达市场,其中最危险的词汇往往是那些并不喧嚣的词汇。虽然计算机识别明显的侮辱性言辞或直接威胁相对容易,但另一种类型的毒性却隐藏在众目睽睽之下。这就是隐性仇恨言论:这种敌意依赖于讽刺、文化代码或对世界的共同理解来表达其观点。一个句子本身看起来可能无害,但如果通过特定事件、历史引用或社区内部梗的视角来看,它就会变成一种恶毒的攻击。多年来,研究人员一直试图教会计算机识别这些隐藏含义,但他们面临着一个根本性的问题:机器缺乏人类认为理所当然的背景知识。它们能读懂文字,却不知道文字背后的故事。
为了解决这个问题,阿姆斯特丹自由大学的一个研究小组决定给他们的计算机模型找一位“导师”。他们转向了大语言模型——即那些能够撰写论文或进行对话的强大人工智能系统——并要求它们做一件特定的事情。研究人员并没有让 AI 充当判断是否仇恨的法官,而是将其作为事实核查员和历史学家。对于系统分析的每一条社交媒体帖子,AI 都会被要求生成一段简短的背景上下文。如果帖子提到了一个模糊的政治团体或一个病毒式传播的梗,AI 就会解释他们是谁以及他们的立场,从而有效地填补了标准计算机程序会遗漏的世界知识空白。研究人员随后测试了将这种新信息输入检测系统的四种不同方式,探讨仅仅将事实粘贴在帖子旁边是否足够,还是说计算机需要分别处理帖子和事实才能理解真实的意图。
实验结果清晰且可衡量。当研究人员在包含数千条含有隐性仇恨之推文的数据集上测试其方法时,使用 AI 生成的背景上下文的系统表现明显优于仅依赖原始文本的模型。最成功的方法涉及一种特定的技术:计算机为原始帖子创建一个数字表示,并为生成的背景故事创建一个单独的表示,然后将这两个不同的信息块结合起来。这种方法使系统正确识别仇恨内容的能力比完全没有上下文的系统提高了高达三个百分点。当研究人员将同样的逻辑应用于另一种类型的内容——互联网迷因(memes)时,这种提升更为显著。迷因结合了图像和文本,通常依赖于视觉线索,而这些线索对机器来说就像代码化的语言对人类一样令人困惑。在一个关于厌女症迷因的数据集上,这种增强了上下文的系统将准确度提高了多达六个百分点。
然而,通往更好检测的道路并非没有陷阱。研究人员发现,仅仅向帖子中添加更多文字并不总是有效;事实上,有时这会让计算机感到困惑。当 AI 为一个已经明显具有仇恨性的帖子生成一段冗长且详细的解释时,额外的信息有时会稀释原始信息,导致系统错过仇恨内容。相反,当 AI 为一个无害的帖子生成背景故事时,它偶尔会臆造出与仇恨思想相关的联系,从而导致系统将无辜的内容错误地标记为危险。这是因为 AI 在试图提供帮助的过程中,有时会过度解读一个中性短语或对某个团体的警告,将其视为对仇恨的认可。研究表明,虽然提供背景知识是一个强大的工具,但必须谨慎处理。最有效的方法不是将帖子和上下文合并为一个文本块,而是在分析的最后阶段之前保持它们各自独立,从而允许计算机在不让其中一方淹没另一方的情况下,权衡原始信息与新信息。
这项工作还挑战了一个领域内的普遍假设:即最强大的人工智能应该是那个进行最终判决的 AI。研究人员测试了大型语言模型是否可以直接阅读帖子并决定其是否具有仇恨性,从而充当分类器本身。虽然 AI 在这方面做得相当出色,尤其是在处理视觉迷因时,但它的表现并未超越那个仅将 AI 用于生成背景事实的专门检测系统。这表明,目前的最佳方法是一种协作关系:将大语言模型作为一个动态图书馆来检索相关事实,然后使用一个更简单、更专注的系统根据这些事实做出最终决定。这种模块化方法使得系统既能学习数据集中仇恨言论的特定模式,又能接触到使隐性仇恨变得可理解的广博世界知识。
最终,这项研究证明了上下文不仅是仇恨言论检测的一个有用补充,它更是理解现代互联网微妙、编码化语言的必然要求。通过将背景信息的生成视为与分类行为相分离的步骤,研究人员创建了一个更准确、更稳健的系统。他们表明,捕捉隐藏仇恨的关键不仅在于阅读文字,还在于理解这些文字所描述的世界。虽然该系统并不完美,在分辨无害的讽刺与真正的恶意之间仍存在困难,但研究结果为未来指明了一个清晰的方向。随着人工智能的不断进化,生成并整合相关上下文的能力,可能会成为任何旨在保护在线空间免受最隐蔽的人类表达形式侵害的系统的标准配置。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。