AHA-Memes: A Fine-Grained Multimodal Benchmark for Understanding Hate in Arabic Memes
本文介绍了 AHA-Memes,这是首个大规模、细粒度的阿拉伯语仇恨模因基准测试,包含 5,000 个人工标注的示例和 66,000 个银标(silver-labeled)模因,并对多种多模态模型进行了全面评估,旨在解决检测阿拉伯语在线内容中具有文化根源性的仇恨这一尚未得到充分研究的挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网就像一个巨大而混乱的数字城镇广场,人们在那里分享笑话、新闻和图片。在这个城镇里,“迷因”(meme)就像是一个数字版的内部梗:一张带有文字说明的图片,只有当你了解特定的文化、时事或隐藏的历史背景时,才能理解其中的含义。有时,这些笑话只是无害的乐趣,比如一张配有滑稽文字的搞笑猫咪照片。但除此之外,同样的图片和文字也可以成为一种武器,旨在针对特定群体——基于他们的宗教、种族、性别或出身——进行伤害、侮辱或传播仇恨。这就是“仇恨迷因”这个复杂的世界。
多年来,科学家们一直试图构建计算机程序(就像数字保安一样)来识别这些恶意的笑话,并在它们传播之前将其阻止。然而,大多数此类程序都是基于英文迷因进行训练的,这就像是在学习如何仅在美式道路上开车。当它们看到来自世界其他地方的迷因时,尤其是使用阿拉伯语的迷因时,往往会感到困惑,因为这些“笑话”高度依赖于当地的文化、方言和深层的历史背景。如果一台计算机不理解当地的俚语或特定的文化引用,它可能会完全漏掉一条仇恨迷因,或者更糟,把一个无害的笑话误判为危险。研究人员提出的核心问题是:我们如何教会计算机理解阿拉伯语迷因中仇恨的细微差别,因为其含义往往隐藏在图片与寥寥数语的结合之中?
本论文介绍了一个名为 AHA-MEMES 的新工具,旨在帮助解开这个谜团。你可以把它想象成一个庞大且经过精心组织的图书馆,其中包含了 5,000 个由人类专家阅读、分析并标注过的阿拉伯语迷因。研究人员不仅仅是在问“这是坏的吗?”,他们挖掘得更深,创建了一张关于仇恨是如何传递的详细地图。他们将攻击行为分类为特定的“策略”,例如嘲讽(取笑某人)、非人化(将人视为动物或物体)、煽动(敦促他人造成伤害)或谩骂(使用冒犯性的名称)。他们还对“好”的迷因进行了标注,区分了无害的幽默与讽刺。
为了建立这个图书馆,团队从 Facebook、Instagram 和 Twitter 等热门社交媒体平台收集了迷因。他们使用了一个巧妙的两步流程:首先,他们使用一种强大的人工智能,从 71,000 个迷因的大堆中筛选出那些可能具有仇恨性的迷因。然后,他们聘请了三位阿拉伯语母语使用者,通过极其细致的工作,人工审核并标注了 5,000 个此类迷因,以确保标签的准确性和文化敏感性。作为额外奖励,他们还发布了一个包含约 66,000 个由 AI 标注的“银质”数据集,这可以作为未来计算机模型的“训练健身房”,让它们进行练习,即便这些标签并非完美无缺。
随后,研究人员对这个新图书馆进行了测试。他们向各种计算机模型提出了挑战——有些模型仅阅读文本,有些仅观察图片,而有些则尝试同时处理两者——以观察哪种模型最能识别出仇恨。结果是发人深省的。他们发现,表现最好的模型是那些能够将图片与文本结合起来观察的模型,就像人类一样。有趣的是,文本(迷因上的文字)携带了大部分线索,而图片则提供了重要的上下文。然而,这项研究也强调了一个主要挑战:即使是最聪明的计算机,在识别最罕见且最微妙的仇恨类型时也显得力不从心,经常会漏掉它们,或者将它们与讽刺混淆。
论文指出,尽管我们已经取得了进展,但检测阿拉伯语迷因中的仇恨仍然是一个极难攻克的难题。计算机正在变得越来越聪明,但它们仍需要更多帮助,以理解那些让迷因在某种语境下是搞笑的、而在另一种语境下却是仇恨的深层文化细微差别。通过发布这个数据集以及创建它时所使用的指南,作者希望为其他研究人员提供一个坚实的基础,从而构建出更智能、更具文化意识的工具,让数字城镇广场对每个人都更加安全。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。