← 最新论文
💬 NLP

SAFE-MEME: Structured Reasoning Framework for Robust Hate Speech Detection in Memes

本文介绍了 SAFE-MEME,这是一个包含问答式和层级式变体的结构化推理框架,并配合两个全新的细粒度多模态仇恨言论数据集(MHS 和 MHS-Con),旨在实现稳健的模因仇恨言论检测,其表现足以媲美闭源模型并优于现有的开源基准模型。

原作者: Palash Nandi, Shivam Sharma, Tanmoy Chakraborty

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Palash Nandi, Shivam Sharma, Tanmoy Chakraborty

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网就像一个巨大、混乱的数字城镇广场,每个人都在那里大声叫喊、窃窃私语,并在墙上涂鸦。在这个城镇里,“迷因”(meme)就像是一种由图片和文字说明组成的秘密握手。有时,它只是关于一只猫的有趣笑话;但有时,它是一个特洛伊木马:一张看起来无害的图片,配上看似平淡无奇的文字,组合在一起却携带了旨在伤害特定群体的隐藏毒性信息。这被称为“仇恨言论”,当它隐藏在迷因之中时,极难被捕捉,因为这种恨意并不在于文字本身,也不在于图片本身——而是在于两者之间那种狡猾的结合。

长期以来,试图监管这个城镇广场的计算机就像是那些只读文本或只看图片的保安。它们往往会错过那些“并非玩笑的玩笑”,或是伪装成赞美的侮辱。它们难以应对“隐性”仇恨,这种仇恨就像是只有了解该城镇秘密历史的人才能听懂的低语。研究人员一直提出的核心问题是:我们能否教会计算机不再仅仅停留在观察表面,而是像人类一样去思考迷因真正的含义?

这篇论文介绍了一组新的数字侦探团队:SAFE-MEME。SAFE-MEME 不仅仅是扫描一个迷因然后大喊“仇恨!”或“安全!”,它更像是一个拒绝仅凭表面现象下结论的好奇青少年。它使用了一种特殊的“结构化推理”技巧,类似于侦探在得出结论前通过一系列提问来破解谜题的过程。

研究人员为这些侦探建立了两个新的训练场。第一个被称为 MHS,是一个将迷因标记为“显性仇恨”(明显的侮辱)、“隐性仇恨”(隐晦、隐藏的侮辱)或“良性”(无害)的图书馆。第二个是 MHS-Con,这是一个旨在迷惑计算机的压力测试。它采用同一张图片,并为其配上三种不同的文字说明:一个是明显的仇恨,一个是隐晦的仇恨,另一个则是完全无害的。这个设置就像是给侦探展示一个人的照片,然后问:“根据你讲述的故事,这个人是英雄、恶棍,还是仅仅是一个邻居?”

论文测试了两个版本的 SAFE-MEME 侦探:

  1. SAFE-MEME-QA:这个版本玩的是“问答”游戏。当它看到一个迷因时,它不会直接猜测。它会问自己问题,比如“这是在针对谁?”以及“这是哪种类型的仇恨?”它会写下答案,在做出决定之前建立起逻辑链。
  2. SAFE-MEME-H:这个版本更像是一个先详细描述图片,然后将其归入层级分类中的图书管理员(它是仇恨性的吗?如果是,是显性的还是隐性的?)。

结果就像是一场惊喜派对。当这些侦探面对标准的迷因库(MHS)时,图书管理员风格的侦探(SAFE-MEME-H)成为了明星选手。它以显著的优势击败了最优秀的开源计算机模型,证明了采取循序渐进、层级化的方法在识别微妙、隐藏的仇恨方面非常有效。然而,当他们转向棘手的压力测试(MHS-Con)——即同一个图像必须针对三个截然不同的故事进行判断时——问答型的侦探(SAFE-MEME-QA)占据了上风。它的表现优于其他开源模型近 5%,并且比它的兄弟版本更好地处理了那些令人困惑的“混淆”案例。

有趣的是,论文发现那些最强大的“闭源”模型(来自大型科技公司的超智能、昂贵的 AI 系统)往往过于谨慎。由于害怕犯错,它们错过了许多隐晦、隐性的仇恨。另一方面,一个简单的纯文本模型(T5-large)在压力测试中表现得出奇地好,但这仅仅是因为该压力测试高度依赖于明显的词汇。然而,SAFE-MEME 侦探展示了它们能够真正理解语境,而不仅仅是识别单词。

研究人员还观察了这些侦探出错的地方。有时,AI 会被它在训练中接触较少的稀有群体所迷惑,或者会混淆不同的文化引用。这就像是一个精通某个社区、但在进入另一个社区时就会迷路的侦探。论文总结道,虽然 SAFE-MEME 在教计算机如何去“思考”而非仅仅是“观看”迷因方面迈出了巨大的一步,但它仍然带有其训练数据中的一些偏见。它还不是一个完美的解决方案,但与我们之前的手段相比,它是一种更聪明的观察数字城镇广场的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →