← 最新论文
💬 NLP

They Said Memes Were Harmless-We Found the Ones That Hurt: Decoding Jokes, Symbols, and Cultural References

本文介绍了 CROSS-ALIGN+,这是一个通过集成结构化知识以解决文化盲区、利用参数高效适配器以厘清讽刺与虐待的界限、并生成级联解释以提升可解释性,从而在多个基准测试中超越现有方法的旨在增强模因式社交虐待检测的三阶段框架。

原作者: Sahil Tripathi, Gautam Siddharth Kashyap, Mehwish Nasim, Jian Yang, Jiechao Gao, Usman Naseem

发布于 2026-02-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Sahil Tripathi, Gautam Siddharth Kashyap, Mehwish Nasim, Jian Yang, Jiechao Gao, Usman Naseem

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网是一个巨大的、嘈杂的城镇广场,人们在这里不断地分享笑话、图片和迷因(memes)。大多数时候,这些都是无害的娱乐。但有时,人们会将带有恶意、仇恨或危险的信息隐藏在这些笑话之中。这就像是一只披着羊皮的狼:在表面上看,它是一个无害的羊(一个有趣的迷因),但在其之下,它是一只狼(仇恨言论)。

问题在于,计算机非常不擅长识别这些“披着羊皮的狼”。它们能看到图片并阅读文字,但它们并不理解文化语境。它们不知道某个特定的青蛙角色实际上是某个仇恨团体的象征,或者关于厨房的一个笑话实际上是一个性别歧视的侮辱。

这篇论文介绍了一种名为 CROSS-ALIGN+ 的新系统来解决这个问题。你可以把它想象成给计算机配备了一个“文化侦探工具包”和一个“逻辑教练”,以帮助它识别真正的危险。

以下是该系统的工作原理,分为三个简单的步骤:

1. 文化侦探(第一阶段:知识落地)

问题: 普通的计算机是“文化盲”。它们看到一只青蛙,只会认为“那只是一只青蛙”。它们错过了隐藏的含义。
解决方案: 该系统将迷因与一个巨大的文化事实库(就像一本超级智能的百科全书)相连。

  • 类比: 想象你正在试图理解一个外语笑话。直到有人解释了背后的历史,你才能理解它。这一步正是做这件事:它查找迷因中的符号(如青蛙、卐字符或特定的卡通角色),并告诉计算机:“嘿,在我们的文化中,这只青蛙不仅仅是一种动物;它是特定政治团体使用的符号。”
  • 结果: 计算机现在看到了隐藏的含义,而不仅仅是表面的图像。

2. 逻辑教练(第二阶段:对比微调)

问题: 即便有了文化事实,计算机仍然会感到困惑。它很难区分无害的笑话(讽刺)和有害的攻击(虐待)。这就像是在尝试区分一位喜剧演员在调侃朋友,还是某人在进行真正的霸凌。
解决方案: 该系统使用一种特殊的训练方法,称为“对比学习”。它扮演着一名严厉的教练,通过成千上万个并排展示的例子来训练计算机:“这是一个笑话。这是仇恨。观察其中的细微差别。”

  • 类比: 这就像一位品酒师在学习区分优质佳酿和劣质酒。起初,它们尝起来一样。但在经过一位指出微妙差异的教练训练后,品酒师终于可以将它们区分开来。
  • 结果: 计算机变得更擅长在“有趣”与“伤人”之间划清界限,减少了混淆。

3. 翻译官(第三阶段:可解释性)

问题: 通常,当计算机说“这是坏的”时,它只会给出一个“是/否”的答案。它不会解释为什么。这就像一位老师在批改试卷时,只写了错,却没写任何评语。如果我们不知道它是如何决定的,我们就无法信任它。
解决方案: 系统被要求为它做出的每一个决定写一段简短、清晰的解释。

  • 类比: 系统不再只是说“你错了”,而是说:“我将其标记为有害,因为该图像使用了与仇恨团体相关的符号,且文本强化了这一信息。”
  • 结果: 人类可以查看计算机的推理过程并说:“啊,我明白了。它捕捉到了隐藏的符号。”这建立了信任,并使系统具有透明度。

结果:奏效了吗?

研究人员在八种不同类型的计算机大脑(称为大型视觉-语言模型)和五种不同类型的迷因数据集上测试了这个“文化侦探工具包”。

  • 得分: 在使用该系统之前,计算机经常感到困惑,正确率约为 58%。在加入这三个步骤后,正确率跃升至约 72%。这是一个巨大的进步(比之前提高了多达 17%)。
  • 速度: 尽管计算机正在做更多的工作(查找事实并编写解释),但它仍然非常快。它每秒可以检查约 8 个迷因,这足以满足社交媒体实时使用的需求。
  • 鲁棒性: 即便有人试图通过裁剪图像或稍微改变文字来欺骗系统,该系统依然能坚守阵地,因为它理解的是含义,而不仅仅是像素。

总结

论文认为,要阻止网络仇恨,我们不能只看图片和文字;我们必须理解背后的文化CROSS-ALIGN+ 是一个三步走的工具,它教会计算机:

  1. 查找符号的文化含义
  2. 练习区分笑话与攻击。
  3. 解释其推理过程,以便人类能够信任它们。

通过这样做,该系统成为了一个更好的互联网“守卫者”,能够识别出那些隐藏在羊皮下的狼。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →