← 最新论文
🤖 AI

EVL-MCoT: Enhanced Vision-Language Multi-CoT for Harmful Meme Detection

本文提出了 EVL-MCoT,这是一个增强型视觉-语言框架,通过利用多视角思维链推理和原型引导解码机制,旨在通过解决背景知识集成和细粒度视文对齐方面的局限性,来提升对有害模因的检测能力。

原作者: Hao Yang, Jin Wang, Xuejie Zhang

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Hao Yang, Jin Wang, Xuejie Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

网络隐藏的语言

想象一下,互联网是一个巨大的、混乱的游乐场,人们在这里不仅仅是说话,还会利用图片和文字的结合来开玩笑。这些被称为“模因”(memes,又称迷因)。有时,一个模因只是一个带有滑稽标题的可爱猫咪;但有时,一个模因是一个“特洛伊木马”:它看起来像是一个无害的笑话,但实际上在内部隐藏着恶意、种族主义或仇恨的信息。这就是科学家们试图解决的棘手问题。要理解一个模因,你不能只看图片或只读文字;你必须理解它们是如何“协同工作”的。这就像试图通过只看魔术师的手或只听音乐来理解一个魔术,却从未将两者结合在一起观察一样。

长期以来,计算机尝试通过分别观察图片和文字来识别这些不良模因,就像两个在隔离状态下工作的不同侦探。但这往往会失败,因为它们会错过那些只有在结合两者时才会出现的微妙线索,比如讽刺或文化引用。最近,科学家开始使用“思维链”(Chain-of-Thought, CoT)推理。把这想象成要求计算机在给出答案之前“大声思考”,像学生展示数学解题步骤那样解释其步骤。然而,旧的方法就像是要求一名学生仅使用单一方法来解决问题。如果这个学生在第一步中犯了错,那么整个答案都是错误的,而且他们没有任何备选方案。本文介绍了一种新方法,通过使用多种视角来帮助计算机进行更仔细的思考,从而捕捉到那些其他方法会漏掉的隐蔽且有害的模因。

侦探小队:EVL-MCoT

研究人员郝阳、王瑾和张学洁(来自云南大学)提出了一种名为 EVL-MCoT(增强型视觉-语言多思维链)的新系统。你可以将这个系统想象成一个超级强大的侦探小队,它不依赖于单一的侦探来破案,而是派出整个团队从不同的角度对同一个模因进行调查。

以下是其运作原理:

1. “三思而后行”策略 (Multi-CoT)
在过去,计算机看一眼模因后就会尝试一次性猜测它是好是坏。如果感到困惑,它只会瞎猜。新的方法 EVL-MCoT 强制计算机为同一个模因生成多种不同的解释。想象一下,向三位不同的专家解释一个令人困惑的笑话:一位可能侧重于历史,另一位侧重于视觉符号,第三位则侧重于语气。该系统会为同一张图片创建一个“有害”的解释和一个“无害”的解释。然后,它会对这些多个路径进行比较。通过观察这些多个路径之间的差异,计算机就不太容易被讽刺或隐藏的偏见所欺骗。这就像在交卷前用第二双眼睛检查自己的作业一样。

2. “手电筒”解码器 (Prototype-Guided)
识别不良模因的最大问题之一是,计算机经常会错过图片中微小且重要的细节。它可能看到了整个人群,却忽略了角落里一个愤怒的表情。为了解决这个问题,研究人员添加了一个“原型引导解码器”。你可以把它想象成计算机用来扫描图像的特殊手电筒。它不再是一次性观察整张图片,而是通过手电筒高亮显示特定的“原型”或关键模式(例如特定的符号或某种表情),而这些模式是已知重要的。这有助于计算机放大那些通常会被忽略的精细细节,确保它不会错过那些将一张有趣的图片转变为仇恨内容的微小线索。

3. “语境”解码器 (Context-Guided)
即使计算机看到了细节,如果没有正确的语境,它可能也无法理解这些细节为什么重要。“语境引导解码器”充当了一个连接图片与文字的翻译官。它获取手电筒发现的视觉线索,并追问:“这张图片如何改变了这段文字的含义?”例如,如果文字说“回家吧”,这是无害的;但如果图片显示特定人群正在被追赶,意义就完全改变了。这个解码器迫使文本和图像进行深度对话,确保计算机理解的是完整的故事,而不仅仅是局部。

研究发现

团队在两个大型模因数据集上测试了他们的系统:Hateful Memes 数据集(包含超过 10,000 个示例)和 MultiOFF 数据集(包含 743 个示例)。他们将自己的系统与许多著名的模型进行了对比,包括一些使用巨大 AI 大脑(如 GPT-4 和 LLaVA)的模型。

结果非常令人振奋。在 Hateful Memes 数据集上,EVL-MCoT 在标准测试中达到了 75.88% 的准确率,在复杂的未见测试中达到了 75.57%。它的 AUROC(衡量区分好坏程度的指标)也分别达到了 79.25%79.40%。这些数字高于他们测试的几乎所有其他方法,包括一些非常先进的方法。

MultiOFF 数据集上,该系统达到了 70.0% 的准确率和 63.8 的 F1 分数,再次击败了其他模型。

研究人员还进行了实验,以观察如果移除其系统的部分组件会发生什么。当他们移除“Multi-CoT”(多思维路径)时,准确率显著下降。当他们移除“原型引导”或“语境引导”解码器时,性能也会下降。这表明他们的团队中的每一个部分对于获得最佳结果都是必要的。他们发现,使用更多的思维路径(具体来说,生成 3 个有害解释和 3 个无害解释)比使用仅一两个路径效果更好。

为什么这很重要

这篇论文表明,我们教计算机理解网络文化的方式需要改变。与其仅仅观察一张图片并进行猜测,或者使用单一的推理逻辑,我们需要能够自我辩论、自我检查并用细齿梳进行精细扫描的系统。通过使用这种“Multi-CoT”方法,EVL-MCoT 系统表明,计算机可以变得更擅长识别那些试图躲在笑脸背后的隐蔽且有害的信息。虽然该系统并不完美,但它代表了使互联网变得更安全的重要一步,因为它帮助机器理解了模因这种复杂且往往具有误导性的语言。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →