← 最新论文
💬 NLP

Labels or Input? Rethinking Augmentation in Multimodal Hate Detection

本文提出了一种端到端的流水线,通过结合结构化提示、细粒度标签以及一种新颖的反事实数据增强框架,来增强紧凑型视觉-语言模型在多模态仇恨检测中的能力,从而在不依赖高成本大模型的情况下,在细微内容上实现鲁棒性能。

原作者: Sahajpreet Singh, Kokil Jaidka, Subhayan Mukerjee

发布于 2026-01-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Sahajpreet Singh, Kokil Jaidka, Subhayan Mukerjee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网是一个巨大的、混乱的数字广场。在这个广场上,人们分享着笑话、新闻和表情包。但有时,在一段有趣的图片和一句滑稽的配文背后,可能隐藏着恶意的侮辱或仇恨信息。这就像是“披着羊皮的狼”。

长期以来,计算机一直试图识别这些“仇恨表情包”,以维护这个广场的安全。但这是一项艰巨的任务,因为仇恨并不总是显而易见的;它通常是无害的图片与恶意笑话的结合体。

这篇论文就像是一群正在研究如何寻找最佳方法,教计算机识别这些隐藏的“狼”的侦探团队,而且他们不想为了这项工作去雇佣数百万名昂贵的专家。他们测试了两种主要的策略:改变给计算机的指令以及创建更好的练习测试

两种侦探策略

1. “说明书”升级版(提示词优化)

想象一下你正在教一个机器人识别坏笑话。

  • 旧方法: 你只是说:“这是仇恨性的吗?是或否。”
  • 新方法: 作者尝试给机器人一份更加详细的说明书。他们不再仅仅使用简单的“是/否”,而是要求机器人按照 0 到 9 的等级(类似于疼痛等级)来评定仇恨程度,并给出了具体的类别让机器人去观察,比如“这是性别歧视吗?”或者“这是种族歧视吗?”

他们的发现:

  • 如果任务很简单(只需回答“是/否”),那么简短、简单的指令效果最好。
  • 但如果任务很复杂(评定程度有多“坏”),那么详细、结构化的指令会让机器人变得更加聪明。
  • 令人惊喜的是: 对于那些规模最大、最聪明的机器人,提供这些详细的指令,其效果几乎等同于花费数月时间用新数据对其进行训练。这就像是意识到一个聪明的学生不需要重新学习整个学科,他们只需要一份更好的学习指南。

2. “伪造”练习测试(多模态增强)

团队面临的第二个问题是,机器人在学习的“教科书”(数据集)存在缺陷。许多用于训练的仇恨表情包只是把恶意的配文贴在了糟糕的图片上。机器人学会了将“恶意的词汇”与“仇恨”联系起来,即使图片本身是无害的。

为了解决这个问题,团队建立了一个制造“伪造”练习测试的工厂

  • 运作方式: 他们提取一个仇恨表情包(一张好的图片 + 一句恶意的配文),并使用人工智能将恶意的配文替换为一个友好的、中性的配文,同时保持图片完全不变。
  • 目标: 这教会了机器人:“嘿,这张图片其实没问题!它之所以具有仇恨性,仅仅是因为那些文字。如果改变文字,仇恨就消失了。”

他们的发现:

  • 通过将这些“中性化”的表情包加入训练数据,机器人变得更擅长理解“语境”。它们不再仅仅寻找坏词,而是开始观察整体画面。
  • 这对更聪明、规模更大的机器人尤其有效,帮助它们捕捉到那些通常会溜过缝隙的微妙且棘手的笑话。

结果:一个更好、更廉价的解决方案

论文得出结论,要解决这个问题,并不一定需要最昂贵、规模最大的超级计算机。

  1. 更好的指令很重要: 如果你给一台较小、较便宜的计算机提供一套非常出色且结构化的指令(提示词),它的表现几乎可以媲美庞大且昂贵的计算机。
  2. 更好的数据很重要: 如果你用“清理过”的例子(即保留图片但移除仇恨内容)来教计算机,它们会学得更公正,不太容易基于刻板印象做出错误判断。

核心结论

作者构建了一个系统,通过创建这些“清理过”的表情包和更好的指令,来帮助规模较小、更经济实惠的计算机在识别网络仇恨方面做得很好。他们证明了,通过改进我们与 AI 对话的方式以及我们教给它的内容,我们可以构建更安全的网络空间,而无需投入巨额资金购买大规模技术。

重要提示: 团队非常谨慎地表示,他们并没有创造新的仇恨内容。他们的“工厂”仅是将现有的坏表情包转化为好的、中性的表情包,以此作为教学工具。他们的目标是减少伤害,而不是制造更多伤害。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →