CLARA: Clip-Level Multimodal Alignment with VLM-Derived Rationales for Hateful Video Detection
本文提出了 CLARA,一种新颖的片段级多模态框架,通过将视频建模为具有自适应对齐、用于时间依赖性的对比学习以及由视觉语言模型(VLM)衍生的合理依据的细粒度序列,增强了仇恨视频检测能力,并在多个数据集上实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数十亿人的屏幕上,一种新型的对话正在发生。它发生在视频平台的快速滚动流中,在那里,一个笑话、一段新闻剪辑或一段个人视频博客(vlog)可以在瞬间从无害变为有害。与意义固定在文字中的书面帖子不同,视频承载着声音、动态图像和口语的复杂叠加。危险在于这些元素是如何相互作用的。一条仇恨信息可能并不通过单一的句子喊出来;相反,它可以通过一系列帧、语调的变化或仅在结合前文语境时才有意义的视觉线索,缓慢地积聚并显现。检测这类内容是互联网面临的一项巨大挑战,因为最危险的信号往往是短暂、隐蔽且依赖于其出现时的特定时刻。
多年来,计算机科学家一直试图教会机器识别这种伤害。早期的努力集中在文本上,寻找特定的愤怒词汇。后来,他们转向图像和迷因(memes),试图理解图片与说明文字是如何共同作用的。但视频提出了一个独特的问题。它们不仅仅是图像的集合或语音的转录;它们是一个随时间变化的流动时间轴,其中的意义会随时间而改变。如果计算机将整个视频视为一个单一的整体,它往往会错过那些仇恨真正发生的微小且关键的时刻。这就像试图通过只读第一句和最后一句来理解一个故事;中间至关重要的情节就会在总结中丢失。
来自埃塞克斯大学和埃克塞特大学的一个研究小组提出了一种解决这一问题的新方法。他们将他们的系统称为 CLARA。CLARA 并不将视频视为一个巨大的、不可改变的对象,而是将其分解为更小的、具有意义的片段。想象一下视频是一句长句;CLARA 不会一次性阅读全文,而是会在言语的每一个自然停顿处暂停,创建一系列与所说内容相匹配的短片。通过专注于这些微小的片段,该系统可以捕捉到仇恨思想被引入的瞬时时刻,即使该思想被埋藏在一分钟的中性内容之中。
研究人员发现,仇恨视频通常依赖于多种线索的结合。演讲者可能会在展示令人不安的图像时使用平静的声音,或者在使用中性短语时背景音乐变得具有攻击性。为了处理这种情况,CLARA 使用了一个灵活的系统,为每个短片决定哪些线索最为重要。有时文本是关键;有时则是声音或视觉场景。该系统不会为整个视频强加单一的规则。相反,它会进行调整,随着视频的推进,以不同的权重对待不同类型的信息。这使其能够观察到仇恨信息是如何演变的,而不仅仅是寻找静态模式。
为了确保系统理解大局,研究人员添加了第二层智能。他们使用了一个强大的人工智能工具,该工具经过训练可以描述并推理图像和文本,从而生成视频意图的高层级摘要。这个摘要充当了一个指南,帮助系统理解这些短片如何组合在一起形成一个更大、潜在有害的叙事。随后,系统将这些详细的片段级观察结果与高层级摘要相结合,从而构建出视频内容的完整图景。这种方法确保了系统不仅能看到孤立的时刻,还能理解正在讲述的论点或故事的流向。
该团队在来自世界各地不同社交媒体平台的三个不同仇恨视频集合上测试了这种新方法。结果非常明确:新系统始终优于现有的最佳方法。它能更好地正确识别仇恨视频,而不会误报无害内容。研究人员还进行了测试,以观察如果移除系统的某些部分会发生什么。当他们取消了将视频分解为短片的能力,或者当他们移除了高层级引导时,系统的性能都下降了。这证实了他们设计的每一个部分都是必要的。这种既能专注于微小、特定时刻,又能兼顾整体语境的能力,是成功的关键。
这项研究表明,检测有害内容的未来在于这种细致的、具备时间意识的分析。通过尊重人类体验视频的真实方式——一段接一段,一刻接一刻——机器终于可以学会观察仇恨言论那种微妙且不断演变的形式。研究人员并未声称已经永久解决了网络仇恨问题,但他们提供了一个显著更锐利的工具。他们的工作表明,要理解视频中的危险,你不能只看全貌;你必须观察故事如何展开,一次一个微小的片段。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。