← 最新论文
💬 NLP

Like Article, Like Audience: Enforcing Multimodal Correlations for Disinformation Detection

本文提出了一种多模态学习算法,该算法利用用户生成内容与共享新闻文章之间的相关性,通过利用用户画像来引导模型训练,同时在预测阶段避免对其进行依赖,从而增强虚假信息检测能力。

原作者: Liesbeth Allein, Marie-Francine Moens, Domenico Perrotta

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Liesbeth Allein, Marie-Francine Moens, Domenico Perrotta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网就像一个巨大、繁忙的城镇广场,每个人都在大声喧哗、分享和争论。在这个数字城镇中,“虚假信息”就像是一个制造谣言的工厂,通过编造荒诞、不实的故事来欺骗人们或制造麻烦。长期以来,试图阻止这些谣言的科学家们主要关注文字本身,就像侦探检查单张纸上的拼写错误或可疑措辞一样去研究新闻文章。但这篇文章指出,仅仅观察这张“纸”是不够的。它提出了一个新想法:要理解一个故事,你还需要理解喜爱这个故事的“人群”。其核心概念是“多模态学习”(multimodal learning),这只是一个高级说法,意思是我们应该同时观察不同类型的线索——比如新闻文章的文本,以及分享该文章的人所写的文本。研究人员提出的核心问题很简单:传播假新闻的人,在外观和声音上是否与传播真新闻的人有所不同?如果我们能教会计算机注意到这种联系,也许它就能更快地识破骗子。

本文的作者利用来自 Twitter 的数据,决定构建一个聪明的计算机程序,这个程序扮演着这样一位侦探的角色:它不仅阅读标题,还会检查拿着标题的人的身份证件。他们创建了一个系统,通过同时观察两样东西来进行学习:新闻文章本身,以及分享它的人所产生的“用户生成内容”(user-generated content)。用户生成内容就是普通人制作的内容,比如你的 Twitter 个人简介(资料描述)和你最近的推文。研究人员注意到,人们通常拥有连贯的网络人格;如果你在简介里写关于音乐的内容,你很可能会分享音乐类文章。他们想知道,一篇假新闻文章是否会吸引特定“类型”的人,以及这些人是否会在氛围上表现出相似性。

为了测试这一点,他们构建了一个学习算法,该算法使用三个特定的规则,或称之为“目标”(objectives),来训练计算机。首先,计算机必须学会分辨真实故事和虚假故事,就像一个普通的侦探一样。其次,这是聪明之处,计算机被强制要求学习文章的“氛围”应与分享它的人的“氛围”相匹配。如果一篇假文章被分享,计算机就会学习到,该文章与分享者在隐藏的数学空间中应该看起来是相似的。第三,计算机还学习到,分享同一篇文章的人彼此之间也应该看起来相似。这就像是在说:“如果一群陌生人都急于分享同一个奇怪的故事,那么他们肯定有共同点,所以让我们确保计算机能看到这种联系。”

研究人员在三个不同的计算机大脑(神经分类器)上测试了这个想法,使用的是来自事实核查网站和有关 COVID-19 新闻的真实数据。他们发现,当他们在训练过程中加入这些“社交线索”时,计算机识别假新闻的能力提高了。结果显示,当模型使用了这些用户线索时,它们能更清晰地将真实故事与虚假故事区分开来。事实上,当他们观察背后的数学原理时,他们看到在计算机的思维中,假故事和真故事被推向了更远的地方。

然而,论文中也有一些让结论保持客观的转折。研究人员尝试观察哪些人选是否重要。他们曾认为,第一批分享故事的人(“早期采用者”)会是最好的线索,但令人惊讶的是,无论是选择第一批分享者还是最后的一批分享者,结果并没有产生巨大的差异。他们还试图通过将文章随机交换给错误的群体来“戏弄”计算机。即使他们破坏了这些联系,计算机的表现仍然优于没有任何用户线索的情况,这表明即便具体的链接并不完美,庞大的额外数据量本身也会提供帮助。

一个有趣的发现来自于观察一个特定的例子:计算机仅在查看用户的个人简介时才能得到正确答案,但在查看他们的推文时却会出错。推文充满了噪音,讨论的话题过于广泛,而个人简介则更加聚焦。这表明虽然用户数据很有帮助,但它可能很杂乱,未来的工作可能需要过滤掉这些噪音。

最终,这篇论文表明,通过教会计算机尊重故事与受众之间的关系,我们可以建立更好的工具来对抗虚假信息。作者谨慎地指出,这种方法仅在计算机“学习”期间使用用户信息,而不是在它进行实际预测时。这意味着计算机不需要知道你是谁来判断一篇新闻文章;它只需要通过人们与故事之间的模式进行学习。虽然结果令人鼓舞且方法新颖,但作者也承认,随着时间的推移,用户资料会发生变化,假新闻的创造者也会消失,因此数据可能会过时。但就目前而言,这是一个充满趣味且强大的提醒:在打击假新闻的战斗中,有时识别谎言的最佳方式,就是观察是谁在讲述它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →