← 最新论文
🤖 machine learning

BERTopic-Virality Prioritisation: A Scalable Framework for Thematic and Comparative Analysis of COVID-19 and Monkeypox Misinformation on Twitter

本文介绍了 BERTopic-VP,这是一个可扩展的框架,它将上下文嵌入聚类与病毒式传播优先层以及混合误导信息检测器相结合,旨在实现对不同大流行期间高影响力健康误导信息叙事的早期识别和对比分析。

原作者: Mkululi Sikosana, Sean Maudsley-Barton, Oluwaseun Ajao

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Mkululi Sikosana, Sean Maudsley-Barton, Oluwaseun Ajao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

当一种新疾病出现时,世界面临着两场同时发生的危机:病毒本身,以及随之而来的虚假信息洪流。这第二场危机通常被称为“信息疫情”(infodemic),其危险程度可能不亚于生物层面的危机。在像 Twitter 这样信息短小且传播极快的社交媒体平台上,关于疗法、起源和安全措施的虚假故事,其传播速度往往比官方卫生指南更快。传统的追踪方法往往会失效,因为它们依赖于统计特定词汇出现的频率。在社交媒体这种充满俚语、标签(hashtag)和表情符号的、混乱且快速变化的语言环境中,简单的词频统计会失效。它们无法捕捉到帖子背后的深层含义,要么将无关的想法归为一类,要么无法在新的危险谣言大规模传播前及时发现它们。

为了解决这个问题,曼彻斯特都会大学(Manchester Metropolitan University)的研究人员开发了一种新的“倾听”数字噪音的方法。他们创建了一个系统,该系统不仅能计数,还能理解词汇背后的含义,同时还会关注一个故事传播的速度。他们的目标是构建一个工具,帮助公共卫生官员及早发现最具危险性的谎言,即使这些谎言才刚刚开始流传。通过将对语言的深度理解与衡量帖子分享量的指标相结合,他们创建了一个框架,可以从成批的推文(tweets)中筛选出对公共卫生构成最大风险的具体叙事。

研究人员将这个名为 BERTopic-VP 的新系统应用于来自两次重大健康危机的真实数据:由新型冠状病毒引起的全球大流行,以及 2022 年的猴痘疫情。他们向系统输入了与这些事件相关的成批推文,处理的规模从 10,000 到 100,000 条不等。该系统并非寻找特定的关键词,而是首先根据其实际含义将推文进行聚类。它利用先进的语言模型来理解:即便两条帖子表达的内容不同,它们仍可能在讨论同一个核心观点,例如对政府的不信任或对疫苗的恐惧。一旦故事被分组,系统会加入第二层分析:观察每个故事获得的参与度。它统计了每个组内帖子获得的点赞、分享或回复数量。这使得系统能够对故事进行排名,突出显示那些不仅受欢迎、而且正在积极传播的故事。

结果揭示了这两次疫情中虚假信息行为的显著差异。在冠状病毒大流行期间,虚假故事呈现出高度多样化且复杂的特征。它们涵盖了广泛的主题,从关于病毒起源的阴谋论到关于口罩有效性和封锁政策的辩论。这些帖子的语言通常很密集且难以阅读,通过模仿专家的语气来让自己显得更具可信度。相比之下,围绕猴痘疫情的虚假信息则更加集中。虚假叙事高度聚焦于几个特定主题,例如疫苗分配的失败以及对卫生部门的深度不信任。这些故事在语言上更简单、更易读,并且带有更强烈的感情色彩,尤其是恐惧和愤怒。

研究发现,该系统能够有效地完成任务。它成功识别出了具有高病毒式传播潜力的虚假信息簇,并将传播最快的排名前 1% 的故事标记出来供人工审核。在猴痘数据中,由于研究人员可以获取实际的分享数据,系统生成了具有语义可解释性的主题,并基于观察到的参与度识别出了最活跃的群体。对于缺乏分享数据的冠状病毒数据,系统使用了一种巧妙的变通方法:它从猴痘数据中学习了哪些语言和心理特征通常会导致高分享量,然后将这些知识应用于预测哪些冠状病毒故事可能具有传播性。这使得系统即使在没有直接访问分享计数的情况下,也能优先处理具有风险的叙事。

至关重要的是,研究人员表明,一个故事的传播能力并不总是与其真实性或虚假性挂钩。该系统发现了许多具有高度病毒式传播能力的真实信息组,例如新闻更新或官方卫生建议。这就是为什么该系统设计为两个步骤:首先,找到传播最快的故事;其次,使用独立的检查来确定这些故事是否真实。这种结合使得卫生官员能够将有限的时间集中在那些传播势头最猛的特定谎言上,而不是试图去拆穿每一个虚假说法,或者忽略那些恰好是真实的快速传播信息。

研究还强调,故事的情感基调是其传播的强大驱动力。最具病毒式传播效应的虚假信息通常是用简单的语言编写的,易于快速理解,并配以恐惧和愤怒等强烈情绪。这表明,那些易于消化并能引发人们强烈情绪的谎言是最容易被分享的。通过识别这些模式,这个新框架为公共卫生团队监测数字景观提供了一种实用的方式。它充当了一个预警系统,能够浮现出那些需要立即关注的高风险特定叙事,以免造成广泛的伤害。这项工作证明,通过理解词汇的含义及其传播机制,我们可以更好地保护社区免受健康紧急情况期间虚假信息的威胁。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →