← 最新论文
🤖 machine learning

Predicting, Evaluating, and Explaining Top Misinformation Spreaders via Archetypal User Behavior

本文提出了一个用于预测、评估和解释顶级虚假信息传播者的框架,该框架通过对三种不同用户原型(放大者、超级传播者和协同账号)进行建模,证明了超级传播者特征在排名顶端占据主导地位,同时时间动态特性和可解释人工智能增强了预测准确性与可解释性,从而助力主动的内容审核。

原作者: Enrico Verdolotti, Luca Luceri, Silvia Giordano

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Enrico Verdolotti, Luca Luceri, Silvia Giordano

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在社交媒体上,信息的传播速度如同思想跳动般之快,但并非每个分享信息的人都扮演着相同的角色。有些人创造原创故事,而另一些人仅仅是将其传递下去,还有少数人通过协作来确保一条信息能被尽可能多的人看到。当虚假信息传播时,它很少是单个人的过错;相反,它是复杂行为网络的结果,其中不同类型的用户通过放大、协调并发布叙事来共同作用。了解这些人是谁以及他们如何运作至关重要,因为虚假故事会扭曲公众舆论、侵蚀对科学的信任,并造成现实世界的伤害。平台面临的挑战在于,当一条虚假故事被标记并删除时,它往往已经传播得太远,无法再被阻止。为了在虚假故事获得势头之前阻止其传播,研究人员需要一种方法,通过观察用户的实际行为,而非猜测其意图,来识别那些最有可能造成破坏的具体账号。

一个研究小组致力于解决这一问题,他们通过观察传播低可信度内容的用户的数字足迹来进行研究。他们专注于这些用户表现出的三种截然不同的行为模式,或称之为“原型”。第一类被称为“放大者”(amplifiers),他们极少创作自己的帖子,而是充当扩音器,不断转发他人制作的内容以提升其触达率。第二类被称为“超级传播者”(super-spreaders),他们是病毒式内容的原创创作者。他们撰写的帖子经常被转发数千次,扮演着点燃火种的角色。第三类由“协同账号”(coordinated accounts)组成,即一群用户同步行动,在同一时间推动同一条信息,从而营造出广泛公众共识的假象。研究人员意识到,这些角色并不总是独立的;单个用户可能在讲述一个故事时是超级传播者,而在讲述另一个故事时则是放大者,或者一个群体可能会通过协调行动来模仿单一的影响力声音。

为了测试他们预测谁会传播下一个误导性信息的准确程度,研究人员分析了疫情期间来自 Twitter 的两组大规模数据集。其中一个数据集包含意大利的对话,另一个则是包含多种语言的全球性帖子集合。他们首先根据帖子中所链接网站的可信度对内容进行标注,使用了一套将新闻域评分从零到一百的系统。随后,他们构建了不同的数学模型,根据三种行为原型对用户进行排名。一些模型统计了用户转发虚假故事的次数,另一些则观察了用户在故事发布后多早进行了分享,或者用户的活动与协同小组中其他人的匹配程度。他们还创建了一种新型的、具有时效性的经典影响力评分,该评分考虑了用户活动随天数和周数的变化情况,而非仅仅观察单一的时间切片。

结果显示,寻找最大麻烦源的最有效方法是寻找“超级传播者”。当研究人员根据用户生成他人会转发的原创内容的能力进行排名时,这些账号始终出现在列表的最顶端。这些人是导致病毒式传播初始爆发、使虚假叙事得以扎根的关键人物。然而,当研究人员查看列表下游的影响力用户时,情况变得更加复杂。在中间和较低的排名中,放大者和协同群体的行为变得更加显著。这表明,虽然少数超级传播者点燃了火焰,但放大者让火焰持续燃烧,而协同群体则在网络中扇动火焰。

为了更清晰地了解这些不同行为是如何协同工作的,团队训练了一个机器学习模型,将这三种原型整合进一个统一的系统中。随后,他们使用了一种能够解释模型决策过程的技术,从而能够观察哪些行为最为关键。他们发现,该模型高度依赖于用户转发低可信度内容的次数,这一特征与“放大者”相关。这令人感到意外,因为人们可能会预期原创病毒内容的创作者才是最重要的信号。相反,数据表明,转发这一行为是风险的一个强有力指标。该模型还证实,超级传播者(通过生成持续性的参与度来识别)至关重要,尤其是在排名最高的那些用户中。随着排名的下降,协同行为和转发频率的影响力逐渐增强,揭示了一个不同类型的参与者在同一个问题中扮演不同角色的分层生态系统。

研究还测试了在数据极少的情况下,这些方法的效果如何,模拟了平台在一条新故事出现后需要迅速做出决策的情景。他们发现,即使在信息有限的情况下,具有时效性的影响力评分依然保持稳定且准确,其表现优于那些未考虑用户活动时机的旧方法。然而,机器学习模型在处理极少量数据时表现挣扎,这表明虽然复杂的模型功能强大,但它们需要足够的历史记录来学习模式。研究人员得出结论,平台最好的方法可能是结合使用这些工具:利用简单且具备时间感知能力的评分来快速识别最具威胁的账号,并利用更详细的模型来理解维持误导信息传播的完整行为范围。通过关注这些可观察的行为模式而非试图猜测用户的意图,平台可以更早地进行干预,针对那些驱动最大伤害的特定账号采取行动,在虚假信息变得无法遏制之前进行处置。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →