Let the Bullets Fly: Multimodal Fake News Detection with Temporal-Aligned Generative Danmaku
本文介绍了 Genda,这是一个通过模拟实时弹幕交互来克服延迟问题的时序生成框架,并利用由此产生的伪流构建了一种新颖的 DM-FEND 模型,从而在中文和英文基准测试上实现了最先进的多模态虚假新闻检测。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代数字景观中,新闻往往不再以静态文章的形式呈现,而是作为视频、声音和文本构成的快速流动流。这些在 TikTok 和 Bilibili 等平台上无处不在的短片,将复杂的叙事压缩进短短几秒钟内,为虚假信息在被事实核查之前的传播创造了肥沃的土壤。传统的识别假新闻方法通常依赖于分析视频或音频本身,寻找编辑或篡改的数字指纹。然而,精巧的伪造品可能看起来和听起来都完美无缺,让这些取证工具无迹可寻。另一种线索存在于观众混乱的实时讨论中。在许多亚洲视频平台上,观众不仅仅是在视频结束后留下评论;他们会发送“弹幕”(Danmaku),即随着视频时间轴在屏幕上飞过的弹幕。这些评论提供了一种独特的、逐秒记录人们对特定时刻反应的方式,创造了一个与正在讲述的故事同步移动的丰富的社会语境层。
研究人员面临的挑战在于,这种社交讨论的到来速度太慢,无法用于实时检测。当有足够多的人观看视频并发送弹幕以形成有意义的模式时,假新闻往往已经病毒式传播了。为了解决这个问题,扬州大学和奥本大学的研究团队开发了一种新方法,模拟这种人类反应过程。他们创建了一个系统,可以精确预测观众会在何时以及如何对一段视频做出反应,甚至在任何真人观看该视频之前。这个被称为 Genda 的系统就像是一个社交互动的“时光机”。它不会等待互联网追赶进度;相反,它会生成一个真实的模拟弹幕流,这些弹幕与视频的时间轴完美对齐,预测用户反应的强度和内容,仿佛此刻正有一群人在观看这段剪辑。
研究人员利用两个不同的部分构建了这个模拟器。首先是一个“触发器”组件,它通过分析视频来理解其内容、情感基调和叙事流。它会预测观众最可能感到惊讶、困惑或愤怒的时刻,并估算这些反应的强度。其次是一个“生成器”,它利用这些预测来撰写实际的评论。它创造了一系列多样化的人类化响应,从轻微的好奇到激烈的辩论,确保模拟的评论与视频在特定秒数内的具体视觉和音频线索相匹配。其结果是一个合成但高度准确的社会反馈流,镜像了真实人群的行为方式,填补了视频发布与实际用户数据积累之间的空白。
有了这个模拟的社交层,团队引入了一种名为 DM-FEND 的新型检测模型。该模型并不将生成的弹幕视为噪声,而是将其视为一种引导。它利用模拟的反应来帮助计算机更深入地理解视频、音频和文本。通过将视频的不同部分与预测的人类反应相对齐,该模型可以发现标准检测器可能会忽略的不一致之处。例如,如果一段视频展示了一个平静的场景,但模拟反应却预测会出现一阵困惑或怀疑的浪潮,系统就会将该时刻标记为可疑。该模型学会忽略无关细节,并将注意力集中在故事与观众可能反应不匹配的部分,从而有效地利用“群众的声音”来寻找真相。
在包括中英文示例在内的真实世界短视频数据集上进行测试时,这种新方法证明其有效性显著高于现有技术。该系统在一个主要数据集上达到了 87.01% 的准确率,在另一个数据集上达到了 83.43%,超越了之前的最先进模型。研究人员发现,成功的关键在于能够对人类反应的时机进行建模。通过模拟人们如何随时间与内容互动,该系统可以检测出那些逐渐展开的微妙谎言,而不仅仅是寻找静态错误。这项研究表明,通过弥合新闻速度与人类反应速度之间的差距,即使是在视频生命的最初阶段,也能够构建起抵御虚假信息的更强大的防御体系。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。