← 最新论文
🤖 machine learning

Predicting Post Virality with Temporal Cross-Attention over Trend Signals

本文介绍了 ViralityNet,这是一种新颖的架构,它通过时间交叉注意力机制将帖子内部特征与源自维基百科页面浏览量激增的外部时间信号相融合,从而提升对 Reddit 帖子病毒式传播的预测能力,并证明纳入现实世界的注意力动态显著优于仅基于文本的基线方法。

原作者: Sarvagya Somvanshi, Mohan Xu, Rakhi Chadalavada, Nathan Canera

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Sarvagya Somvanshi, Mohan Xu, Rakhi Chadalavada, Nathan Canera

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在猜测你朋友们的哪条社交媒体帖子会“病毒式传播”——获得成千上万的点赞和评论,而哪些帖子会被忽视。

大多数计算机程序试图通过仅查看帖子本身来解决这个问题。它们读取标题、统计字数、检查是否发布于周五,并查看用户有多少粉丝。这就像试图仅通过阅读歌词来预测一首歌是否会走红,却从未听过广播,也不知道人们当前正在传唱什么。

本文认为,这种方法遗漏了拼图中至关重要的一块:时机与语境。关于某个特定主题的帖子,在随机的周二可能显得乏味,但如果该主题突然成为世界上最大的新闻故事,那么该帖子的热度可能会爆发式增长。

以下是作者 Sarvagya Somvanshi 和 Mohan Xu 如何构建一个名为ViralityNet的新系统来解决这一问题,并简要解释其原理:

1. 互联网的“天气预报”

作者意识到,要预测病毒式传播,你需要知道那一刻的“公众情绪”。为此,他们使用维基百科页面浏览量作为互联网关注度的“天气预报”。

  • 类比:想象你是一名渔夫。你可以查看你的船(帖子)和你的渔具(文本),但要想钓到大鱼,你需要知道鱼此刻在哪里。
  • 方法:他们追踪了哪些维基百科文章每天出现突然且巨大的浏览量激增。如果“人工智能”突然比平时多出 10 万次浏览量,那就意味着整个世界突然对人工智能着了迷。ViralityNet 利用这些数据来判断一条 Reddit 帖子是否正在“乘风破浪”,顺应当前的公众兴趣。

2. “超级读者”(架构)

他们构建了一个名为ViralityNet的神经网络(一种人工智能)。把它想象成一个超级读者,它同时通过四个不同的视角来审视一条 Reddit 帖子:

  1. 标题:头条说了什么?
  2. 正文:实际的故事是什么?
  3. 结构:它是什么时候发布的?长度如何?
  4. 社区:它属于哪个“俱乐部”(子版块)?(例如,金融俱乐部中的帖子与游戏俱乐部中的帖子受到的评判标准不同)。

秘密武器
通常,这四个视角只是被混合在一起。但 ViralityNet 拥有一个特殊的“交叉注意力”功能。

  • 类比:想象你正在阅读一篇新闻文章。在阅读过程中,你不断瞥向窗外,看看街上发生了什么。如果你看到一场游行,你就会对文章中关于游行的部分给予额外的关注。
  • 工作原理:ViralityNet 读取 Reddit 帖子,然后立即瞥向过去一周内排名前 512 位的趋势性维基百科主题的“滑动窗口”。它会问:“这篇帖子是否与世界当前正在讨论的内容相符?”如果答案是肯定的,它就会提升该帖子将病毒式传播的预测概率。

3. 他们如何衡量成功

他们在三年时间内,针对来自 10 个不同社区(如 r/technology、r/politics 和 r/gaming)的近 80 万条 Reddit 帖子测试了该系统。

  • 目标:预测某条帖子是否能在其特定社区中获得前 10% 的互动量。
  • 结果
    • 旧方法(仅查看文本)尚可,但不够出色。
    • 新方法(ViralityNet),即包含“维基百科天气预报”的方法,表现始终更优
    • 它将准确率提高了虽小但意义重大的幅度。该系统学习到,如果人们当前正在维基百科上搜索某只股票,那么关于该股崩盘的帖子就更有可能病毒式传播。

4. 重要的细微差别

该论文强调了一些有趣的细节:

  • 语境至关重要:该系统在外部世界影响较大的社区(如 r/technology 或 r/stocks)中效果最佳。它在由内部笑话或特定文化驱动的社区(如 r/gaming)中表现稍差,因为在这些社区中,“全球天气”不如“本地氛围”重要。
  • 时间是关键:系统学习到互动规范每年都在变化。在 2021 年获得 1,000 个赞的帖子可能被视为“病毒式传播”,而在 2023 年,你可能需要 5,000 个赞。模型学会了对此进行调整。
  • 并非魔法:该系统并不完美。它有时会受骗。例如,如果帖子的标题听起来像是一个热门话题,但实际上是一个笑话或低质量内容,系统可能会高估其成功的可能性。相反,它有时会错过那些因纯粹幽默或愤怒而病毒式传播的帖子,这些与当前的新闻趋势毫无关系。

核心结论

主要结论很简单:内容不会在真空中病毒式传播。

要预测什么会像野火一样蔓延,你不能只盯着木头(帖子);你必须观察风(当前的公众注意力)。通过将帖子的文本与世界实际阅读和思考内容的实时数据相结合,作者表明,我们可以对网络上什么会变得流行做出显著更好的预测。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →