← 最新论文
🔬 physics

TeraGram: A Structured Longitudinal Dataset of the Telegram Messenger

本文介绍了 TeraGram,一个包含 2015 年至 2025 年超过 59 亿条公开 Telegram 消息的大规模纵向数据集,该数据集作为一种独特的、无需算法的资源,用于研究跨多种语言和社区的参与模式、网络演变及社群形成。

原作者: Anastasia Golovin, Sebastian B. Mohr, Arne I. Gottwald, Ulrik Hvid, Srushhti Trivedi, Joao Pinheiro Neto, Andreas C. Schneider, Viola Priesemann

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Anastasia Golovin, Sebastian B. Mohr, Arne I. Gottwald, Ulrik Hvid, Srushhti Trivedi, Joao Pinheiro Neto, Andreas C. Schneider, Viola Priesemann

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象互联网是一座巨大而喧嚣的城市。这座城市里大多数主要广场(如 Facebook 或 Twitter/X)都由隐形且超级聪明的保安把守。这些保安决定你能听到哪些演讲、看到哪些广告,以及哪些对话会被放大,所有这一切都基于旨在让你紧盯屏幕的隐秘规则。

TeraGram 是一张描绘另一种城市广场——Telegram——的全新巨型地图。

以下是用日常类比对这篇论文内容的简明拆解:

1. “无保安”城市

与其他社交媒体平台不同,Telegram 就像一个没有保安决定你看到什么的城镇广场。如果有人发布消息,它只会以简单的、按时间顺序排列的方式出现(就像实时新闻滚动条)。没有隐藏算法将特定内容推至顶端。

研究人员构建了TeraGram来研究这一独特环境。他们想看看,当没有人暗中操纵对话时,人们如何交流、分享并形成社群。

2. 59 亿条消息的时间胶囊

团队不仅仅拍了一张快照;他们建造了一台时间机器

  • 规模:他们收集了59 亿条消息。如果将它们打印出来,足以填满一座相当于小国规模的图书馆。
  • 时间跨度:数据可追溯至2015 年,并延伸至2025 年。这是一份长达十年的公共对话日记。
  • 范围:他们不仅关注单一主题,而是收集了来自71.2 万个不同频道和群组的数据。

3. 他们如何收集数据:“雪球”法

由于 Telegram 没有为研究人员提供直接下载所有内容的按钮,团队使用了一种名为**“雪球爬取”**的巧妙技巧。

  • 类比:想象你想绘制一片森林的地图。你从一棵大树(一个热门频道)开始。你观察树枝(消息),看它们指向哪些其他树木(频道)。你跟随这些链接,发现新树木,并继续跟随它们的树枝。
  • 结果:就像滚下山坡的雪球越滚越大一样,他们的数据收集呈指数级增长,最终捕捉到了 Telegram 网络中最具影响力的“枢纽”。

4. 盒子里有什么?

该数据集就像一个巨大且有序的仓库。它不仅仅是一堆文本;其结构经过设计,便于计算机读取。在其中,你可以找到:

  • 消息:人们实际写下的文字(尽管出于隐私考虑,完整文本被锁定,但研究人员可申请查看)。
  • 反应:有多少人“点赞”或回应了某条帖子。
  • 投票:数百万条人们参与投票的问题和答案。
  • 连接:谁将消息转发给了谁,从而绘制出信息传播的地图。
  • 语言:虽然英语存在,但该地图主要由**俄语(56%)波斯语(15%)**主导,这反映了 Telegram 作为日常工具在哪些地区最为流行。英语占比较小(6%),但在绝对数量上依然庞大。

5. 他们发现了什么?(“氛围检查”)

研究人员对数据进行了快速巡览,以了解不同语言群体的“氛围”:

  • 俄语与波斯语:这些群体谈论的内容包罗万象:既有政治,也有书籍、时尚、艺术、音乐和日常生活。这感觉像是一个多元、主流的城镇广场。
  • 英语:这个群体则不同。虽然他们也谈论体育和新闻,但其中阴谋论极端主义话题(如“气候变化骗局”或“反犹太主义叙事”)的集中度要高得多。
  • “信任”测试:当他们检查英语聊天中人们分享的网站时,发现60% 的链接指向不可靠或虚假新闻来源。相比之下,在 Twitter 上,可靠来源要常见得多。这就像英语 Telegram 广场里挤满了人拿着未经证实的小册子高喊谣言,而俄语/波斯语广场则更像标准的报刊亭。

6. 为何这很重要

该数据集是一个科学工具。它使研究人员能够在没有秘密算法“噪音”干扰的情况下研究人类行为。

  • 隐私优先:为了保护人们,研究人员清除了电话号码并隐藏了姓名。他们仅保留了公开数据。
  • 向科学开放:他们使数据可用(格式为 Parquet),以便其他科学家利用它研究社群如何形成、谣言如何传播,以及当人们不再受到算法推波助澜时,人们的行为模式。

简而言之:TeraGram 是一份庞大、跨越十年、组织有序的社会媒体平台记录,该平台运行基于“时间”而非“算法”。它为科学家提供了一个罕见且清晰的视角,去观察当没有人试图向他们兜售商品或操纵其信息流时,人类实际上是如何相互交谈的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →