TeraGram: A Structured Longitudinal Dataset of the Telegram Messenger
本文介绍了 TeraGram,一个包含 2015 年至 2025 年超过 59 亿条公开 Telegram 消息的大规模纵向数据集,该数据集作为一种独特的、无需算法的资源,用于研究跨多种语言和社区的参与模式、网络演变及社群形成。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象互联网是一座巨大而喧嚣的城市。这座城市里大多数主要广场(如 Facebook 或 Twitter/X)都由隐形且超级聪明的保安把守。这些保安决定你能听到哪些演讲、看到哪些广告,以及哪些对话会被放大,所有这一切都基于旨在让你紧盯屏幕的隐秘规则。
TeraGram 是一张描绘另一种城市广场——Telegram——的全新巨型地图。
以下是用日常类比对这篇论文内容的简明拆解:
1. “无保安”城市
与其他社交媒体平台不同,Telegram 就像一个没有保安决定你看到什么的城镇广场。如果有人发布消息,它只会以简单的、按时间顺序排列的方式出现(就像实时新闻滚动条)。没有隐藏算法将特定内容推至顶端。
研究人员构建了TeraGram来研究这一独特环境。他们想看看,当没有人暗中操纵对话时,人们如何交流、分享并形成社群。
2. 59 亿条消息的时间胶囊
团队不仅仅拍了一张快照;他们建造了一台时间机器。
- 规模:他们收集了59 亿条消息。如果将它们打印出来,足以填满一座相当于小国规模的图书馆。
- 时间跨度:数据可追溯至2015 年,并延伸至2025 年。这是一份长达十年的公共对话日记。
- 范围:他们不仅关注单一主题,而是收集了来自71.2 万个不同频道和群组的数据。
3. 他们如何收集数据:“雪球”法
由于 Telegram 没有为研究人员提供直接下载所有内容的按钮,团队使用了一种名为**“雪球爬取”**的巧妙技巧。
- 类比:想象你想绘制一片森林的地图。你从一棵大树(一个热门频道)开始。你观察树枝(消息),看它们指向哪些其他树木(频道)。你跟随这些链接,发现新树木,并继续跟随它们的树枝。
- 结果:就像滚下山坡的雪球越滚越大一样,他们的数据收集呈指数级增长,最终捕捉到了 Telegram 网络中最具影响力的“枢纽”。
4. 盒子里有什么?
该数据集就像一个巨大且有序的仓库。它不仅仅是一堆文本;其结构经过设计,便于计算机读取。在其中,你可以找到:
- 消息:人们实际写下的文字(尽管出于隐私考虑,完整文本被锁定,但研究人员可申请查看)。
- 反应:有多少人“点赞”或回应了某条帖子。
- 投票:数百万条人们参与投票的问题和答案。
- 连接:谁将消息转发给了谁,从而绘制出信息传播的地图。
- 语言:虽然英语存在,但该地图主要由**俄语(56%)和波斯语(15%)**主导,这反映了 Telegram 作为日常工具在哪些地区最为流行。英语占比较小(6%),但在绝对数量上依然庞大。
5. 他们发现了什么?(“氛围检查”)
研究人员对数据进行了快速巡览,以了解不同语言群体的“氛围”:
- 俄语与波斯语:这些群体谈论的内容包罗万象:既有政治,也有书籍、时尚、艺术、音乐和日常生活。这感觉像是一个多元、主流的城镇广场。
- 英语:这个群体则不同。虽然他们也谈论体育和新闻,但其中阴谋论和极端主义话题(如“气候变化骗局”或“反犹太主义叙事”)的集中度要高得多。
- “信任”测试:当他们检查英语聊天中人们分享的网站时,发现60% 的链接指向不可靠或虚假新闻来源。相比之下,在 Twitter 上,可靠来源要常见得多。这就像英语 Telegram 广场里挤满了人拿着未经证实的小册子高喊谣言,而俄语/波斯语广场则更像标准的报刊亭。
6. 为何这很重要
该数据集是一个科学工具。它使研究人员能够在没有秘密算法“噪音”干扰的情况下研究人类行为。
- 隐私优先:为了保护人们,研究人员清除了电话号码并隐藏了姓名。他们仅保留了公开数据。
- 向科学开放:他们使数据可用(格式为 Parquet),以便其他科学家利用它研究社群如何形成、谣言如何传播,以及当人们不再受到算法推波助澜时,人们的行为模式。
简而言之:TeraGram 是一份庞大、跨越十年、组织有序的社会媒体平台记录,该平台运行基于“时间”而非“算法”。它为科学家提供了一个罕见且清晰的视角,去观察当没有人试图向他们兜售商品或操纵其信息流时,人类实际上是如何相互交谈的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。