TeraGram: A Structured Longitudinal Dataset of the Telegram Messenger
本論文は、2015 年から 2025 年までの 59 億件を超える公開 Telegram メッセージを含む大規模な縦断データセット「TeraGram」を紹介するものであり、これは多様な言語やコミュニティにおけるエンゲージメントパターン、ネットワークの進化、およびコミュニティ形成を研究するための、ユニークかつアルゴリズムに依存しないリソースとして機能する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
インターネットを巨大で騒がしい都市だと想像してみてください。この都市の主要な広場のほとんど(Facebook や Twitter/X など)は、目に見えない超賢い警備員によって運営されています。これらの警備員は、秘密のルールに基づいて、あなたが聞くスピーチ、見る広告、そして増幅される会話を決定します。その秘密のルールは、あなたを画面に釘付けにしておくように設計されています。
TeraGramは、異なる種類の都市広場であるTelegramの、巨大で新しい地図です。
この論文が何についてのものであるかを、日常的な比喩を使って簡単に解説します。
1. 「警備員不在」の都市
他のソーシャルメディアプラットフォームとは異なり、Telegram はあなたが何を見るかを決める警備員がいない広場のようなものです。誰かがメッセージを投稿すれば、それは単純な時系列のライン(リアルタイムのニューステロップのようなもの)に表示されます。特定のコンテンツをトップに押し上げる隠れたアルゴリズムはありません。
研究者たちは、このユニークな環境を研究するためにTeraGramを構築しました。彼らは、誰かが会話を秘密裡に操作していない状態で、人々がどのように話し合い、共有し、コミュニティを形成するかを知りたかったのです。
2. 59 億件のメッセージのタイムカプセル
チームは単なるスナップショットを撮っただけではなく、タイムマシンを構築しました。
- 規模: 彼らは59 億件のメッセージを収集しました。これらを印刷すれば、小さな国ほどの大きさの図書館を埋め尽くすでしょう。
- 時間: データは2015 年にさかのぼり、2025 年まで続いています。これは 10 年間にわたる公開会話の日記です。
- 範囲: 彼らは一つのトピックだけを見たわけではありません。712,000 の異なるチャンネルとグループからデータを収集しました。
3. 収集方法:「スノーボール」法
Telegram は研究者にすべてのものを直接ダウンロードするボタンを提供していないため、チームは**「スノーボール・クローリング」**と呼ばれる巧妙なトリックを使用しました。
- 比喩: 森を地図化したいと想像してください。まず一本の大きな木(人気のあるチャンネル)から始めます。枝(メッセージ)を見て、それが他の木(チャンネル)を指している場所を確認します。そのリンクに従い、新しい木を見つけ、その枝に従います。
- 結果: 丘を転がりながら大きくなる雪だるまのように、彼らのデータ収集は指数関数的に成長し、最終的に Telegram ネットワークの最も影響力のある「ハブ」を捉えました。
4. 箱の中には何があるか?
データセットは、巨大で整理された倉庫のようです。単なるテキストの山ではなく、コンピュータが簡単に読み取れるように構造化されています。中には以下のようなものがあります。
- メッセージ: 人々が書いた実際の言葉(ただし、プライバシー保護のため全文はロックされていますが、研究者は閲覧を依頼できます)。
- リアクション: 投稿に「いいね」したり反応したりした人の数。
- アンケート: 人々が投票した数百万の質問と回答。
- 接続: 誰が誰にメッセージを転送したかを示す、情報の流れの地図。
- 言語: 英語も含まれていますが、この地図は**ロシア語(56%)とペルシャ語(15%)**が支配的であり、Telegram が日常ツールとして最も人気のある地域を反映しています。英語は規模が小さい(6%)ものの、絶対数としては依然として巨大です。
5. 彼らは何を見つけましたか?(「雰囲気チェック」)
研究者たちは、これらの異なる言語グループの「雰囲気」を把握するために、データを簡単に巡りました。
- ロシア語とペルシャ語: これらのグループは、政治だけでなく、本、ファッション、芸術、音楽、日常生活など、あらゆることについて話していました。多様で主流の広場のような雰囲気でした。
- 英語: このグループは異なっていました。スポーツやニュースについても話していましたが、陰謀論や過激なトピック(「気候変動の偽装」や「反ユダヤ主義的な物語」など)の集中度がはるかに高かったのです。
- 「信頼」テスト: 彼らは英語のチャットで共有されたウェブサイトを調べたところ、リンクの 60% が信頼性の低いまたは偽のニュースソースであることがわかりました。これを、信頼できるソースがはるかに一般的な Twitter と比較してください。まるで、英語の Telegram 広場には検証されていないパンフレットから噂を叫ぶ人々で溢れ、ロシア語/ペルシャ語の広場は標準的な新聞販売店のようであるかのようです。
6. なぜこれが重要なのか
このデータセットは科学的ツールです。秘密のアルゴリズムの「ノイズ」なしに人間の行動を研究することを研究者に可能にします。
- プライバシー最優先: 人々を保護するために、研究者は電話番号を削除し、名前を隠しました。公開データのみを保持しました。
- 科学のために開放: 彼らはデータを利用可能にしました(Parquet という形式で)。これにより、他の科学者がコミュニティの形成方法、噂の広がり方、アルゴリズムに促されない場合の人々の行動を研究できるようになります。
要約すると: TeraGram は、「アルゴリズム」ではなく「時間」に基づいて運営されるソーシャルメディアプラットフォームの、巨大で 10 年間にわたる組織化された記録です。それは、誰かが何かを売ろうとしているわけでも、フィードを操作しようとしているわけでもないときに、人間が実際に互いにどのように話しかけ合うかを、科学者たちに稀でクリーンな視点で提供します。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。