TeraGram: A Structured Longitudinal Dataset of the Telegram Messenger
Este artigo apresenta o TeraGram, um conjunto de dados longitudinal massivo que compreende mais de 5,9 bilhões de mensagens públicas do Telegram de 2015 a 2025, o qual serve como um recurso único, livre de algoritmos, para estudar padrões de engajamento, evolução de redes e formação de comunidades em diversas línguas e comunidades.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine a internet como uma cidade gigante e barulhenta. A maioria das praças principais dessa cidade (como Facebook ou Twitter/X) é administrada por seguranças invisíveis e superinteligentes. Esses seguranças decidem quais discursos você ouve, quais anúncios você vê e quais conversas são amplificadas, tudo baseado em regras secretas projetadas para mantê-lo grudado na tela.
TeraGram é um novo mapa massivo de um tipo diferente de praça: Telegram.
Aqui está uma explicação simples do que este artigo trata, usando analogias do cotidiano:
1. A Cidade "Sem Seguranças"
Ao contrário de outras plataformas de mídia social, o Telegram é como uma praça da cidade onde não há seguranças decidindo o que você vê. Se alguém publica uma mensagem, ela aparece em uma linha simples e cronológica (como um telejornal em tempo real). Não há algoritmos ocultos empurrando conteúdo específico para o topo.
Os pesquisadores construíram o TeraGram para estudar esse ambiente único. Eles queriam ver como as pessoas conversam, compartilham e formam comunidades quando ninguém está manipulando secretamente a conversa.
2. Uma Cápsula do Tempo de 5,9 Bilhões de Mensagens
A equipe não tirou apenas uma foto; eles construíram uma máquina do tempo.
- O Tamanho: Eles coletaram 5,9 bilhões de mensagens. Se impressas, elas preencheriam uma biblioteca do tamanho de um pequeno país.
- O Tempo: Os dados se estendem de 2015 até 2025. É um diário de uma década de conversas públicas.
- O Escopo: Eles não olharam apenas para um tópico. Coletaram dados de 712.000 canais e grupos diferentes.
3. Como Coletaram: O Método "Bola de Neve"
Como o Telegram não fornece aos pesquisadores um botão de download direto para tudo, a equipe usou um truque inteligente chamado "Rastreamento em Bola de Neve".
- A Analogia: Imagine que você quer mapear uma floresta. Você começa com uma árvore grande (um canal popular). Você olha para os galhos (mensagens) e vê para onde apontam outras árvores (canais). Você segue esses links, encontra novas árvores e segue seus galhos.
- O Resultado: Como uma bola de neve que cresce ao rolar ladeira abaixo, a coleta de dados deles cresceu exponencialmente, capturando eventualmente os "hubs" mais influentes da rede do Telegram.
4. O Que Há Dentro da Caixa?
O conjunto de dados é como um grande armazém organizado. Não é apenas uma pilha de texto; é estruturado para que computadores possam lê-lo facilmente. Dentro, você pode encontrar:
- As Mensagens: As palavras reais que as pessoas escreveram (embora o texto completo esteja trancado por privacidade, os pesquisadores podem solicitar vê-lo).
- As Reações: Quantas pessoas "curtiram" ou reagiram a uma postagem.
- As Enquetes: Milhões de perguntas e respostas nas quais as pessoas votaram.
- As Conexões: Quem encaminhou uma mensagem para quem, criando um mapa de como a informação viaja.
- Os Idiomas: Embora o inglês esteja presente, o mapa é dominado por Russo (56%) e Persa (15%), refletindo onde o Telegram é mais popular como ferramenta diária. O inglês é menor (6%), mas ainda enorme em números absolutos.
5. O Que Eles Encontraram? (O "Check de Vibração")
Os pesquisadores fizeram uma rápida visita ao conjunto de dados para ver qual era a "vibração" desses diferentes grupos linguísticos:
- Russo e Persa: Esses grupos falavam sobre uma mistura de tudo: política, mas também livros, moda, arte, música e vida cotidiana. Parecia uma praça da cidade diversificada e mainstream.
- Inglês: Este grupo foi diferente. Embora também falassem sobre esportes e notícias, eles tinham uma concentração muito maior de teorias da conspiração e tópicos extremistas (como "fraudes sobre mudanças climáticas" ou "narrativas antissemitas").
- O Teste de "Confiança": Quando verificaram os sites que as pessoas compartilhavam em chats em inglês, descobriram que 60% dos links eram para fontes de notícias não confiáveis ou falsas. Compare isso com o Twitter, onde fontes confiáveis são muito mais comuns. É como se a praça do Telegram em inglês estivesse cheia de pessoas gritando rumores de panfletos não verificados, enquanto as praças em Russo/Persa são mais como bancas de jornal padrão.
6. Por Que Isso Importa
Este conjunto de dados é uma ferramenta científica. Permite que os pesquisadores estudem o comportamento humano sem o "ruído" de algoritmos secretos.
- Privacidade em Primeiro Lugar: Para proteger as pessoas, os pesquisadores removeram números de telefone e ocultaram nomes. Eles mantiveram apenas dados públicos.
- Aberto para a Ciência: Eles disponibilizaram os dados (em um formato chamado Parquet) para que outros cientistas possam usá-los para estudar como as comunidades se formam, como os rumores se espalham e como as pessoas se comportam quando não estão sendo incentivadas por um algoritmo.
Em resumo: O TeraGram é um registro massivo, de uma década e organizado, de uma plataforma de mídia social que funciona baseada em "tempo" e não em "algoritmos". Oferece aos cientistas uma visão rara e limpa de como os humanos realmente conversam entre si quando ninguém está tentando vender algo ou manipular seu feed.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.