TeraGram: A Structured Longitudinal Dataset of the Telegram Messenger
Este artículo presenta TeraGram, un conjunto de datos longitudinal masivo que comprende más de 5.900 millones de mensajes públicos de Telegram desde 2015 hasta 2025, el cual sirve como un recurso único y libre de algoritmos para estudiar patrones de participación, evolución de redes y formación de comunidades en diversos idiomas y comunidades.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina internet como una ciudad gigante y ruidosa. La mayoría de las plazas principales de esta ciudad (como Facebook o Twitter/X) están gestionadas por porteros invisibles y superinteligentes. Estos porteros deciden qué discursos escuchas, qué anuncios ves y qué conversaciones se amplifican, todo basado en reglas secretas diseñadas para mantenerte pegado a tu pantalla.
TeraGram es un nuevo mapa masivo de un tipo diferente de plaza: Telegram.
Aquí tienes un desglose sencillo de lo que trata este documento, utilizando analogías cotidianas:
1. La ciudad "sin porteros"
A diferencia de otras plataformas de redes sociales, Telegram es como una plaza donde no hay porteros que decidan qué ves. Si alguien publica un mensaje, aparece en una línea simple y cronológica (como un ticker de noticias en tiempo real). No hay algoritmos ocultos empujando contenido específico hacia la parte superior.
Los investigadores construyeron TeraGram para estudiar este entorno único. Querían ver cómo la gente habla, comparte y forma comunidades cuando nadie está manipulando secretamente la conversación.
2. Una cápsula del tiempo de 5.900 millones de mensajes
El equipo no solo tomó una instantánea; construyeron una máquina del tiempo.
- El tamaño: Recopilaron 5.900 millones de mensajes. Si los imprimieras, llenarían una biblioteca del tamaño de un país pequeño.
- El tiempo: Los datos se remontan a 2015 y llegan hasta 2025. Es un diario de una década de conversaciones públicas.
- El alcance: No solo miraron un tema. Recopilaron datos de 712.000 canales y grupos diferentes.
3. Cómo lo recopilaron: El método "bola de nieve"
Dado que Telegram no ofrece a los investigadores un botón de descarga directa para todo, el equipo utilizó un truco inteligente llamado "Rastreo en bola de nieve".
- La analogía: Imagina que quieres mapear un bosque. Comienzas con un árbol grande (un canal popular). Miras las ramas (mensajes) y ves a qué otros árboles (canales) apuntan. Sigues esos enlaces, encuentras nuevos árboles y sigues sus ramas.
- El resultado: Como una bola de nieve que crece al rodar cuesta abajo, su recopilación de datos creció exponencialmente, capturando finalmente los "hubs" más influyentes de la red de Telegram.
4. ¿Qué hay dentro de la caja?
El conjunto de datos es como un almacén gigante y organizado. No es solo un montón de texto; está estructurado para que las computadoras puedan leerlo fácilmente. Dentro puedes encontrar:
- Los mensajes: Las palabras reales que escribió la gente (aunque el texto completo está bloqueado por privacidad, los investigadores pueden solicitar verlo).
- Las reacciones: Cuántas personas "dieron me gusta" o reaccionaron a una publicación.
- Las encuestas: Millones de preguntas y respuestas sobre las que la gente votó.
- Las conexiones: Quién reenvió un mensaje a quién, creando un mapa de cómo viaja la información.
- Los idiomas: Aunque el inglés está presente, el mapa está dominado por el ruso (56%) y el farsi (15%), reflejando dónde Telegram es más popular como herramienta diaria. El inglés es más pequeño (6%) pero sigue siendo enorme en números absolutos.
5. ¿Qué encontraron? (La "prueba de ambiente")
Los investigadores hicieron un recorrido rápido por los datos para ver cuál era el "ambiente" de estos diferentes grupos lingüísticos:
- Ruso y farsi: Estos grupos hablaron de una mezcla de todo: política, pero también libros, moda, arte, música y la vida cotidiana. Se sentía como una plaza de ciudad diversa y convencional.
- Inglés: Este grupo fue diferente. Aunque también hablaron de deportes y noticias, tenían una concentración mucho mayor de teorías de conspiración y temas extremistas (como "estafas sobre el cambio climático" o "narrativas antisemitas").
- La prueba de "confianza": Cuando verificaron los sitios web que la gente compartía en los chats en inglés, descubrieron que el 60% de los enlaces eran a fuentes de noticias poco fiables o falsas. Compara eso con Twitter, donde las fuentes fiables son mucho más comunes. Es como si la plaza de Telegram en inglés estuviera llena de gente gritando rumores desde folletos no verificados, mientras que las plazas en ruso/farsi son más como quioscos de noticias estándar.
6. Por qué esto importa
Este conjunto de datos es una herramienta científica. Permite a los investigadores estudiar el comportamiento humano sin el "ruido" de algoritmos secretos.
- Privacidad primero: Para proteger a las personas, los investigadores eliminaron los números de teléfono y ocultaron los nombres. Solo conservaron datos públicos.
- Abierto para la ciencia: Pusieron los datos a disposición (en un formato llamado Parquet) para que otros científicos puedan usarlos para estudiar cómo se forman las comunidades, cómo se propagan los rumores y cómo se comporta la gente cuando no están siendo empujados por un algoritmo.
En resumen: TeraGram es un registro masivo, de una década y organizado de una plataforma de redes sociales que funciona basándose en el "tiempo" en lugar de en "algoritmos". Ofrece a los científicos una mirada limpia y rara sobre cómo los humanos realmente se hablan entre sí cuando nadie intenta venderles algo o manipular su feed.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.