← 최신 논문
🔬 physics

TeraGram: A Structured Longitudinal Dataset of the Telegram Messenger

본 논문은 2015 년부터 2025 년까지의 59 억 개 이상의 공개 텔레그램 메시지로 구성된 대규모 종단 데이터셋인 TeraGram 을 소개하며, 이는 다양한 언어와 커뮤니티에 걸쳐 있는 참여 패턴, 네트워크 진화, 그리고 커뮤니티 형성을 연구하기 위한 고유하고 알고리즘이 없는 자원으로서 기능한다.

원저자: Anastasia Golovin, Sebastian B. Mohr, Arne I. Gottwald, Ulrik Hvid, Srushhti Trivedi, Joao Pinheiro Neto, Andreas C. Schneider, Viola Priesemann

게시일 2026-05-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Anastasia Golovin, Sebastian B. Mohr, Arne I. Gottwald, Ulrik Hvid, Srushhti Trivedi, Joao Pinheiro Neto, Andreas C. Schneider, Viola Priesemann

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 거대하고 시끄러운 도시라고 상상해 보세요. 이 도시의 대부분의 주요 광장 (페이스북이나 트위터/X 와 같은) 은 보이지 않는 초지능의 문지기가 운영합니다. 이 문지기들은 비밀 규칙에 따라 어떤 연설을 듣고, 어떤 광고를 보며, 어떤 대화가 증폭될지 결정합니다. 이 규칙들은 모두 당신이 화면에 매달려 있도록 고안된 것입니다.

TeraGram은 완전히 다른 종류의 도시 광장인 텔레그램에 대한 거대한 새로운 지도입니다.

이 논문이 무엇에 관한 것인지 일상적인 비유를 사용하여 간단히 설명해 보겠습니다.

1. "문지기 없는" 도시

다른 소셜 미디어 플랫폼과 달리 텔레그램은 당신이 무엇을 볼지 결정하는 문지기가 없는 광장 같습니다. 누군가 메시지를 게시하면 실시간 뉴스 티커처럼 단순한 연대기 순서로 나타납니다. 특정 콘텐츠를 상단으로 밀어 올리는 숨겨진 알고리즘은 없습니다.

연구자들은 이 독특한 환경을 연구하기 위해 TeraGram을 구축했습니다. 그들은 아무도 대화를 비밀리에 조작하지 않을 때 사람들이 어떻게 이야기하고, 공유하며, 공동체를 형성하는지 보고 싶어 했습니다.

2. 59 억 개의 메시지가 담긴 시간 캡슐

이 팀은 단순히 스냅샷을 찍은 것이 아니라 시간 기계를 구축했습니다.

  • 규모: 그들은 59 억 개의 메시지를 수집했습니다. 이를 인쇄한다면 작은 나라 크기의 도서관을 채울 것입니다.
  • 시간: 데이터는 2015 년까지 거슬러 올라가 2025 년까지 이어집니다. 이는 10 년간의 공개 대화 일지입니다.
  • 범위: 그들은 한 가지 주제만 보지 않았습니다. 712,000 개의 서로 다른 채널과 그룹에서 데이터를 수집했습니다.

3. 수집 방법: "눈덩이" 방식

텔레그램은 연구자들에게 모든 것을 직접 다운로드할 수 있는 버튼을 제공하지 않기 때문에, 이 팀은 **"눈덩이 크롤링 (Snowball Crawling)"**이라는 교묘한 트릭을 사용했습니다.

  • 비유: 숲을 매핑하고 싶다고 상상해 보세요. 당신은 하나의 큰 나무 (인기 있는 채널) 로 시작합니다. 가지 (메시지) 를 살펴보고 다른 나무 (채널) 를 가리키는 곳을 확인합니다. 그런 다음 그 링크를 따라가 새로운 나무를 찾고 그들의 가지를 따릅니다.
  • 결과: 언덕을 굴러 내려가면서 점점 커지는 눈덩이처럼, 그들의 데이터 수집은 기하급수적으로 성장하여 결국 텔레그램 네트워크의 가장 영향력 있는 "허브"들을 포착했습니다.

4. 상자 안에는 무엇이 있을까?

이 데이터셋은 거대하고 조직화된 창고와 같습니다. 단순한 텍스트 더미가 아니라 컴퓨터가 쉽게 읽을 수 있도록 구조화되어 있습니다. 내부에는 다음을 찾을 수 있습니다.

  • 메시지: 사람들이 쓴 실제 단어들 (비밀 유지를 위해 전체 텍스트는 잠겨 있지만, 연구자들은 이를 볼 수 있도록 요청할 수 있습니다).
  • 반응: 게시물을 "좋아요"하거나 반응한 사람의 수.
  • 투표: 사람들이 투표한 수백만 개의 질문과 답변.
  • 연결: 누가 누구에게 메시지를 전달했는지, 정보가 어떻게 이동하는지에 대한 지도를 만드는 연결 관계.
  • 언어: 영어도 있지만, 이 지도는 텔레그램이 일일 도구로 가장 인기 있는 지역을 반영하여 **러시아어 (56%)**와 **페르시아어 (15%)**가 지배적입니다. 영어는 작지만 (6%) 절대적인 수치는 여전히 큽니다.

5. 그들이 무엇을 발견했나? ("분위기 점검")

연구자들은 이 다양한 언어 그룹의 "분위기"를 보기 위해 데이터를 빠르게 둘러보았습니다.

  • 러시아어 & 페르시아어: 이 그룹들은 정치뿐만 아니라 책, 패션, 예술, 음악, 일상생활 등 모든 것에 대해 이야기했습니다. 다채롭고 주류적인 광장 같은 분위기였습니다.
  • 영어: 이 그룹은 달랐습니다. 스포츠와 뉴스에 대해 이야기하기도 했지만, 음모론극단적 주제 (예: "기후 변화 사기"나 "반유대주의 서사"와 같은) 에 훨씬 더 집중되어 있었습니다.
  • "신뢰" 테스트: 그들이 영어 채팅에서 공유한 웹사이트를 확인했을 때, 링크의 60% 가 신뢰할 수 없거나 가짜 뉴스 출처로 연결된 것을 발견했습니다. 신뢰할 수 있는 출처가 훨씬 더 흔한 트위터와 비교해 보세요. 마치 영어 텔레그램 광장은 검증되지 않은 팜플렛에서 소문을 외치는 사람들로 가득 차 있는 반면, 러시아어/페르시아어 광장은 표준 뉴스スタンド와 같은 것과 같습니다.

6. 이것이 중요한 이유

이 데이터셋은 과학적 도구입니다. 비밀 알고리즘의 "소음" 없이 인간 행동을 연구할 수 있게 해줍니다.

  • 개인정보 보호 최우선: 사람들을 보호하기 위해 연구자들은 전화번호를 지우고 이름을 숨겼습니다. 공개 데이터만 유지했습니다.
  • 과학을 위해 개방됨: 그들은 다른 과학자들이 커뮤니티가 어떻게 형성되는지, 소문이 어떻게 퍼지는지, 그리고 알고리즘에 의해 유도되지 않을 때 사람들이 어떻게 행동하는지 연구할 수 있도록 데이터를 (Parquet 형식으로) 제공했습니다.

간단히 말해: TeraGram 은 알고리즘이 아닌 "시간"에 따라 운영되는 소셜 미디어 플랫폼에 대한 거대하고 10 년간 지속된 조직화된 기록입니다. 이는 과학자들에게 아무도 무언가를 팔려고 하거나 피드를 조작하지 않을 때 인간이 실제로 서로 어떻게 대화하는지에 대한 드물고 깨끗한 시선을 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →