← 최신 논문
💬 NLP

Linked Multi-Model Data on Russian Domestic and Foreign Policy Speeches

본 논문은 권위주의적 정치 커뮤니케이션 연구에서 고급 사회과학 연구 및 대규모 언어 모델 응용을 촉진하기 위해 다국어 텍스트, 이미지, 전문가 검증 주제 주석을 결합한 포괄적이고 상호 연결된 러시아 정부 연설 멀티모달 데이터셋을 제시합니다.

원저자: Daria Blinova, Gayathri Emuru, Rakesh Emuru, Kushagradheer Shridheer Srivastava, Mina Rulis, Sunita Chandrasekaran, Benjamin E. Bagozzi

게시일 2026-05-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Daria Blinova, Gayathri Emuru, Rakesh Emuru, Kushagradheer Shridheer Srivastava, Mina Rulis, Sunita Chandrasekaran, Benjamin E. Bagozzi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

복잡하고 중대한 대화가 요새 안에서 일어나고 있다고 상상해 보세요. 수년 동안 러시아 정부를 연구하려는 연구자들은 이 대화를 단 하나, 잡음이 심한 라디오 채널 (텍스트만) 을 통해 듣거나, 몇 장의 흐릿한 스냅샷 (이미지만) 을 통해 바라봐야 했습니다. 종종 텍스트는 러시아어로만 제공되어 많은 사람이 이해하기 어려웠고, 사진들은 말해진 특정 단어들과 거의 연결되지 않았습니다.

이 논문은 게임의 규칙을 바꾸는 거대하고 고해상도의 '감시 시스템'을 소개합니다. 저자들은 1999 년부터 2025 년 말까지 러시아의 최고 지도자들 (대통령과 외무장관) 이 행한 35,000 건 이상의 연설을 담은 거대하고 조직화된 도서관을 구축했습니다.

다음은 그들이 어떻게 이 도서관을 구축했는지, 그리고 무엇이 이를 특별하게 만드는지에 대한 간단한 비유를 통해 설명한 내용입니다:

1. 쌍둥이 도서관 (텍스트와 번역)

이 데이터셋은 모든 연설마다 두 개의 동일한 도서관을 가지고 있다고 생각하세요: 하나는 원본 러시아어로, 다른 하나는 영어로 작성된 것입니다.

  • 주의할 점: 이들은 단순히 완벽한 번역이 아닙니다. 때로는 러시아어 버전이 한 가지 내용을 말하고, 영어 버전은 약간 다른 내용을 말하기도 합니다. 저자들은 두 버전을 나란히 보관했습니다. 이를 통해 연구자들은 탐정처럼 두 버전을 비교하여 정부가 자국민과 나머지 세계를 위해 메시지를 어떻게 다르게 '맞춤화'하는지 확인할 수 있습니다.
  • 규모: 그들은 크렘린 (대통령실) 과 외무부에서 연설을 수집했습니다. 이는 20 년 이상 러시아 정부의 최상위 두 인물이 행한 모든 기자회견, 인터뷰, 연설의 완전한 대본을 보유하는 것과 같습니다.

2. 사진 앨범 (단어와 연결된 이미지)

과거에는 연설을 읽을 때 게시된 사진을 쉽게 볼 수 없었습니다.

  • 혁신: 저자들은 모든 연설을 사진 앨범처럼 취급했습니다. 모든 연설에 대해 관련 이미지 (지도자, 장소, 군중의 사진) 를 모두 가져와 텍스트에 붙였습니다.
  • 결과: 이제 연설의 '시각적 맥락'을 볼 수 있습니다. 지도자가 탱크 앞에서 연설했나요? 아늑한 사무실에서였나요? 거대한 집회에서였나요? 데이터는 단어를 사진과 직접 연결하여 '다중 모드' 기록 (단어 + 이미지) 을 생성합니다.

3. 스마트 사서 (주제 모델링)

35,000 건의 연설을 하나씩 읽는 것은 한 생애가 걸릴 것입니다. 이를 해결하기 위해 저자들은 '스마트 사서'(BERTopic 이라는 AI 시스템) 를 고용했습니다.

  • 작동 방식: AI 는 모든 연설과 모든 이미지를 읽은 후, 이를 주제별 폴더로 분류했습니다. 크렘린의 경우 '우크라이나', '경제', '군사', '에너지'와 같은 89 개의 서로 다른 폴더를 만들었습니다. 외무부의 경우 32 개의 폴더를 만들었습니다.
  • 인간의 손길: 러시아 정치를 잘 아는 인간 전문가가 AI 의 작업을 검토하여 폴더 라벨이 타당한지 확인했습니다. 이는 주제가 단순한 무작위 컴퓨터의 말장난이 아니라 실제 정치적 주제를 반영하도록 보장합니다.
  • 산출물: 이제 연설이 무엇에 관한 것인지 알기 위해 연설을 읽는 대신, "이 연설은 80% 가 '군사 안보'에 관한 것이고 20% 는 '외교'에 관한 것이다"라고 즉시 확인할 수 있습니다.

4. GPS 추적기 (위치 데이터)

모든 연설은 어디에서 발생했는지에 대한 태그가 붙어 있습니다.

  • 저자들은 단순히 위치 이름만 복사한 것이 아니라, 'GPS 번역기'를 사용하여 도시 이름 (예: '모스크바' 또는 '소치') 을 실제 지도 좌표 (위도와 경도) 로 변환했습니다.
  • 이를 통해 연구자들은 시간이 지남에 따라 러시아 정부가 지리적으로 어디에 주의를 기울이고 있는지 보여주는 지도를 그릴 수 있습니다.

5. '완벽한 일치' 시스템 (데이터 무결성)

저자들은 데이터가 정제되고 연결되어 있도록 매우 신중하게 작업했습니다.

  • 고유 ID: 모든 연설에는 고유한 ID 번호 (사회보장번호와 같은) 가 있습니다. 이 번호는 러시아어 파일, 영어 파일, 이미지 폴더에서 동일합니다. 이것이 전체 데이터셋을 하나로 묶는 '접착제'입니다.
  • 완전성: 그들은 원래 정부 웹사이트와 작업을 대조하여 확인했습니다. 웹사이트에 사진이 5 장 있다고 하면, 그들은 정확히 5 장을 다운로드했는지 확인했습니다. 웹사이트에 위치가 있다면, 그것이 기록되었는지 확인했습니다.

이것으로 무엇을 할 수 있나요?

이 논문은 이 데이터셋이 '테스트베드'(실험을 위한 샌드박스) 라고 설명합니다.

  • 정치학자를 위해: 권위주의 정권이 의도를 어떻게 신호로 보내는지, 다른 청중을 위해 이야기를 어떻게 바꾸는지, 또는 25 년 동안 우선순위가 어떻게 변하는지 연구할 수 있습니다.
  • 컴퓨터 과학자를 위해: 러시아어를 이해하는 새로운 AI 모델을 훈련시키거나, 정치적 이미지를 분석하거나, AI 가 다중 모드 데이터 (텍스트 + 이미지) 를 얼마나 잘 처리하는지 테스트하는 데 이 거대하고 정제된 레이블이 지정된 데이터셋을 사용할 수 있습니다.

간단히 말해: 이 논문은 단순히 몇몇 웹사이트를 스크랩한 것이 아니라, 러시아어와 영어로 된 단어, 사진, 위치, 주제를 한 번에 볼 수 있도록 25 년간의 러시아 정치 커뮤니케이션을 거닐게 해주는 타임머신을 구축했습니다. 이는 연구에 완벽하게 조직되어 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →