Linked Multi-Model Data on Russian Domestic and Foreign Policy Speeches
本論文は、多言語テキスト、画像、および専門家が検証したトピック注釈を統合した包括的かつ相互連結されたロシア政府演説のマルチモーダルデータセットを導入し、権威主義的政治コミュニケーションの研究における高度な社会科学研究および大規模言語モデルの応用を促進するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
複雑で重大な会話が要塞の内部で行われていると想像してください。長年にわたり、ロシア政府を研究しようとする研究者たちは、この会話を単一のノイズの多いラジオチャンネル(テキストのみ)で聞き取るか、いくつかのぼやけたスナップショット(画像のみ)を眺めるしかなかったのです。しばしば、テキストはロシア語のみで利用可能だったため、多くの人にとって理解が困難でしたし、画像は話されている特定の言葉とほとんど結びついていませんでした。
この論文は、ゲームのルールを変える巨大な高解像度の「監視システム」を導入します。著者たちは、1999 年から 2025 年末までのロシアの最高指導者(大統領と外務大臣)による 35,000 件以上の演説を含む、巨大で組織化された「図書館」を構築しました。
以下に、彼らがこの図書館をどのように構築し、何が特別なのかを、簡単な比喩を用いて説明します。
1. 双子の図書館(テキストと翻訳)
このデータセットは、すべての演説に対して2 つの同一の図書館を持っていると想像してください。一つは元のロシア語で書かれ、もう一つは英語で書かれています。
- 注意点: これらは単なる完璧な翻訳ではありません。ロシア語版が何かを言い、英語版が少し異なることを言うこともあります。著者たちは両方のバージョンを並べて保持しました。これにより、研究者たちは探偵のように振る舞い、両方を比較して、政府が自国民と世界の残りの人々に対してメッセージをどのように「調整」しているかを確認できます。
- 規模: 彼らはクレムリン(大統領府)と外務省からの演説を収集しました。これは、ロシア政府のトップ 2 人のプレイヤーが 20 年以上にわたって行ったすべての記者会見、インタビュー、演説の完全な脚本を持っているようなものです。
2. 写真アルバム(言葉にリンクされた画像)
過去には、演説を読んでも、それと一緒に投稿された写真を簡単に見ることができませんでした。
- 革新: 著者たちは、すべての演説を写真アルバムのように扱いました。すべての演説について、関連するすべての画像(指導者の写真、場所、群衆)を拾い上げ、テキストに貼り付けました。
- 結果: 今や、演説の「視覚的コンテキスト」を見ることができます。指導者は戦車の前で話しましたか?居心地の良いオフィスでですか?大規模な集会でですか?データは言葉を直接画像にリンクさせ、「マルチモーダル」な記録(言葉+画像)を作成します。
3. 賢い司書(トピックモデリング)
35,000 件の演説を 1 つずつ読むには一生かかります。これを解決するために、著者たちは**「賢い司書」**(BERTopic という AI システム)を雇いました。
- 仕組み: AI はすべての演説とすべての画像を読み、それらをトピックごとのフォルダに分類しました。クレムリンについては、「ウクライナ」、「経済」、「軍事」、「エネルギー」などの 89 の異なるフォルダを作成しました。外務省については 32 のフォルダを作成しました。
- 人間のタッチ: ロシア政治に精通した人間の専門家が、AI の作業をチェックして、フォルダのラベルが意味をなすことを確認しました。これにより、トピックが単なるランダムなコンピュータのガベージではなく、実際の政治的テーマを反映していることが保証されます。
- 出力: 今や、何について話しているかを知るために演説を読む代わりに、すぐに「この演説は 80% が『軍事安全保障』についてで、20% が『外交』についてである」と確認できます。
4. GPS トラッカー(位置データ)
すべての演説には、どこで行われたかがタグ付けされています。
- 著者たちは単に場所の名前をコピーしただけではありませんでした。「GPS 翻訳機」を使用して、「モスクワ」や「ソチ」のような都市名を実際の地図座標(緯度と経度)に変換しました。
- これにより、研究者たちは時間経過とともにロシア政府が地理的にどこに焦点を当てているかを示す地図を描くことができます。
5. 「完璧な一致」システム(データの完全性)
著者たちは、データがクリーンで接続されていることを確実にするために非常に注意を払いました。
- 一意の ID: すべての演説には、一意の ID 番号(社会保障番号のようなもの)があります。この番号はロシア語ファイル、英語ファイル、画像フォルダのすべてで同じです。これはデータセット全体を結びつける「接着剤」です。
- 完全性: 彼らは元の政府ウェブサイトに対して作業を確認しました。ウェブサイトに 5 枚の写真があると言っていれば、正確に 5 枚をダウンロードしたことを確認しました。ウェブサイトに場所があれば、それが記録されたことを確認しました。
これを使って何ができるか
この論文は、このデータセットが実験のための「テストベッド(サンドボックス)」であると説明しています。
- 政治学者にとって: 権威主義体制がどのように意図をシグナル送信するか、どのように異なる聴衆に対して物語を変更するか、または 25 年間にわたって優先順位がどのように変化するかを研究できます。
- コンピュータ科学者にとって: この巨大でクリーンでラベル付けされたデータセットを使用して、ロシア語を理解する新しい AI モデルを訓練したり、政治的画像を分析したり、AI がマルチモーダルデータ(テキスト+画像)をどの程度よく処理するかをテストしたりできます。
要約すると: この論文は単にいくつかのウェブサイトをスクレイピングしたわけではありません。それは、ロシアの政治的コミュニケーションの過去 25 年間を、言葉、画像、場所、そしてテーマをすべて同時に、ロシア語と英語の両方で、研究のために完璧に整理された状態で目撃できるタイムマシンを構築したのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。