← 最新论文
💬 NLP

Linked Multi-Model Data on Russian Domestic and Foreign Policy Speeches

本文介绍了一个全面且相互关联的俄罗斯政府演讲多模态数据集,该数据集融合了多语文本、图像以及经专家验证的主题标注,旨在促进社会科学高级研究及大型语言模型在威权政治传播研究中的应用。

原作者: Daria Blinova, Gayathri Emuru, Rakesh Emuru, Kushagradheer Shridheer Srivastava, Mina Rulis, Sunita Chandrasekaran, Benjamin E. Bagozzi

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Daria Blinova, Gayathri Emuru, Rakesh Emuru, Kushagradheer Shridheer Srivastava, Mina Rulis, Sunita Chandrasekaran, Benjamin E. Bagozzi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图理解一场发生在堡垒内部的复杂且高风险的对话。多年来,研究人员若想研究俄罗斯政府,只能通过一个单声道、充满杂音的无线电频道(仅限文本)来聆听这场对话,或者查看几张模糊的快照(仅限图像)。通常,文本仅提供俄语版本,使许多人难以理解,而图片也很少与正在说的具体话语相关联。

本文介绍了一个巨大的高清“监控系统”,它彻底改变了游戏规则。作者构建了一个庞大的、有组织的图书馆,收录了从 1999 年到 2025 年底俄罗斯最高领导人(总统和外交部长)发表的 35,000 多篇演讲。

以下是他们如何构建这座图书馆及其独特之处,通过简单的类比来说明:

1. 双子图书馆(文本与翻译)

将此数据集想象为每篇演讲都拥有两座完全相同的图书馆:一座用原始俄语书写,另一座用英语书写。

  • 关键点:这些并非完美的翻译。有时俄语版本表达一种意思,而英语版本则略有不同。作者将两个版本并排保存。这使得研究人员能够像侦探一样,通过对比两者,观察政府是否正在针对本国人民与针对世界其他地区“量身定制”其信息。
  • 规模:他们收集了来自克里姆林宫(总统办公室)和外交部的演讲。这就像拥有了俄罗斯政府两位核心人物在二十多年间举行的每一次新闻发布会、采访和演讲的完整剧本。

2. 相册(与文字关联的图片)

在过去,如果你阅读一篇演讲,很难看到随附发布的照片。

  • 创新之处:作者将每篇演讲视为一本相册。对于每篇演讲,他们抓取了所有相关图像(领导人的照片、地点、人群),并将它们与文本“粘贴”在一起。
  • 结果:你现在可以看到演讲的“视觉背景”。领导人是在坦克前讲话?在舒适的办公室里?还是在大型集会上?数据将文字直接与图片链接,创建了“多模态”记录(文字 + 图像)。

3. 智能图书管理员(主题建模)

逐篇阅读 35,000 篇演讲将耗费一生。为了解决这个问题,作者雇佣了一位**“智能图书管理员”**(一个名为 BERTopic 的 AI 系统)。

  • 工作原理:AI 阅读了每篇演讲和每张图片,然后将它们归类到主题文件夹中。对于克里姆林宫,它创建了 89 个不同的文件夹(如“乌克兰”、“经济”、“军事”、“能源”)。对于外交部,它创建了 32 个文件夹。
  • 人工介入:一位精通俄罗斯政治的人类专家随后检查了 AI 的工作,以确保文件夹标签具有意义。这确保了主题不仅仅是随机的计算机乱码,而是真正反映了现实的政治主题。
  • 产出:现在,你无需通读演讲即可了解其内容,而是可以立即看到:“这篇演讲 80% 关于‘军事安全’,20% 关于‘外交’。”

4. GPS 追踪器(位置数据)

每篇演讲都标记了发生地点

  • 作者不仅复制了地点名称,还使用"GPS 翻译器”将城市名称(如“莫斯科”或“索契”)转换为实际的地图坐标(纬度和经度)。
  • 这使得研究人员能够绘制地图,精确展示俄罗斯政府在地理上随时间推移的关注焦点所在。

5. “完美匹配”系统(数据完整性)

作者非常谨慎地确保数据干净且相互关联。

  • 唯一 ID:每篇演讲都有一个唯一的 ID 号码(类似于社会安全号码)。该号码在俄语文件、英语文件和图像文件夹中是相同的。它是将整个数据集“粘合”在一起的“胶水”。
  • 完整性:他们将工作结果与原始政府网站进行了核对。如果网站显示有 5 张照片,他们确保下载了 exactly 5 张。如果网站上有地点信息,他们确保已将其记录在案。

你可以用它做什么?

论文指出,该数据集是一个**“测试床”**(实验沙盒)。

  • 对于政治学家:你可以研究威权政权如何发出意图信号,如何针对不同受众改变其说辞,或者其优先事项如何在 25 年间发生转变。
  • 对于计算机科学家:你可以利用这个庞大、干净且带有标签的数据集来训练新的 AI 模型,以理解俄语、分析政治图像,或测试 AI 处理多模态数据(文本 + 图片)的能力。

简而言之:这篇论文不仅仅是抓取了一些网站;它构建了一台时间机器,让你能够穿越俄罗斯政治沟通的过去 25 年,同时看到文字、图片、地点和主题,且全部以俄语和英语呈现,为研究进行了完美的组织。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →