← 最新论文
💻 computer science

Using machine learning to build public policy agenda from social media conversations

本文提出了一种利用社交媒体数据、主题模型和自然语言生成技术来高效识别公众关注议题并构建经过验证的政策议程的人机增强机器学习框架,并通过在 Twitter 数据上的实验验证,展示了其在叙事连贯性和议程项目相关性方面的显著成果。

原作者: Rahman Sanya

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Rahman Sanya

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,政府就像一个繁忙的大厨房,正试图为整个国家烹饪一顿美餐。在开始烹饪之前,他们需要一份菜单(即公共政策议程),这份菜单要列出人们真正想吃的最重要菜肴。

传统上,制定这样一份菜单就像派出一支厨师团队去敲每一户人家的门,然后询问:“你想吃什么?”这既缓慢又昂贵,而且等他们回到厨房时,人们的胃口可能已经变了。

本文提出了一种利用机器学习 (ML)社交媒体(特别是 Twitter)来创建这份新菜单的方法。你可以把它想象成安装了一个高科技的“倾听装置”,能够扫描网络上发生的数百万场对话,从而瞬间弄清楚人们渴望吃什么。

以下是作者如何构建他们的“智能菜单机器”的过程,分为五个简单的步骤:

1. 清理食材(数据清洗)

社交媒体是非常杂乱的。它充满了拼写错误、表情符号、链接以及人们互相争吵的声音。

  • 类比: 想象一下,你试图用一袋混杂着泥土、塑料包装和旧收据的蔬菜进行烹饪。
  • 他们做了什么: 他们使用计算机程序清洗了这些“蔬菜”(即推文)。他们去除了“泥土”(表情符号、URL、标签)并扔掉了“垃圾”(转发和简短无意义的词汇),以便只留下干净、可读的句子。

2. 寻找风味特征(关键词提取与议题识别)

现在文本已经干净了,计算机需要弄清楚主要的“风味”或主题是什么。

  • 类比: 想象一位主厨品尝了一大锅汤,然后说:“我尝到了胡萝卜的味道,我尝到了牛肉的味道,还有一点香料的味道。”
  • 他们做了什么: 他们使用了两种不同的“品尝工具”(称为 LDATop2Vec)。这些工具观察清洗后的推文并将它们分组为不同的主题。例如,他们发现了由“警察”、“暴力”和“和平”等词汇组成的簇(他们称之为主题 11),以及其他关于“水”、“道路”和“健康”的词汇(与服务相关)。这告诉了他们人们实际上在讨论哪些议题。

3. 编写菜单描述(叙事生成)

计算机知道主题,但它需要以一种听起来像人类政策提案的方式将它们写出来。

  • 类比: 计算机就像一位知道食材但需要编写精美菜单描述的副厨。原本的“炖牛肉”变成了“一份带有根茎类蔬菜的、浓郁且慢炖的炖牛肉”。
  • 他们做了什么: 他们使用了一种名为 GPT-2 的智能 AI。他们将找到的关键词(如“残暴”或“教育”)输入给它,并要求它围绕这些词编写短段落。AI 尝试编写听起来自然且有意义的句子,将一系列单词转化为关于问题的故事。

4. 味觉测试(文本验证)

有时,AI 会写出一些胡言乱语。作者需要确保这位“副厨”并没有在胡编乱造。

  • 类比: 在将菜单呈献给公众之前,主厨会请几位美食评论家来品尝这些描述。他们会问:“这听起来像真正的英语吗?这个故事逻辑通顺吗?”
  • 他们做了什么: 他们聘请了英语水平较高的大学生来阅读 AI 生成的段落。他们根据可读性(读起来是否流畅?)和连贯性(故事是否前后一致?)进行了评分。
  • 结果: 学生们给出了“非常好”的可读性评分和“良好”的连贯性评分。AI 编写的句子大多是合理的。

5. 对照官方食谱进行检查(议程验证)

最后,他们需要检查 AI 的菜单是否真的符合政治领导人所关注的事项。

  • 类比: 主厨将新菜单与“官方食谱手册”(2020/2021 年乌干达选举的政党竞选纲领)进行对比,看看他们烹饪的是不是同样的菜肴。
  • 他们做了什么:
    1. 计算机检查: 他们使用了一个数学公式(余弦相似度)来衡量 AI 的句子与官方政党承诺之间的接近程度。AI 在匹配“安全”和“民主”主题方面做得很好,但在“经济”和“医疗保健”方面稍显吃力。
    2. 人工检查: 他们请一组人进行投票,看 AI 生成的菜单项是否确实是国家的重要议题。该小组达成了一致意见(“良好”的一致性),认为 AI 已成功识别出了真实的公众关注点。

核心结论

作者成功构建了一个半自动化系统,该系统可以倾听社交媒体、寻找最重要的议题、将其编写为政策问题,并检查其有效性。

他们的发现:

  • 它奏效了!该系统可以将混乱的 Twitter 闲谈转化为结构化的公共政策议题列表。
  • 它还不完美。有时 AI 写的句子并不完全合乎逻辑,有时它在处理复杂的议题(如经济)时会偏离目标。
  • 目标: 这并不是为了取代人类政治家。它是为了给他们提供一种更快、更便宜的方式来倾听民众的声音,尤其是在进行传统的调查研究过于困难或昂贵的地方。

简而言之,他们建造了一个数字扩音器,帮助政府在无需敲开每一扇门的情况下,也能听到人群的声音。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →