OATH-Frames: Characterizing Online Attitudes Towards Homelessness with LLM Assistants
本文介绍了用于分析美国对无家可归者在线态度的九类分类法 OATH-Frames,并证明了利用大语言模型辅助领域专家可以实现 240 万条推文标注的 6.5 倍加速且性能损失极小,从而为不同人口统计特征和地区的公众情绪提供细致入微的见解。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,试图理解数百万人对像“无家可归”这样一个复杂且具有情感色彩的问题是如何看待的。如果你试图阅读关于这个话题的每一条推文,你会发现自己瞬间就被淹没在文字的大山之中。这就像是在试图用消防水龙头的喷射流量来饮水一样。
这篇题为**“OATH-Frames”**的论文,讲述了如何构建一副更好的眼镜,以便看清那股“消防水龙头”中究竟包含着什么。研究人员结合了人类社会工作专家的知识与强大的人工智能(大语言模型),对美国关于无家可归问题的 240 万条推文进行了分类。
以下是他们是如何完成这项工作的过程,分为几个简单的部分:
1. 问题所在:“一刀切”的眼镜
在此项研究之前,如果你想分析关于无家可归问题的推文,你可能会使用标准的工具,这些工具仅仅会询问:“这条推文是否有毒性(是否刻薄)?”或“这条推文是开心的还是悲伤的(情感倾向)?”
研究人员认为,这些工具就像是试图仅用“红色”和“绿色”标签来对一袋混合水果进行分类。
- 缺陷: 一条推文可能会说:“无家可归的人又懒又脏。” 标准工具可能会错过这一点,因为它没有使用“脏话”(低毒性),也不是“快乐”的(负面情感)。但这种言论是具有深度伤害性的。
- 现实情况: 人们的态度是复杂的。你可能在同一句话里既对无家可归者表示同情,又对政府未能解决问题感到愤怒。简单的“好/坏”标签忽略了这种细微差别。
2. 解决方案:“OATH-Frames”菜单
团队创建了一个新的“菜单”,由九个特定的类别(框架)组成,用以精确描述人们讨论无家可归问题的方式。这就像是提供一份“厨师品鉴菜单”,而不仅仅是泛泛而谈的“食物”。
他们将这九个类别分成了三种主要“风味”:
- 批判(抱怨类):
- 政府批判: 指责政治家或法律。
- 社会批判: 指责社会或“伪善”的人。
- 资金援助: 争论税款应该投向何处。
- 感知(刻板印象类):
- 有害的概括: 将所有无家可归者称为小偷、瘾君子或懒汉。
- 应得 vs 不应得: 争论某些群体(如退伍军人)是否比其他群体(如移民)更值得获得帮助。
- 邻避效应 (NIMBY): “我不反对无家可归者,只是别在我家附近。”
- 反应(行动类):
- 解决方案: 提出修复方案、收容所或政策变革。
- 个人互动: 分享与无家可归者见面的故事。
- 媒体描绘: 讨论新闻或电视节目如何报道无家可归问题。
3. 过程:“人机共舞”
人工对 240 万条推文进行分类需要人类团队花费数年时间。而仅靠 AI 进行分类则是存在风险的,因为 AI 可能会误解微妙的社交暗示(如讽刺或特定的政治引用)。
因此,他们发明了一种**“人机共舞”**模式:
- 专家: 社会工作专家首先定义了规则(即“菜单”),并对一小批推文进行了标注,以此来教导 AI 应该寻找什么。
- AI 助手 (GPT-4): AI 尝试对数千条推文进行标注。当它感到困惑时,它会解释自己的推理过程(就像学生展示解题步骤一样)。
- 检查环节: 人类专家查看了 AI 的“作业”并修正了错误。他们发现,通过让 AI 承担繁重的工作并仅进行结果检查,他们的标注速度提升了 6.5 倍,而准确度仅有极微小的下降。
- 最后冲刺: 一旦 AI 从专家那里学会了窍门,他们就训练了一个规模更小、速度更快的 AI 模型,让它独立完成剩余 240 万条推文的标注。
4. 发现:隐藏的模式
一旦他们将所有 240 万条推文都分入了这九个类别,他们就能看到此前无法察觉的模式。
- “毒性”盲点: 他们发现,许多包含有害刻板印象(如称无家可归者为“肮脏”)的推文,其“毒性”得分都很低。OATH-Frames 捕捉到了这些内容,而旧有的工具却漏掉了它们。
- 地理位置的影响:
- 在加利福尼亚州、华盛顿州和俄勒冈州,人们更有可能使用有害的概括(刻板印象)。研究人员认为这是因为这些地区有更多可见的、露宿街头的无家可归人群,从而引发了更多直接(有时是负面)的反应。
- 在纽约州,人们更有可能争论应得 vs 不应得的群体。这似乎与有关移民和寻求庇护者抵达该市的新闻有关,引发了关于谁“应得”援助的辩论。
- “乌克兰 vs 移民”的分野:
- 当人们将美国无家可归者与乌克兰人进行比较时,推文大多涉及政府批判和资金援助(例如:“当我们这里还有无家可归者时,为什么要把数十亿资金送往乌克兰?”)。
- 当人们将他们与移民进行比较时,推文则表现出更多的敌意,充满了有害的概括和邻避效应的态度(例如:“他们在抢夺我们的工作/住房”)。
- 时间的重要性: 在重大新闻事件期间(如关于俄罗斯-乌克兰战争资金辩论期间),特定类别的推文量会出现激增。当国会在讨论对乌克兰的援助时,“资金援助”和“应得 vs 不应得”的争论在推文中爆发式增长。
核心结论
这篇论文不仅仅是在计数推文;它教会了计算机如何理解人类关于无家可归问题的愤怒、同情和困惑中的那些细微差别。
通过将人类社会工作的专业知识与 AI 的速度相结合,他们创建了一个能够识别微妙且有害的态度,而传统的“好坏”检测器却会错失这些态度的工具。他们表明,我们讨论无家可归问题的方式,取决于我们居住在哪里、我们在与谁做比较,以及新闻正在发生什么。
注: 本文完全侧重于分析这些在线态度,以帮助研究人员和倡议团体更好地了解公众舆论。它并不声称能直接解决无家可归问题,也不提供临床建议,而是提供了一个更清晰的视角来观察这一问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。