POLAR: A Benchmark for Multilingual, Multicultural, and Multi-Event Online Polarization
本文介绍了 POLAR,一个针对在线极化现象的全面多语言及多文化基准数据集,并评估了各种语言模型的能力,揭示了虽然这些模型能够检测出极化,但在识别特定类型及其表现形式等复杂任务上仍面临困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网是一个巨大的、全球性的城镇广场。在这个广场上,来自世界各个角落的人们正在互相叫喊、辩论,有时甚至是在互相尖叫。有时,这些争吵会变得如此激烈,以至于整个城镇分裂成两个阵营,彼此甚至无法直视对方,哪怕只是看一眼都会感到厌恶。这就是极化(Polarization)。
长期以来,试图研究这场“大声叫喊”的科学家们一直通过一个非常狭窄的窗口进行观察。他们大多只倾听美国或欧洲的英语使用者,并且主要关注特定的争论,比如“选举 A 对阵 选举 B”。这就像是试图通过只观看一个国家的一场足球赛来理解全人类的冲突——你错过了比赛的其余部分。
于是,POLAR 诞生了。
什么是 POLAR?
可以将 POLAR 想象成一个庞大的、多语言的“世界争论录音”。研究人员不仅记录了一种语言,他们还记录了 11 万场对话,涵盖了 22 种不同的语言(从英语、西班牙语到斯瓦希里语和高棉语)。他们不只是观察选举,还观察了关于战争、宗教、性别、种族甚至气候变化的争论。
他们构建这个数据集是为了成为一个冲突的通用翻译器,捕捉人们如何在自己的文化后花园里进行争论,而不仅仅是在西方的教室里。
争论的三个层面
研究人员意识到,仅仅说“这是一个争论”是不够的。他们将这些叫喊拆解成了三个层面,就像剥洋葱一样:
- “它是否正在发生?”层面(检测): 这段文本是真的处于极化状态,还是仅仅是一个普通的观点?
- 类比: 房间里是在着火,还是有人只是拿着一支蜡烛?
- “它在争论什么?”层面(类型): 争斗的核心是什么?是政治性的?种族性的?还是宗教性的?
- 类比: 他们是在为谁拥有房子而争吵,还是在为谁能开车而争吵?
- “他们是如何争斗的?”层面(表现形式): 他们使用了哪些技巧?是在骂人吗?是在说“你不属于人类”吗?是在使用像“总是”或“从不”这样的极端词汇吗?
- 类比: 他们是在扔泥巴,还是在使用大锤,或者只是在低声辱骂?
实验:计算机能理解这场争斗吗?
研究人员将这个巨大的数据集喂给了两种类型的“数字大脑”(AI 模型),以观察它们是否能弄清楚发生了什么。
- 小脑(SLMs - 小型语言模型): 这些就像专门的工具。它们擅长特定的工作,但可能会被复杂的文化细微差别所迷惑。
- 大脑(LLMs - 大型语言模型): 这些像是通识巨头。它们了解很多世界知识,但未必专门针对“互联网争吵”进行过训练。
结果:
- 好消息: 计算机在第一个层面表现得相当不错。它们通常能识别出:“嘿,这是一场争吵!”(二元检测)。
- 坏消息: 当被问及为什么会发生争吵或争吵是如何发生时,计算机就卡壳了。
- 它们很难识别冲突的具体类型(例如,区分政治争论与种族争论)。
- 它们很难察觉到那些表现形式(技巧)。它们错过了微妙的讽刺、文化的暗语(dog whistles),以及那些并不总是用粗体字写出来的深层仇恨。
这就像是给一个机器人一本字典,然后要求它理解一段脱口秀表演。机器人认识这些词,但它并不理解其中的笑点、讽刺或文化背景。
为什么这很重要
论文的结论是,虽然我们目前的 AI 工具在识别“火灾”方面做得越来越好,但在理解“纵火犯的动机”或“点火的方法”方面仍然很糟糕。
研究人员发现,文化是关键。在某个国家被视为侮辱的话,在另一个国家可能只是一个玩笑。在一种语言中看起来像是政治争论的内容,在另一种语言中可能就是宗教争论。因为 AI 模型主要是在英语数据上训练的,当它们试图倾听世界其他地方的声音时,往往会迷失方向。
总结
POLAR 是一个全新的、巨大的世界争论地图。它向我们展示了,虽然我们已经建造了一些聪明的工具来检测冲突,但对于人们分化彼此的深层、文化性和微妙的方式,我们仍然是盲目的。要修复互联网上的叫喊大战,我们需要不仅能听懂语言,而且能理解文化、历史以及文字背后隐藏含义的工具。
研究人员已经向公众发布了所有的数据和工具,希望其他科学家可以利用这张地图,为未来构建更具文化意识的工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。