想象一下你是一名大型、混乱体育赛事中的裁判,观众正对着球员大声叫喊。你的职责是决定哪些评论属于“冒犯性”言论,并需要被禁言。
这篇论文就像是两类裁判——机器人(计算机算法)和人类(具有不同政治观点的真实人类)的成绩单。研究人员想要观察,在讨论美国政治时,这些裁判对于什么才算作侮辱是否能达成一致。
以下是研究结果的拆解,使用了简单的类比:
1. 机器人裁判无法对规则达成共识
研究人员测试了九种不同的计算机程序(即“机器审核员”),针对 YouTube 新闻频道上的 300 多万条评论进行了测试。
- 类比: 想象九个不同的裁判正在观看同一次比赛。一个吹哨判定犯规,另一个说“没犯规”,而第三个说:“嗯,这确实是犯规,但前提是你得穿着蓝色的鞋子。”
- 发现: 机器人之间的分歧极大。有时,一条评论被其中一个机器人标记为冒犯性,却被其他八个机器人忽略。事实上,近一半的评论被所有机器人忽略了,而只有极小部分的评论被所有机器人同时标记。这意味着,关于什么是冒犯性的,并不存在单一的“机器人真理”。
2. 人类裁判拥有不同的剧本
研究人员随后要求真实的人类(民主党人、共和党人和独立人士)对相同的评论进行评分。他们提出了两个问题:
- 个人受挫感: “这条评论是否伤害了你的感情?”
- 替代性受挫感: “你认为这条评论是否会伤害来自另一方政治阵营的人的感情?”
- 类比: 这就像问一名 A 队的粉丝:“这个侮辱伤到你了吗?”然后问他:“你认为 B 队的粉丝会被这个侮辱到吗?”
- 发现:
- 人类彼此之间的共识高于与机器人的共识: 民主党人、共和党人和独立人士通常比机器人更能理解彼此。
- “共情鸿沟”: 然而,人类在预测“另一方”会对什么感到被冒犯方面表现得很糟糕。
- 共和党人的盲点: 研究发现,共和党人在猜测民主党人或独立人士会觉得什么具有冒犯性方面表现最差。反之亦然,民主党人和独立人士在理解什么会冒犯共和党人方面也遇到了困难。这就像两群人在互相叫喊,每群人都认定对方在以错误的音量叫喊,而实际上,他们是在完全不同的频率上进行交流。
3. “替代性受挫感”实验
论文引入了一个新概念——替代性受挫感 (Vicarious Offense)。
- 概念: 通常,我们只关心自己是否被冒犯。这项研究询问的是:“你能否设身处地为他人着想,并预测他们是否会感到被冒犯?”
- 结果: 研究人员发现,人们在这方面表现得非常糟糕。即使民主党人和独立人士在“认为什么会冒犯共和党人”这一点上达成了一致,他们在预测“实际什么会冒犯共和党人”时往往也是错误的。他们看的是同一条评论,看到的却是完全不同的东西。
4. “敏感话题”陷阱
研究人员观察了诸如堕胎和枪支控制等热点议题。
- 类比: 如果比赛是关于普通体育运动,裁判可能会对规则达成共识。但如果比赛是关于宗教或极其私密的个人话题,规则似乎会根据谁拿着哨子而改变。
- 发现: 在这些话题上,分歧变得更加严重。
- 关于枪支,共和党人对冒犯性言论的容忍度低于民主党人。
- 关于堕胎,民主党人的容忍度低于共和党人。
- 独立人士通常是容忍度最高的群体,他们愿意让更多的评论通过。
5. “科技巨头”的困境
论文强调了社交媒体公司面临的一个令人困惑的现实:
- 机器人: 它们是不一致的。今天它们可能会删除一条评论;明天,另一个机器人可能会让它保留。
- 人类: 它们受政治立场的影响。民主党人可能会删除一条共和党人认为没问题的评论,反之亦然。
- 结论: 并不存在一个完美的“金标准”来定义什么是冒犯性的。取决于你询问的对象(是机器人、民主党人还是共和党人),答案会完全改变。
总结
论文得出结论,监管在线言论是非常困难的,因为冒犯感在于观察者的眼中。
- 机器人是不一致的,且往往缺乏细微差别。
- 人类受其政治阵营的影响,并且很难理解“另一方”的感受。
- 结果: 我们陷入了一种无法轻易就什么是“冒犯性”达成共识的局面,这使得建立公平的在线政治辩论审核系统变得异常困难。
作者还测试了一种高级 AI(ChatGPT),看它能否预测另一方会觉得什么具有冒犯性,但它也像人类一样表现挣扎,证明了这对于大脑和计算机来说都是一个极难解决的问题。
技术摘要:替代性冒犯与攻击性言论分类器的噪声审计
问题陈述
攻击性言论检测是内容审核的关键组成部分,然而“冒犯性”的定义具有高度主观性,导致人类审核员与机器审核员之间经常出现分歧。现有文献研究了检测系统在不同数据集间的泛化能力、对抗性脆弱性以及地理偏差,但缺乏对大规模、真实世界政治话语中过滤结果的全面、实地评估。此外,当前的方法往往未能考虑到**替代性冒犯(vicarious offense)**现象——即个人预测具有不同政治立场的人会对特定内容产生何种感知能力。本研究旨在填补这一空白,探讨机器审核员之间分歧的程度,以及人类审核员在预测跨党派冒犯感知方面的局限性。
研究方法
1. 机器审核员的噪声审计
作者进行了一项大规模噪声审计,以衡量不同决策系统之间的结果变异性,其灵感源自 Kahneman 等人提出的关于人类判断中“噪声”的概念。
- 数据集: 一个包含超过 9200 万条评论的大规模数据集,涵盖了 CNN、Fox News 和 MSNBC 官方 YouTube 频道在 2014 年至 2022 年期间发布的 241,112 个新闻视频。审计使用了 300 万条评论的随机样本。
- 机器审核员 (MMs): 评估了九种不同的攻击性语言识别模型:
- 八个基于 BERT-LARGE-CASED 架构并在知名数据集(AHSD, HASOC, HatEval, HateXplain, OLID, TRAC, OHS, TCC)上训练的模型。
- 一个公开可用的 Detoxify (ROBERTA-BASE) 模型,该模型是在 Jigsaw 的 Unintended Bias 数据集上训练的。
- 指标: 研究使用 Cohen's κ 量化成对一致性,并使用 Fleis' κ 量化整体一致性,以确定“攻击性”与“非攻击性”分类的一致性。
2. 人类标注与替代性冒犯研究
为了补充机器审计,作者引入了一个涉及替代性冒 offense 的新型标注框架。
- 数据集构建: 创建了一个具有代表性的社会网络帖子子集(共 2,310 条),根据机器审核员的分歧程度(简单、争议、攻击性子集)以及主题(一般话题、枪支控制、生殖权利)进行分层。
- 标注员: 通过 Amazon Mechanical Turk 招募了 753 名独特的真人标注员,并进行了平衡,以确保涵盖三种政治身份:民主党人 (35%)、共和党人 (35%) 和独立人士 (30%)。
- 标注任务: 对于每条帖子,标注员需要回答两类问题:
- 个人(第一人称)冒犯感: “你是否觉得这具有冒犯性?”
- 替代(第二人称)冒犯感: “你认为具有不同政治身份的人(例如,共和党人)会觉得这具有冒犯性吗?”
- LLM 基准: 研究还利用了 ChatGPT API (GPT-3.5-turbo) 来预测替代性冒犯,通过提示词让模型扮演特定政党成员的角色,去评估另一个政党的观点。
核心贡献
- 前所未有的噪声审计: 本文展示了一项全面的噪声审计,揭示了在真实世界政治数据上,九种不同的机器审核员在内容审核结果上的显著变异性。
- VOICED 数据集: 发布了 VOICED (Vicarious Offense Identification Corpus for Estimating Disagreements) 数据集。这是首个此类数据集,标注员同时标注第一人称和替代性冒犯,涵盖了民主党人、共和党人和独立人士。
- 替代性冒犯框架: 引入了一种全新的冒犯视角,该视角超越了个体主观性,转而分析不同政治群体如何理解对方的敏感度。
- 人机对齐分析: 对具有不同政治倾向的人类审核员与机器分类器之间的对齐(及失配)情况进行了详细分析,包括将 LLM 作为替代性预测器的应用。
研究结果
机器审核员的分歧
- 低共识: 机器审核员之间存在广泛的分歧。没有任何一对模型表现出实质性的一致性(κ≥0.81)。仅有少数模型显示出中度一致性(0.41≤κ≤0.60)。
- 整体噪声: 在三个新闻网络中的整体 Fleis' κ 值较低(分别为 0.27、0.25 和 0.22),表明取决于部署的具体分类器,审核结果会发生剧烈变化。
- 波动性内容: 近一半的内容未被任何机器审核员标记,而极小部分(0.03%)被所有机器审核员标记。很大一部分内容(10.1%)处于“争议区”,即恰好有一半的模型标记了该内容,这使得审核结果具有高度的波动性。
人类审核员的分歧与替代性冒犯
- 第一人称一致性: 人类之间的共识通常高于人机一致性,尽管仍仅为中等水平(例如,独立人士与民主党人之间的 κ=0.43)。民主党人和独立人士的对齐程度最高。
- 替代性预测失败: 人类审核员难以准确预测其他政治群体如何看待冒犯性。
- 共和党人 是预测针对民主党人和独立人士之冒犯感的表现最差的群体。
- 民主党人和独立人士 可以较好地预测彼此的冒犯感,但在预测共和党人会觉得什么具有冒犯性时却感到困难。
- “一致性陷阱”: 一个仅由民主党人和独立人士组成的审核池,在“预测”共和党人认为什么具有冒犯性方面可能表现出高度的一致性,但这种预测在关于共和党人“实际”感受方面可能从根本上是错误的。
人类与机器的对齐
- 政治对齐: 虽然所有政治群体在“什么是冒犯性的”这一问题上与机器都表现出相当的对齐度,但共和党人在“什么不是冒犯性的”这一问题上与机器的对齐度略高。
- 上下文细微差别: 人类能够检测出基于上下文和目标的冒犯行为(例如,对 Caitlyn Jenner 的贬低性评论),而机器审核员则忽略了这一点。相反,人类有时会基于政治分歧而非毒性(toxicity)来标记内容具有冒犯性,而机器则往往依赖于脏话。
- 敏感议题: 在枪支控制和生殖权利等敏感话题上,分歧显著加剧。在这些话题上,机器与人类的对齐度大幅下降,且某些审核员对之间的 κ 值甚至为负,表明存在系统性的分歧。
LLM 表现
- 作为替代性预测器的 ChatGPT API (GPT-3.5) 显示出的对齐模式更接近于机器审核员而非人类多数派。它与人类审核员的一致性较低,而与机器多数派的一致性较高,这凸显了 LLM 在模拟微妙的人类政治主观性方面面临的困难。
意义与主张
本文声称通过前所未有的规模量化了内容审核中的“噪声”,并引入了替代性冒犯的概念。作者认为:
- 主观性是根本性的: 在高度极化的政治话语中,不同标注组之间可能实际上不存在共识,导致关于什么构成冒犯性内容的“另类事实”存在。
- 现有系统的局限性: 当前的机器审核员甚至大型语言模型都无法预测不同政治群体如何感知冒犯,这表明单一的“金标准”标签往往是不充分甚至具有误导性的。
- 民主与信任: 研究强调了民主信任的侵蚀,指出不同政治群体在选举公平性和对冒犯性言论的容忍度方面持有分歧,这使得社交媒体平台在审核话语时变得更加复杂。
作者将他们的工作定位为主要是描述性的,旨在“闭环”理解从机器和人类两个角度看攻击性内容的挑战,并提供一个资源(VOICED),用于开发更稳健、多视角的建模系统。他们明确指出,其研究结果表明内容审核是一个细微的话题,其中容忍度因议题和政治身份而异,目前的系统在没有人类监督或更复杂的政治主观性建模的情况下,难以应对这种复杂性。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。