← 最新论文
🤖 machine learning

Vicarious Offense and Noise Audit of Offensive Speech Classifiers: Unifying Human and Machine Disagreement on What is Offensive

原作者: Tharindu Cyril Weerasooriya, Sujan Dutta, Tharindu Ranasinghe, Marcos Zampieri, Christopher M. Homan, Ashiqur R. KhudaBukhsh

发布于 2026-02-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Tharindu Cyril Weerasooriya, Sujan Dutta, Tharindu Ranasinghe, Marcos Zampieri, Christopher M. Homan, Ashiqur R. KhudaBukhsh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名大型、混乱体育赛事中的裁判,观众正对着球员大声叫喊。你的职责是决定哪些评论属于“冒犯性”言论,并需要被禁言。

这篇论文就像是两类裁判——机器人(计算机算法)和人类(具有不同政治观点的真实人类)的成绩单。研究人员想要观察,在讨论美国政治时,这些裁判对于什么才算作侮辱是否能达成一致。

以下是研究结果的拆解,使用了简单的类比:

1. 机器人裁判无法对规则达成共识

研究人员测试了九种不同的计算机程序(即“机器审核员”),针对 YouTube 新闻频道上的 300 多万条评论进行了测试。

  • 类比: 想象九个不同的裁判正在观看同一次比赛。一个吹哨判定犯规,另一个说“没犯规”,而第三个说:“嗯,这确实是犯规,但前提是你得穿着蓝色的鞋子。”
  • 发现: 机器人之间的分歧极大。有时,一条评论被其中一个机器人标记为冒犯性,却被其他八个机器人忽略。事实上,近一半的评论被所有机器人忽略了,而只有极小部分的评论被所有机器人同时标记。这意味着,关于什么是冒犯性的,并不存在单一的“机器人真理”。

2. 人类裁判拥有不同的剧本

研究人员随后要求真实的人类(民主党人、共和党人和独立人士)对相同的评论进行评分。他们提出了两个问题:

  1. 个人受挫感: “这条评论是否伤害了的感情?”
  2. 替代性受挫感: “你认为这条评论是否会伤害来自另一方政治阵营的人的感情?”
  • 类比: 这就像问一名 A 队的粉丝:“这个侮辱伤到你了吗?”然后问他:“你认为 B 队的粉丝会被这个侮辱到吗?”
  • 发现:
    • 人类彼此之间的共识高于与机器人的共识: 民主党人、共和党人和独立人士通常比机器人更能理解彼此。
    • “共情鸿沟”: 然而,人类在预测“另一方”会对什么感到被冒犯方面表现得很糟糕。
    • 共和党人的盲点: 研究发现,共和党人在猜测民主党人或独立人士会觉得什么具有冒犯性方面表现最差。反之亦然,民主党人和独立人士在理解什么会冒犯共和党人方面也遇到了困难。这就像两群人在互相叫喊,每群人都认定对方在以错误的音量叫喊,而实际上,他们是在完全不同的频率上进行交流。

3. “替代性受挫感”实验

论文引入了一个新概念——替代性受挫感 (Vicarious Offense)

  • 概念: 通常,我们只关心自己是否被冒犯。这项研究询问的是:“你能否设身处地为他人着想,并预测他们是否会感到被冒犯?”
  • 结果: 研究人员发现,人们在这方面表现得非常糟糕。即使民主党人和独立人士在“认为什么会冒犯共和党人”这一点上达成了一致,他们在预测“实际什么会冒犯共和党人”时往往也是错误的。他们看的是同一条评论,看到的却是完全不同的东西。

4. “敏感话题”陷阱

研究人员观察了诸如堕胎枪支控制等热点议题。

  • 类比: 如果比赛是关于普通体育运动,裁判可能会对规则达成共识。但如果比赛是关于宗教或极其私密的个人话题,规则似乎会根据谁拿着哨子而改变。
  • 发现: 在这些话题上,分歧变得更加严重。
    • 关于枪支,共和党人对冒犯性言论的容忍度低于民主党人。
    • 关于堕胎,民主党人的容忍度低于共和党人。
    • 独立人士通常是容忍度最高的群体,他们愿意让更多的评论通过。

5. “科技巨头”的困境

论文强调了社交媒体公司面临的一个令人困惑的现实:

  • 机器人: 它们是不一致的。今天它们可能会删除一条评论;明天,另一个机器人可能会让它保留。
  • 人类: 它们受政治立场的影响。民主党人可能会删除一条共和党人认为没问题的评论,反之亦然。
  • 结论: 并不存在一个完美的“金标准”来定义什么是冒犯性的。取决于你询问的对象(是机器人、民主党人还是共和党人),答案会完全改变。

总结

论文得出结论,监管在线言论是非常困难的,因为冒犯感在于观察者的眼中

  • 机器人是不一致的,且往往缺乏细微差别。
  • 人类受其政治阵营的影响,并且很难理解“另一方”的感受。
  • 结果: 我们陷入了一种无法轻易就什么是“冒犯性”达成共识的局面,这使得建立公平的在线政治辩论审核系统变得异常困难。

作者还测试了一种高级 AI(ChatGPT),看它能否预测另一方会觉得什么具有冒犯性,但它也像人类一样表现挣扎,证明了这对于大脑和计算机来说都是一个极难解决的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →