Can Data Work be Reparative?
这项民族志研究认为,通过一种以受在线伤害最深的人群为中心的女性主义协作方式来重新定向数据工作,对于实现人工智能领域的修复性正义至关重要,这需要对问责关系和数据集的集体治理进行根本性的重置。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心理念:修复破碎的流水线
想象一下,你正在建造一个巨大的、超级智能的机器人(AI),它需要学习如何理解人类语言,尤其是在人们在网上进行言语攻击或传播伤害性内容时。为了教这个机器人,你需要一个庞大的示例库(数据集)。
通常,这个图书馆是建立在一条破碎的流水线之上的。公司雇佣成千上万的工人来点击按钮并标注词汇。这些工人往往报酬极低,被当作机器中可互换的齿轮,并且被迫在没有任何支持的情况下观看糟糕、有毒的内容。那些真正了解伤害感的人——受害者和专家——却很少成为构建这个图书馆的人。
这篇论文提出了一个大问题:我们能否重建这条流水线,使其不仅能产生数据,还能真正修复旧方式所造成的伤害?
作者研究了印度的一个名为 Tattle Civic Tech 的组织,以观察这是否可行。他们发现,虽然这很难,但确实存在一条前进的路径。
Tattle 的故事:“社区厨房” vs. “快餐工厂”
把传统的 AI 数据制作方式想象成一个快餐工厂。
- 过程: 你得到一份任务清单(将这条推文标记为“坏”)。你快速、孤独地完成它,只为了几分钱。
- 结果: 做出的食物(数据)是标准化的,但往往味道不对,因为厨师并不了解当地文化或客户的具体痛苦。
现在,看看 T 在尝试做的是什么。他们正在经营一个社区厨房。
- 过程: 他们不再雇佣陌生人来点击按钮,而是邀请那些真正经历过网络骚扰、仇恨言论或基于性别的暴力的人。这些人包括社会工作者、记者、活动家和心理学家。
- 方法: 他们不仅仅是要求这些人对数据进行标注。他们坐在一起(通过虚拟研讨会)讨论为什么一个词是具有伤害性的,这种伤害的感觉如何,以及缺失了哪些语境。他们共同“烹饪”数据。
- 目标: 创造一个真正理解印度语言中伤害细微差别的数据库,而不是仅仅将英语规则翻译到另一种文化中。
两大障碍(“张力”)
尽管 Tattle 试图做正确的事,但他们撞到了两堵墙。论文认为,修复这些墙是实现“修复性”工作的关键。
1. 工资问题:“专业知识 vs. 劳动力”
在旧系统中,数据工人被视为工厂劳动力。而在 Tattle 的厨房里,贡献者是拥有深刻生活经验的专家。
- 冲突: Tattle 希望像对待专家一样支付报酬(这成本更高),但 AI 行业习惯于支付极其微薄的薪水。
- 现实: 一些贡献者是富有的学者,他们将此视为对社会的“馈赠”;而另一些则是需要靠这份收入维持生计的自由职业者。Tattle 尝试向所有人支付公平且高额的报酬(约为行业标准的 10 倍),但仍然面临困难。
- 教训: 如果你按最低工资支付报酬,你就不能声称尊重他们作为“专业知识”的丰富生活经验。真正的修复意味着要支付人们专业知识应有的价值,即使这会让项目变得更加昂贵。
2. 所有权问题:“谁拥有食谱?”
在旧系统中,一旦数据制作完成,大科技公司就会永久拥有它。他们可以随心所欲地使用,甚至可以忽略那些帮助他们制作数据的人。
- 冲突: Tattle 的贡献者感到担忧:“如果我们把这些数据交给大型科技公司(如 Instagram 或 X),他们是真的会用它来帮助我们,还是会再次拿走数据并无视我们?”
- 现实: 大多数贡献者觉得,网络安全只是他们更广泛斗争(如身体暴力或种姓歧视)中的一小部分。他们愿意将数据交给大公司,因为他们觉得这是获得结果的唯一途径,即便这感觉并不公平。
- 教训: 论文认为我们需要一种新的治理方式。这不仅仅关乎谁拥有数据,更关乎谁有权决定如何使用它。如果遭受伤害的人对规则没有发言权,这项工作就称不上是真正的“修复性”工作。
核心信息:重置“问责制”
作者使用了一个概念叫做**“修复性正义”(Reparative Justice)**。
- 旧方式: “我们修好了机器人。我们增加了更多数据。我们完成了。”
- 修复式方式: “我们修好了机器人,但我们也修复了机器人制造者与受伤害者之间的关系。”
论文得出结论:只有当我们不再把 AI 或数据集作为主角时,数据工作才具有修复性。相反,我们必须将遭受伤害的人放在中心位置。
这就像修理一座断裂的桥梁。
- 旧方式: 只是在裂缝上再浇筑一层混凝土(数据)。
- 修复式方式: 询问从桥上掉下来的人哪里出了问题,支付他们协助维修的时间费用,并把建筑现场的钥匙交给他们,让他们确保此类事件不再发生。
总结
论文认为,要让 AI 真正安全且公平,我们需要停止将数据工人视为隐形的机器。我们需要:
- 像对待专家一样支付报酬,他们持有宝贵的知识,而不只是劳动力。
- 赋予他们话语权,让他们参与决定其数据的用途和治理。
- 关注受伤害的人,使他们成为解决方案的核心,而不仅仅是数据的来源。
这是一个大胆的愿景。它表明,“负责任的 AI”之路不仅仅在于更好的代码,更在于更好、更公平、更具人性化的关系。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。