Epistemic Injustice in Language Models: An Audit of Pretraining Filters and Guardrails
本文审计了语言模型中的预训练过滤器和推理时护栏,揭示了它们由于依赖过于简单的词汇线索,不成比例地抹除了对边缘化群体的提及,却未能捕捉到真正的仇恨言论或隐私信息,从而造成了一种与人类判断相悖的认识论不公。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在建造一座宏大的图书库,旨在教导一个超级聪明的机器人如何说话并理解这个世界。这个机器人被称为“大语言模型”(LLM),它需要阅读来自互联网的数十亿个句子来学习。
然而,在机器人开始阅读之前,人类会设置一些过滤器(就像一位严格的图书管理员),把“坏”书扔掉。然后,当机器人开始与人交流时,人类会设置护栏(就像一位安全检查员),阻止它说任何“不安全”的话。
这篇论文是一项审计——是对这些图书管理员和安全检查员工作表现的一次深度调查。研究人员发现,虽然他们试图让机器人保持安全,但他们无意中抹去了边缘化群体的声音(例如跨性别者、女性和来自中美洲的人),并将人类的判断替换成了僵化且往往错误的规则。
以下是他们研究结果的拆解,使用了简单的类比:
1. “禁用词”陷阱
研究人员发现,许多这些安全系统的工作方式就像是一个儿童的“黑名单”。
- 运作方式: 如果一个句子包含特定的“坏”词(如脏话或性相关术语),系统会立即将其删除,而不去观察上下文。
- 问题所在: 这就像一位图书管理员仅仅因为一本书提到了某个身体部位,就扔掉了关于医疗程序的书籍;或者仅仅因为一个故事提到了“性”这个词,就删除了关于性工作者权利的故事。
- 结果: 这些系统非常擅长捕捉其“黑名单”上的词汇,但在识别真正的伤害(如隐私泄露、版权盗窃或不使用特定禁用词的真实仇恨言论)方面表现极差。
2. “过度保护”的过滤器
研究发现,这些过滤器对特定群体表现出过度保护,行为就像一个对戴着某种特定帽子的人充满怀疑的保安。
- 跨性别者: 提到跨性别身份的句子被标记并要求删除的频率,远高于提到顺性别(非跨性别)人士的句子。
- 女性: 提到女性的内容被标记的次数显著高于提到男性。
- 中美洲人: 提到中美洲人的内容几乎总是被标记为删除,而关于欧洲西部人的内容却极少被触及。
- 类比: 想象一位博物馆的保安,他允许所有人进入,唯独不让来自某个特定社区的人进入。保安并不是想表现得刻薄,他只是在执行一条有缺陷的规则,即假设那个社区的人具有“风险”。这导致博物馆(AI)永远无法了解那个社区的文化。
3. 机器人 vs. 人类
研究人员要求人类志愿者查看被机器人标记的句子,并决定:“这个句子应该保留还是删除?”
- 令人震惊的数据: 对于预训练过滤器想要删除的句子,人类在 88.5% 的情况下选择了“保留”;对于护栏想要拦截的句子,人类在 91.3% 的情况下选择了“保留”。
- 类比: 这就像一个机器人厨师品尝了一锅汤,因为它含有某种特定的香料,就判定这锅汤是“有毒的”,然后把整锅汤都倒掉了。而人类厨师品尝后,意识到这只是一锅辛辣的汤,并说:“不,这很好吃也很安全。”
- 冲突点: 自动化系统正在删除人类认为实际上具有价值、教育意义或无害的内容。通过删除这些句子,AI 正在失去理解这些群体及其经历的能力。
4. “沉默的抹除”
论文将其称为**“认识论抹除”(Epistemic Erasure)**。
- 含义: “认识论”涉及知识。“抹除”意味着擦除或消除。
- 隐喻: 想象一张正在由 AI 绘制大陆轮廓的世界地图。由于过滤器不断删除关于跨性别者或中美洲人的句子,AI 绘制出的地图最终会在这些群体本该存在的地方留下空白的白点。由于数据在它能够学习之前就被清理掉了,AI 实际上并不“知道”它们的存在,也不了解它们的生活。
论文主张摘要
- 系统之间并不一致: 不同的过滤器和护栏经常相互矛盾。有些能捕捉到其他系统漏掉的东西,但它们过度依赖简单的词表,而非理解上下文。
- 偏见是系统性的: 这不仅仅是一个小故障,而是一种模式。来自不同公司和不同大洲的系统似乎都在过度标记相同的边缘化群体。
- 人类判断截然不同: 人类通常认为这些句子是安全或重要的,而机器则认为它们是危险的。
- 后果: 通过依赖这些自动化系统,我们正在主动塑造一种对跨性别者、女性和特定地区人群视而不见的 AI,从而在数字世界中有效地使他们失声。
论文结论指出,要解决这个问题,我们不能仅仅依靠自动化的“黑名单”。我们需要让受影响的人参与到决策过程中,并创建能够理解“上下文”而非仅仅计算“坏词”的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。