✨ 要点🔬 技术摘要
想象一个这样的世界:计算机就像是巨大的、贪婪的读者,吞噬了几乎所有被写下来的书籍、网站和对话。这些被称为“大语言模型”(LLMs)的机器,是当今我们使用的许多聊天机器人和人工智能工具背后的“大脑”。它们通过识别词语中的模式来学习,试图猜测句子接下来的内容。但问题在于:如果一台计算机从未听过某种特定的表达方式,它就会感到困惑。它可能会把一个友好的玩笑误认为是一种侮辱,或者完全无法理解某个文化梗。这对于“社会方言”(sociolects)来说是一个大问题——即特定群体(如青少年、游戏玩家或 LGBTQ+ 群体)所使用的专门化语言。当人工智能无法理解这些群体时,它可能会在无意中表现得刻薄、误认身份,或者仅仅是无法进行正常的交流。研究人员提出的问题是:我们该如何教导这些数字大脑去理解酷儿群体那丰富、绚丽且不断演变的俚语,而不至于出错?
这就是名为 SLAYING 的新项目发挥作用的地方。你可以把它想象成一本专门针对酷儿俚语的、经过社区认可的大型字典和故事书。研究人员意识到,虽然人工智能在理解多种语言方面变得越来越好,但它在面对酷儿方言时经常会踉跄。有时,AI 会变得如此困惑,以至于将一个无害的、带有庆祝意味的短语误认为是仇恨言论,或者仅仅因为用户使用了某个特定的词汇,就生成了一个粗鲁的回复。为了解决这个问题,团队构建了第一个包含 500 多个酷儿俚语术语的真实世界数据集,并包含了 3,405 个关于这些词如何在句子中实际使用的示例。他们并没有直接从教科书中提取这些词汇;而是从电影、播客和社交媒体中收集它们,然后请真实的酷儿社群成员核查每一个示例,以确保用法正确且没有伤害性。
团队使用这个新数据集对一些流行的 AI 模型进行了测试,并发现了一些令人惊讶的事实。他们发现,一台计算机可以对酷儿群体表现得“友善”(即不持有刻板印象或仇恨他们),但同时在语言理解上依然显得“迟钝”。这就像是有一个很爱你、却听不懂你最爱的内部梗的朋友;他们并不是在恶意对待你,只是没能理解那个梗。研究表明,当他们利用这个包含无害且经社区认可的俚语的新数据集来训练 AI 模型时,模型不仅在理解这些词汇方面变得更好,而且在理解酷儿群体整体方面也变得更出色了。
然而,研究人员也发现,人工智能并没有平等地对待每个人。模型在处理特定群体的俚语时表现得最为吃力,特别是来自非裔美国人和拉美裔酷儿群体的术语,以及与变装(drag)和非二元性别身份相关的术语。这仿佛 AI 对那些创造了它试图学习的俚语的社群存在着一种“盲点”。此外,研究显示,旨在捕捉“有毒”语言的自动化系统经常会将这些酷儿术语标记为危险,即使这些词是被以积极、回收(reclaimed)的方式使用时。这表明,那些旨在维护互联网安全的工具,可能会在无意中审查酷儿的声音。论文指出,通过向这些模型输入更多多样化、真实的酷儿语言示例,我们可以帮助它们更好地理解该社群,从而减少它们的困惑,并降低它们错误地将无害言论标记为有害言论的可能性。
技术摘要:SLAyiNG —— 一个多样化且经社区验证的酷儿俚语数据集
问题陈述
尽管自然语言处理(NLP)在其他社会方言和非正式语言领域取得了进展,但酷儿语汇在评估基准和资源中仍然显著代表性不足。目前的 NLP 系统经常错误地处理酷儿语言,导致其被误分类为仇恨言论、生成负面响应、性别误认以及刻板印象。现有的关于 NLP 中酷儿语言的文献非常有限,通常侧重于单一特征(如回收使用的诋称)或利用小型、合成的术语列表。目前缺乏多样化、非合成且经社区验证的资源,而这些资源对于评估和缓解 AI 系统中的反酷儿语言偏见至关重要。
方法论
作者介绍了 SLAyiNG ,这是第一个真实的英语酷儿俚语数据集,通过严格的多阶段策展和标注流水线构建而成。
数据收集与溯源
术语溯源: 作者从四个主要来源汇总了俚语术语:性别、性向及性取向本体论 (GSSO)、lgbtDB、Chew 包容性术语表以及 Wiktionary。这初步获得了 695 个唯一术语和 90 个变体。
原始数据获取: 为了捕捉真实世界的使用情况,团队从三个来源抓取了 197,958 个句子级示例:OpenSubtitles(电影/电视字幕)、Reddit(论坛帖子)和 Podscripts(播客转录文本)。
预过滤: 由于许多俚语具有歧义性(例如,“mother”或“read”具有非酷儿含义),作者使用 GPT-5 Mini 作为预过滤模型进行语义消歧。该模型经过由三位作者标注的金标准集验证,实现了 0.78 的 micro F1 分数。
标注流水线
该数据集经历了涉及内部作者和 33 名多样化志愿者组成的众包群体进行的三个任务的标注过程:
语义消歧: 确定特定定义是否适用于给定句子中的术语用法。
有害言论检测: 识别句子是否具有危害性,区分诋毁性用法与回收/圈内用法。
作者身份识别: 确定句子的作者属于“圈内”(即该术语所指代的群体)还是“圈外”,因为这会极大影响对诋称词汇感知到的伤害程度。
验证与发布:
内部标注: 手动标注了 5,973 个示例。通过“完整性检查”批次确保了标注指南的稳定性。
众包标注: 数据集的 12% 由社区志愿者进行标注,以验证正确性和安全性。
数据集版本: 最终的公开 版本包含 3,405 条被标记为无害的条目。一个包含 121 条额外条目(被标记为“不确定有害”但确认为圈内言论)的私有 版本可根据要求提供,以防止滥用同时保留语言细微差别。
核心贡献
SLAyiNG 数据集: 一个经过人工标注的非合成数据集,包含超过 500 个酷儿俚语术语,用于 3,405 个句子语境,涵盖了 20 多个酷儿子群体(包括变装、非二元性别、非裔美国人和拉丁裔社区)。
解耦表征与语言偏见: 作者证明了语言模型可以在关于表征 (刻板印象化身份)保持无偏的同时,仍然表现出语言偏见 (对该群体的语言处理能力差)。他们展示了模型的性能(通过每字节比特数 Bits Per Byte 衡量)与 WinoQueer 基准测试中的偏见得分之间存在负相关关系。
交叉性偏见分析: 研究表明,NLP 模型在处理特定子群体的俚语时表现明显较差,尤其是非二元性别和变装社区。此外,与非特定族裔术语相比,与非裔美国人和拉丁裔社区相关的俚语会导致更高的错误率和毒性分类假阳性。
实验结果
作者利用 SLAyiNG 对 DATADECIDE 1B 模型套件及各种数据配方进行了两项案例研究:
语言偏见 vs. 表征偏见: 对 25 种不同数据配方的分析显示,模型的酷儿俚语拟合度(较低的 BPB)与反酷儿偏见得分(越低越好)之间存在负相关(r = − 0.34 , p = 0.09 r = -0.34, p = 0.09 r = − 0.34 , p = 0.09 )。虽然该相关性在 0.05 水平上不具有统计学显著性,但作者假设这可能表明包含酷儿内容的语料库可能会无意中强化酷儿恐慌的刻板印象(通过有害内容或圈外作者身份),这表明表征和语言偏见可能是部分解耦的。
通过持续预训练进行缓解: 作者在 SLAyiNG 上对 OLMo-1B 模型进行了微调。这导致所有社区子集的 WinoQueer 偏见得分降低,并且 BPB 降低(语言拟合度提高),这表明接触无害的、圈内使用的酷儿语言样本,具有减轻表征偏见和语言偏见两者的潜力。
子群体性能差异: 包含非二元性别和变装俚语的文本在性能指标(BPB)上始终较差。同样,与黑人、非裔美国人和拉丁裔社区相关的俚语比无特定族裔的术语具有更高的 BPB(性能更差)。
毒性分类错误: 仇恨言论分类器(DOLMA 和 TOXIGEN 的 HateBERT)错误地将大量 SLAyiNG 示例标记为有毒(分别为 7.81% 和 31.16%)。这种假阳性率在变装俚语和具有语义扩展的术语(例如“cunty”)中特别高,分类器往往通过其主流的、厌女的定义而非其回收后的酷儿含义来误解这些词汇。
重要性与主张
论文认为 SLAYiNG 为提高 NLP 系统对酷儿利益相关者的公平性和实用性提供了必要的基石。作者主张:
生态效度: 与合成数据集不同,SLAyiNG 提供了一个现实的测试平台,用于分析语言偏见如何影响酷儿用户,从而超越了单一特征分析,实现了交叉性评估。
偏见的细微差别: 研究结果挑战了“无偏见模型本质上能够处理多样化语言”的假设;表征偏见和语言偏见是不同的现象,需要不同的缓解策略。
以社区为中心的开发: 通过让酷儿社区参与标注和验证过程,该数据集确保了对伤害和身份的定义是基于利益相关者的真实生活体验,而非外部假设。
作者总结道,虽然 SLAyiNG 是向前迈出的重要一步,但它仅是当前可用资源的缩影。他们强调需要不断的修订和扩展,以跟上不断演变的酷儿语汇特性,并解决当前小规模模型在推断到更大规模 AI 系统时的局限性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。