Do Language Models Know Their Slang? Queer Slang Understanding in User-Generated Content
本文介绍了 Slang-Q,这是一个包含 118 个酷儿俚语词汇的人工策展数据集和分类法,旨在评估语言模型准确理解并定义这一代表性不足的特定社区语言的能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网是一个巨大且繁忙的城市,每个社区都有自己的秘密握手方式、内部笑话和特殊词汇。在科学领域,有一门叫做自然语言处理(NLP)的学科,它致力于构建被称为“大语言模型”(LLMs)的数字大脑——用来阅读并理解这座城市。把这些模型想象成超级聪明的游客,他们读过几乎所有的书籍和网站,但有时却难以理解特定社区的本土俚语。LGBTQIA+ 社区便是这样一个社区,它拥有一种丰富、富有创意且变化迅速的语言,其中的词汇在不同的人口中可能具有截然不同的含义。如果这些数字游客误解了俚语,他们可能会将一个友好的问候误认为是一种侮辱,或者完全错过一个笑话的梗。这至关重要,因为这些模型正越来越多地被用于帮助人们寻找信息、与朋友聊天以及浏览网络;如果它们不能理解边缘化群体的语言,就无法公平地为每个人服务。
于是,一群研究人员决定测试一下这些数字游客对“酷儿俚语”(Queer Slang)这个社区了解得究竟有多深。他们构建了一个特殊的评估场,名为 Slang-Q,它就像一本精心组织的巨型字典,包含了 118 个特定的酷儿术语,并配有 1,024 个真实的人使用这些词汇的句子。至关重要的是,这份词汇表是独立于句子之外创建的,以确保模型没有仅仅是死记硬背了答案。他们不仅仅是让模型去猜测,而是设置了一系列挑战,看模型是否能正确定义这些词汇。研究人员测试了四种不同的提问方式:有时他们只给出一个词(比如问“什么是 'tea'?”),有时则给出一个词加上一个展示其用法方式的句子(比如“我正在分享关于那个派对的 'tea' [八卦]”)。他们还尝试了两种不同的“面具”:一种是让模型表现得像一个通用的语言专家,另一种是告诉模型它专门是酷儿互联网俚语方面的专家。
结果有点像是看着一个没看对教科书的学生在考试。当模型在没有任何上下文或特殊指令的情况下被要求定义俚语术语时,它们经常会跌跌撞撞。它们倾向于选择一个词最常见、最日常的含义,而不是特定的酷儿含义。例如,如果你询问关于“bear”(熊)的问题,模型可能会认为是指一种毛茸茸的动物,而不是同性恋群体中特定类型的人。然而,当研究人员给模型一点帮助时,故事发生了变化。当他们提供一个展示该词用法的句子,或者告诉模型“嘿,你是一位酷儿俚语专家”时,模型在猜对含义方面表现得好多了。这就像模型是一个知道单词字典定义,但需要一点上下文线索才能想起朋友们在派对上到底是怎么使用它的那个人。
研究人员发现,虽然模型正变得越来越聪明,但它们仍然并不完美。即使有了最好的提示,模型也还无法达到在社区中长大的人类专家的水平。模型经常会错过微妙的文化细微差别,比如一个词最初是作为侮辱语,后来被社区重新赋予了积极含义,或者它是否与某些文化群体有特定的联系。有趣的是,这项研究还检查了模型是否只是从它们的训练数据中死记硬背了答案。他们发现,一些模型(尤其是商业模型)似乎以前“见过”这些特定的句子,而开源模型则没有。但即便那些没有死记硬背答案的模型,如果给予正确的上下文,也能推断出来。
最后,这篇论文表明,虽然我们的数字大脑功能强大,但它们仍然需要一点引导,才能真正理解酷儿社区那充满活力且不断变化的语言。它们不能仅仅依赖通用的字典;它们需要被告知:“这是一个特殊的社区,这里是当地人的说话方式。”这项研究并不声称已经永久解决了这个问题,但它确实表明,给予模型正确的上下文和框架会带来巨大的差异。这提醒我们,要构建真正有用的 AI,我们不仅要教它词汇,还要教它词汇背后的文化和故事。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。