Estimating Grammatical Gender Directions in Contextual Embeddings under Controlled and Natural Contexts
本文提出了一种新颖的框架,用于将西班牙语等具有语法性别的语言中上下文嵌入(contextual embeddings)中的语法性别与语义偏差进行解耦,证明了非加权控制上下文结合质心估计器能有效隔离语法性别方向,同时保留语义区别。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你拥有一个巨大的、超级聪明的机器人图书管理员(一个“语言模型”),它几乎读过了所有用西班牙语和法语编写的书籍。这个机器人非常擅长理解单词,但它有一个令人困惑的问题:它混淆了两种截然不同的“性别”。
- 语法性别(Grammar Gender): 在西班牙语和法语等语言中,每个物体都有一个性别,这仅仅是出于语法规则。例如,“桌子”是阴性,“椅子”是阳性,尽管它们既不是男孩也不是女孩。这就像是物体必须穿着的一套制服。
- 社会性别(Social Gender): 这是我们所担忧的偏见。机器人从现实世界的书籍和文章中学习到,护士通常是女性,而工程师通常是男性。这是机器人基于社会的“观点”。
问题的在于,机器人的大脑(其“嵌入/embeddings”)将这两者混淆了。很难分辨出机器人认为“桌子”是阴性的,是因为语法规则,还是因为它认为桌子是“柔软且具有女性化特征”的(这是一种偏见)。
核心目标
这篇论文的作者想要教会机器人如何区分这两者。他们想要找到那个代表纯粹语法规则、而不包含社会偏见的“纯净方向”。一旦找到了这个纯净方向,他们就可以在不意外删除职业(如“医生”与“护士”)中重要的性别信息的前提下,为那些不该有性别的物体“关闭”这种性别属性。
他们是如何做的:“洁净室” vs. “杂乱室”
为了找出纯粹的语法方向,研究人员尝试了两种不同的方式来询问机器人关于单词的问题:
- 杂乱室(自然语境): 他们让机器人观察从真实维基百科文章中提取的句子。这就像是让一名学生在嘈ло的食堂里学习。机器人看到的单词“桌子”被其他关于家具、艺术或历史的词汇所包围。这些额外的词汇会用社会偏见来“污染”答案。
- 洁净室(受控模板): 他们为每个单词创建了一个特殊的、枯燥且重复的句子模板。例如:“那个[单词]在文中被提及。” 他们对成千上万个单词都做了同样的操作。这就像是将学生置于一个安静、洁白的房间里,没有任何干扰。
意外的发现:
研究人员曾认为,也许可以用数学方法来“清理”那些杂乱的维基百科句子。但他们发现,“洁净室”方法要优越得多。 这些“枯燥”的句子为他们提供了最纯净、最准确的语法规则图谱。试图用数学去修复那些杂乱的句子虽然能略微改善结果,但永远无法达到最初使用洁净句子的效果。
工具:如何绘制地图
一旦有了数据,他们需要画出一条线(一个向量)来分隔“阳性”语法和“阴性”语法。他们尝试了三种工具:
- 平均值(质心/Centroid): 他们只是取了所有的“阳性”词汇求平均值,再取所有的“阴性”词汇求平均值,然后在两个中心点之间画出一条线。
- 严厉的老师(SVM 和 LDA): 这些是复杂的数学工具,试图画出一条完美的线,将每一个样本都完美地分隔开,就像一位严格给学生打分的老师。
胜出者:
令人惊讶的是,简单的**平均值(质心)**方法效果最好。复杂的“严厉老师”会被噪声搞混并出错。简单的平均值足够鲁棒,能够忽略混乱并找到真正的语法方向。
结果:一个平衡的解决方案
研究人员创建了一种新的测试方法。他们想确保在移除像“桌子”和“椅子”这类物体的“语法性别”时,不会意外地抹除“演员”和“女演员”这类词汇中的“社会性别”。
他们的方案完美运作:
- 它成功地从无生命物体中移除了不必要的语法性别(因此机器人不再认为“桌子”本质上具有女性特征)。
- 它完整保留了职业中重要的社会性别区别(因此机器人仍然能理解男性医生和女性医生的区别)。
简而言之
这篇论文就像是一份清洁脏窗户的指南。作者发现,试图在窗户还覆盖着雨水和泥泞(自然文本)时去擦拭它是不奏效的。相反,你需要把玻璃取下来,把它放在一个洁净的房间里(受控模板),然后在那里进行擦拭。他们还发现,用简单的、温柔的擦拭(取平均值)比使用复杂的工具去努力擦掉每一个污点效果更好。这使我们能够在不破坏机器人理解人类工作和角色能力的前提下,修正机器人的偏见。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。