← 最新论文
💬 NLP

General Phrase Debiaser: Debiasing Masked Language Models at a Multi-Token Level

本文介绍了通用短语去偏器(General Phrase Debiaser),这是一个自动化的多标记流水线,通过从维基百科生成刻板印象短语并利用这些短语来识别和消除触发偏见的提示词,从而减轻掩码语言模型中的短语级偏差,并在各种领域和模型规模上实现了性别刻板印象的显著降低。

原作者: Bingkang Shi, Xiaodan Zhang, Dehan Kong, Yulei Wu, Zongzhen Liu, Honglei Lyu, Longtao Huang

发布于 2026-09-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Bingkang Shi, Xiaodan Zhang, Dehan Kong, Yulei Wu, Zongzhen Liu, Honglei Lyu, Longtao Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

能够阅读和书写语言的计算机已经变得异常出色,能够总结新闻、翻译文档,甚至创作诗歌。这些被称为语言模型的系统,通过学习来自互联网的海量文本进行学习,吸收其中包含的模式、事实和观点。然而,由于人类语言充满了历史偏见和文化刻板印象,这些模型往往也会学会重复这些内容。计算机可能会假设护士总是女性,或者数学家总是男性,仅仅是因为它在训练数据中经常看到这样的情况。对于任何试图公平使用这些工具的人来说,这是一个显著的问题,因为机器可能会在无意中强化关于性别、种族和职业的有害偏见。虽然研究人员长期以来一直试图解决这些问题,但以往的大多数尝试都集中在纠正单个词汇上,将偏见视为仅仅更换几个有问题的术语这一简单问题。然而,现实世界的偏见很少孤立存在;它隐藏在单词组合成短语和句子的方式中,在那里,意义会以微妙且危险的方式发生转变。

来自中国科学院、阿里巴巴集团和布里斯托大学的研究团队开发了一种新方法来应对这种更深层次的偏见。他们称其方法为“通用短语去偏器”(General Phrase Debiaser),这是一个旨在通过观察词组而非仅仅是单个词来清理语言模型的系统。研究人员认识到,要真正解决这个问题,他们需要找到模型偏见最强的特定短语,然后教导模型忽略这些关联。他们的过程始于一种巧妙的收集纠正所需证据的方法。该系统并没有要求人类手动写下每一个可能的偏见短语(因为这既缓慢又不完整),而是扫描维基百科页面。它寻找连接到职业、数学、艺术和科学等主题的超链接,并利用这些链接来识别模型可能学到的刻板印象短语。例如,它可能会发现模型强烈地将“男性”与“数学理论”联系在一起,将“女性”与“舞蹈艺术”联系在一起。

一旦系统识别出这些偏见短语,它就会进入第二阶段:寻找触发模型偏见的准确问题或提示词。想象一下让计算机完成这样一个句子:“这位[人]是[空白]方面的专家。”研究人员让计算机在数百万个可能的句子中进行搜索,以找到那些它最有可能做出偏见猜测的句子。他们不仅仅寻找单词答案;他们寻找多词答案,例如“数学理论”对比“舞蹈艺术”,因为这才是真实偏见隐藏的地方。通过衡量模型在面对男性与女性时对这些短语的不同反应,系统会计算出一个代表偏见强度的分数。研究人员随后利用这个分数来指导微调过程。他们将这些特定的、触发偏见的句子反馈给模型,但这一次,他们调整模型的内部设置,以减少其反应之间的差异。目标不是抹除模型对数学或艺术的知识,而是确保它不再将这些领域与特定性别挂钩。

这项工作的成果表明,针对短语比针对单个词更为有效。研究人员在三个不同规模的知名语言模型上测试了他们的方法,发现该方法显著降低了跨职业和学术领域的性别偏见。在旨在衡量偏见的标准测试中,模型的表现有了显著提升。例如,其中一个模型 BERT 的偏见分数从 0.35 降至 0.12,而另一个模型 ALBERT 则从 0.72 降至 0.16。这些数字表明,模型将特定职业或领域与某一特定性别的关联性大大降低了。至关重要的是,研究人员还检查了这一清理过程是否损害了模型理解语言的普遍能力。他们让去偏后的模型通过了一系列涵盖语法、情感和逻辑的标准语言测试,发现模型几乎保留了其原始的所有技能。理解语言的能力保持完好,证明了在不破坏机器智能的情况下移除有害刻板印象是可能的。

这种方法标志着研究人员思考如何修复人工智能的一种转变。以往的方法通常依赖于由人类编写的外部词表,或者试图同时纠正模型的整个词汇表,这可能会导致效率低下或错过偏见实际运作的细微差别。相比之下,通用短语去偏器通过自动化发现偏见短语,并针对存在问题的特定词组组合进行处理。研究人员认为,这种多标记(multi-token)层面的纠正是必不可少的,因为人类的偏见很少是一个单词,而是一种跨越短语的关联模式。虽然本研究侧重于仅编码器(encoder-only)模型,这是语言模型的一种特定类型,但他们发现的原理同样可以应用于其他类型的系统。这项工作表明,通过更深入地观察语言结构,我们可以构建出不仅更聪明而且更公平的工具,确保未来的计算机能够反映出它们所服务的世界的多样性,而非其训练数据的局限性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →