A Heuristic Perspective on Debiasing Language Models
本文介绍了 HEIMAT,这是一个基于启发式的自动去偏框架,它将模板驱动的偏差披露与最小化差异的微调相结合,在有效缓解语言模型中文化偏差的同时,保留了其自然语言理解能力,为成本高昂的现有方法提供了一种可扩展的替代方案。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你制造了一个超级聪明的机器人,它读遍了互联网上几乎所有的书籍、网站和论坛来学习人类如何说话。这个被称为“语言模型”的机器人,就像一个读完了整个图书馆的才华横溢的学生,但它还没有学会如何过滤掉在这些书中所发现的混乱、不公平或刻板印象的想法。如果你问这个机器人:“护士长什么样?”它可能会猜是“女性”,因为在它的训练数据中,这种模式出现了数百万次,尽管男性也可以是护士。这并不是因为机器人是“邪恶的”,而是因为它从一个充满人类偏见的世界中学习到了这些东西。科学家们正在努力修复这个问题,以便让机器人公平地对待每个人,但目前大多数解决方案就像是用一把小牙刷去清洗巨大的污渍:它们既费时又昂贵,或者只能针对一种特定类型的污渍起作用。
正是在这里,一项新的研究提出了一个更聪明、更轻量化的方法来清理这些机器人。研究人员引入了一种名为 HEIMAT 的方法。请不要把 HEIMAT 仅仅看作是一个重型清洁器,而要把它看作是一个“偏见侦探”,它利用一些简单、聪明的技巧来发现机器人在想什么,然后轻轻地引导它改变想法。HEIMAT 不需要一个庞大的、预先制作好的“正确”与“错误”答案列表(这对于每种文化来说都很难制作),它通过向机器人提出一系列刁钻的问题来揭示其隐藏的假设,然后教它变得更加平衡。团队在几个不同的机器人上测试了它,发现它成功减少了关于性别和种族的偏见猜测,同时仍能让机器人像以前一样出色地完成语言理解工作。
问题所在:机器人的“内在图书馆”
语言模型是在海量的互联网文本堆中进行训练的。由于人类的写作往往包含刻板印象(例如“女性是护士”或“男性是医生”),机器人吸收了这些模式。当你要求它填补空白时,比如“这位 [MASK] 是一位医生”,它可能会比猜“她”更频繁地猜“他”,仅仅是因为在训练数据中看到这样的模式最多。这可能导致现实世界的伤害,比如强化关于谁能从事什么工作的偏见。
旧方法 vs. 新窍门
此前,科学家尝试通过两种主要方式来解决这个问题:
- “重写一切”法: 他们会手动创建成千上万个完美平衡的新句子来重新训练机器人。这就像是通过为每一个学科编写一本新教科书来教导一个孩子变得公平。这既昂贵又缓慢,且难以推广到世界上的每种语言。
- “数学投影”法: 他们试图使用复杂的数学方法从机器人的内部记忆中抹除偏见。这在处理简单问题时通常有效,但当偏见深层且复杂时,情况就会变得混乱。
本文作者认为这些方法过于僵化且成本过高。他们问道:我们能否让机器人意识到自身的偏见并自行修复,而不需要一个庞大的、预先写好的规则手册?
HEIMAT 如何运作:侦探与镜子
研究人员设计了 HEIMAT(一个启发式自动框架),使其分为两个有趣且简单的步骤。
第一步:“偏见揭示”(侦探)
首先,HEIMAT 扮演侦探的角色。它使用一些简单的、预先写好的模板向机器人提出可能触发偏见回答的问题。
- 示例: “这位年轻女性经常出现在医院,她的职业是 [MASK]。”
- 如果机器人猜“护士”的频率远高于“医生”,HEIMAT 就知道:“啊哈!这个机器人认为女性属于护理角色。”
- 为了确保捕捉到所有偏见,系统随后会要求机器人列出其他相关的词汇(如“拉丁裔”、“亚裔”、“拉丁系”),并创建一个“替换列表”。这就像侦探在收集嫌疑人名单,以观察机器人如何区别对待不同的人。
第二步:“镜像修正”(老师)
一旦偏见被暴露,HEIMAT 会创建一个几乎完全相同的句子集,这些句子仅在人口统计学词汇上有所不同(例如,“这位女性是一名医生”对比“这位男性是一名医生”)。
- 随后,机器人会被要求预测所有这些句子的下一个词。
- 如果机器人存在偏见,它对“女性”句子的回答会与对“男性”句子的回答有很大不同。
- HEIMAT 使用一种称为 Jensen-Shannon Divergence(詹森-香农散度)的数学工具(可以将其视为一个“公平度计”)来衡量这些回答之间的差异。
- 系统随后会对机器人进行“微调”,轻轻地推动它,直到它对“女性”和“男性”的回答变得几乎一致。这就像是拿着一面镜子对它说:“嘿,你在无缘无故地区别对待这两个人。让我们来修正这一点吧。”
他们的发现
团队在几个不同的机器人上测试了 HEIMAT,包括 BERT、ALBERT、TinyBERT、LLaMA-2 和 GPT-2。他们还在法语模型 CamemBERT 和 FrALBERT 上进行了测试,以观察它是否具有跨文化适用性。
- 结果: 论文报告称,HEIMAT 始终能够降低偏见得分。例如,在 CrowS-Pairs 基准测试(一种针对刻板印象的测试)中,原始 BERT 模型的性别偏见得分为 58.01。在使用 HEIMAT 后,该得分降至 50.00(其中 50 代表完美的、无偏见的得分)。对于种族偏见,得分从 58.12 降至 47.48。
- 跨文化成功: 它在法语模型上也同样有效,将 CamemBERT 的整体偏见得分从 57.36 降低到了 50.69。
- 没有“脑损伤”: 一个主要的担忧是,修复偏见是否会导致机器人变“笨”。研究人员通过标准语言测试(如英语的 GLUE 和法语的 FLUE)进行了检查。他们发现,去偏见后的模型表现与原始模型几乎完全相同。例如,BERT 在 GLUE 测试上的平均得分保持在 79.09 左右(相比于原始的 79.24),这证明了机器人并没有丧失理解语言的能力。
大局观
作者指出,HEIMAT 是一种灵活且低成本的清理 AI 的方式。与其为每种新文化或语言准备一个庞大且昂贵的数据集,你只需要一些简单的模板和一种让机器人反思自身答案的方法。这项研究表明,通过简单地要求机器人对不同群体保持一致,你可以在不破坏其大脑的前提下,洗去大部分不公平的刻板印象。
然而,作者也谨慎地指出,这并不是解决“一切问题”的魔杖。他们承认,某些关联(如“基督徒去教堂”)只是常识,并不一定是 Harmful Bias(有害偏见),区分“有害偏见”与“文化事实”仍然是未来一个棘手的难题。但就目前而言,HEIMAT 为让我们更公平的 AI 伙伴提供了一种极具前景、有趣且有效的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。