Effects of Answer Format Variation on Gender Bias in Large Language Models
本文表明,答案格式(封闭式、李克特量表式或开放式)会显著改变对大语言模型性别偏见和分布对齐的测量结果,这种变化往往会导致模型排名发生逆转,并使得采用多格式评估设计成为进行稳健评估的必要手段。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,大型语言模型是驱动从聊天机器人到搜索助手等一切事物的数字引擎。这些系统是在来自互联网的海量文本上进行训练的,通过学习来预测下一个词应该是什么。因为它们向人类的写作学习,所以不可避免地吸收了数据中存在的模式、偏见和刻板印象。其中最持久且有害的模式之一是性别偏见,例如模型可能会自动假设医生是男性或护士是女性。为了解决这个问题,研究人员需要衡量这些偏见的强度。他们通过向模型提问并观察其回答来进行测量。几十年来,科学家们一直知道提问的方式会改变答案,即使是对人类也是如此。如果你要求某人在两个选项中做出选择,他们可能会选一个;如果你要求他们对认同程度进行评分,他们可能会给出不同的答案。这是调查科学中一个成熟的事实,但长期以来,测试人工智能的研究人员一直认为问题的格式并不重要,或者认为无论如何呈现问题,模型的回答都会保持不变。
斯图加特大学的一个研究小组决定直接测试这一假设。他们想看看关于性别的提问方式是否会改变他们在机器中测得的偏见。他们采用了三种不同类型的语言模型,并针对同一组关于性别角色的问题进行提问,但每次都改变了回答的格式。在第一个版本中,模型必须从一组选项中选择一个字母,就像做多项选择题一样。在第二个版本中,模型必须根据一到十的量表对自己的认同程度进行评分,类似于人们回答民意调查的方式。在第三个版本中,模型被允许用自己的语言进行自由形式的回答。研究人员使用了两组不同的问题:一组专门设计用于测试具有明确对错答案的偏见,另一组则取自关于社会如何看待性别的真实公众舆论调查。
结果令人震惊,表明问题的格式完全改变了研究人员所听到的“故事”。当模型被迫从列表中选择单一选项时,它们表现出强烈且一致的性别偏见。它们经常选择刻板印象中的答案,例如在领导角色中选择男性。然而,当研究人员切换到开放式格式(即模型可以编写自己的回答)时,测得的偏见大幅下降。在许多情况下,模型只是拒绝选择一方,或者表示信息不足以做出决定。这并不是因为模型突然变得不那么有偏见了,而是因为开放式格式为它们提供了一种避开多项选择题陷阱的方法。最令人惊讶的发现是,模型的排名取决于格式。一个在被迫选择字母时显得最有偏见的模型,在被允许自由书写时却变成了最有偏见最小的模型。另一个模型在多项选择测试中几乎没有表现出偏见,但在被要求按量表评分时却显露出了显著的偏见。
研究人员还观察了这些模型与真实人类调查受访者意见的匹配程度。他们发现,格式同样改变了这种一致性。在某些情况下,当使用一种格式时,模型的回答看起来与人类观点非常相似,但使用另一种格式时,看起来则完全不同。例如,当模型被要求使用量表时,它们的答案往往会相互抵消,产生一个看似中立的平均值,尽管模型在极端值处表达了强烈的对立观点。这与人类的行为不同:人们通常使用量表的中间值来表示犹豫不决,而模型则利用中间值来平衡极端的刻板印象。这项研究表明,我们在这些机器中看到的偏见并不是像物理特征那样固定不变的特质。相反,它是一种根据所施加的约束而变化的行为。
这项工作挑战了“单一测试可以告诉我们关于模型的全部信息”这一观点。研究人员发现,答案格式的选择不仅仅是实验中的一个小细节,它是一个塑造结果的重要因素。如果研究人员只看多项选择测试,他们可能会得出结论认为模型存在深度偏见。如果他们只看开放式回答,他们可能会得出结论认为模型是完全公平的。这两种结论都是不完整的。该研究既没有证明模型是没有任何偏见的,也没有证明偏见完全是幻觉。它表明偏见是一种复杂的行为,在不同的条件下会以不同的方式表现出来。研究人员认为,为了真正理解和评估这些系统,我们必须停止依赖单一的提问方式。我们需要观察模型在不同格式下的行为,以获得其行为的全貌,就像医生不会仅凭单一症状来诊断病人,而是会观察其健康的整体情况一样。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。