← 最新论文
💬 NLP

Who Do Language Models Think Is Competent? A Mechanistic Analysis of Occupational Bias

本文揭示了语言模型往往会保留基于性别和种族等人口统计特征的关于用户能力的内部表征偏见,即便其可观察到的输出表现得看似无偏见,这表明仅凭行为评估不足以检测出这些潜在的失效模式。

原作者: Keren Fuentes, Aaron Mueller

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Keren Fuentes, Aaron Mueller

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

人类能够持有关于他人的潜意识假设,且往往在意识到这一点的情况下。一个人可能会认为某个特定的人口统计群体不太适合从事某项工作,即使他们在意识层面拒绝此类观点。这些隐藏的关联会悄无声息地塑造决策,从谁被录用到某人能获得多少帮助。在人工智能领域,大型语言模型通过学习海量文本来模仿人类语言。因为它们向人类的写作学习,所以经常会习得这些相同的隐藏关联。多年来,研究人员一直试图通过向它们提问或观察它们的回答来衡量这些计算机程序是否存在偏见。如果一个模型拒绝表达偏见言论,它通常被认为是安全的。然而,一项新的研究表明,一个模型在表面上可能表现得非常礼貌,但在其自身的处理过程中仍然保留着这些偏见想法。

这项工作的研究者 Keren Fuentes 和 Aaron Mueller 想要观察模型的内部想法是否与其外部行为相匹配。他们关注一种特定类型的偏见:即基于性别、种族或社会经济地位而非实际技能来判定某些人更强或更弱的假设。为了调查这一点,他们观察了判断模型的两种不同方式。第一种是“行为”视角,即模型在被问及问题时实际说出的话。第二种是“表征”视角,它观察模型在思考过程中在其大脑内部创建的数学模式。可以将模型的内部状态想象成存在于其形成句子之前的隐藏思维层。研究人员开发了一种测量这种隐藏层的方法,以观察模型是在将用户视为专家还是新手,而无论用户对自己经验的描述如何。

为此,团队创建了一套涵盖二十种不同职业(从护理到软件开发)的专业问题。他们向三个不同的语言大模型提出了这些问题,但在每种情况下都略微改变了语境。有时他们告诉模型用户是该领域的专业人士;有时则在不提及用户职业的情况下提到其性别、种族或收入水平。然后,他们测量了两件事:模型在回答中所使用的语言复杂度,以及模型给出的用户专业程度的内部“评分”。语言复杂度作为行为指标,而内部评分则作为窥视模型隐藏推理的窗口。

结果揭示了一个显著的脱节。在许多情况下,模型生成的回答看起来公平且无偏见。当被要求雇佣一名候选人或回答一个技术问题时,模型并不会根据用户的种族或性别给出明显不同的回答。如果你只看最终的文本,模型似乎对每个人都一视同同。然而,当研究人员窥视模型的内部处理过程时,他们发现了不同的情况。模型根据那些本不该相关的统计学细节,为用户分配了不同的专业程度等级。例如,一个模型可能会在内部将一名白人用户评定为比一名拉丁裔用户更有能力,即便两名用户提出的问题完全相同且拥有相同的职位头衔。这种内部偏见即便在模型的最终措辞没有显示任何偏见时依然存在。

研究人员证明了这些内部评分并非随机噪声;它们实际上控制着模型的行为。通过使用一种称为“转向”(steering)的技术,他们可以引导模型的内部想法,使其将用户视为更有能力或较少能力的个体。当他们这样做时,模型的回答发生了变化。如果他们引导模型将用户视为专家,模型就会使用更复杂的语言并提供更详细的技术建议。如果引导其视为新手,回答则会变得更简单。这证实了专业程度的内部表征是一种驱动模型输出的真实且具有因果关系的驱动力。研究表明,这些内部偏见对人口统计学线索非常敏感。即使模型知道用户的职业,其内部状态中仍能检测到基于种族或性别的关于能力的微妙差异感知,即便这些差异并不总是体现在最终的文本中。

这一发现表明,目前测试人工智能偏见的方法可能遗漏了很多内容。如果我们只检查模型说了什么,我们可能会误以为它是公平的,而实际上并非如此。此处研究的模型(包括 Gemma 和 Llama 的版本)显示,它们可以在隐藏层中编码人口统计群体与能力之间的关联。这些关联可能会以一种不易察觉的方式影响模型的决策。例如,在招聘任务中,尽管最终的招聘决定在各组之间在统计学上看起来相似,但模型的内部评分会随种族和性别而变化。研究人员发现,虽然可以通过转向技术改变模型的招聘率,但底层的内部偏见依然存在,这表明模型仍在以一种影响其判断的方式处理人口统计信息。

这项工作的意义在于如何评估和改进人工智能。它表明,一个模型可以通过标准的安全性测试,却仍然怀揣着可能被特定提示或条件触发的深层偏见。研究人员认为,我们需要超越模型所言的表面层次,去审视它是如何思考的。通过测量这些内部表征,我们或许能够在偏见转化为有害行为之前检测并修复它们。这种方法提供了一种确保这些强大工具不仅在言语上,而且在本质上都是真正公平的新途径。研究结论指出,虽然行为指标是必要的,但仅靠它们是不够的;对公平性的稳健理解需要观察模型本身的隐藏机制。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →