← 最新论文
🤖 AI

Position: Fairness Failure in Generative Models is an Evaluation Problem

本立场论文认为,生成式模型中的公平性失效主要是一个评估问题,其根源在于发现结果的不可比性和不可操作性,并提议将“公平性卡片”(Fairness Cards)作为一种标准化的报告人工制品,以实现偏差评估的可复现性、可比性和问责制。

原作者: Mariia Vladimirova, Jean-Yves Franceschi, Thibaut Issenhuth

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Mariia Vladimirova, Jean-Yves Franceschi, Thibaut Issenhuth

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在过去的十年里,计算机已经学会了创作艺术、编写故事,并能以一种曾经看似不可能的流利程度进行对话。这些生成式系统可以根据简单的指令生成图像、文本和视频,如今已融入日常生活的肌理之中。然而,随着这些工具变得越来越强大,一个持久的阴影也随之而来:它们倾向于复制并放大社会性的不平等。当计算机生成一张医生的图像时,它往往默认是一位男性;当它编写关于领导者的故事时,它经常选择特定的性别或种族。这不仅仅是代码中的一个小故障,而是对机器所学习数据的反映,是一面映射人类历史偏见的镜子。多年来,研究人员和监管机构一直试图解决这个问题,开发检测并减少这些不公平模式的方法。其目标始终是确保这些强大的工具能以平等的尊严和准确性对待所有人。

然而,一个新的观点表明,问题可能不在于缺乏更好的修复方法,而在于我们衡量修复效果的方式。一组研究人员认为,该领域之所以陷入混乱的循环,是因为用于判断公平性的测试过于灵活。正如一把由橡胶制成的尺子会根据你拉伸的方式给出不同的测量值一样,目前的 AI 公平性测试方法会根据研究人员做出的微小且通常未报告的选择而改变其结果。一项研究可能使用一种特定的提问方式并得出 AI 是公平的结论,而另一项研究使用稍微不同的措辞可能会得出同一个 AI 存在严重偏见的结论。两项研究在各自狭窄的规则内在技术上都是正确的,但它们向公众和政策制定者讲述了截然相反的故事。这种不一致性使得我们无法得知技术是否真的在进步,还是我们只是在观察同一个问题的不同角度。

这项新工作的背后研究者 Mariia Vladimirova 及其同事,旨在诊断为什么生成式模型的公平性仍然是一个如此棘手的问题。他们并没有简单地提出一种让 AI 变得更“礼貌”的新算法;相反,他们审视了评估过程本身。通过一系列受控实验,他们证明了关于 AI 是否公平的判定,往往完全取决于用于测试它的“协议”。在一个引人注目的演示中,他们针对同一个不变的 AI 模型,测试了各种不同的场景。他们改变了提问的方式、期望回答的风格以及生成文本时使用的设置。他们发现,同一个模型在一种条件下可能被判定为存在严重的公平性问题,而在另一种条件下则被判定为完全平衡。

例如,当研究人员要求模型描写一个从事特定职业的人时,结果表现出严重的刻板印象倾向。但当他们要求同一个模型为同一个人写一份专业的备忘录时,偏见就消失了。在另一项测试中,他们改变了计算机选择单词的方式,即一种被称为“解码机制”(decoding regime)的设置。这种设置的轻微偏移(在其他研究中通常是随机或默认设置)足以将结论从“有偏见”翻转为“无偏见”。研究人员发现,这些变化并非随机噪声,而是系统性的偏移,它们会根据评估者的选择来隐藏或揭示伤害。这意味着,一家公司可以发布一个模型并附带一份声称其公平的报告,仅仅是因为他们选择了一种恰好显示良好结果的测试方法,而另一种方法则会揭示显著的问题。

论文指出,这种缺乏标准化的现象才是真正的瓶颈。问题不在于我们不知道如何构建更公平的模型,而在于我们无法可靠地判断是否取得了成功。目前的格局充斥着“临时性”(ad-hoc)的检查,研究人员挑选几个例子进行测试并报告结果。这种方法允许所谓的“择优挑选”(cherry-picking),即一个系统看起来很好,是因为测试的设计初衷就是为了让它看起来很好;或者是一个真正的改进被错过了,因为测试过于狭隘。此外,研究人员强调,现代 AI 系统通常包含拒绝回答某些问题的安全层。如果一个模型对某些群体拒绝回答问题,却对另一群体回答问题,这就是一种被称为“访问差异”(access disparity)的不公平形式。然而,许多当前的测试只是忽略了这些拒绝行为,或者将其视为应丢弃的错误,从而有效地掩盖了某些人被噤声而另一些人被倾听的事实。

为了解决这个问题,该团队提出了一个名为“公平性卡片”(Fairness Card)的新标准。想象一下食品包装上的营养标签,但它是针对 AI 系统的。正如营养标签会告诉你食物中含有多少糖分以及它是如何加工的一样,公平性卡片会列出关于 AI 测试的所有细节。它会明确说明询问了哪些问题、运行了多少次测试、使用了哪些生成答案的设置,以及研究人员如何处理拒绝或安全拦截。这份文件并不会规定什么是“公平”,但它会让衡量公平性的过程变得透明且可复现。如果两个不同的研究人员想要比较他们的结果,他们会确切知道如何复制该测试,从而确保他们是在进行“苹果对苹果”的比较,而不是“苹果对橘子”。

研究人员通过为自己的实验创建一份详细的公平性卡片来测试这个想法。他们记录了每一个变量,从提示词中使用的具体词汇到影响计算机选择的随机种子。当他们公布这些细节时,他们展示了同一个模型可以根据你观察卡片的哪个部分,产生广泛的公平性评分。在一种提示风格下,模型表现出高度的刻板语言倾向;而在另一种风格下,则几乎没有。通过在单一的、标准化的格式中呈现所有这些数字,他们证明了关于模型公平性的“真相”并非一个单一的数字,而是一个复杂的图景,只有当所有变量都可见时,图景才会清晰。

这种方法将重点从试图寻找一个完美的、一劳永逸的公平定义,转向建立一个使评估过程本身变得诚实且完整的系统。作者承认,这并不会解决所有问题。他们指出,一些公司可能仍会隐藏数据,且不同的文化可能对公平有不同的理解。然而,他们认为,如果没有一份关于系统如何被测试的共享且详细的记录,就无法取得进展。无法可靠地衡量你无法一致衡量的东西,如果游戏规则不断变化,你也无法比较解决方案。

论文最后向研究人员、开发者和监管机构发出了行动呼吁。他们敦促,每当一个新的 AI 系统发布或关于其公平性的声明做出时,必须提供一份公平性卡片。这份文件应被视为发布的强制组成部分,就像安全手册或用户指南一样。它应该详细说明测试的具体人群、提问的具体方法,以及全范围的结果,包括最坏的情况。通过使这些选择显性化,该领域可以从模糊的承诺转向一个未来,在那里,公平性是构建和使用这些强大工具时一个可衡量、可追踪且可问责的部分。目标不是消除所有的偏见(这可能是不可能的),而是确保当我们决定一个系统是否安全可用时,我们看到的都是同样的证据。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →