想象一下你拥有一台神奇的绘画机器。你输入一个描述,比如“一名医生”,它就会立刻画出一幅画。长期以来,人们一直认为这些机器只是中立的工具,就像照相机一样。但这篇文章认为,这些机器更像是带有偏见的镜子——它们不仅是在展示现实,还在展示一个基于其从互联网上学到的知识而扭曲的版本。
这篇文章的作者 Thomas、Adrian 和 Biying 想要测试五种最流行的“绘画机器”(Midjourney、Stable Diffusion、DALL-E 3、Playground 和 FLUX),看看它们如何处理职业和人物。他们建立了一个特殊的测试场,叫做 BAFIS(公平图像合成战斗竞技场)。
以下是他们研究结果的拆解,使用了简单的类比:
1. 竞技场:BAFIS
把 BAFIS 想象成一场盲测比赛。
- 设置: 他们并没有只是让计算机来给图片评分,而是让两台不同的机器进行“战斗”。
- 竞赛内容: 用户看到一个提示词(例如“一名护士”)和由两台不同机器生成的两张匿名图像。
- 投票: 用户针对三点进行投票:
- 偏见: 图片看起来是真实的人群组合,还是只展示了一种类型?
- 质量: 图片是否漂亮且清晰?
- 对齐度: 图片是否真的符合你输入的文字?
- 评分: 他们使用了一种排名系统(类似于国际象棋等级分)来观察哪台机器获得的选票最多。
2. 数据集:一个巨大的职业图书馆
为了确保测试公平,他们没有仅仅询问“一名医生”。他们创建了一个包含 21,140 张图片 的庞大图书馆,基于 1,057 种不同的职业描述。
- 他们使用了两种语言:英语和德语。
- 他们尝试了不同的提问方式:
- 直接式: “一张男性会计的照片。”
- 间接式: “一张管理财务的人的照片。”
- 群体式: “一群会计的照片。”
- 他们将结果与德国政府的现实世界统计数据进行了对比(就像根据实际配料表来检查食谱是否正确一样),以查看这些机器在描述谁持有这些职业时是否在撒谎。
3. 研究结果:机器错在哪里
性别问题(“建筑 vs 护理”的分野)
这些机器对性别有着强烈的刻板印象。
- 建筑与工程: 当被要求绘制这些职业时,机器几乎总是画出男性。这就像它们认为只有男性才能从事建筑工作。
- 医疗与办公室工作: 当被要求画护士或办公室职员时,机器则严重倾向于女性。
- 令人惊讶的是: 其中一台机器 DALL-E 3 是最平衡的。它画出的男女比例几乎相等,就像一次公平的硬币投掷。另一台机器 FLUX 实际上在某些职业中画出的女性比男性还要多,这是一种新型的偏见。
种族问题(“白人围墙”)
这是最大的问题。无论你询问什么职业,机器都压倒性地绘制白人面孔。
- 这就像机器有一个默认设置,即:“如果你没有指定种族,就做成白人。”
- 这种偏见在德语中比在英语中更严重。当提示词使用德语时,机器画出的非白人面孔甚至更少。
- DALL-E 3 是唯一一台能够将白人面孔的比例在两种语言中都控制在 50% 以下的机器,这使其最具多样性。
“人类 vs 机器人”计分板
这里情况变得复杂了。论文发现,计算机指标(用于评估图像质量的数学公式)经常与人类的感觉产生分歧。
- 图像质量: 一台名为 FLUX 的机器被人类评为最美观、最真实的。然而,计算机数学(FID 分数)却说 DALL-E 3 才是最好的。
- 启示: 数学公式就像是一个试图评价绘画的机器人;它们测量像素,却捕捉不到人类看画时的“灵魂”或感觉。人类更喜欢 FLUX,即便数学公式得出的结论并非如此。
语言的转折
- DALL-E 3 有一个秘密武器:它会重写你的提示词。如果你输入德语提示词,它会在绘画前偷偷将其翻译并调整为英语。这有助于它更好地理解请求,并在德语对抗中获得更高的“对齐度”(匹配文字)分数。
- Stable Diffusion 3 是英语提示词的冠军,但在德语方面表现挣扎。
4. 结论
论文得出结论,这些 AI 绘画机器并不是中立的。它们承载了训练数据的偏见。
- 它们在“硬核”工作中过度代表男性,而在“护理”工作中过度代表女性。
- 它们几乎总是默认生成白人面孔。
- 计算机测试是不够的。 我们需要询问真实的人类他们的想法,因为数学并不能总是捕捉到对我们而言什么是“公平”或“真实”的感觉。
作者建议,为了解决这个问题,开发者需要更密切地倾听人类的反馈,并将他们的机器与现实世界的统计数据进行对比,而不仅仅是依靠计算机公式。他们建立了 BAFIS,以便在未来,我们可以通过这个“战斗竞技场”持续监督这些机器,确保它们变得更加公平。
技术摘要:BAFIS —— 用于评估现代文本生成图像模型职业偏见与人类偏好的数据集及框架
1. 问题陈述
生成式人工智能,特别是文本生成图像(T2I)模型,在提高生产力和创造性内容生成方面具有巨大潜力。然而,现有研究表明,这些模型深受偏见影响,往往无法准确呈现性别、种族和文化的多元性。这存在延续社会偏见的风险,因为用户可能会在不知不觉中信任带有偏见的结果。
现有的 T2I 模型评估方法主要依赖于自动化指标(如提示词对齐度、图像质量)或基于分类的偏见检测。虽然存在一些用于人类偏好评估的平台(如 Chatbot Arena、IMGSYS),但它们缺乏评估偏见的特定能力。此外,许多现有基准测试侧重于英语提示词和图像质量,往往忽略了社会经济偏见或多语言语境下的细微差别。因此,迫切需要一个结合自动化指标与人类偏好反馈的框架,以评估在职业图像生成背景下固有的以及由语言引起的偏见。
2. 研究方法
2.1 BAFIS 框架
作者引入了 BAFIS(用于公平图像合成的战斗竞技场,Battle-Arena for Fair Image Synthesis),这是一个静态基准测试平台,旨在收集关于偏见、图像质量和提示词对齐度的匿名、随机化人类反馈。与用户可以修改提示词的实时竞技场不同,BAFIS 利用预先计算的数据集,在受控条件下研究特定提示词的影响。
- 机制: 用户选择一种语言(英语或德语),并参与“战斗”,其中两个随机选择的模型会针对特定提示词生成图像。
- 评估: 用户在三个维度上进行主观投票:
- 偏见: 感知到的性别和种族分布相对于社会预期的情况。
- 图像质量: 写实度与美感。
- 提示词对齐度: 图像与文本描述的匹配程度。
- 排名: 通过对两两比较的结果进行转换,利用 Elo 等级分系统 和基于 Bradley-Terry 模型的 极大似然估计(MLE) 来确保排名的稳定性。
2.2 数据集生成
为了实现这一评估,作者构建了一个包含 21,140 张合成图像 和 1,057 个提示词 的综合数据集。
- 源提示词: 基于 MAGBIG 数据集,并进行了扩展,包含了 151 个德语和 151 个英语的“群体”提示词,以及“直接”、“间接”、“直接女性化”和“德语性别星号(gender star)”变体。
- 评估模型: 测试了五种处于默认配置下的最先进 T2I 模型:
- Midjourney v6.1
- Stable Diffusion 3 Medium
- DALL-E 3
- Playground v2.5
- FLUX.1-dev
- 过滤: 使用人脸检测算法自动排除了面部被遮挡或不可见的图像。
2.3 评估指标
本研究采用了双重方法:
- 自动化指标:
- 偏见: 使用 YoloV8 进行人脸检测,并使用 FairFace 进行性别/种族分类。偏见通过计算相对于均匀分布基准的 平均绝对偏差(MAD) 得分来量化。
- 图像质量: 通过针对 Flickr-Faces-HQ 数据集的 FID(Fréchet Inception Distance)以及用于人脸图像质量(FIQ)的 MagFace 得分进行评估。
- 提示词对齐度: 通过提示词与图像之间 CLIP 向量表示的余弦相似度来衡量。
- 人类反馈: 通过 BAFIS 平台收集(459 场战斗,1,377 次投票),并与 德国联邦就业局 的官方统计数据进行对比,以提供社会经济参考点。
3. 主要结果
3.1 偏见分析
- 性别偏见:
- 英语提示词: Midjourney v6.1、Playground v2.5 和 SD 3 Medium 生成了超过 55% 的男性面孔。“直接型”提示词表现出极端的偏见(例如,Playground v2.5 约为 70% 男性)。
- 德语提示词: 与英语相比,大多数类别中的性别偏见有所降低,但在“服务与款待业”领域仍存在男性偏见。
- 异常值: DALL-E 3 展示了最均衡的性别分布。FLUX.1-dev 在英语环境下表现出对女性面孔的偏好。
- 种族偏见:
- 所有模型在两种语言中都表现出对生成白人种族面孔的显著偏好。
- 语言影响: 德语提示词中的偏见更为明显。例如,当从英语提示词切换到德语提示词时,SD 3 Medium 中白人面孔的比例增加了约 30%。
- DALL-E 3 是唯一一个在两种语言中白人种族面孔比例均低于 50% 的模型。
- MAD 得分: DALL-E 3 在性别和种族方面均获得了最低的 MAD 得分(表明偏见最小)。德语提示词一致比英语提示词产生更高的 MAD 得分(即更多偏见)。
3.2 图像质量与对齐度
- 自动化指标: DALL-E 3 获得了最佳的 FID 分数,而 SD 3 Medium 在 MagFace(人脸识别质量)方面得分最高。
- 人类偏好(Elo 等级):
- 图像质量: FLUX.1-dev 排名最高,其次是 Midjourney v6.1。尽管 DALL-E 3 拥有卓越的 FID 分数,但在人类对图像质量的偏好中排名最后。
- 提示词对齐度: SD 3 Medium 在英语战斗中排名最高,而 DALL-E 3 在德语战斗中排名最高。
- 偏见偏好: DALL-E 3(德语)和 Midjourney v6.1(英语)在人类偏好评分中获得了最高的偏见相关评分。
3.3 相关性差异
研究发现既定的自动化指标与主观人类评分之间存在部分相关性:
- 图像质量: FID 分数(DALL-E 3 表现优异)与人类 Elo 等级(FLUX.1-dev 表现优异)之间存在显著脱节。
- 提示词对齐度: 虽然 CLIP 相似度分数在英语提示词中更青睐 Playground v2.5,但人类 Elo 等级更青睐 SD 3 Medium。
- DALL-E 3 异常现象: DALL-E 3 的图像与英语提示词之间表现出高度相似性,这归功于其“提示词修订”功能(该功能为了安全性进行提示词重写和翻译),从而可能增强了与人类预期的对齐。
4. 核心贡献
- BAFIS 平台: 一个全新的静态基准测试平台,专门设计用于通过人类偏好反馈来评估 T2I 模型在偏见、质量和对齐度方面的表现。
- 综合数据集: 一个多语言(德语/英语)的合成图像数据集,包含 21,140 张图像,专注于职业背景,扩展了 MAGBIG 基准。
- 多语言偏见分析: 对语言(英语 vs 德语)如何影响偏见进行了系统性调查,揭示了德语提示词往往会加剧种族偏见。
- 人类 vs 自动化指标: 一项对比分析,证明了既定的自动化指标(FID、CLIP 相似度、MagFace)并不总是与人类偏好一致,强调了“人类在环(human-in-the-loop)”评估对于公平性的必要性。
5. 意义与主张
论文声称,其研究强调了仅依靠自动化指标来评估 T2I 模型公平性的局限性。通过整合人类偏好反馈,作者证明了:
- 系统性偏见在所有评估的模型中都存在,特别是在种族(偏向白人面孔)和性别方面。
- 语言在偏见体现中起着至关重要的作用,德语提示词通常显示出比英语更强的偏见。
- 人类对图像质量和对齐度的偏好可能与自动化评分显著背离,这表明当前的评估标准可能无法完全捕捉用户感知的“公平性”和“质量”的细微差别。
作者总结道,开发更公平、更具包容性的 T2I 模型需要将人类偏好纳入评估流程。他们倡导制定解决偏见、多样化数据集策展和定期偏见评估的指南,同时强调建立反馈渠道以识别与偏见相关的疑虑。代码和数据集已公开,以促进进一步研究。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。