想象你拥有一台魔法艺术机器(一种文生图人工智能),它可以画出你描述的任何东西。你输入“医生”,它就画出一幅图。但由于这台机器是从海量旧互联网图片中学习而来的,它养成了一种坏习惯:即使你没有指定性别,它也几乎总是为“医生”画男性,为“护士”画女性。这就像机器内部有一个隐藏的自动设置,强行植入了这些刻板印象。
本文介绍了一种名为DebFilter的工具来解决这个问题。以下是其工作原理,使用简单的类比来说明:
问题所在:“泄漏”的说明书
人工智能不仅仅读取你的文字;它会将文字翻译成一种秘密代码(嵌入向量),以指导其绘图过程。作者发现,这种秘密代码存在“泄漏”。当代码表示“医生”时,它会意外地泄露出额外的指令,例如“必须是男性”,因为这是人工智能在训练数据中见到最多的情况。
解决方案:“价值过滤器”
作者意识到,人工智能使用其大脑中的一个特定部分,即交叉注意力(Cross-Attention),来决定画什么。可以将交叉注意力想象成一群正在阅读食谱的厨师。
- 查询(Query): “我现在在看什么?”
- 键(Key): “这是食材清单(你的文本)。”
- 值(Value): “这是食材的实际风味。”
问题在于,对人工智能来说,单词“医生”的“风味”(即值)尝起来像是“男性”。
DebFilter 就像一个智能调料瓶。它不需要重写整本食谱,也不需要解雇厨师(那将需要数月的重新训练),DebFilter 只需在“医生”这个词的“值”上撒入微量且精确的“反偏见”调料。
- 如果人工智能认为“医生”等于“男性”,DebFilter 就会加入一点“女性”调料来平衡它。
- 这样做无需改变人工智能的大脑,也无需新数据。它只是在人工智能绘图的同时微调指令。
实际运作方式
- “之前”的味道: 人工智能尝试画一个“医生”,并强烈倾向于男性特征。
- “目标”的味道: 研究人员向人工智能展示一张“女医生”的图片,以观察“风味”应该是什么样。
- 计算: DebFilter 计算出“男医生”风味与“女医生”风味之间的确切差异。
- 修正: 它创建一个通用的“校正向量”(一种数学偏移量)。当你输入“一个医生”时,DebFilter 会自动将此校正添加到指令中,引导人工智能走向平衡的结果。
它能做什么
- 性别平衡: 它可以处理像“消防员”这样的提示(通常画的是男性),使人工智能画出男女混合的画面,甚至只画女性,具体取决于你想要调整的程度。
- 年龄平衡: 它也适用于年龄。如果你要求画一个“咖啡师”,人工智能可能会画出一个老人。DebFilter 可以将其调整为画一个年轻人,或者混合年龄,而无需改变咖啡杯或咖啡馆背景。
- 精确控制: 想象一个包含“一名医生和一名护士”的场景。DebFilter 足够智能,能够分辨哪个词对应哪个角色。它可以同时将医生改为女性、护士改为男性,而不会混淆角色或破坏背景。
为何它与众不同
大多数其他消除这种偏见的方法,就像试图为了修复一扇歪斜的门而重建整栋房子。它们需要巨大的计算能力,并需要从头开始重新训练整个人工智能。
DebFilter 则像是对门铰链进行快速、廉价的调整。
- 无需训练: 当你使用人工智能时,它能立即生效。
- 无需额外数据: 它不需要新的照片来学习。
- 灵活: 你可以调高或调低“偏见过滤器”,精确决定你希望结果达到何种程度的平衡。
简而言之,DebFilter 是一个轻量级、“即插即用”的工具,它能清理人工智能艺术生成器中隐藏的刻板印象,使其更加公平,而无需破坏机器或降低其速度。
技术摘要:DebFilter
问题陈述
文本到图像扩散模型虽然在理论上等价于基于分数的生成模型,但存在固有的社会和语义偏见。这些偏见——特别是关于性别、年龄和职业的偏见——被编码在从预训练视觉 - 语言模型(例如 CLIP)中提取的文本嵌入中。在去噪过程中,这些有偏见的嵌入通过模型的引导机制(特别是交叉注意力层)被传播和放大。因此,即使是中性提示词(例如“一名医生”),也往往会产生扭曲或刻板的输出。现有的缓解策略通常依赖于对分数网络或文本编码器进行计算成本高昂的重新训练或微调,这需要平衡的数据集和大量资源,从而限制了其在现实世界应用中的实用性。
方法:DebFilter
作者提出了DebFilter,这是一个轻量级、无需训练的框架,旨在缓解文本到图像扩散模型在推理阶段的偏见。该方法通过选择性地调整交叉注意力机制内的值分量来运行,而不是修改模型权重。
核心机制
- 通过值调整进行偏差校正:该方法观察到,模型在每个去噪步骤中的误差预测主要受交叉注意力动态的影响。具体而言,条件嵌入 c 定义了键和值的表示。DebFilter 向原始条件信号引入了一个偏差校正向量 Δc。
- 交叉注意力对齐:该方法旨在将中性提示词 c 的交叉注意力输出与显式的偏差校正提示词 c′(例如,将“一名医生”与“一名女医生”对齐)的输出对齐。
- 去噪预测 ϵ^θ(zt,c) 被视为交叉注意力输出的函数。
- 该方法通过求解最小二乘优化问题,计算特定令牌索引 m(对应于有偏见的概念)的目标值向量 v^m。该优化旨在最小化源交叉注意力输出与源自显式提示词的目标输出之间的差异。
- 统一引导估计:由于 U-Net 包含具有不同深度和头的多个注意力块,该方法独立地为每一层和每一个头估计目标值向量。随后,这些估计值通过加权最小二乘回归进行聚合,以导出统一的去偏嵌入 cmnew。
- 稳定去偏引导(DebFilter):为了确保可扩展性并避免为每个提示词计算校正,该方法跨多个提示词计算偏移量 Δc=cmnew−cm 并对其进行平均。这个平均偏移量被称为DebFilter,作为一个稳定的、通用的校正方向,适用于任何包含目标概念的提示词。
- 推理时应用:在推理过程中,将此固定偏移量添加到条件嵌入中。该方法专注于早期的去噪步骤(通常是前两步),因为粗粒度结构和高级属性在此阶段确定,从而确保偏差校正不会干扰后期的纹理或风格细化。
主要特点
- 无需训练:不需要额外的数据或模型更新。
- 细粒度控制:通过识别特定的令牌索引,该方法允许在多对象场景中进行对象级控制(例如,改变“医生”的性别,同时保持“护士”不变)。
- 可逆性:校正向量可以反转(通过改变符号),以便在相反方向上应用过滤器(例如,从男性到女性与从女性到男性)。
主要贡献
- 无需训练的去偏:提出了一种针对 Stable Diffusion 的方法,通过在推理过程中调整交叉注意力机制来缓解偏见,消除了重新训练的需求。
- 对象级控制:展示了在多对象图像中的针对性控制,允许对特定概念进行去偏,同时保持空间一致性和其他属性。
- 实际可扩展性:提出了一种灵活的方法,在不改变模型架构或为每个新应用要求策划去偏数据集的情况下提高公平性。
实验结果
作者在 Stable Diffusion v2.1(以及用于特定比较的 SDXL)上评估了 DebFilter,使用了性别和年龄偏见指标。
- 性别偏见缓解:
- 在 87 种职业(58 种男性主导,29 种女性主导)上进行了评估。
- 偏见比率(Δ):DebFilter 显著降低了跨职业偏离 50% 性别平衡的归一化绝对偏差,其表现优于 TIME、UCE 和 MIST 等基线方法。
- 过渡分数(TS):该方法实现了接近目标比率(例如 0.5)的过渡分数,证明了对去偏样本比例的精确控制。
- 偏斜度:与其他方法相比,DebFilter 实现了最低的 SKEW 分数(62.1),表明跨职业的性别分布更加平衡。
- CLIPScore:去偏后的图像保持了与文本提示词的高度一致性,通常匹配甚至超过了原始模型的 CLIPScore,证实了语义保真度得以保留。
- 年龄偏见缓解:
- 成功缓解了与特定年龄组相关的职业的年龄偏见(例如,“钟表匠”与“咖啡师”)。
- 该方法自然地调整了视觉属性,如发型和皮肤纹理,同时保留了动作和背景。
- 多对象场景:
- 展示了在单个提示词内对不同对象应用不同去偏过滤器的能力(例如,“一名医生和一名护士”),成功反转了特定实体的性别表征,而不影响其他实体。
意义与主张
该论文声称,DebFilter 提供了一条可扩展且高效的途径,以实现更公平、更具包容性的文本到图像生成。通过在推理阶段完全运行,它解决了重新训练大规模模型在计算上的不切实际性。作者强调,他们的方法提供了细粒度的、可解释的去偏强度控制,同时保持了生成输出的语义保真度。
其意义在于证明了微调文本引导可以有效地重塑分数函数景观,从而抑制潜在偏见。作者将 DebFilter 定位为数据集策划或模型重新训练的替代方案,而是作为一种实用、即时的解决方案,用于缓解已部署生成模型中的社会偏见。他们指出,该方法可扩展到其他偏见概念,如种族或文化属性,尽管他们目前的实验集中在性别和年龄上。
论文结论认为,受控的引导调整为社会负责任的 AI 驱动创造力提供了一种强大的机制,在无需额外训练开销的情况下,推动了生成模型的包容性和可控性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。