技术摘要:BioPro —— 迈向视觉-语言模型中具备差异感知能力的性别公平性
1. 问题定义
视觉-语言模型(VLMs)继承了训练数据中显著的社会偏见,尤其是在性别表示方面。现有的公平性干预通常采用“差异无关”(difference-unaware)的视角,即对所有人口统计群体实施统一的处理。作者认为,这种方法无法区分需要保持中立的场景(例如描述一个模糊的主体)与需要保留特定群体属性的场景(例如描述一位清晰可见的女性医生)。
本文将差异感知性别公平性(difference-aware gender fairness)的问题形式化,专门针对视觉-语言模型中的两类任务:
- 图像描述(Image Captioning): 模型应避免对模糊主体推断性别(中立公平性),同时应忠实地保留清晰可辨主体的性别信息(显式忠实性)。
- 文本生成图像(Text-to-Image Generation): 模型应对中性提示词(如“一张人的照片”)生成平衡的性别分布,同时严格遵循显式提示词中的指定性别身份(如“一张女性医生的照片”)。
核心挑战在于实现选择性去偏(selective debiasing):在消除中性语境下不必要的偏见的同时,不抹除显式语境中有意义的区别,并在此过程中保持语义保真度。
2. 方法论:BioPro(偏置正交投影)
作者提出了 BioPro,这是一个完全无需训练的框架,通过在表示空间中进行正交投影来运行。该方法识别出一个低维的性别变化子空间,并根据输入的上下文选择性地中和性别相关信息。
2.1 构建性别变化子空间
BioPro 利用反事实嵌入(counterfactual embeddings)来定义偏置方向。
- 数据来源: 该方法采用了 SCFs 数据集 [19],该数据集生成了除性别属性外,在所有特征上都完全相同的图像对(例如,在相同姿态/场景下的男性与女性主体)。
- 子空间提取: 对于一对嵌入 (hm,hf),其差分向量编码了高纯度的性别变化。通过将这些差异收集到矩阵 D 中,作者通过奇异值分解(SVD)提取出性别变化的主成分方向。前 k 个奇异向量构成了性别变化子空间 S。
2.2 特定任务的实现
A. 图像描述(选择性去偏)
对于图像描述,目标是仅在输入具有歧义时移除性别信息。
- 正交投影: 模型将融合后的文本-图像嵌入投影到性别子空间的正交补空间(P⊥)上。这移除了性别成分(Hbias),同时保留了语义成分(Hsem)。
- 基于投影的选择机制: 为了防止对显式样本进行过度修正,BioPro 引入了一种选择机制。它通过分析嵌入在性别子空间上的投影幅度来区分样本。
- 显式样本(性别特征明显的)表现出较大的投影幅度。
- 中性样本(模糊的)表现出较小的投影幅度。
- 通过优化权衡系数 λc 来学习一个阈值 δc,以区分这两种分布(建模为偏态正态分布)。
- 操作: 如果样本的投影幅度低于 δc,则应用正交投影;如果高于 δc,则保留原始嵌入以保持显式的性别忠实性。
B. 文本生成图像(校准)
对于生成任务,输出空间本质上是二元的(图像必须展现性别属性),因此简单的投影可能不足够,因为这仍可能导致分布不均。
- 校准项: BioPro 引入了一个结合了正交投影项与校准项的优化目标。
- 该目标旨在最小化投影矩阵 P 与正交投影器 P⊥ 之间的距离(以保留语义)。
- 同时,最小化投影后的女性嵌入与男性嵌入(以及反之)之间的距离,以平衡生成方向。
- 闭式解: 作者推导出了最优投影矩阵 Pf→m 的闭式解,使模型能够在处理中性提示词时,将表示向代表性不足的性别偏移,而不至于抹除显式提示词中预期的语义。
2.3 向连续偏置的泛化
该框架被扩展到了处理场景亮度等连续偏置变量。通过构建具有不同强度强度的提示对(例如,“明亮的照片”与“黑暗的照片”),BioPro 识别出了一个连续的偏置子空间。校准项允许通过超参数 λg 对生成的场景亮度水平进行可调节控制,证明了其在处理离散类别属性之外的应用能力。
3. 核心贡献
- 概念扩展: 本文将差异感知公平性的概念从仅限文本的大语言模型(LLMs)扩展到了多模态视觉-语言模型,为选择性偏置缓解提供了原则性的公式化表述。
- BioPro 框架: 提出了 BioPro,这是一种无需训练的方法,通过正交投影和自适应选择/校准机制,有效地平衡了中性公平性和显式性别忠实性。
- 处理连续偏置: 据作者所知,这是第一个在文本生成图像任务中有效处理连续偏置变量(如场景亮度)的方法,超越了二元或类别偏置缓解的范畴。
4. 实验结果
作者在图像描述(使用 LLaVA-1.5 和 LLaVA-NeXT)和文本生成图像(使用 FLUX.1-dev 和 FLUX.1-schnell)任务上对 BioPro 进行了评估。
图像描述:
- BioPro 实现了最佳的综合偏置率(CBR),表明其在降低中性情况下的偏置(BRn)与保持显式情况下的忠实度(BRe)之间取得了卓越的平衡。
- 它显著优于 Prompting、LIBRA 和 SFID 等基线方法。
- 语义保留指标(METEOR 和 CLIP-S)与基础模型保持一致,证实了去偏过程并未降低图像描述质量。
- 消融研究表明,移除“选择(Selection)”模块会导致显式忠实度大幅下降,验证了选择机制的必要性。
文本生成图像:
- BioPro 在男性刻板印象和女性刻板印象职业中均实现了最低的**偏斜(Skew)**得分(表明性别分布更平衡)。
- 对于显式提示词,它保持了接近于零的误分类率(MR),确保了指定的性别得到尊重。
- 图像质量指标(CLIP-S 和 MUSIQ)与基础模型相比几乎没有退化。
- “无校准(w/o Calibration)”变体表现出明显较弱的去偏效果,凸显了校准项对于生成任务的重要性。
连续偏置(场景亮度):
- BioPro 能够根据参数 λg 成功调整生成图像的亮度(例如,使天空场景变暗)。
- 该方法在有效缓解过度曝光场景偏置的同时,保持了语义对齐(CLIP-S)和图像质量(MUSIQ)。
5. 重要性与主张
本文声称 BioPro 为视觉-语言模型中的偏置感知生成提供了一个可控且有效的范式。其重要性在于:
- 上下文敏感性: 不同于将所有群体视为完全相同的“盲目”公平方法,BioPro 尊重上下文的细微差别,在消除伪造刻板印象的同时保留了合法的区别。
- 无需训练的高效性: 作为一种事后推理阶段的干预手段,它避免了重新训练或微调大型模型所需的计算成本和数据需求。
- 泛化性: 该框架展示了偏置缓解可以从离散属性(性别)推广到连续变量(亮度),为多种类型的偏置提供了统一的解决方案。
作者总结道,虽然其线性干预方法可能无法完全解释属性之间的非线性纠缠,但它为实现多模态系统中的选择性公平提供了一个实用、灵活且高质量的解决方案。