想象一台巨大的、神奇的绘画机器(一种“文本生成图像”AI),它已经从互联网上的数十亿张图片中学习了知识。你可以对它说,“画一个医生”,它就会画出一个。但由于它是从现实世界中学习的,它也吸收了现实世界的偏见。如果你要求画一个“医生”,它几乎总是会画出一个穿着白大褂的男人。如果你要求画一个“护士”,它几乎总是会画出一个女人。
问题在于,我们通常只检查那些我们已经熟知的、明显的、宏观的偏见(比如性别或种族)。但那些AI可能懂得如何绘制、却仅仅是由于某种原因从未选择去绘制的奇特、罕见或微妙的事物呢?也许它知道如何画一个有着卷发的医生,或者一个复古照片风格的医生,但它却一直在忽略这些想法。
RAIGen 正式登场。
把 AI 的大脑想象成一个巨大的“神经元”图书馆(即当 AI 想到特定事物时会亮起的微小开关)。大多数时候,只有少数几个开关会反复亮起(即“流行”的想法)。而那些罕见的想法则隐藏在几乎从未被开启的开关里。
RAIGen 的工作原理(“俄罗斯套娃”类比)
俄罗斯套娃(Matryoshka Sparse Autoencoders):
想象 AI 的大脑是一套俄罗斯套娃。外层的娃娃很大,涵盖了宽泛的概念(比如“一个人”)。内层的娃娃很小,涵盖了非常具体的细节(比如“一种特定类型的帽子”)。
RAIGen 使用一种被称为 Matryoshka Sparse Autoencoder 的特殊工具来打开这些娃娃。它不仅仅是观察大局,它还会剥开层层外壳,去寻找内部那些微小且具体的开关。
“安静神经元”检测器:
RAIGen 会寻找那些最安静的开关。它会问两个问题:
- 这个开关触发的频率有多低?(如果它只在 1% 的时间里亮起,那么它就是一个“罕见”的想法)。
- 这个开关是否具有唯一性?(它代表的是某种与平均水平完全不同的东西,还是仅仅是一个嘈杂的故障?)。
如果一个开关既安静又具有唯一性,RAIGen 就会将其标记为一个“罕见属性”(Rare Attribute)。
寻宝之旅:
一旦 RAIGen 找到了这些安静的开关,它就会去查看那些让这些开关亮起的图片。它可能会发现一张“黑白肖像中的女性医生”或者“冒着滚滚浓烟的火车”。这些都是 AI 知道如何绘制,但为了追求“标准版本”而通常会跳过的东西。
RAIGen 究竟发现了什么
研究人员在流行的 AI 模型(如 Stable Diffusion)上测试了它,并发现:
- 它能发现隐藏的瑰宝: 它发现了标准偏见检查器所遗漏的罕见概念,比如特定的发型、文化符号或不寻常的相机角度。
- 它适用于不同的模型: 它在较旧、较小的模型和较新的、庞大的模型中都发现了这些罕见特征。
- 这不仅仅关乎公平性: 它发现了一些并非关于性别或种族的罕见事物,而是关于风格和语境的事物(比如“拿着医疗图表的医生”对比仅仅是一个“通用的医生”)。
“音量旋钮”效应
最酷的部分是接下来会发生什么。一旦 RAIGen 识别出这些安静的开关,研究人员展示了他们可以通过“调高这些开关的音量”来改变它们。通过根据 RAIGen 的发现对文本提示词进行微调,他们可以迫使 AI 更频繁地绘制出这些罕见的图片。
核心结论
RAIGen 就像一名侦探,通过倾听 AI 内部的思想,来寻找它正秘密保留着的想法。它不仅仅是在告诉我们 AI “不擅长”什么;它是在告诉我们 AI “忽略了”什么。这有助于我们理解这些模型的完整能力范围,而不仅仅是它们最常产出的那些常见事物。
重要提示: 该论文谨慎地指出,这仅能发现 AI 已经学到 的东西。如果 AI 在训练期间从未见过某种特定罕见文化符号的图片,RAIGen 也无法找到它。它只能揭示图书馆中那些已经存在、但却极少被造访的“隐藏部分”。
技术摘要:RAIGen —— 文本生成图像模型中的稀有属性识别
1. 问题陈述
文本生成图像(T2I)扩散模型(如 Stable Diffusion)能够生成高保真度的图像,但也继承并放大了其训练数据中的偏差。虽然先前的研究通过闭集方法(缓解预定义类别如性别或种族中的偏差)或开集方法(识别主导性的多数属性)来解决这一问题,但仍存在一个关键空白。现有方法忽略了对稀有或少数属性的系统性低估,这些属性被编码在模型的内部表示中,但在生成过程中被抑制。这些属性可能是社会性的、文化性的或风格性的,且不一定需要先验知识。仅仅抑制主导属性并不自动等同于放大这些被低估的特征;相反,它往往会导致概率质量的不均匀重新分配。因此,需要一个框架来系统地发现这些“被抑制”的少数属性,而无需依赖预定义的标签。
2. 方法论:RAIGen 框架
RAIGen 是一个无需标签的框架,旨在直接从扩散模型的内部潜层表示中识别稀有属性。它通过三个主要阶段运行:
2.1. 通过 Matryoshka 稀疏自编码器 (MSAEs) 进行特征分解
为了将纠缠的内部表示映射为具有语义解释性的特征,RAIGen 采用了Matryoshka 稀疏自编码器 (MSAEs)。
- 输入: 框架在扩散模型的反向采样过程中(通常在语义信息表达最充分的最终时间步)提取瓶颈表示 (ht)。
- 架构: MSAEs 将这些表示分解为不同粒度层次的稀疏潜特征 (z)。
- 层级选择: 虽然 MSAEs 提供细粒度的层级,但 RAIGen 专注于最粗糙的层级 (k1)。较细的层级往往会将单一概念破碎化为局部的、脆弱的部分特征,而最粗糙的层级则能产生适用于识别全局属性的语义和空间连贯的特征。
2.2. 少数派得分 (The Minority Score)
为了将稀有的、有意义的属性与噪声或常见特征区分开来,RAIGen 引入了一个少数派得分 (s),它结合了两个互补的信号:
- 激活频率 (ν): 特定神经元在数据集中活跃的样本比例。稀有属性对应于激活频率较低的神经元。
- 语义显著性 (d): 神经元的激活加权 CLIP 质心 (μi) 与全局数据集质心 (μDc) 之间的余弦距离。这确保了该神经元代表了一个显著偏离数据集平均语义的概念。
得分计算公式为:
s(z)=d⊙(1−ν)
该公式优先考虑那些既激活频率低又语义独特的神经元。
2.3. 发现与验证流水线
- 排序: 根据其少数派得分对神经元进行排序。
- 去重: 为了确保集合的紧凑性和多样性,通过神经元质心之间的成对余弦距离评估冗余度。语义相似的神经元会被过滤掉,仅保留得分最高的代表。
- 可解释性: 使用 MSAE 激活热图可视化所选神经元的高激活图像。使用多模态大语言模型 (MLLMs) 生成人类可读的注释,以描述发现的属性。
- 无需标签的特性: 该过程不需要预定义的少数派类别或属性标签,仅依赖于模型的内部表示和用于测量显著性的预训练语义先验 (CLIP)。
3. 核心贡献
- 首个无需标签的框架: 据作者所知,RAIGen 是第一个用于扩散模型中稀有属性识别的无需预定义少数派类别的框架。它将关注点从识别主导偏差转向发现模型中所编码的被抑制的少数派特征。
- 新颖的少数派度量指标: 本文提出了一种结合神经元激活频率和语义显著性的度量指标,并验证其为识别欠代表概念的可靠代理。
- 系统性审计与放大: RAIGen 展示了在多种架构(Stable Diffusion 1.4, 2, XL, 和 FLUX.1-schnell)下揭示超越固定公平性类别的属性的能力。它进一步通过轻量级的提示词干预,实现了对这些稀有属性的有针对性的放大。
4. 实验结果
作者在 Stable Diffusion v1.4、SDXL 和 FLUX.1-schnell 上使用 WinoBias(基于职业)和 COCO(多样化场景)提示词对 RAIGen 进行了评估。
- 启发式方法的验证: 在一个具有已知地面真值(ground-truth)稀有因子的受控玩具实验设置中,作者证明了 MSAEs 中激活频率最低的潜变量不成比例地映射到稀有特征(Spearman 相关系数 ρ≈0.991),从而验证了激活频率作为稀有性的代理指标。
- 定量性能: 在 WinoBias 和 COCO 上,由 RAIGen 发现的属性表现出显著较低的“属性存在度”(约 0.20),而 OpenBias 识别出的多数属性约为 0.94,这证实了 RAIGen 隔离了被抑制的特征。
- 定性发现: RAIGen 成功发现了多样化的少数派属性,包括:
- 社会/公平性: 女性医生、女性警长。
- 上下文/风格: 框架肖像中的医生、带有医疗图表的医生、带有巨大烟柱的火车、带有运动模糊的侧视图火车,以及拥有非裔卷发纹理的女性。
- 跨架构: 该方法推广到了基于 Transformer 的模型(FLUX.1-schnell),尽管与 U-Net 架构相比,其热图分布略显弥散。
- 用户研究: 一项针对 25 名参与者的研究确认了 RAIGen 发现的属性在感知上是稀有的。对于五种职业,参与者报告这些属性在生成的图像中平均出现频率低于 10 张中的 3 张,验证了这些特征虽然被编码,但在标准采样中表达不足。
- 放大作用: 使用 RAIGen 的注释来修订提示词,导致属性存在度的偏差大幅降低(例如,在 SD v1.4 中从 0.50 降至 0.22),这表明重新引入少数派描述符可以有效增加对欠代表模式的覆盖。
5. 重要性与主张
本文将 RAIGen 定位为生成模型全面审计的基础工具。其重要性在于:
- 弥合差距: 它解决了当前偏差缓解工具仅能处理已知类别或多数趋势的局限性,从而能够发现模型潜空间中的“未知之未知”。
- 基于表示的发现: 通过将发现过程植根于模型的内部表示而非外部世界模型,RAIGen 识别的是模型已经学习到但选择不表达的特征。
- 实际效用: 它提供了一种针对性放大的机制,允许开发者系统地提高生成输出的多样性,而无需重新训练模型。
作者保持了审慎的态度,指出 RAIGen 只能呈现模型中已经编码的属性;它无法发现模型完全未能学习到的社会显著性少数群体。他们建议将 RAIGen 视为一个混合审计框架的组成部分,通过补充外部语义先验(如基于 LLM 的工具)来提供对欠代表情况的完整视图。他们同时也承认了潜在的误用风险,例如故意生成敏感或刻板印象的图像,并强调了建立治理和保障措施的必要性。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。