Beyond Content: How Grammatical Gender Shapes Visual Representation in Text-to-Image Models
本文引入了一个跨语言基准测试,证明了提示语言中的语法性别会显著使文本生成图像模型的输出向相应的视觉性别偏置,揭示了语言结构本身(而非仅仅是语义内容)如何塑造人工智能生成的视觉呈现。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位只要读到食谱就能做出任何菜肴的大厨。但这里有个转折:这份食谱不仅仅是食材清单;你用来编写食谱的语言的“语法”会秘密地改变菜肴的风味,即使食材完全相同。
这篇论文讲述了一组研究人员发现,文本生成图像(T2I)AI 模型(即“大厨”)深受我们描述事物时所用词汇的语法性别的影响,而不仅仅是词汇本身的含义。
以下是他们利用简单的类比对研究结果进行的拆解:
核心理念:“语法幽灵”
在英语或中文等语言中,“守卫”(guard)或“闲话”(gossip)这类词是没有内置性别的。它们是中性的。但在法语、德语或西班牙语等语言中,每个名词都有性别(阳性或阴性),即使它是一个物体或一个概念。
- 实验: 研究人员选取了那些语法性别与刻板印象性别发生冲突的词汇。
- 例子: 在法语中,“守卫”这个词(une sentinelle)在语法上是阴性的,尽管守卫在刻板印象中通常被视为男性。
- 例子: 在德语中,“闲话”这个词(der Tratsch)在语法上是阳性的,尽管闲话通常在刻板印象中与女性相关联。
他们要求三种不同的 AI 模型(DALL-E 3、Ideogram 和 Flux)使用三种类型的提示词来绘制这些概念的图像:
- 性别化提示词: 使用法语/德语单词(例如:“一张 sentinelle 的照片”)。
- 中性提示词(英语): 使用英语单词(“一张 guard 的照片”)。
- 中性提示词(中文): 使用中文单词。
重大发现:语法是一根魔杖
结果令人惊讶。AI 不仅仅是在看这个词的意思;它还在倾听词语的性别。
阳性效应: 当 AI 接收到一个具有阳性语法的词(即使该概念通常是阴性的)时,它会更多地画出男性。
- 类比: 这就像如果你想要一份“阴性”食谱,却使用了一个“阳性”的食材标签,大厨突然决定为你上一份牛排而不是沙拉。
- 数据: 拥有阳性语法时,AI 有 73% 的概率画出男性。而在使用中性英语时,它只画出男性的概率为 22%。仅仅因为一个微小的语法标记,差异就如此巨大。
阴性效应: 当 AI 接收到具有阴性语法的词时,它会更多地画出女性,但这种效果略显复杂。
- 数据: 阴性语法将女性图像的比例提高到了 38%(相比之下,英语为 28%)。
- 转折: 在某些情况下(尤其是对于 DALL-E 3 模型),AI 实际上做出了与语法建议相反的操作,这可能是因为它试图过于努力地去“修正”刻板印象,从而导致了过度矫正。
为什么会发生这种情况?
研究人员发现了两个主要原因:
- “高资源”偏差: 这种效应在拥有大量训练数据的语言(如法语、西班牙语和德语)中最为强烈。就好像 AI 阅读了这些语言中如此多的书籍,以至于它学会了将语法性别标签与特定的视觉风格联系起来。
- “英语过滤器”: 当他们将结果与英语进行比较时,这种效应有时会减弱。研究人员怀疑这是因为英语 AI 模型在“去偏差”(旨在避免刻板印象)方面经过了大量的训练。然而,当他们将结果与中文(中文的偏差研究较少)进行比较时,语法性别的效应甚至更加强烈和清晰。
模型反应各异
可以将这三个 AI 模型想象成三位不同的艺术家:
- Flux: 最敏感的艺术家。它严格遵循语法性别规则,几乎每次都会为阳性词汇画出男性,为阴性词汇画出女性。
- Ideogram: 中庸的艺术家。它遵循规则,但并不极端。
- DALL-E 3: “叛逆”的艺术家。它经常忽略语法性别,甚至做出相反的操作,这可能是因为它接受了旨在避免性别刻板印象的强烈指令。
“模糊性”副作用
一个有趣的补充:当使用带性别的语言进行提示时,AI 生成的图像中出现了更多难以分类(它无法分辨是男性还是女性)的图像。这就像是词义与语法性别之间的冲突让 AI 感到困惑,使得生成的图像在性别特征上显得“模糊”。
总结
这篇论文证明了语言结构本身塑造了 AI 的现实。不仅是你说了什么(内容),而且是你如何表达(语法)也会改变图像。
如果你想要一张“守卫”的照片,如果你用英语,AI 可能会显示一个男人;但如果你用法语,它可能会显示一个女人,仅仅因为法语中“守卫”这个词在语法上是阴性的。研究人员将这称为一种新的偏差维度:语法性别偏差。
这篇论文并未说明:
- 它并不建议我们停止使用带性别的语言。
- 它目前还没有针对这个问题提供具体的解决方案(除了指出 AI 模型训练需要考虑到这一点)。
- 它并不声称这发生在所有的 AI 系统中,而仅限于其测试的这三种特定模型。
简而言之,语言的语法就像是 AI 的一本隐藏指令手册,在它查看单词含义之前,就已经告诉了它该画谁。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。