Investigating Social Bias in Narrative Image Generation
本文表明,文本生成图像模型中的社会偏见在分镜脚本和漫画等叙事形式中不仅更为普遍,而且表现得更为显性,这凸显了在多样化视觉语境下对这些系统进行评估的紧迫需求。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:调查叙事图像生成中的社会偏见
问题陈述
虽然文本生成图像(T2I)模型越来越多地应用于媒体、教育和设计领域,但关于其倾向于复制社会偏见的担忧依然存在。先前的研究广泛记录了 T2I 模型将特定的人口统计特征与职业、特质和社会角色联系起来的现象。然而,现有的偏见评估主要集中在单次拍摄的写实图像生成上。这种狭窄的范围留下了一个关键性的空白:目前尚不清楚社会偏见是否以及如何在叙事视觉格式(如分镜脚本和漫画)中体现,因为在这些格式中,意义是通过角色连续性、事件序列、时间进展以及视觉与文本元素的相互作用来构建的。作者认为,在静态照片中可能显得微妙或隐形的偏见,在顺序叙事格式中可能会变得更加显性或被放大。
研究方法
本研究改编了最初为文本生成设计的 BBG(生成偏见基准) 框架,用于评估图像生成模型。该方法包含以下组成部分:
- 提示词构建: 作者从 BBG 数据集中选择了 140 个种子提示词,涵盖了七个社会偏见类别:年龄、残障、性别、外貌、种族/国籍、宗教和社会经济地位(SES)。这些提示词经过刻意设计,具有上下文模糊性,未指定关键属性(例如,哪个角色拥有特定的特质或结果)。数据集包含 70 个英文提示词和 70 个韩文提示词,以调查跨语言偏见。
- 评估的模型: 测试了六个最先进的 T2I 模型:
- 专有模型: GPT-Image-1.5, GPT-Image-2, Gemini-3.1-Flash-Image, 以及 Gemini-3-Pro-Image。
- 开源模型: FLUX.1-Dev 和 SDXL。
- 生成设置: 对于每个提示词,输出以三种不同的格式生成:
- 写实图像: 单张静态图像。
- 分镜脚本(Storyboard): 侧重于镜头构图和相机覆盖的粗略草图,不含文本。
- 四格漫画: 集成了视觉元素与对话气泡、说明文字和旁白的顺序叙事。
- 评估协议: 四位作者根据 BBG 问题隐含的答案对生成的图像(共 2.4K 张)进行了人工标注。输出被标记为有偏见的(biased)、反偏见的(counter-biased)或中立的(neutral)。研究还采用了主题编码法来识别反复出现的视觉和叙事模式。此外,还针对视频生成(Sora-Pro-2 和 Veo-3.1)进行了案例研究,以将发现扩展到时间性媒体。
关键结果
定量发现
- 叙事格式放大偏见: 与照片相比,专有模型在叙事格式中生成了更多的有偏见输出。在照片生成中,专有模型平均产生 25.9% 的有偏见输出。这一比例在分镜脚本生成中增加了 9.6 个百分点 (pp),在漫画生成中增加了 18.2 个百分点 (pp)。
- 语言差异: 韩文提示词的偏见流行率高于英文提示词,韩文设置的平均有偏见输出率高出 7.2 个百分点 (pp)。最大的差距出现在照片生成中(例如,Nano Banana 2 显示出 17.4 pp 的增幅)。
- 开源模型表现: 开源模型(FLUX.1-Dev 和 SDXL)在平均 93.6% 的案例中生成了中立输出。然而,作者将其归因于指令遵循能力的薄弱而非有效的偏见缓解,指出这些模型通常无法纳入人口统计学线索,或生成文化不匹配的内容。
定性发现
- 显性偏见 vs. 隐性偏见: 在照片生成中,偏见通常通过微妙的视觉线索(如特定的服装、配饰或表情)进行编码。相比之下,分镜脚本和漫画通过事件序列、角色定位、叙事解决方式以及文本元素(如明确表达刻板印象的对话气泡)更显性地揭示了偏见。
- 视觉关联的持久性: 即使输出风格发生变化,刻板的视觉关联(例如,“创意型”人士被描绘为穿着休闲/嬉皮风格或带有灯泡符号)在所有格式中依然存在。
- 层级化的刻板印象: 叙事格式暴露了超越简单角色分配的偏见。例如,角色失败或依赖的原因因刻板印象而异(例如,女性护士的依赖被框架化为情感脆弱,而盲人的依赖则被框架化为实际需求)。
- 表面层面的缓解: 模型有时会尝试通过引入反刻板印象的元素或道德化结局(例如,调解冲突的邻居)来避免偏见。然而,作者指出这并不一定能消除潜在的关联,因为微妙的视觉线索仍可能强化刻板印象。
- 文化错位: 在韩国语境下,模型经常无法对齐文化细微差别,生成英文或混合语言的文本,或者产生与提示词文化背景不符的西方化或过度传统的东亚图像。
意义与贡献
本文声称有三个主要贡献:
- 首个关于叙事偏见的研究: 它首次系统地调查了叙事图像生成格式中的社会偏见,对比了写实图像、分镜脚本和四格漫画。
- 格式依赖偏见的证据: 它证明了专有模型在叙事格式(分镜脚本和漫画)中表现出的偏见显著高于单图生成,这表明单图评估不足以捕捉模型偏见的全部范围。
- 定性机制: 它提供了关于偏见如何随格式不同而呈现差异的定性证据——即从照片中的微妙视觉线索转向漫画中的显性叙事和文本强化。
作者得出结论,叙事图像格式是比单纯的照片生成更强的模型偏见探测工具。他们认为,评估 T2I 系统需要超越单张图像输出,以考虑多样化的生成格式,因为在静态图像中较不明显的偏见,在顺序叙事语境中可能会浮现并变得更具危害性。该研究还强调了评估多语言和跨文化能力的需求,指出目前的模型往往无法将其提示词锚定在特定的文化背景中。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。