← 最新论文
🤖 machine learning

Aligned but Stereotypical? How System Prompts Shape Demographic Bias in LLM-Based Text-to-Image Models

本文揭示了基于大语言模型(LLM)的文本生成图像系统由于其系统提示词的存在,比非大语言模型基准模型引入了更强的人口统计学偏见,并提出了 FairPro,这是一个通过自适应生成兼顾公平性与保留用户意图的指令来减轻这些偏见的无需训练的框架。

原作者: NaHyeon Park, Na Min An, Kunhee Kim, Soyeon Yoon, Jiahao Huo, Hyunjung Shim

发布于 2026-06-15
📖 1 分钟阅读☕ 轻松阅读

原作者: NaHyeon Park, Na Min An, Kunhee Kim, Soyeon Yoon, Jiahao Huo, Hyunjung Shim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:那个“过度热心的翻译官”

想象一下,你想根据一个简单的句子画一张图,比如“一位植物学家”。

在旧式的绘画机器中,你会直接把这个句子交给艺术家。艺术家会画出一个植物学家,但可能会依赖于他们旧有的习惯或刻板印象(例如,只画白人男性)。

新型、更智能的绘画机器中(即本论文研究的对象),多了一个额外的步骤。在艺术家看到你的句子之前,一位**聪明的翻译官(AI 语言模型)**会先阅读它。这位翻译官的目的是通过增加细节来让画面变得更好。例如,它可能会把“一位植物学家”变成“一位戴着帽子、拿着放大镜、站在绿地上的植物学家”。

问题在于: 论文发现,这个“聪明的翻译官”在试图提供帮助时,经常会加入不想要的刻板印象。即使你没有要求特定的性别、种族或年龄,翻译官也可能预设:“哦,植物学家通常是白人男性”,并在艺术家开始绘画之前,就把这些细节加入到指令中。

研究过程:“COMPBIAS” 测试

研究人员构建了一个巨大的测试套件,名为 COMPBIAS(可以把它想象成绘画机器的标准考试)。他们测试了 1,024 个不同的提示词,范围从非常简单的(“一位医生”)到非常复杂的(“一位在繁忙医院里救治病人的医生”)。

他们对比了两类机器:

  1. 老派: 直接向艺术家下达指令。
  2. 新派: 指令先经过“聪明的翻译官”。

研究结果:

  • “新派”机器的偏见更严重。 与旧款相比,它们生成的图像具有更强的刻板印象(例如,对于“医生”这个词,生成的图像大多是白人男性)。
  • “对齐陷阱” (The Alignment Trap): 新型机器在遵循你的指令并制作高质量图像方面表现得更好。但论文发现这其中存在一种权衡:它们越擅长理解你的话语,在你不指定细节时,就越容易陷入刻板印象。
  • 复杂度会让情况恶化: 你的提示词越复杂,翻译官添加的刻板细节就越多,从而使偏见变得更强。

罪魁祸首:“系统提示词” (System Prompt)

研究人员深入挖掘了为什么会发生这种情况。他们发现罪魁祸首是系统提示词

你可以把系统提示词看作是给聪明翻译官的规则手册经理备忘录。它告诉翻译官应该如何表现。

  • 论文发现,这些默认的规则手册通常包含隐藏的假设。
  • 当翻译官读到一个中性的提示词如“一位法官”时,规则手册会引导它在为艺术家撰写描述之前,先去联想一种特定的人(例如,一位年长的白人男性)。
  • 研究人员通过观察机器的“想法”(文本嵌入/text embeddings)证明了这一点。他们看到翻译官在图像被创建之前,就在秘密地将中性词汇转化为带有偏见的词汇。

解决方案:“FAIRPRO”(公平教练)

研究人员并不想仅仅因为翻译官能让图片看起来很棒就把它删掉。相反,他们创造了一个名为 FAIRPRO 的修复方案。

它是如何工作的:
想象一下,聪明的翻译官身边站着一位教练。

  1. 教练检查提示词: 当你说“一位植物学家”时,教练会查看翻译官的规则手册。
  2. 教练重写规则: 为了不让翻译官瞎猜,教练会给它一个新的、临时的指令:“这个人是一位植物学家。不要假设其性别、种族或年龄。保持多样性。”
  3. 结果: 翻译官仍然会添加有用的细节(比如帽子和放大镜),但它不再预设植物学家一定是白人男性。它创造出了更加多样化的图像组合。

它的特别之处在于:

  • 无需重新训练: 他们不需要重建整个机器或教它新知识。他们只是在机器工作改变了它接收到的指令。
  • 尊重你的意愿: 如果你确实说了“一位女性植物学家”,教练会尊重这一点并保持女性身份,但它仍会确保种族和年龄的多样性。它只修正那些你没有指定的细节部分。

总结

这篇论文表明,现代 AI 图像生成器中“聪明”的部分实际上是产生新类型偏见的源头。通过简单地调整给这些聪明翻译官的指令(即系统提示词),我们可以在不破坏图片质量的前提下,阻止它们做出不公平的假设。这就像是教导一位乐于助人的助手,让它在做假设之前,先学会停止猜测你的偏好,而是问一句:“我该画谁?”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →