← 最新论文
💻 computer science

KG-FairDiff: Knowledge Graph-Guided Prompt Refinement for Demographically Fair Text-to-Image Generation

KG-FairDiff 是一个与模型无关的推理时框架,它利用知识图谱和闭环优化过程来精炼文本到图像的提示词,在无需昂贵模型重训练的情况下,有效地减少人口统计学和文化偏见,同时保持语义保真度。

原作者: Farbod Davoodi, Seyed Reza Tavakoli Shiyadeh, Pooria Safaei, Sana Harighi, Parsa Gholami, Amirali Amini, Kimia Vanaei, Emad Firoozi, Parham Abed Azad, Babak Khalaj, Siavash Ahmadi, Amir Hossein Payber
发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Farbod Davoodi, Seyed Reza Tavakoli Shiyadeh, Pooria Safaei, Sana Harighi, Parsa Gholami, Amirali Amini, Kimia Vanaei, Emad Firoozi, Parham Abed Azad, Babak Khalaj, Siavash Ahmadi, Amir Hossein Payberah, Mohammad Hossein Rohban, Soheil Kolouri, Ali Diba

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一台神奇的相机,可以将你写的任何句子变成一张图片。你输入“一名医生”,它就会拍下一张照片。但问题在于:这台相机是用互联网上数百万张旧照片训练出来的。因此,它养成了一个坏习惯。当你要求显示“医生”时,它几乎总是显示一名年长的白人男性。当你要求显示“护士”时,它会显示一名年轻女性。这就像相机被困在了时光隧道里,只能通过一个非常狭隘、刻板的镜头来看世界。

这篇论文介绍了一种名为 KG-FairDiff 的新工具,旨在无需重建相机本身的情况下修复这台相机。

问题所在:相机的“默认设置”

把这些文本生成图像系统想象成记住了大量食谱的大厨。如果你要求“首席执行官(CEO)”,他们会自动拿出一张穿着西装的男性的照片,因为那是他们在训练数据中最常看到的。他们并不是想表现出恶意,他们只是在遵循他们所知的最常见模式。这导致某些群体(如女性、有色人种或老年人)很少在权力角色中出现,或者以滑稽、夸张的方式呈现。

解决方案:“智能编辑师”

与其试图解雇大厨并聘请一位新的大厨(这既昂贵又对许多封闭式相机来说是不可能的),KG-FairDiff 扮演的角色更像是一个站在你和相机之间的智能编辑师

以下是这位编辑师的工作步骤:

  1. 知识库(“事实核查员”):
    编辑师携带一个包含约 1,200 个事实的特殊图书馆(知识图谱)。这些事实就像一些小卡片,上面写着:“医生可以是女性”、“护士可以是男性”或“这种文化的传统服饰长这样”。它还有一些卡片写着:“这是我们应该避免的刻板印象”。

  2. 重写(“建议”):
    当你输入“一名医生”时,编辑师不会直接将这句话发送给相机。首先,它会在自己的图书馆中查找。它发现“医生”经常带有刻板印象。然后,它会请求一个超级聪明的 AI(大语言模型,LLM)来重写你的句子。

    • 你的输入: “一名医生。”
    • 编辑师的建议: “一群多样化的医生,包括女性和来自不同背景的人,在现代化的医院里工作。”
      编辑师确保新的句子仍然符合你想要表达的意思(语义保真度),同时增加了缺失的多样性。
  3. 把关者(“验证员”):
    在将新句子发送给相机之前,编辑师会检查两件事:

    • 我们修复了偏见吗?(新的句子是否鼓励了更多样化的图像?)
    • 我们是否过度改变了原意?(它仍然是关于医生的吗?)
      如果两个答案都是“是”,编辑师才会发送。如果不是,它会像循环一样不断尝试,直到达到要求。

为什么这很重要

通常,要修复一台有偏见的相机,你必须拆解它,用新数据重新训练它,并寄希望于它能学得更好。这很困难、昂贵,而且对于许多“黑箱”相机来说往往是不可能的(因为你无法看到其内部结构)。

KG-FairDiff 的不同之处在于:

  • 它是即插即用的修复方案: 无论相机是免费的还是付费的、保密的,它都能与之配合工作。
  • 它不会破坏相机: 它只是微调了你给出的指令(提示词)。
  • 它以事实为基础: 它不仅仅是猜测;它使用一份结构化的事实列表来引导变化。

结果

研究人员在八种不同的流行图像生成器上测试了这个“智能编辑师”。他们发现:

  • 它显著减少了相机默认显示刻板印象(如只显示男性作为 CEO)的情况。
  • 它增加了展示人物的多样性(更多的女性、有色人种和不同年龄层的人)。
  • 它在做这些工作时,并没有让图片看起来很奇怪,也没有改变用户的原始意图。

局限性(“细则”)

作者诚实地指出了该工具可能出错的地方:

  • “安全过滤器”冲突: 一些相机有自己严格的安全规则。有时,编辑师增加多样性的建议可能会与相机的内部规则发生冲突,导致图片生成失败或看起来很奇怪。
  • “循环型”编辑师: 同一个 AI 模型既用于编写新句子,也用于检查句子是否合格。这就像学生在为自己的作业评分;虽然通常有效,但并不完美。
  • 文化差距: 虽然该工具试图涵盖非西方文化,但其事实库还不完美。它可能会错过一些特定的文化细节。

总结

KG-FairDiff 就像是你想象力的公平过滤器。它不改变相机,它只是帮助你以一种确保相机能看到整个世界,而不仅仅是看到一个狭隘、有偏见的切片的方式来请求图片。这是一个实用且即插即用的方法,可以让 AI 生成的图像更具代表性,更贴近现实生活。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →