← 最新论文
🤖 AI

Efficient bias mitigation in T2I diffusion models using Concept Graphs

该论文介绍了一种名为 CO-ALIGN 的新型文本生成图像扩散模型偏见缓解框架,该框架利用内部本体论中的概念图对齐,在显著减少有害偏见和语义不连贯性的同时,保持了图像质量并增强了概念遗忘的鲁棒性。

原作者: Mansi, Avinash Kori, Francesco Leofante

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Mansi, Avinash Kori, Francesco Leofante

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一位非常有才华的艺术家,只要你描述,他就能画出任何东西。如果你说“护士”,他通常会画出一个女性;如果你说“医生”,他几乎总是画出一个男性。这并不是因为艺术家很坏,而是因为他们从大量的旧图片和故事中学习到了这些角色大多由特定性别担任。这就是我们所说的偏见(Bias)

这篇论文介绍了一种名为 CO-ALIGN(概念本体对齐)的新方法,旨在解决这个问题,同时又不破坏艺术家画出好画的能力。

以下是它的工作原理,使用简单的类比:

问题所在:两位艺术家,一个错位

目前修复偏见的方法就像试图通过只调整一个齿轮来修理一台损坏的机器。

  • 文本编码器(翻译官): 这部分负责倾听你的话语,并将它们转化为一份“食谱”。如果你说“护士”,翻译官目前会认为:“哦,这意味着‘女性护士’。”
  • 去噪器(画家): 这部分负责根据食谱实际画出图像。它已经学会了预期当你说“护士”时,翻译官总是会提供“女性护士”的指令。

旧方法的错误:

  • 如果你只修复翻译官,让它认为“护士”是性别中立的,画家就会感到困惑。它接收到了一份它无法理解的食谱,结果导致画面模糊、毫无意义。
  • 如果你只修复画家,让它忽略性别,翻译官仍然会发送带有偏见的指令。画家试图遵循新规则,却会被旧指令拉回去,因此偏见依然存在。

解决方案:CO-ALIGN(团队集会)

CO-ALIGN 意识到,翻译官和画家是一个团队。你不能在不与对方沟通的情况下只修复其中一个。

  1. 映射关系(概念图):
    想象艺术家的脑海里有一个巨大的便利贴网络。一张贴着“护士”,另一张写着“男护士”,还有一张写着“女护士”。在有偏见的模型中,“护士”这张贴纸被紧紧地粘在“女护士”上,而与“男护士”的连接则很松散。
    CO-ALIGN 绘制出了翻译官和画家各自的整个网络图。

  2. 对齐团队:
    CO-ALIGN 并不是直接撕掉墙上的贴纸,而是温柔地移动“护士”这张贴纸,使其与“男护士”和“女护士”之间的距离相等。

  • 它首先对翻译官进行操作。
  • 然后,它立即更新画家的网络,以匹配新的排列方式。
  1. 结果:
    现在,当你提到“护士”时,翻译官会发送一份平衡的食谱,而画家能完美地理解它。最终呈现的是一张清晰、高质量的护士照片,可以是男性也可以是女性,且图像看起来不会模糊或破碎。

神奇的副作用:“邻里”拉力

研究人员发现了一个酷炫的副作用。想象你有一群朋友站在一个圆圈里。如果你把其中一个朋友(“护士”概念)向中心拉,他们最亲近的朋友(相关的概念,如“男护士”)也会被顺带拉过去,即使你并没有直接触碰他们。

作者利用这一点来解决另一个问题:遗忘(Unlearning)
有时,你希望艺术家忘记如何画某些有害的内容(比如裸体)。如果你只是告诉艺术家忘记“裸体”,一个聪明的骗子可能会要求画“Nymphette”或“Creampie”(在艺术家的脑海中是“裸体”的邻居词汇)来达到同样的效果。

CO-ALIGN 利用“邻里拉力”,在告诉艺术家忘记之前,先将这些“骗子词汇”(“Nymphette”等)直接拖到“裸体”旁边。现在,当艺术家忘记“裸体”时,他们也会自动忘记那些“骗子词汇”,这使得系统在应对绕过手段时更加安全。

他们证明了什么?

团队在流行的 AI 模型(Stable Diffusion)上进行了测试,并发现:

  • 公平性: 与之前的最佳方法相比,它减少了 30% 的偏见。
  • 质量: 图片保持了锐利和逼真(提升了图像质量评分)。
  • 连贯性: 它解决了“模糊混乱”的问题。它减少了 88% 的无意义图像。
  • 安全性: 它使模型更难被诱导绘制有害内容,甚至无需更改现有的安全工具。

简而言之,CO-ALIGN 通过确保理解文字的“大脑”和绘画的“大脑”步调一致、和谐协作,从而解决了偏见问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →