Orthogonal Negative Guidance in Attention Feature Space for Text-to-Image Generation
本文提出了一种无需训练的文本到图像生成方法——正交负向引导,该方法通过将负向提示的注意力特征相对于正向提示进行正交化来抑制不需要的概念,从而在保持图像质量和提示对齐的同时实现更优的概念移除。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一位技艺高超的厨师(即人工智能),擅长根据食谱(即文本提示)烹饪菜肴。你能让一碗“拉面”看起来美味诱人,但存在一个问题:每次制作拉面时,你都会自动加入一个煮鸡蛋,即使顾客并未要求。
如果你只是告诉厨师“不要鸡蛋!”(即负面提示),厨师可能会感到困惑,反而不小心放入更多鸡蛋,或者为了避开鸡蛋而毁掉整道菜。这正是当前人工智能图像生成器面临的困境:告诉它们不要包含什么,竟然出奇地困难。
本文介绍了一种新颖巧妙的技术,称为正交负向引导(Orthogonal Negative Guidance)。以下是其工作原理,辅以简单的类比说明:
1. 问题所在:“笨拙的橡皮擦”
当前用于移除 unwanted 内容(例如从“拉面”中移除“鸡蛋”)的方法,就像在画作上使用一块巨大而笨拙的橡皮擦。
- “提示否定”方法:你只需说“不要鸡蛋”。人工智能往往会忽略你,或感到困惑。
- “减法”方法:某些方法试图从“拉面”概念中减去“鸡蛋”概念。但试想,如果“鸡蛋”和“拉面”是用同一种墨水书写的。当你试图擦除“鸡蛋”这个词时,可能会不小心擦除“拉面”这个词的部分笔画,最终留下一幅模糊破碎的画面。
2. 解决方案:“智能过滤器”(正交负向引导)
作者提出了一种方法,它如同一个智能过滤器或专用筛网。它并非盲目擦除,而是审视人工智能用于构建图像的“成分”(数学特征)。
设置:人工智能利用两条信息流来构建图像:
- 正向流:“制作一碗拉面。”
- 负向流:“不要制作鸡蛋。”
魔法技巧(正交化):
想象“拉面”流是一个指向特定方向的向量(箭头)。“不要鸡蛋”流是另一个箭头。- 有时,“不要鸡蛋”箭头的方向与“拉面”箭头重叠。如果你直接减去“不要鸡蛋”箭头,就会破坏“拉面”。
- 这种新方法计算“不要鸡蛋”箭头,并将其旋转,使其与“拉面”箭头完全垂直(成 90 度角)。
- 随后,它仅移除“不要鸡蛋”箭头中向外侧突出的部分(即与拉面不重叠的部分)。
类比:将“拉面”想象为一束红光,“鸡蛋”想象为一束蓝光。它们照射在同一面墙上。
- 旧方法试图关闭蓝光,但在此过程中,红光也会随之变暗。
- 这种新方法找出蓝光中未照射到红光的部分,并仅阻挡该特定部分。红光(拉面)保持明亮清晰,而蓝光(鸡蛋)则被完全阻挡。
3. 实现的效果
由于该方法如此精确,它能够完成其他方法无法做到的事情:
- 多概念抑制:你可以告诉人工智能同时移除“鸡蛋”和“筷子”,它能在不破坏拉面碗的情况下处理两者。
- 可调节强度:你可以转动一个“旋钮”,决定抑制鸡蛋的程度。你可以从“也许不要鸡蛋”调整到“绝对不要鸡蛋”,而不会导致图像变得杂乱无章。
- 无需重新训练:最重要的是,这不需要重新教导人工智能。这是一种在图像生成过程中应用的“即插即用”技巧。
4. 结果
作者在名为DCS-Bench(多样化概念抑制基准)的基准测试中对此进行了测试,该测试包含 200 种不同场景(例如“没有听诊器的医生”或“没有沙发的客厅”)。
- 得分:在人类测试中,人们对该新方法的偏好度比次优方案高出近19%。
- 质量:图像并未变得模糊或怪异。“拉面”看起来依然像拉面,只是去掉了不需要的“鸡蛋”。
总结
简而言之,本文通过一种数学技巧,在“坏”想法与“好”想法混合之前将它们分离开来,从而解决了“告诉人工智能不要画什么”的问题。这就像俱乐部里的一位保镖,他确切知道如何阻止不受欢迎的客人(鸡蛋)进入,而不会误将贵宾(拉面)踢出去。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。