LazyDrag: Enabling Stable Drag-Based Editing on Multi-Modal Diffusion Transformers via Explicit Correspondence
LazyDrag 引入了首个针对多模态扩散 Transformer 的基于拖拽的图像编辑方法,该方法通过生成显式对应图,消除了对隐式点匹配的依赖,从而在无需测试时优化(test-time optimization)的情况下实现了稳定的全强度反转(full-strength inversion),并在精确的几何控制和复杂的文本引导编辑方面达到了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一张数码照片,想要移动其中的某个部分——比如,通过拖动让一只狗的嘴巴张开以露出牙齿,或者将一只手滑进兜里。这被称为“基于拖拽的编辑”(drag-based editing)。
长期以来,利用人工智能(AI)来实现这一点,就像是在黑暗中戴着隔着手套的盲人手套去搬动一件沉重的家具。AI 必须根据模糊的提示来猜测像素应该去向何处,这往往会导致混乱的结果、扭曲的面部,或者需要计算机进行大量的“深度思考”(一种被称为“测试时优化”的缓慢且昂贵的过程)才能达到正确效果。
LazyDrag 是一种改变游戏规则的新方法。以下是它的工作原理,我们使用简单的类比来解释:
1. 旧方法:在黑暗中猜测
以往的方法依赖于“隐式点匹配”(implicit point matching)。想象一下,你试图告诉你的朋友:“把那个红点移到蓝点那里”,但你只能隔着墙向对方低声传递提示。AI 必须猜测哪个像素对应于哪个像素。
- 问题所在: AI 经常会感到困惑。它可能会抓错图像的部分,或者导致图像模糊。为了修复这个问题,旧方法会强迫 AI 进行缓慢且重复的优化过程(例如,为每一张照片重新计算 50 次移动过程)。这不仅速度缓慢,还会限制 AI 的创作能力(例如,防止它在场景中添加新物体,如一个网球)。
2. LazyDrag 的解决方案:清晰的地图
LazyDrag 说:“别再瞎猜了,让我们画一张地图。”
与其让 AI 去猜测,不如将用户的拖拽指令立即转换为一个显式对应图(Explicit Correspondence Map)。
- 类比: 把这张地图想象成一组铁轨。如果你想把手从 A 点移动到 B 点,这张地图就会绘制一条连接两者的直接、不可阻断的轨道。AI 不需要猜测手要去哪里,它只需要沿着轨道行驶即可。
- 结果: 因为路径非常清晰,AI 无需通过减速或重新计算(无需“测试时优化”)就能完美地移动物体。它之所以被称为“懒惰(Lazy)”,是因为它不需要进行那些额外的、繁重的基础计算工作。
3. “全强度”超能力
由于地图非常可靠,LazyDrag 可以发挥 AI 的“全强度”。
- 类比: 想象一位画家,因为害怕弄乱画面,通常只能使用稀薄、水性的颜料进行创作。LazyDrag 则给了他色彩浓郁、厚实的颜料。
- 这意味着: AI 现在可以做以前无法做到的事情。它可以:
- 自然地进行图像补全(Inpaint): 如果你拖动狗的嘴巴使其张开,AI 可以自信地在嘴里“画出”内部结构(牙齿、舌头),因为它完全清楚边界在哪里。
- 遵循文本指令: 你可以拖动一只手并说“把它放进兜里”,AI 会理解其中的语境。
- 创造新物体: 你可以拖动一个位置并说“网球”,它会在那里生成一个球,而这在以前的方法中是很难实现的。
4. 保护背景安全
移动照片中的物体,最难的部分之一就是保持背景不被破坏。
- 类比: 想象你在房间里移动一把椅子。你不希望在移动椅子的同时,把地毯或墙壁也一起拖走了。LazyDrag 使用了一个“掩模”(mask,类似于模板/模具)来规定:“只移动椅子,让地毯保持原样不动。”它锁定了背景,使其不会发生扭曲或变形。
5. 现实世界的结果
研究人员在标准基准测试(DragBench)上对该方法进行了测试,并将其与另外八种顶尖方法进行了对比。
- 结果: LazyDrag 胜出了。它更准确(手确实到了你想要的位置),看起来更自然(没有奇怪的扭曲),并且不需要那步缓慢的“重新计算”过程。
- 用户研究: 当人类被要求挑选出最好的照片时,即使其他方法尝试使用了那些缓慢且昂贵的优化技巧,人类仍有 60% 的时间选择了 LazyDrag。
总结:
LazyDrag 就像是给了 AI 一个 GPS 和一套清晰的指令,而不是一个模糊的谜题。它允许 AI 以手术级的精度移动照片中的物体,添加新物体,并保持完美的背景——而且无需减速或过度思考。它适用于最新的、最强大的 AI 模型(称为 MM-DiTs),并且是第一个如此高效且无需额外训练就能实现此类编辑的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。