SI-Edit: Toward Sketch-Instruction Guided Local Image Editing with Pixel-Level Precision
为了克服像素级草图引导图像编辑高质量基准测试的缺乏,本文引入了 SI-Data 数据集和 SI-Edit 框架,它们利用多模态大语言模型来合成指令引导的四元组,并通过协同空间-语义学习方法实现精确且语义对齐的局部变形。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图给一位能够画出任何你想要之物的神奇艺术家下达一个非常具体、微小的指令。你可能会说:“让那个花茎弯曲成一个平滑的 S 形。”但问题在于,这位艺术家有点爱做白日梦。他听到“S 形”时,可能会在错误的地方弯曲茎部,或者把整株植物变成一条蛇,而不是仅仅弯曲茎部。这就是使用人工智能进行图像编辑所面临的挑战。科学家们构建了强大的“生成模型”——可以把它们想象成接受过数百万张图片训练的数字艺术家——它们可以根据文本来改变图像。但当你要求进行一个微小且精确的改变,比如弯曲一片叶子或拉伸一团火焰时,这些数字艺术家往往会感到困惑。他们可能会改变图片的错误部分,或者误解你究竟想如何进行改变。
为了解决这个问题,研究人员尝试了两种主要技巧。一种是给艺术家一个草图,比如在屏幕上画一条线,以展示确切的弯曲位置。另一种是给出文本指令,比如写下“在这里弯曲”。但每种技巧都有缺陷。如果你只给一个草图,艺术家就不知道要做什么(你是想复制那片叶子、移动它,还是仅仅弯曲它?)。如果你只给文本指令,艺术家就不知道在哪里做。这篇名为 SI-Edit 的论文试图通过教导艺术家同时听从草图和文本,使其成为一个超级精准的数字雕塑家,能够精确到每一个像素来重塑图像,从而解决这个问题。
问题所在:“翻译失误”的艺术家
想象一下你在玩一个游戏,你需要向一位只能画出你所说内容的对手描述一幅画。如果你说“让树枝弯曲”,你的朋友可能会弯曲错误的树枝,或者画出一棵全新的树。这就是目前仅靠听从文本指令的 AI 工具所面临的情况。它们擅长进行大幅度的改变,比如“把天空变蓝”,但对于微小的、精确的改变却表现得很差。它们缺乏“空间锚点”——即一种知道要移动哪个像素的方法。
另一方面,如果你只给一个草图(在屏幕上画的一条线),AI 知道要在哪里画,但不知道要做什么。那条线是为了移动一片叶子、复制它,还是仅仅弯曲它?如果没有明确的指令,AI 可能会做出错误的猜测,导致奇怪的结果,比如一片叶子突然变成了它自己的副本,或者一根茎凭空消失了。
本文的作者意识到,要获得完美的像素级控制,你需要两者兼备:一张地图(草图)和一个目的地(文本)。但有一个巨大的障碍:从未有人为这种能完美结合这两者的 AI 构建过训练手册。
解决方案:一本新的训练手册和一位新艺术家
为了解决这个问题,团队首先必须构建一个大规模、高质量的训练数据集,称为 SI-Data。你可以把它想象成一本巨大的 AI 食谱。他们不仅仅是向 AI 展示“修改前”和“修改后”的图片及文本描述,而是创建了四元组——即由四个相互关联的部分组成的集合:
- 原始图像(起点)。
- 目标图像(修改后应该呈现的样子)。
- 草图(显示确切形状变化的简单线条)。
- 指令(告诉 AI 该做什么的文本)。
他们并没有手工绘制这些内容,因为那样太慢了。相反,他们使用了一个聪明的自动化流水线。他们选取精美的照片,要求一个聪明的 AI(Qwen3-VL)发明一个特定的编辑指令(例如“拉伸帐篷”),然后使用另一个 AI(Nano Banana Pro)实际执行这一改变。接着,他们使用了一种叫做**光流法(optical flow)**的数学技巧,通过观察像素如何从原始图像移动到新图像,从而自动绘制出“草图”。这为他们提供了 6,500 个完美的示例,展示了如何结合草图和文本指令来进行精确的编辑。
SI-Edit 如何运作:“相同位置”技巧
有了这个新数据集,他们构建了一个新的编辑工具,名为 SI-Edit。这个工具被设计为一个“协作式”艺术家。它不仅看文本或草图,它还将两者结合起来看。
论文介绍了两个主要的技巧来使之实现:
- “任务触发”标记(Task-Trigger Token): 他们在每个指令的开头添加了一个特殊的秘密代码词,写作
<sk>。你可以把它想象成在艺术家开始绘画前敲响的一声铃声。当 AI 听到“铃声”(<sk>)时,它就知道:“哦,我需要格外注意接下来要看到的草图线条。”这有助于 AI 理解草图不仅仅是装饰,而是一条严格的规则。 - 相同位置编码(Same Position Encoding, SPE): 这是最重要的部分。想象一下你正在在玻璃纸上描摹一幅画。你下方有原图,上方有你的草图。如果你没有将它们对齐,你的绘画就会偏离。AI 通常将草图和原始图像视为两个独立的事物,这会导致它们产生“漂移”。SI-DT 强制要求 AI 将草图和原始图像视为在其大脑中处于完全相同的位置。它将草图叠加在图像上,并告诉 AI:“这两个东西位于相同的坐标。”这防止了 AI 在哪里发生弯曲这件事上产生困惑。
他们的发现:像素级的精准度
团队将 SI-Edit 与其他流行的工具(如 SketchEdit、MagicQuill 和 FramePainter)进行了对比测试。结果显而易见:SI-Edit 更擅长遵循规则。
- 几何精度: 在衡量 AI 遵循草图线条的紧密程度时,SI-Edit 的得分是 4.292(越低越好),而排名第二的工具 MagicQuill 得分为 7.434。这意味着 SI-Edit 的弯曲和曲线更接近用户实际绘制的内容。
- 语义理解: 在检查 AI 是否真的执行了文本指令(例如“拉伸”与“复制”的区别)时,SI-Edit 在名为 CS 的指标上表现出色,击败了所有其他方法。
- 用户偏好: 当真实的人观察结果时,根据他们关注点的不同(视觉一致性、准确性或图像质量),他们倾向于选择 SI-Edit 的比例在 81.3% 到 94.8% 之间。
论文还表明,该工具不仅能弯曲物体,甚至可以改变人的姿态,比如让一名武术家变换站姿,同时保持其面部和衣服看起来完全一样。
核心结论
作者认为,通过将清晰的地图(草图)与清晰的目的地(文本)相结合,并教导 AI 将它们视为一个统一的指南,我们终于可以获得足够精确的图像编辑工具,能够处理微小且复杂的改变,而不会破坏图片的其余部分。他们不仅构建了一个更好的工具,还构建了第一个教导 AI 如何实现此功能的公开数据集,为未来研究人员创造更聪明的数字艺术家开辟了大门。论文总结道,虽然“空间歧义性”(不知道在哪里编辑)和“语义盲目性”(不知道编辑什么)是主要的障碍,但这种协作式的方法成功地扫清了通往像素级完美编辑的道路。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。