← 最新论文
💻 computer science

Model the Edit, Not the Image: Visual Autoregressive Editing from a Source-Centric Perspective

本文介绍了 EditMod,一种以源图像为中心的视觉自回归编辑框架,该框架通过将编辑建模为源条件预测与目标条件预测之间差异所衍生的尺度级残差更新,实现了在数秒内完成高保真、文本对齐的图像编辑,且无需进行反转、优化或掩码操作。

原作者: Hongyi Fang, Chuwen Xie, Benjia Zhou, Yu-Xuan Qiu, Chenggong Hu, Zhibin Wang, Chao Chen, Jianbin Qin, Rui Mao

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Hongyi Fang, Chuwen Xie, Benjia Zhou, Yu-Xuan Qiu, Chenggong Hu, Zhibin Wang, Chao Chen, Jianbin Qin, Rui Mao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一本神奇的写生簿,只要轻声描述,你就能画出任何你能想象到的东西。长期以来,实现这一目标最流行的方法就像是从一块粘土块中进行雕刻:你从一个杂乱、充满噪声的团块开始,慢慢剔除噪声,直到一幅清晰的图像显现出来。但最近,出现了一位工作方式截然不同的艺术家。他们不再是剔除,而是逐层构建图像,从一个粗略、模糊的轮廓开始,逐渐增加更清晰的细节,就像从大陆缩放到街道角落一样放大地图。这被称为“视觉自回归”(Visual Autoregressive)生成。它速度极快,并能产生极其清晰的图像。

现在,想象一下你想改变你的杰作中的仅仅一处——比如把一匹白马变成金色的马,或者在天空中添加一座城堡——而不需要从头开始重新绘制整个画面。旧的“粘土雕刻法”往往在这里会遇到困难;它们可能会在试图改变颜色的同时,不小心把马的腿也给“融化”了;或者需要你花费数小时手动涂抹遮罩,以保护你想保留的部分。这篇论文提出了一个简单但棘手的问题:我们能否使用这种新的、逐层构建的快速方法来轻松编辑图像,而无需先撤销我们的工作,或花费数小时调整设置?作者提出了一种新的思考编辑的方式,即将原始图像视为一个基础,而不是一个需要去对抗的约束。

由 Fang Hongyi 及其同事领导的研究人员提出了一个名为 EditMod 的方法。他们的核心创意是停止尝试根据一个新的描述来“重新生成”整个图像,而是专注于精确计算“究竟什么需要改变”。你可以这样想:如果你正在搭建一座乐高城堡,有人要求你改变塔楼的颜色,旧的方法是拆掉整个城堡并重新搭建,并试图记住哪些积木放在了哪里。EditMod 则像是观察这座塔楼,找出哪些积木需要被更换,然后只更换这些积木,同时让其余部分保持完好无损。

该论文反对目前流行的所谓“以生成为中心”(generation-centric)的方法。这些方法通常尝试根据你的新文本提示生成一张全新的图像,然后使用复杂的技巧(如“反转”——即倒带生成过程,或“遮罩”——即告诉计算机忽略哪些像素)来强迫它看起来像原图。作者认为这种方式效率低下,且容易导致图像发生“漂移”或丢失原始形状。相反,他们采取了“以源为中心”(source-centric)的视角。他们将编码后的原始图像版本视为主要状态,并简单地计算计算机对原始图像的预测与对新图像的预测之间的差异。

以下是他们的 “EditMod” 如何通过三个有趣的步骤运作的:

  1. 粗略草图(粗尺度阶段): 在图像最初只是一个模糊形状的团块时,EditMod 直接复制原始图像的结构。它说:“让我们保持布局完全一致。”这锚定了图像,以免马突然变成了一艘船。
  2. 魔法交换(中间尺度阶段): 随着图像变得清晰,计算机观察“旧提示词”(例如“白马”)与“新提示词”(例如“金马”)之间的差异。它将这种差异计算为一个类似于从旧想法指向新想法的向量箭头。然后,它将这个“差异箭头”应用于原始图像,有效地微调像素,使其在不干扰场景其余部分的情况下完成改变。
  3. 精细打磨(细尺度阶段): 最后,当图像接近完成并需要毛发纹理或光影反射等微小细节时,计算机会根据新提示词来生成这些细节。这确保了新物体看起来真实自然,并符合场景的光照。

结果非常令人印象深刻。作者在名为 PIE-Bench 的基准测试上测试了他们的方法,该测试包含 700 张真实图像以及各种编辑任务,如改变物体、姿势或背景。他们发现 EditMod 速度极快,在单块 A100 GPU 上仅需 1.57 秒 即可编辑一张高质量的 1K 图像。这比同类模型中之前的最佳方法(AREdit)快了约 47.7%

更重要的是,编辑后的图像比其他方法生成的图像更接近原图。从技术角度来看,与 AREdit 相比,他们的 LPIPS(一个衡量两张图像在人类眼中差异程度的分数)降低了 15.1%,这意味着变化更加精准,且其余部分更忠实于原图。他们也保持了与文本提示词的高度一致性,这意味着如果你要求一只“金马”,你得到的是一只金马,而不是一只带着金色滤镜的白马。

论文明确排除了对“反转”(rewinding)、“遮罩”(手动绘制要改变的部分)或“训练”(教模型新技巧)的需求。他们展示了通过简单地比较新旧提示词的预测,并将差异作为一次微小的更新应用,就可以获得高质量的编辑。虽然他们承认其方法依赖于一些预设的边界来决定何时切换这三个步骤,但他们认为这种“以源为中心”的方法是编辑由这些下一尺度模型生成的图像时,一种更自然且高效的方式。

简而言之,这篇论文表明,与其在试图改变的同时努力保持图像不变,我们不如直接计算出所需的精确变化,并将其直接应用于基础之上。这是一种从“重建房屋”到“装修房间”的转变,而且看起来比目前的替代方案更快、更好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →