← 最新论文
💻 computer science

LocateEdit-Bench: A Benchmark for Instruction-Based Editing Localization

本文介绍了 LocateEdit-Bench,这是一个包含 23.1 万张图像的大规模数据集,旨在通过将各种方法针对新兴的基于指令的图像编辑范式进行基准测试,来解决 AI 生成伪造定位领域存在的关键空白。

原作者: Shiyu Wu, Shuyan Li, Jing Li, Jing Liu, Yequan Wang

发布于 2026-02-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Shiyu Wu, Shuyan Li, Jing Li, Jing Liu, Yequan Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一把神奇的画笔,只需听从你的声音就能改变照片。你可以说,“在沙发上加一只老虎”,画笔就会立刻在那里画上一只老虎,让它看起来如此真实,完美地融入房间之中。这就是现代“基于指令”的图像编辑技术所做的事情。

然而,这种魔法也为数字侦探带来了新的问题。多年来,专家们一直擅长识别“伪造”的照片,因为旧式的魔法画笔会留下明显的痕ata——比如在新粘贴的对象处留下一条锯齿状的线条。但这种由语音控制的新型画笔非常平滑,几乎不留下任何可见的接缝。这就像一位大师级的伪造者,他不只是粘贴一个假的签名,而是完美地重写了整个文件,使纸张看起来毫无痕迹。

问题:“隐形”的编辑
这篇论文的作者意识到,我们用来捕捉这些伪造品的工具就像只受过“寻找撕裂纸张”训练的保安一样。它们擅长发现旧式的伪造(即某人剪切并粘贴图像),但面对这些新型、无缝的编辑时却完全感到困惑。当你要求 AI “把车变成红色”时,AI 不仅仅是在车上涂色,它还从头开始重建了这辆车,使其看起来就像原本就在那里一样。旧的检测器找不到那个“剪切口”,因为根本不存在剪切口。

解决方案:一个新的训练场 (LocateEdit-Bench)
为了解决这个问题,研究人员构建了一个庞大的全新训练场,名为 LocateEdit-Bench。你可以把它想象成一个巨大的 AI 侦探“打地鼠”游戏。

  • 游戏板: 他们创建了 231,000 张伪造图像。
  • 伪造者: 他们使用了目前最聪明、最先进的四种 AI 编辑器来创造这些伪造品。
  • 招式: 他们练习了三种主要的戏法:
    1. 添加 (Adding): 在原处放入一个新物体(比如在客厅里放一个雪人)。
    2. 更换 (Swapping): 用一件东西替换另一件东西(比如把木桥变成石堡)。
    3. 改变 (Changing): 改变物体的外观(比如把蓝色花瓶变成绿色)。
  • 答案解析: 对于每一张伪造图像,他们还创建了一个完美的“掩码”(一个数字轮廓),精确显示了 AI 在哪里改变了图片。这就是侦探 AI 需要学习的“答案解析”。

实验:让侦探接受测试
一旦建立了这个庞大的数据集,他们就将现有的最好的“识别伪造”AI 工具拿出来进行严苛的测试。他们问道:这些旧工具能发现这些新型、隐形的编辑吗?

结果是一个警钟:

  1. 差距: 旧的工具表现得非常吃力。它们就像试图寻找幽灵的保安;它们能看到房间,却无法发现那个隐形的入侵者。
  2. “魔法”编辑器: 他们发现其中一个特定的 AI 编辑器(被称为 BAGEL)是最难被抓到的。它在融合修改效果方面做得如此出色,以至于即使是最聪明的检测器也会感到困惑。
  3. 泛化问题: 当他们用一种 AI 制作的伪造品来训练检测器,然后用另一种 AI 制作的伪造品来测试它时,检测器的性能崩溃了。这就像教一个学生只用加法来解数学题,然后却给他一份乘法的测试卷。他们并没有理解底层的逻辑,而只是死记硬背了第一个老师的特定模式。

总结
这篇论文并不声称已经解决了捕捉所有伪造品的问题。相反,它构建了第一个巨大的、现实的“健身房”,研究人员可以在这里训练他们的检测器去识别这些新型的、无缝的编辑。

他们向我们展示了,仅仅寻找“瑕疵”的旧方法已经不够了。为了抓住这些新的伪造品,我们需要能够理解图像“故事”而不只是像素的侦探。这个全新的数据集 LocateEdit-Bench 是教导那些侦探如何在这些隐形变化成为普遍问题之前识别它们的第一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →