想象一下,你有一张照片,里面有个不速之客——也许是背景里的陌生人、美丽风景中的垃圾桶,或是餐桌上的杂乱物品。通常,要消除它们,你必须使用图像编辑软件,用画笔仔细地将物体“涂抹”覆盖,逐像素地描摹其轮廓。这就像试图用一把钝刀从一张纸上剪出一个特定形状:耗时漫长,需要手稳,一旦稍有偏差,切口就会显得参差不齐、难看至极。
ClickRemoval 是一款全新的免费工具,它将彻底改变游戏规则。你无需绘制遮罩,只需点击想要移除的物体即可。仅此而已。一次点击,计算机便能精准判断该删除什么、保留什么,并神奇地用逼真的背景填充空白区域。
以下是其工作原理,借助一些简单的类比来说明:
1. “点击即映射”翻译器(M2N2)
当你点击某个物体时,该工具并非仅仅看到一个点,而是理解该物体的概念。
- 类比:想象你向池塘中投入一颗小石子,涟漪向外扩散,清晰展示出水的波及范围。ClickRemoval 的做法与此类似。它利用一种“涟漪效应”(称为语义距离图),精确判断物体何时结束、背景何时开始,即使物体形状怪异或部分被遮挡。它将你的一次点击转化为该物体的详细映射,而无需你绘制任何线条。
2. “注意力切换”(SGAR 与 SGAS)
一旦工具识别出物体,它就需要告知 AI 模型:“忽略这部分,专注于背景。”
- 类比:将 AI 模型想象为一位全神贯注于整幅画面的画家。通常,画家会同等地审视所有部分。ClickRemoval 则如同灯光操作员。
- SGAR(聚光灯):它调暗你所点击物体的灯光(告诉画家:“不要绘制此处”),同时调亮背景的灯光(告诉画家:“用属于这里的内容填充此处”)。
- SGAS(调光开关):如果始终将物体的灯光调暗,最终画面可能会显得怪异或不自然。因此,这部分如同一个调光开关。它在开始时将“忽略”信号调至最强,随着画面逐渐接近完成,再慢慢减弱该信号。这确保了背景看起来自然,而非生硬。
3. “融合大厨”(ARG)
最后,工具需要决定将多少“新”背景与“旧”原始图像进行混合。
- 类比:想象你在制作冰沙。你拥有原始水果(背景)和新口味(AI 的猜测)。ARG 就是那位决定完美比例的大厨。如果你希望结果非常接近原始照片,大厨就少加一点新口味;如果你希望彻底转变,大厨就多加一些。这让你能够控制移除效果的强度。
为何这意义重大?
大多数其他工具如同专业厨师,在烹饪前需要特定的食谱(文本提示)和预先准备好的配料清单(手动遮罩)。它们通常还需要进入烹饪学校(额外训练)才能学会如何处理特定食材。
ClickRemoval 则像一位智能厨房助手,能配合你已有的任何食谱工作。
- 无需训练:它开箱即用,兼容现有的 AI 模型。你无需教它任何新东西。
- 无需遮罩或文本:你无需绘制轮廓或输入“移除狗”。只需点击即可。
- 开源:创作者已免费分享了完整的“食谱书”(代码、说明和工具),因此任何人都可以使用它或在其基础上构建。
成果
创作者将该工具与其他顶级图像编辑器进行了测试。
- 质量:在测试中,它生成的照片效果与那些需要遮罩和文本的复杂方法一样好,甚至更好。
- 用户偏好:当普通人(非专家)查看结果时,他们最偏爱 ClickRemoval。他们认为它更易用,且结果看起来更自然。
- 多功能性:它适用于不同类型的照片,从简单的 512x512 图像到高清的 1024x1024 图像,甚至能处理棘手的情况,例如移除躲在栅栏后的狗(使用“负向点击”来告知工具:“不要移除栅栏,只移除狗”)。
简而言之,ClickRemoval 将图像编辑的繁重工作转化为简单的“点击即点”体验,让任何人只要拥有一台电脑,就能实现专业级的物体移除。
技术摘要:ClickRemoval
问题陈述
现有的多媒体内容创作和隐私保护用物体移除工具,往往为非专家用户设置了显著障碍。当前最先进的方法,如 AttentiveEraser、PowerPaint 和 SD-Inpaint 系列,通常依赖精细的手动蒙版、文本提示或专门的训练流程。这些依赖导致交互成本高昂,并限制了其在复杂场景中的可用性,常导致物体移除不完整或背景填充不自然。因此,亟需一种解决方案,能够在无需手动蒙版、文本描述或额外模型训练的情况下,实现精确的物体移除。
方法论
ClickRemoval 是一个基于预训练 Stable Diffusion 模型(SD1.5、SD2.1 和 SDXL1.0)构建的开源交互式物体移除工具。它仅依靠用户点击运行,消除了对手绘蒙版或文本提示的需求。该系统通过将用户点击转换为软语义图,并在去噪过程中利用这些图重定向扩散模型内的自注意力机制来发挥作用。
该框架包含三个主要组件:
M2N2 语义距离图提取:
- 使用 M2N2 方法将用户点击转换为语义距离图。这涉及在冻结的 Stable Diffusion 模型上执行单次去噪前向传播,以聚合多头自注意力图,形成转移矩阵。
- 从点击位置开始执行马尔可夫传播,以确定每个像素的语义距离。
- 物体图(Mob): 通过对语义图应用洪水填充(Flood Fill)生成,以抑制局部极小值并增强实例感知,从而定义待移除区域。
- 背景图(Mbg): 一种归一化的马尔可夫图(未应用洪水填充),用于测量与点击物体的语义距离,其中较小的值表示与物体具有更高的相似性。该图指导背景的恢复。
自引导注意力重定向与调度(SGAR & SGAS):
- SGAR(自引导注意力重定向): 在推理过程中调节自注意力 logits(Sself)。它使用较大的负惩罚(Pob)抑制与物体相关的键条目,并利用源自 Mbg 的调度因子(Gbg(t))重新加权背景键条目。
- SGAS(自引导注意力调度): 控制 SGAR 的时机和强度,以确保自然的背景填充。去噪过程分为以下阶段:
- 早期阶段(前约 20%): 无修改。
- 早中期阶段: 启用 SGAR,背景引导逐渐衰减。
- 中期阶段: 禁用背景引导,但物体抑制保持激活状态。
- 晚期阶段: 禁用所有引导,允许模型自主完成剩余细节。
注意力重定向引导(ARG):
- 为了提供可控的输出级引导,ARG 将原始噪声预测(ϵ(x,t))与调制后的噪声预测(ϵ′(x,t))进行线性组合。
- 最终预测计算为 ϵARG=(1−r)⋅ϵ(x,t)+r⋅ϵ′(x,t),其中 r 为用户指定的系数。较小的 r 保留更多原始模型的行为,而较大的 r 则更严格地遵循移除引导。
该系统支持正向点击(指示待移除物体)和负向点击(指示需保留区域),从而支持复杂的交互,例如在移除遮挡物体的同时保留前景元素。
主要贡献
- 交互式物体移除工具: 推出了 ClickRemoval,这是一款无需蒙版、文本描述或额外训练的工具。它支持正向和负向点击交互,显著降低了非专家用户的使用门槛。
- 可扩展的注意力重定向机制: 一个由 M2N2、SGAR、SGAS 和 ARG 组成的点击驱动框架。该机制不与特定的扩散骨干网络紧密耦合,并已成功在 SD1.5、SD2.1 和 SDXL1.0 上实现。
- 完整的开源交付: 在 Apache-2.0 许可下发布了全面的软件包,包括源代码、配置文件、Docker 环境、文档、演示界面和评估脚本。
实验结果
作者使用源自 Pico-Banana-400K 的统一测试集,将 ClickRemoval 与 SD-Inpaint、LaMa、PixelHacker、Inpaint Anything、PowerPaint-v2 和 AttentiveEraser 等强基准进行了评估。
- 定量指标: ClickRemoval 在未进行额外训练的情况下取得了具有竞争力的结果。
- 在 1024×1024 分辨率(SDXL1.0)下,其 FID 为 8.05,Local-FID 为 15.56,与 AttentiveEraser(7.98 / 15.74)相当。
- 在 512×512 分辨率(SD1.5)下,它在同分辨率方法中获得了最佳整体性能,FID 为 9.35,KID 为 0.899,Local-FID 为 17.27。
- 用户研究: 在涉及 25 名非专家参与者的研究中,ClickRemoval 在两种分辨率设置下均排名第一,在 512 分辨率下获得 30.48% 的选票,在 1024 分辨率下获得 41.89% 的选票。
- LLM 辅助验证: 使用基于 GPT 的多模态评估器,ClickRemoval 在 512 分辨率下排名第一(28.85%),在 1024 分辨率下排名第二(39.21%),仅比 AttentiveEraser 低 1.97 个百分点。
- 效率: 该工具表现出可接受的推理开销,1024 分辨率的运行时与强基准相当,且在消费级硬件(RTX 3090)上对 512 分辨率任务具有实际效率。
意义
该论文将 ClickRemoval 定位为迈向高质量物体移除民主化的重要一步。通过消除对手动蒙版和文本提示的依赖,它提供了一种“点击即移除”的工作流,既易于非专家使用,又保持了具有竞争力的恢复质量。作者强调,他们的方法无需额外训练即可实现这些结果,而是依赖于预训练扩散模型的固有能力,并通过其注意力重定向框架加以增强。完整开源包的发布旨在支持可复现的研究和实际的内容编辑应用。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。