GenEraser: Generalizable Video Object Removal via Balanced Text-Mask Guidance and Decoupled Locator-Preserver
GenEraser 是一个新颖的框架,它通过利用具有二分文本引导的多条件混合专家模型、用于自适应条件平衡的可学习深度 CFG 融合机制,以及用于解决语义泛化与像素级保留之间权衡的解耦定位器 - 保留器架构,在开放世界场景中实现了通用且高保真的视频对象与效果移除。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在编辑一段家庭录像。你想移除一个走进画面的人,但当你简单地“剪掉他们”时,却留下了奇怪的伪影:他们的影子还留在地上,镜子里的倒影依然存在,或者他们手中香烟冒出的烟雾还悬浮在半空中。这看起来既假又乱。
GenEraser 是一款新的人工智能工具,旨在解决这一问题。不妨将其视为一种“数字魔法橡皮擦”,它不仅能擦除物体本身,还能清理该物体留下的所有杂乱副作用,使场景看起来仿佛该物体从未存在过。
以下是论文如何用简单的类比解释其三大“超能力”:
1. “双语翻译器”(二分文本引导)
大多数旧式视频编辑器只关注掩码(即围绕待移除物体绘制的黄色轮廓)。它们假设,一旦移除物体,其他一切也会随之消失。但人工智能往往会感到困惑。如果你擦除一辆汽车,人工智能可能会忘记擦除轮胎冒出的烟雾或汽车投下的阴影。
GenEraser 采用了一种翻译器方法。它不仅仅是向人工智能展示要剪除的图片,而是提供两部分描述:
- 第一部分(红色文本): “移除汽车。”
- 第二部分(黄色文本): “同时移除烟雾、阴影和倒影。”
通过阅读这段描述,人工智能理解了场景的“故事”。它知道烟雾和阴影是“因果效应”——即因为汽车存在而发生的事物。这有助于人工智能发现并擦除简单的轮廓容易遗漏的棘手事物,如光束、水中的涟漪或镜子里的倒影。
2. “智能混合器”(可学习的深度 CFG 融合)
想象你在煮汤。有时你需要多加盐(文本引导)来调整味道,有时则需要多加水(掩码引导)来填满锅。如果你每次都加入固定量的盐,某些食谱中的汤可能会难以下咽。
旧的人工智能工具使用固定配方(手动调整)来决定在多大程度上听从文本描述与视觉轮廓。GenEraser 则使用智能混合器。它会观察具体的视频场景,并实时自动调整平衡:
- 如果场景中充满了复杂的烟雾,它会调高“文本音量”,以理解烟雾的样子。
- 如果场景是 Plain 墙上的简单物体,它会调高“掩码音量”,以精确处理边缘。
这种“智能混合器”会自行学习如何为每一段视频平衡这两项指令,因此你无需猜测设置。
3. “双人协作团队”(解耦的定位器与保持器)
论文指出了一个常见问题:试图让一个人同时做两项截然不同的工作,往往会导致失败。
- 工作 A: 找到并擦除物体(需要大胆和概括性)。
- 工作 B: 保持背景完美无缺(需要谨慎和精确性)。
如果你训练一个人工智能模型同时完成这两项任务,它往往会感到困惑。它可能很好地擦除了物体,却破坏了背景;或者保持了背景完美,却留下了物体的幽灵。
GenEraser 通过雇佣两名专业工人来解决这一问题:
- 定位器(Locator): 该工人经过多种类型视频(合成视频和真实视频)的训练。它的唯一任务是充当“猎人”。它学习在任何环境中识别物体及其怪异效应(如阴影)并将其擦除。它擅长泛化(处理新的、怪异的情况)。
- 保持器(Preserver): 该工人经过“完美”数据的训练,其中背景是像素级完美的。它的唯一任务是充当“修复者”。它确保视频中未被擦除的部分看起来与原始画面完全一致。它擅长精确性。
通过将这些工作分开,团队配合得更好。定位器发现混乱,保持器修复背景,从而生成干净、逼真的视频。
结果
论文将 GenEraser 与其他顶级方法进行了测试,发现它是最佳选择。它成功移除了以下棘手事物:
- 汽车轮胎产生的烟雾。
- 海豚产生的气泡。
- 灯具发出的光线。
- 镜子中的倒影。
- 人或物体投下的阴影。
简而言之,GenEraser 是一款视频编辑工具,它通过阅读描述来理解场景的物理特性(光线、阴影、烟雾),自动平衡自身设置,并利用专业的双人团队确保最终视频看起来自然且干净。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。