← 最新论文
💻 computer science

VOID: Video Object and Interaction Deletion

本文提出了 VOID 框架,通过结合视觉语言模型识别受移除物体影响的区域,并利用视频扩散模型生成符合物理规律的因果反事实结果,从而解决了现有视频物体删除方法在处理复杂物理交互(如碰撞)时生成不真实画面的问题。

原作者: Saman Motamed, William Harvey, Benjamin Klein, Luc Van Gool, Zhuoning Yuan, Ta-Ying Cheng

发布于 2026-04-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Saman Motamed, William Harvey, Benjamin Klein, Luc Van Gool, Zhuoning Yuan, Ta-Ying Cheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 VOID 的新 AI 模型,它的核心能力非常酷:不仅能从视频里“擦除”某个物体,还能让剩下的世界按照物理规律“自然”地继续运转。

为了让你轻松理解,我们可以把现有的视频编辑技术比作“修图”,而 VOID 则是在做“重写剧本”。

1. 以前的 AI 像“只会填色的画家”,而 VOID 是“懂物理的导演”

想象一下,你有一段视频:一排多米诺骨牌正在倒下。

  • 以前的 AI(传统视频修复技术): 如果你把中间的一块骨牌擦掉,它只会像填色游戏一样,把那块空缺补上背景颜色。结果就是:后面的骨牌依然会倒下,哪怕前面已经空了。这在现实中是不可能的,就像你抽走了积木,上面的积木却悬空不掉一样。
  • VOID 模型: 它像个懂物理的导演。当你擦掉中间那块骨牌时,它会思考:“哎呀,前面没东西了,后面的骨牌应该停住不动才对!”于是,它生成的视频里,后面的骨牌真的就稳稳地立住了。

简单说: 以前的 AI 只懂“修补画面”,VOID 懂“修补因果”。

2. 它是如何学会“思考”的?(三大法宝)

为了让 AI 学会这种“物理直觉”,作者给它准备了三样法宝:

🧪 法宝一:在虚拟世界里“制造意外”(数据训练)

AI 需要大量练习。作者没有用普通的视频,而是用两个“虚拟沙盒”:

  • Kubric(物理沙盒): 在这里,他们模拟了成千上万次碰撞、倒塌和滚动。比如,模拟一个球撞倒杯子,然后故意把球拿走,看杯子是不是真的不会倒。AI 通过对比“有球”和“没球”的两种结果,学会了物理规律。
  • HUMOTO(人类动作沙盒): 这里模拟了人和物体的互动。比如,人拿着气球,人走了,气球应该飘起来。AI 学会了这种“人走茶凉(或者人走球飘)”的逻辑。

🎭 法宝二:给 AI 一张“四色地图”(四色掩码 Quadmask)

以前的 AI 只有一张黑白地图:哪里要擦除(黑),哪里保留(白)。这太模糊了。
VOID 发明了一张四色地图

  1. 黑色: 要擦除的物体(比如那个捣乱的人)。
  2. 深灰色: 物体和它造成的影响重叠的地方(比如人手里抓着的球,人没了,球的位置也要变)。
  3. 浅灰色: 受影响的区域(比如因为人走了,原本被挡住的桌子现在露出来了,或者因为人走了,原本被推倒的积木现在立住了)。
  4. 白色: 完全不受影响的地方。
    这张地图告诉 AI:“嘿,这里不仅仅是把黑色涂掉,浅灰色和深灰色的区域也要跟着剧情变化!”

🧠 法宝三:请个“超级顾问”(VLM 视觉语言模型)

在生成视频前,VOID 会先请一位“超级顾问”(一种能看懂视频并懂常识的 AI,比如 Gemini 或 GPT)。

  • 顾问的作用: 当你圈出要删除的人时,顾问会分析:“这个人走了,他手里的杯子会掉下去,他挡住的阳光会照进来,他推的球会滚远。”
  • 结果: 顾问把这些“剧情变化”画成地图,交给 VOID 去执行。这样,VOID 就不是瞎猜,而是基于逻辑推理来生成视频。

3. 它有多厉害?(两个神奇案例)

论文里展示了两个让 AI 都惊讶的例子,说明它真的“举一反三”了:

  • 案例 A:消失的吹风机
    训练数据里根本没有吹风机。但当你把视频里“打开吹风机的人”擦掉后,VOID 知道:人没了,吹风机就不转了,里面的食物也不会被搅动。 它成功让旋转的食物停住了。
  • 案例 B:飘走的气球
    训练数据里没有气球。但当你把“拿着气球的人”擦掉后,VOID 知道:没人抓着,气球应该飘向天空。 它成功生成了气球飞走的画面。

这说明 VOID 不是死记硬背了训练数据,而是真的学会了世界的运行规则

4. 总结:这不仅仅是修图,这是“时间旅行”

VOID 的核心贡献在于: 它让视频编辑从“视觉修补”升级到了“逻辑重写”。

  • 以前的编辑: “把这个人 P 掉,把背景补上。”(像 PS 修图)
  • VOID 的编辑: “把这个人 P 掉,然后重新计算如果没有他,这个世界接下来会发生什么,并生成那个新的现实。”(像电影特效导演)

虽然它现在还有一些小缺点(比如视频长度有限,或者角度太刁钻时容易懵),但它为未来的视频编辑打开了一扇大门:未来的 AI 不仅能帮你剪辑视频,还能帮你模拟“如果当时没发生这件事,世界会怎样”的平行宇宙。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →