← 最新论文
💻 computer science

Geometry-Instructed Video Editing

本文介绍了 GIVE,这是一个几何指令驱动的视频编辑框架,该框架利用统一的对象状态公式化以及深度/方向框流,实现了可靠、时间相干的对象级几何编辑,并保持了如阴影和反射等次要效应的一致性。

原作者: Chirui Chang, Xiaoyang Lyu, Yi-Hua Huang, Haoru Tan, Shizhen Zhao, Yikang Ding, Jianmin Bao, Xin Tao, Pengfei Wan, Xiaojuan Qi

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Chirui Chang, Xiaoyang Lyu, Yi-Hua Huang, Haoru Tan, Shizhen Zhao, Yikang Ding, Jianmin Bao, Xin Tao, Pengfei Wan, Xiaojuan Qi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一段朋友在街上行走的家庭录像。你想对它进行编辑,但不仅仅是涂抹像素。你想要移动你的朋友向左走三步,旋转他们以面向摄像机,或者像玩具一样把他们缩小

在传统的视频编辑软件(如 Blender 或 Unreal Engine)中,你可以轻松做到这一点,因为计算机知道一切的 3D 形状。但在生成式 AI(那种从零开始创建视频的 AI)中,计算机通常只是在“猜测”视频应该长什么样。如果你要求它移动一个人,它可能会让那个人移动得非常生硬、影子变化不正确,或者让其消失又重新出现。

这篇论文介绍了 GIVE(几何指令视频编辑,Geometry-Instructed Video Editing),这是一种教导 AI 如何执行这些精确 3D 动作的新方法,而无需先重建整个视频的 3D 模型。

以下是它的工作原理,通过简单的概念进行拆解:

1. 问题所在:“盲目”的编辑师

目前的 AI 视频编辑器就像是一个只能看到画布表面的画家。如果你告诉他们“移动杯子”,他们可能会抹掉油漆或改变杯子的形状,因为他们不理解杯子在 3D 空间中的位置。

  • 结果: 编辑看起来很凌乱,阴影不会随物体移动,且视频可能会出现闪烁。
  • 旧有的解决方法: 一些方法试图先构建视频的完整 3D 模型。但这既缓慢又昂贵,而且如果视频有复杂的运动(比如人在跳舞),模型往往会崩溃。

2. 解决方案:“前后”蓝图

GIVE 并不试图重建整个世界。相反,它使用了一个聪明的技巧:它要求提供一个关于物体“现在”在哪里以及“稍后”要在哪里处的蓝图

这就像是给导演两张简单的草图:

  1. 草图 A(“深度框”): 一个粗略的轮廓,显示物体在房间里的位置(它有多远以及它有多大)。
  2. 草图 B(“朝向框”): 一个简单的箭头,显示物体的朝向。

你向 AI 提供“之前”的草图和“之后”的草图。AI 的任务仅仅是找出将草图 A 转化为草图 B 的神奇变换过程,同时保持视频的其余部分(背景、光照和其他人)完全不变。

3. 核心秘诀:“训练健身房”

如何教导 AI 完美地做到这一点?你不能只给它看真实的视频,因为真实的视频并不具备那种“只有一个物体移动了”的“前后”配对。

作者利用游戏引擎(Unreal Engine)建立了一个虚拟训练健身房

  • 过程: 他们编写程序让计算机创建数千个虚假视频。在这些视频中,一个机器人会拿起一个物体,移动它、旋转它或删除它,然后瞬间渲染出“之前”和“之后”的版本。
  • 优势: 因为使用的是游戏引擎,计算机确切地知道阴影应该如何变化以及反射应该如何呈现。它为 AI 创建了完美的“教师”示例供其学习。

4. 你如何使用它(用户界面)

使用 GIVE 时,你不需要成为 3D 艺术家。

  1. 你上传一段视频。
  2. 你点击想要移动的物体。
  3. 你告诉系统要做什么(例如,“旋转 90 度”)。
  4. 系统会自动使用现成的工具来推测 3D 形状和朝向,创建那些“之前”和“之后”的草图(几何流),并将它们喂给 AI。
  5. AI 生成新的视频。

5. 它能做什么

论文表明,GIVE 可以处理一系列“数字内容创作”(DCC)任务:

  • 平移(Translation): 将物体滑动到一个新的位置。
  • 旋转(Rotation): 使物体转向不同的方向。
  • 缩放(Scaling): 使物体变大或变小。
  • 复制(Duplication): 创建一个物体的副本。
  • 移除(Removal): 让物体消失(并正确填充背景)。
  • 轨迹(Trajectory): 让物体沿着特定的路径移动。

总结

GIVE 就像是给了 AI 一副 3D 眼镜和一个尺子。它不再是通过猜测来移动物体,而是通过观察物体位置和朝向的简单“之前”与“之后”地图。这使得它能够实现逼真的物体移动,保持阴影、反射和背景的一致性,而无需先重建整个视频的 3D 模型。

该论文声称,这种方法比目前的商业视频编辑器更准确、更可靠,尤其是在处理需要精确 3D 运动的任务时。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →