← 最新论文
🤖 machine learning

Go-with-the-Track: Video Compositing and Motion Control with Point Tracking

Go-with-the-Track 是一个统一的视频生成框架,它通过引入空间感知的点追踪嵌入和混合训练策略,将点追踪与多张参考图像相结合,从而在整个视频序列中实现精确的运动控制和高保真度的合成。

原作者: Koichi Namekata, Yash Kant, Zhizheng Liu, Ryan D Burgert, Yuancheng Xu, Kuan Heng Lin, Emmett Steven, Julien Philip, Li Ma, Andrea Vedaldi, Paul Debevec, Ning Yu

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Koichi Namekata, Yash Kant, Zhizheng Liu, Ryan D Burgert, Yuancheng Xu, Kuan Heng Lin, Emmett Steven, Julien Philip, Li Ma, Andrea Vedaldi, Paul Debevec, Ning Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一位正在剪辑电影的导演。你有一个明确的构想:你想让一张照片中的角色走进你的场景,与环境互动,并完全按照你的意愿移动。

目前的 AI 视频工具就像是笨拙的助手。它们虽然能让角色动起来,但只能让角色从视频的第一帧就开始出现。如果你想让角色在场景进行到一半时才走进来,AI 就会感到困惑。其他工具虽然可以把一张照片放入视频中,但它们根本不知道如何让这张照片“跳舞”或自然地运动;它只会呆在那里,或者进行一些平庸、机械化的移动。

“Go-with-the-Track” 是一款全新的 AI 工具,它扮演着一位大师级木偶师的角色。它同时解决了这两个问题,其核心在于使用一种被称为**“点追踪”(point-tracks)**的技术。

核心理念:隐形的线

把**“点追踪”**想象成一根系在视频中特定位置(比如鼻尖、汽车轮子或树叶)的隐形线。随着视频播放,这根线会逐帧跟随那个点。

在过去,这些线只能系在第一帧上。如果你想在稍后加入一个新物体,你就无法把它系在线上,因为它当时还不存在。

Go-with-the-Track 改变了规则。它允许你不仅将这些隐形的线系在视频上,还可以系在你的参考照片上。

  • 比喻: 想象你有一张红球的照片。你在照片上的球上画一个点。然后,你在视频中的球上也画一个点。AI 现在明白了:“照片里的红球就是视频里的这个红球,它必须沿着这条特定的路径移动。”

这让你能够告诉 AI:“把这张照片里的红球拿过来,让它完全沿着这条路径在视频中滚动,即使它是在场景进行到一半时才进入的。”

它是如何运作的(魔术技巧)

论文描述了该 AI 实现这一目标的三个主要“技巧”:

1. “智能身份证”(空间感知嵌入)
以前,当 AI 尝试追踪数千个点时,它会给每个点分配一个随机且毫无意义的 ID 数字(比如“ID #492”)。这就像试图通过喊出随机数字来在一群人中寻找朋友。

  • 创新之处: Go-with-the-Track 根据点的实际位置和运动情况,为每个点发放了一张“智能身份证”。这就像是给你的朋友贴上了一个写着“我是那个在树旁走动的人”的名字牌。因为 ID 是基于点的实际位置生成的,所以 AI 能瞬间理解照片中的点与视频中的哪个点相匹配,即使它们相距甚远。这使得追踪变得极其精准。

2. “压缩服”(适配器)
AI 视频模型在一个“压缩”的世界里工作(就像一个低分辨率的草图)以节省能量,但你的点追踪是高分辨率的细节。通常,将高分辨率细节挤进低分辨率的草图中会丢失精细的动作(比如微妙的转头)。

  • 创新之处: 团队构建了一个特殊的“适配器”(一种压缩服),能让高分辨率的点追踪完美地契合进 AI 的低分辨率世界。它保留了所有微小的、重要的运动细节,而不会丢失任何信息,确保角色看起来不会像一个模糊的色块。

3. “训练健身房”(混合数据)
为了学习如何完美地移动物体,AI 需要练习。现实世界的视频是混乱的;“线”(点追踪)经常会断裂或丢失。

  • 创新之处: 团队并没有仅仅在混乱的现实视频上进行练习,而是让 AI 在以下内容的混合体上进行训练:
    • 完美的合成数据: 计算机生成的世界,AI 在其中能精确知道每一个点的位置(就像一个拥有完美物理法则的游戏世界)。
    • 静态场景: 没有物体移动的房间,让 AI 学习如何处理摄像机的移动。
    • 真实视频: 用来学习真实的人和物体看起来是什么样的。
      这种混合训练让 AI 既具备了来自合成数据的精准性,又具备了来自真实数据的真实感。

你究竟可以用它做什么?

论文展示了这项“木偶师”技能可以实现的几种具体应用:

  • 视频风格重塑(Video Restylization): 你可以拍一段人走路的视频,然后告诉 AI,“让这个人看起来像某张特定照片中的画作”。AI 会保留完全一致的走路动作,但改变其外观以匹配照片。
  • 网格驱动的合成(Mesh-Driven Compositing): 你可以拿一段 3D 动画(比如机械臂在移动),然后告诉 AI 用照片中的特定角色替换掉机器人,让角色完全模仿机器人的动作。
  • 相机控制(Camera Control): 你可以拍摄一个静态房间或行驶中的汽车,然后告诉 AI,“将相机移动到一个新的角度”。AI 会利用点追踪来理解 3D 空间,并从新角度生成视频,同时保持物体在正确的位置。
  • 多重参考(Multi-Reference): 你可以使用多张照片。例如,你可以告诉 AI 使用一张照片作为角色的脸部,另一张照片作为他们的衣服,第三张照片作为背景,然后让它在遵循运动轨迹的同时将它们缝合在一起。

总结

Go-with-the-Track 是一款终于让创作者能够精确控制视频中出现什么以及如何运动的工具。它不再让 AI 去“猜”,而是通过简单的点和照片来引导用户去导演复杂的、具有电影感的视频。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →