← 最新论文
💻 computer science

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking

本文介绍了 DiTracker,一种鲁棒的点追踪方法,它通过零样本分析和轻量化适配,利用了视频扩散 Transformer 特征卓越的时间相干性,在仅依赖合成监督的情况下,超越了那些基于大量真实世界数据训练的现有模型。

原作者: Soowon Son, Honggyu An, Jisu Nam, Hyunah Ko, Chaehyun Kim, Dahyun Chung, Siyoon Jin, Jung Yi, Junhwa Hur, Seungryong Kim

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Soowon Son, Honggyu An, Jisu Nam, Hyunah Ko, Chaehyun Kim, Dahyun Chung, Siyoon Jin, Jung Yi, Junhwa Hur, Seungryong Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:“迷失的跟随者”问题

想象一下,你正在观看一段混乱的街景视频。你选中了一个特定的红色气球,并试图追踪它在跳动、被公交车遮挡、快速移动或因风吹而变得模糊时的轨迹。

目前的计算机程序在尝试做这件事(称为点追踪/Point Tracking)时,就像是一个非常聪明但容易在物体移动时感到困惑的新实习生。它们依赖于一个“特征骨干网络”(即识别形状的大脑部分),而这个网络主要是在静态图像上训练出来的。当视频变得混乱时——比如快速运动、模糊或物体消失——这个实习生就会丢掉那个气球。

发现: “梦想家”才是最好的追踪者

研究人员提出了一个简单的问题:哪种类型的 AI 大脑实际上最擅长追踪移动物体?

他们测试了许多不同的“视觉基础模型”(经过海量数据训练的高级 AI)。他们发现,表现最好的并不是那些专门为追踪点而训练的模型。相反,赢家是视频扩散 Transformer (DiTs)

类比:

  • 旧的骨干网络(如 ResNet): 它们就像摄影师,拍摄了成千上万张完美的静态肖像。它们在影棚里识别一张脸很厉害,但如果那个人开始奔跑或者相机开始抖动,它们就会迷失方向。
  • 视频扩散 Transformer (DiTs): 它们像是梦想家。它们是被训练来从无到有“创造”视频的。为了制作一段逼真的人在奔跑的视频,AI 必须理解一个人是如何移动的,衣服是如何起伏的,以及当人被部分遮挡时看起来是什么样的。
  • 结果: 因为这些“梦想家”通过“想象”世界是如何运作的,从而学会了如何移动,所以它们比“摄影师”拥有更强的追踪真实物体的“直觉”,即使在视频模糊或混乱的情况下也是如此。

解决方案:DiTracker

研究人员构建了一个名为 DiTracker 的新系统。他们并没有尝试从头教这个“梦想家”如何进行追踪,而是研究了如何利用“梦想家”现有的知识来辅助追踪器。

他们使用了三个聪明的技巧:

  1. “查询-键”握手 (The "Query-Key" Handshake): 他们没有让 AI 去猜测物体在哪里,而是让 AI 使用其内部的“匹配”系统(即它用于生成视频的同一个系统)来寻找物体。这就像是在问这位梦想家:“如果我给你看这个红色气球,它会出现在你的下一个梦境中的什么位置?”
  2. “高分辨率”助手 (The "High-Res" Assistant): “梦想家”看到的的世界是以一种略显模糊、压缩的方式呈现的(就像一张低分辨率的草图)。为了解决这个问题,他们添加了一个小型、快速的助手(一个轻量级的 ResNet),该助手能提供清晰、细腻的细节。他们将梦想家的“大局观”直觉与助手的“精细细节”结合在了一起。
  3. “微调” (LoRA): 他们没有重新训练整个庞大的 AI(那会耗费极长时间)。相反,他们为 AI 添加了微小的、可调节的“辅助轮”(称为 LoRA)。这使得梦想家能够快速学习如何将其视频创作技能应用于特定的点追踪任务。

结果:更少的数据,更好的性能

这篇论文中最令人惊讶的部分是 DiTracker 所需的数据量之少。

  • 竞争对手 (CoTracker3): 一个顶尖的追踪器,它是在 15,000 段真实世界视频以及合成数据上训练而成的。它就像一个读遍了所有教科书并看遍了所有电影的学生。
  • DiTracker: 仅在合成数据(计算机生成的视频)上进行训练,并且使用的训练步骤也少得多。它就像一个只读了几页书、但拥有“梦想家”大脑的学生。

最终结果:
尽管 DiTracker 训练的数据更少,但它击败了竞争对手

  • 当视频模糊、快速移动或物体被遮挡时,它的追踪效果更好。
  • 它在不同的追踪系统中都能同样出色地工作,证明了它是一个通用的“大脑”,可以插入任何追踪器中。

总结

这篇论文证明了被训练用来生成(创造)视频的 AI 模型,实际上比专门被训练用来追踪视频的模型更擅长理解(追踪)视频

通过使用一个“视频梦想家”作为追踪系统的核心大脑,并进行一些微小的调整,研究人员创造出了一个更鲁棒、需要更少真实数据进行学习、且能比以往方法更好地处理混乱现实情况的追踪器。这表明,提升追踪能力的秘诀不仅仅是观看更多的视频,而是通过学习如何“想象”世界是如何运动的,从而理解世界的运行方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →