大局观:“迷失的跟随者”问题
想象一下,你正在观看一段混乱的街景视频。你选中了一个特定的红色气球,并试图追踪它在跳动、被公交车遮挡、快速移动或因风吹而变得模糊时的轨迹。
目前的计算机程序在尝试做这件事(称为点追踪/Point Tracking)时,就像是一个非常聪明但容易在物体移动时感到困惑的新实习生。它们依赖于一个“特征骨干网络”(即识别形状的大脑部分),而这个网络主要是在静态图像上训练出来的。当视频变得混乱时——比如快速运动、模糊或物体消失——这个实习生就会丢掉那个气球。
发现: “梦想家”才是最好的追踪者
研究人员提出了一个简单的问题:哪种类型的 AI 大脑实际上最擅长追踪移动物体?
他们测试了许多不同的“视觉基础模型”(经过海量数据训练的高级 AI)。他们发现,表现最好的并不是那些专门为追踪点而训练的模型。相反,赢家是视频扩散 Transformer (DiTs)。
类比:
- 旧的骨干网络(如 ResNet): 它们就像摄影师,拍摄了成千上万张完美的静态肖像。它们在影棚里识别一张脸很厉害,但如果那个人开始奔跑或者相机开始抖动,它们就会迷失方向。
- 视频扩散 Transformer (DiTs): 它们像是梦想家。它们是被训练来从无到有“创造”视频的。为了制作一段逼真的人在奔跑的视频,AI 必须理解一个人是如何移动的,衣服是如何起伏的,以及当人被部分遮挡时看起来是什么样的。
- 结果: 因为这些“梦想家”通过“想象”世界是如何运作的,从而学会了如何移动,所以它们比“摄影师”拥有更强的追踪真实物体的“直觉”,即使在视频模糊或混乱的情况下也是如此。
解决方案:DiTracker
研究人员构建了一个名为 DiTracker 的新系统。他们并没有尝试从头教这个“梦想家”如何进行追踪,而是研究了如何利用“梦想家”现有的知识来辅助追踪器。
他们使用了三个聪明的技巧:
- “查询-键”握手 (The "Query-Key" Handshake): 他们没有让 AI 去猜测物体在哪里,而是让 AI 使用其内部的“匹配”系统(即它用于生成视频的同一个系统)来寻找物体。这就像是在问这位梦想家:“如果我给你看这个红色气球,它会出现在你的下一个梦境中的什么位置?”
- “高分辨率”助手 (The "High-Res" Assistant): “梦想家”看到的的世界是以一种略显模糊、压缩的方式呈现的(就像一张低分辨率的草图)。为了解决这个问题,他们添加了一个小型、快速的助手(一个轻量级的 ResNet),该助手能提供清晰、细腻的细节。他们将梦想家的“大局观”直觉与助手的“精细细节”结合在了一起。
- “微调” (LoRA): 他们没有重新训练整个庞大的 AI(那会耗费极长时间)。相反,他们为 AI 添加了微小的、可调节的“辅助轮”(称为 LoRA)。这使得梦想家能够快速学习如何将其视频创作技能应用于特定的点追踪任务。
结果:更少的数据,更好的性能
这篇论文中最令人惊讶的部分是 DiTracker 所需的数据量之少。
- 竞争对手 (CoTracker3): 一个顶尖的追踪器,它是在 15,000 段真实世界视频以及合成数据上训练而成的。它就像一个读遍了所有教科书并看遍了所有电影的学生。
- DiTracker: 仅在合成数据(计算机生成的视频)上进行训练,并且使用的训练步骤也少得多。它就像一个只读了几页书、但拥有“梦想家”大脑的学生。
最终结果:
尽管 DiTracker 训练的数据更少,但它击败了竞争对手。
- 当视频模糊、快速移动或物体被遮挡时,它的追踪效果更好。
- 它在不同的追踪系统中都能同样出色地工作,证明了它是一个通用的“大脑”,可以插入任何追踪器中。
总结
这篇论文证明了被训练用来生成(创造)视频的 AI 模型,实际上比专门被训练用来追踪视频的模型更擅长理解(追踪)视频。
通过使用一个“视频梦想家”作为追踪系统的核心大脑,并进行一些微小的调整,研究人员创造出了一个更鲁棒、需要更少真实数据进行学习、且能比以往方法更好地处理混乱现实情况的追踪器。这表明,提升追踪能力的秘诀不仅仅是观看更多的视频,而是通过学习如何“想象”世界是如何运动的,从而理解世界的运行方式。
技术摘要:探测并利用视频扩散 Transformer 特征实现鲁棒的点追踪
1. 问题陈述
目前的点追踪方法虽然在标准基准测试上表现出色,但往往依赖于缺乏内在时间连贯性的特征骨干网络(例如 ResNet),导致在涉及运动模糊、快速运动和频繁遮挡的真实场景中表现不佳。尽管最近的研究已开始引入如 DINOv2 之类的视觉基础模型 (VFMs),但尚未有系统性的分析来确定哪种 VFM 架构或训练目标能产生最鲁棒的表示用于密集时间追踪。此外,现有方法通常需要在大规模真实世界视频数据集上进行广泛监督才能达到高性能。
2. 方法论
2.1. VFM 的系统性分析
作者进行了多样化 VFM 的零样本评估,以确定最鲁棒的点追踪骨干网络。该研究对比了以下维度的模型:
- 预训练模态: 仅图像 vs. 视频。
- 架构: UNet vs. Transformer。
- 学习目标: 自监督(MAE, DINO) vs. 扩散(Diffusion)。
- 基准测试: 标准(TAP-Vid-DAVIS)、运动模糊损坏(TAP-Vid-DAVIS + ImageNet-C)以及具有挑战性的真实世界场景(ITTO-MOSE)。
分析的关键发现:
- 视频扩散 Transformer (DiTs) 的表现一致优于所有其他 VFM,包括图像训练模型(DINOv2, SD3)以及采用分解注意力机制或 MAE 目标的视频模型(V-JEPA)。
- CogVideoX-5B 取得了最高的性能,甚至超过了在追踪数据上进行显式监督的 ResNet 骨干网络。
- 归因因素: 视频 DiT 的优越性归功于三个特性:
- 大规模真实世界视频预训练: 接触到多样化的运动和外观变化。
- 全 3D 时空注意力: 实现了跨空间和时间的全局交互,不同于分解注意力机制。
- 扩散训练目标: 在不同噪声水平下重建所有 token,与仅关注空间的 MAE 等目标相比,产生了更丰富的对应关系表示。
- 缩放法则 (Scaling Law): 在同一模型家族内,更大的模型(例如 WAN-14B vs. WAN-1.3B)在追踪性能上始终表现更好,尤其是在挑战性条件下。
2.2. DiTracker 框架
受上述分析的启发,作者提出了 DiTracker 框架,该框架通过三个核心组件将视频 DiT 特征集成到现有的追踪流水线中(具体使用 CoTracker3 头部):
- 查询-键匹配代价计算 (Query-Key Matching Cost Computation): DiTracker 不再使用隐藏状态,而是直接从视频 DiT 的全 3D 注意力层中提取查询 (Q) 和键 (K) 投影。这些投影本质上编码了帧间对应关系。匹配代价通过缩放点积注意力计算:
CDiT=Softmax(dheadqikj⊤)
- 代价级融合 (Cost-Level Fusion): 由于视频 DiT 在空间压缩的潜空间中运行(例如 H/16×W/16),它们缺乏标准追踪头所需的细粒度空间细节。DiTracker 将 DiT 匹配代价与提供更高分辨率特征的轻量级 ResNet 分支进行融合。代价被展平、拼接,并通过 MLP 投影为代价嵌入:
Ej=MLP([Flatten(CDiT),Flatten(CResNet)])
这在恢复空间细节的同时,保留了 DiT 预训练的匹配分布。
- LoRA 微调 (LoRA Adaptation): 为了高效地将生成式特征迁移到追踪任务,作者采用了低秩自适应 (LoRA)。在冻结的视频 DiT 骨干网络的注意力层中插入可训练的低秩矩阵。模型使用轨迹回归、可见性分类和置信度损失的组合目标进行训练。
3. 核心贡献
- 首次系统性分析: 本文提出了第一个关于 VFM 表示用于鲁棒点追踪的全面研究,确定了视频 DiT 是最鲁棒的骨干网络,其表现甚至超过了受监督的 ResNet 骨干网络。
- DiTracker 框架: 引入了一种通过查询-键匹配、与 ResNet 分支进行代价级融合以及 LoRA 微调来利用视频 DiT 特征进行监督追踪的方法。
- 数据效率与鲁棒性: 证明了 DiTracker 仅在合成数据 (Kubric) 上进行训练,通过显著减少迭代次数,即可在相同的追踪头下超越使用额外真实世界视频训练的 CoTracker3。它在损坏和挑战性场景中展现了最大的性能提升。
- 泛化性与可扩展性: 验证了视频 DiT 特征的优势可以推广到不同的追踪头(如 AllTracker),并随骨干网络规模的变化而扩展,证实了视频 DiT 是一个鲁棒、高效且与头部无关的骨干网络。
4. 实验结果
- 标准基准测试: 在 TAP-Vid-DAVIS 和 ITTO-MOSE 上,仅在合成数据上训练的 DiTracker 超越了使用 1.5 万个真实世界视频训练的 CoTracker3。例如,在 ITTO-MOSE 上,DiTracker 比 CoTracker3 的 δavgx 提高了 2.7%。
- 鲁棒性基准测试: 在 ImageNet-C 损坏(噪声、模糊、天气)下,尽管 CoTracker3 经过了真实世界训练,DiTracker 仍取得了最佳平均得分 (71.1%),超过了 CoTracker3 (69.2%)。
- 消融实验:
- 特征选择: 查询-键投影 (52.6% AJ) 显著优于隐藏状态 (45.7% AJ)。
- 融合策略: 拼接 DiT 和 ResNet 代价 (72.2% δavgx) 优于简单的上采样或特征拼接。
- LoRA: 自适应是必不可少的;冻结的 DiT 特征效果较差 (41.0% AJ)。使用更高秩 (128) 的全层 LoRA 提供了最佳性能。
- 缩放效应: 在所有指标上,较大的骨干网络 (WAN-14B) 始终优于较小的变体 (WAN-1.3B)。
5. 重要性与主张
本文主张,生成式视频预训练为对应关系提供了强大的真实世界先验,从而有效地降低了对大规模真实数据监督的依赖。通过利用视频 DiT,作者证明了:
- 鲁棒追踪所需的时空连贯性,天生存在于使用扩散目标和全 3D 注意力训练的生成式视频模型中。
- 使用仅合成数据和更少的训练迭代,即可实现具有竞争力的鲁棒性。
- 未来视频生成的进步可以直接造福于点追踪任务,这表明生成式与判别式视频理解之间存在趋同趋势。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。