← 最新论文
💻 computer science

Versatile Video Representation via Feed-Forward 2D Gaussian Splatting Tokenization

该论文介绍了高斯视频 Transformer (GVT),这是一个通用的视频表示框架,它利用具有时空适应性和显式静态-动态分离功能的前馈 2D 高斯泼溅(Gaussian Splatting)标记化技术,在视频重建、压缩、动作识别和生成方面实现了最先进的性能。

原作者: Zhenghao Chen, Zicong Chen, Lei Liu, Yiming Wu, Dong Xu

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhenghao Chen, Zicong Chen, Lei Liu, Yiming Wu, Dong Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图通过一个缓慢的网络连接向朋友发送一部电影。你不能直接发送整个文件;你必须将其分解成微小的碎片,进行压缩,并将它们作为“标记”(token,即微小的数字信息包)进行发送。这就是**视频标记化(video tokenization)**的世界,它是计算机视觉中的一个关键技巧,帮助计算机理解、存储和创建视频。长期以来,这种方法的标准方式就像是拍一张照片,然后将其切割成均匀大小的正方形网格,无论网格里画的是什么。如果你有一个显示着单调白墙的正方形,而另一个显示着剧烈爆炸的正方形,计算机对它们的处理方式完全一样,给予它们相同数量的数据。这既浪费资源,又经常遗漏重要的细节。

现在,想象一下,如果不再使用僵化的网格,而是可以使用一支神奇的、可以变形的画笔,它知道在哪里该多涂一点颜料来表现爆炸,而在哪里少涂一点来表现墙壁。这就是**高斯泼溅(Gaussian Splatting)**背向后的理念。它最初用于让 3D 场景看起来更真实,它使用一些小“团块”(高斯分布)来表示,这些团块可以拉伸、收缩和旋转,以完美契合物体的形状。目前研究人员一直在问的一个大问题是:我们能否使用这种灵活的、基于“团块”的绘画风格来表示整个视频,而不只是单张图像? 如果我们能做到这一点,我们就能更高效地存储视频,并让它们看起来更清晰,同时教会计算机理解什么是运动的,什么是静止的。


新型“团块”视频生成器

在这篇论文中,作者介绍了一种名为**高斯视频 Transformer(Gaussian Video Transformer, GVT)**的新系统。把它想象成一个聪明的视频编辑器,它不仅仅是将电影切成正方形网格,而是将视频转化为一系列灵活的、二维“团块”(高斯分布),这些团块可以根据动作发生的位置进行拉伸和移动。

以下是他们实现这一目标的方法,其中包含了一些巧妙的技巧:

1. “智能团块”生成器 (STGE)
大多数旧的视频系统是僵化的。它们观察视频并说:“好吧,我需要 1,000 个标记来表示这个场景,”无论这个场景是一个安静的图书馆还是一个混乱的足球赛。作者的新系统,称为时空高斯嵌入(Spatio-Temporal Gaussian Embedding, STGE),则不同。它观察视频并说:“嘿,这部分很无聊,我们用少一点的团块。这部分很疯狂,我们多用一些!”它通过一次性的快速过程(称为“前馈”过程)生成这些团块,这意味着它不需要花费数小时去反复调整视频以使其看起来完美。它只需即时创建出一组完美的团块。

2. “静态与动态”的分离 (GSP)
这是该系统最聪明的地方。在视频中,有些东西永远不会移动(比如背景墙),而有些东西则四处穿梭(比如奔跑的狗)。旧系统会在每一帧都重新绘制那面墙,浪费了大量数据。作者引入了一种称为**高斯集合划分(Gaussian Set Partitioning, GSP)**的策略。它像一个聪明的分类器,将视频分为两堆:

  • 静态堆: 背景团块,它们保持不变。系统只需绘制一次,然后说:“在整个视频中复制这个。”
  • 动态堆: 随时间变化的移动团块。

通过只更新移动的部分并重复使用静态的部分,该系统节省了大量的空间和时间。这就像是画了一张房间的照片,然后仅仅通过动画展示走过房间的人物,而不是为每一帧都重新画一遍整个房间。

3. 结果:更好、更小、更快
团队在几个著名的视频数据集(如 UCF101 和 Kinetics)上测试了他们的 GVT 系统,并将其与当前最先进的方法进行了对比。

  • 重建: 当他们尝试从这些团块中重建视频时,GVT 的表现优于之前的冠军模型,它能以更少的误差创建出更清晰的图像。
  • 压缩: 由于该系统非常擅长识别哪些是静态的,哪些是动态的,它可以显著缩小视频文件体积。他们发现,与最新的标准视频压缩技术(H.266/VVC)相比,GVT 在保持高画质的同时,可以将文件大小减少约 54.8%
  • 理解与生成: 该系统不仅擅长存储视频,它在帮助计算机识别动作(如“弹奏大提琴”)甚至从头开始创造全新的视频方面也表现出色。

他们没做到的事情(以及为什么)
作者谨慎地指出,他们的系统目前还不能做到的事情。虽然它可以从无到有生成视频(无条件生成),但它目前还无法达到目前最顶尖的 AI 视频生成器的水平。他们解释说,这是因为他们使用的是一种新型的“团块”表示法,尚未在海量的现有数据集上进行充分训练。他们并不是声称已经解决了视频生成的难题,而是展示了这种“团块”方法是一个非常有前景且效果惊人的新方向,在存储和理解方面表现优异。

总结
这篇论文表明,通过将僵化的网格替换为灵活的、智能的“团块”(这些团块知道如何分离运动物体和静态背景),我们可以让视频表示变得更加多样化。这有点像是从像素化的、充满方块感的视频游戏切换到流畅、灵动的动画,其中屏幕的每个部分都清楚地知道自己需要多少关注。结果表明,这种方法可以带来更清晰的视频、更小的文件体积,以及一种让计算机观察世界更聪明的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →