🤖 AI
One Trajectory, One Token: Grounded Video Tokenization via Panoptic Sub-object Trajectory
本文介绍了 TrajViT,这是一种基于 grounding 的视频分词方法,它用全景子对象轨迹取代了低效的时空图块,从而在显著降低计算成本的同时,相较于传统 ViT3D 编码器,在视频检索和理解任务中实现了更优越的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图向朋友描述一部电影,但只被允许使用有限数量的词语。
旧方法:“网格” approach
目前,大多数 AI 模型观看视频的方式,就像一名保安盯着屏幕上由无数小方块(像素)组成的巨大网格。每次视频播放时,AI 都必须为每一帧中的每一个小方块写下一条笔记。
- 问题所在: 如果视频很长,或者相机只是在平移扫过一面静止的墙,AI 就会反复写下成千上万条关于空白空间或同一面墙的笔记。这就像在一分钟没有任何变化的视频里,不停地写下“墙、墙、墙、墙”。这浪费了海量的计算机内存和能源。
- 缺陷: 即使 AI 试图删除那些“无聊”的笔记,当相机移动时,它往往也会感到困惑,因为它仍然只是在观察方块,而非实际的物体。
新方法:“一条轨迹,一个标记”
这篇论文(TrajViT)背后的研究人员提出了一种更聪明的观影方式。他们不再观察由方块组成的网格,而是关注运动的轨迹。
他们将视频视为一系列在场景中移动的“角色”(物体)。
- 类比: 想象一场足球赛。
- 旧 AI: 计算每一帧中每一片草叶、每一粒尘土和每一块天空。如果相机平移,它会把草重新数一遍。
- TrajViT: 会说:“好的,我看到一个足球从左向右移动,还有一名球员在追赶它。”它为足球的整条路径生成一条笔记,也为球员的整条路径生成一条笔记。
- 结果: 对于一分钟的视频,AI 不再需要成千上万条笔记,而可能只需要几十条——每个物体的旅程对应一条。
他们是如何做到的(“侦探”流程)
为了实现这一点,他们构建了一个三步流程:
- 发现起点: 他们扫描视频,寻找新事物出现的“关键时刻”(例如球进入画面)。
- 追踪踪迹: 他们使用追踪系统跟随这些物体的移动,即使它们暂时被遮挡或相机发生抖动。
- 总结旅程: 他们将物体的整条路径(即其“轨迹”)压缩成一个单一的、智能的“标记”(digital summary),告诉 AI 该物体长什么样以及它去了哪里。
为何这很重要
该论文声称,这种新方法之所以是游戏规则的改变者,主要有两个原因:
- 更快、更轻量: 因为他们是在总结整个运动而非计算像素,所以他们使用的笔记(标记)数量比旧方法少了 10 倍。这意味着计算机消耗的能源和内存要少得多。
- 实际上更聪明: 尽管使用的笔记更少,但 AI 对视频的理解更好。在测试中,它在以下方面表现更佳:
- 根据文本描述查找视频(例如,“找到狗追球的那个视频”)。
- 回答关于视频中发生了什么的问题。
- 识别动作,即使在长视频中也是如此。
"VideoLLM"测试
研究人员还将这一新系统接入到“视频大语言模型”(一种可以就视频进行对话的 AI)中。
- 结果: 使用他们新系统的 AI,训练速度快了 4 倍,运行所需的计算能力减少了 18 倍。然而,它在回答关于视频的问题时却更加准确。
一言以蔽之
把旧方法想象成试图通过计算每一页上的每一个字母来理解一本书。而新方法(TrajViT)则是阅读句子并理解情节。它忽略空白空间,专注于角色及其旅程,使其在理解视频中实际发生的事情时,变得更快、更便宜、更准确。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。