← 最新论文
🤖 machine learning

Unified Spatio-Temporal Token Scoring for Efficient Video VLMs

本文提出了一种名为时空令牌评分(STTS)的轻量级模块,通过无需文本条件且兼容端到端训练的机制,在视频视觉语言模型的全架构中统一剪枝 50% 的视觉令牌,从而在仅造成 0.7% 性能下降的情况下显著提升了 62% 的推理与训练效率。

原作者: Jianrui Zhang, Yue Yang, Rohun Tripathi, Winson Han, Ranjay Krishna, Christopher Clark, Yong Jae Lee, Sangho Lee

发布于 2026-03-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Jianrui Zhang, Yue Yang, Rohun Tripathi, Winson Han, Ranjay Krishna, Christopher Clark, Yong Jae Lee, Sangho Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 STTS(时空令牌评分)的新技术,旨在让视频理解的人工智能(VLM)变得更快、更省资源,同时还能保持聪明。

为了让你轻松理解,我们可以把视频 AI 想象成一位正在看监控录像的侦探

1. 侦探的困境:信息过载

想象一下,这位侦探(AI 模型)需要分析一段长达 1 小时的监控视频。

  • 传统做法:侦探会把每一帧画面都切成几千个小方块(就像把一张大拼图拆成无数碎片),然后一个不落地把所有碎片都拿在手里仔细研究。
  • 问题:视频里大部分时间其实什么都没发生(比如静止的墙壁、不变的背景)。侦探花大量精力去研究这些“静止的墙壁”,不仅累得满头大汗(计算成本高),而且处理速度极慢,甚至可能因为脑子(显存)不够用而崩溃。

2. 以前的解决方案:要么太笨,要么太复杂

以前的方法主要有两种,但都有缺点:

  • 方法 A(只看画面):在把画面交给侦探之前,先让一个“初级助手”删掉一些重复的碎片。但这助手只懂看图,不懂侦探要问什么(比如“谁在偷东西?”),所以可能会误删关键线索。
  • 方法 B(只删文字):让侦探看完所有画面后,自己决定哪些不重要。但这就像让侦探背着一千斤的石头跑完步,再决定扔掉哪块石头——石头已经背得太重了,根本跑不动。

3. STTS 的妙计:聪明的“智能筛选员”

STTS 就像给侦探配备了一位超级智能的筛选员,它有两个绝招:

绝招一:懂“空间”(看哪里重要)

  • 比喻:就像侦探看一张照片,他知道是重点,而天空草地通常可以忽略。
  • STTS 的做法:它不需要侦探先看完所有东西再决定。它在侦探刚开始看画面时,就根据“哪里对回答问题最有用”来打分。如果某块区域是静止的背景,它就直接划掉;如果是移动的人物,它就保留。

绝招二:懂“时间”(看哪里重复)

  • 比喻:如果监控里一个人站在门口 10 秒钟没动,这 10 秒钟的画面其实是一样的。
  • STTS 的做法:它会对比前后几帧画面。如果发现“这一秒”和“上一秒”几乎一模一样(比如背景没变),它就会果断扔掉重复的帧,只保留变化的部分。

4. 核心创新:打包与瘦身

最厉害的是,STTS 不仅仅是“扔掉”不重要的碎片,它还做了一件很聪明的事情——打包(Packing)

  • 比喻:想象侦探手里拿着 100 个碎片,其中 50 个是垃圾。
    • 普通做法:扔掉 50 个垃圾,剩下 50 个碎片,但侦探还得拿着原本装 100 个碎片的空盒子,空间没省下来。
    • STTS 的做法:扔掉垃圾后,它把剩下的 50 个重要碎片紧紧压缩,塞进一个更小的盒子里。这样,侦探不仅处理的数据变少了,连“搬运”这些数据的力气都省了一半。

5. 结果如何?

  • 效率大爆发:通过这种方法,STTS 可以安全地扔掉 50% 的视觉信息(那些没用的背景、重复的帧)。
  • 速度提升:因为数据量减半,AI 训练和推理的速度提升了 62%(相当于从走路变成了开车)。
  • 智商不掉线:虽然扔掉了一半数据,但因为扔掉的都是“废话”,侦探的解题能力(在 13 个视频问答测试中)几乎没受影响,只下降了 0.7%(可以忽略不计)。
  • 长视频更厉害:视频越长,重复内容越多,STTS 省下的资源就越多,效果越明显。

总结

这就好比给一位正在读厚书的侦探,配了一个智能书签
这个书签能自动把书里重复的段落无关紧要的描写折叠起来,只让侦探阅读核心剧情
结果就是:侦探读得更快了(省时间),脑子更清爽了(省内存),而且对剧情的理解依然非常深刻(准确率没降)。

这篇论文提出的 STTS,就是这样一个让视频 AI 从“笨重”变得“轻盈且聪明”的关键技术。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →