这篇论文介绍了一种名为 STTS(时空令牌评分)的新技术,旨在让视频理解的人工智能(VLM)变得更快、更省资源,同时还能保持聪明。
为了让你轻松理解,我们可以把视频 AI 想象成一位正在看监控录像的侦探。
1. 侦探的困境:信息过载
想象一下,这位侦探(AI 模型)需要分析一段长达 1 小时的监控视频。
- 传统做法:侦探会把每一帧画面都切成几千个小方块(就像把一张大拼图拆成无数碎片),然后一个不落地把所有碎片都拿在手里仔细研究。
- 问题:视频里大部分时间其实什么都没发生(比如静止的墙壁、不变的背景)。侦探花大量精力去研究这些“静止的墙壁”,不仅累得满头大汗(计算成本高),而且处理速度极慢,甚至可能因为脑子(显存)不够用而崩溃。
2. 以前的解决方案:要么太笨,要么太复杂
以前的方法主要有两种,但都有缺点:
- 方法 A(只看画面):在把画面交给侦探之前,先让一个“初级助手”删掉一些重复的碎片。但这助手只懂看图,不懂侦探要问什么(比如“谁在偷东西?”),所以可能会误删关键线索。
- 方法 B(只删文字):让侦探看完所有画面后,自己决定哪些不重要。但这就像让侦探背着一千斤的石头跑完步,再决定扔掉哪块石头——石头已经背得太重了,根本跑不动。
3. STTS 的妙计:聪明的“智能筛选员”
STTS 就像给侦探配备了一位超级智能的筛选员,它有两个绝招:
绝招一:懂“空间”(看哪里重要)
- 比喻:就像侦探看一张照片,他知道人和车是重点,而天空和草地通常可以忽略。
- STTS 的做法:它不需要侦探先看完所有东西再决定。它在侦探刚开始看画面时,就根据“哪里对回答问题最有用”来打分。如果某块区域是静止的背景,它就直接划掉;如果是移动的人物,它就保留。
绝招二:懂“时间”(看哪里重复)
- 比喻:如果监控里一个人站在门口 10 秒钟没动,这 10 秒钟的画面其实是一样的。
- STTS 的做法:它会对比前后几帧画面。如果发现“这一秒”和“上一秒”几乎一模一样(比如背景没变),它就会果断扔掉重复的帧,只保留变化的部分。
4. 核心创新:打包与瘦身
最厉害的是,STTS 不仅仅是“扔掉”不重要的碎片,它还做了一件很聪明的事情——打包(Packing)。
- 比喻:想象侦探手里拿着 100 个碎片,其中 50 个是垃圾。
- 普通做法:扔掉 50 个垃圾,剩下 50 个碎片,但侦探还得拿着原本装 100 个碎片的空盒子,空间没省下来。
- STTS 的做法:扔掉垃圾后,它把剩下的 50 个重要碎片紧紧压缩,塞进一个更小的盒子里。这样,侦探不仅处理的数据变少了,连“搬运”这些数据的力气都省了一半。
5. 结果如何?
- 效率大爆发:通过这种方法,STTS 可以安全地扔掉 50% 的视觉信息(那些没用的背景、重复的帧)。
- 速度提升:因为数据量减半,AI 训练和推理的速度提升了 62%(相当于从走路变成了开车)。
- 智商不掉线:虽然扔掉了一半数据,但因为扔掉的都是“废话”,侦探的解题能力(在 13 个视频问答测试中)几乎没受影响,只下降了 0.7%(可以忽略不计)。
- 长视频更厉害:视频越长,重复内容越多,STTS 省下的资源就越多,效果越明显。
总结
这就好比给一位正在读厚书的侦探,配了一个智能书签。
这个书签能自动把书里重复的段落和无关紧要的描写折叠起来,只让侦探阅读核心剧情。
结果就是:侦探读得更快了(省时间),脑子更清爽了(省内存),而且对剧情的理解依然非常深刻(准确率没降)。
这篇论文提出的 STTS,就是这样一个让视频 AI 从“笨重”变得“轻盈且聪明”的关键技术。
1. 研究背景与问题 (Problem)
随着视觉语言模型(VLM)在视频理解任务中的快速发展,其计算成本急剧上升。主要挑战在于:
- 计算冗余高:视频包含大量帧,每帧通过视觉 Transformer (ViT) 被分解为数百个 Patch Token。随着帧数增加,Token 序列长度呈二次方增长(O(N2)),导致显存占用巨大、训练吞吐量低且推理延迟高。
- 现有方法的局限性:
- ViT 内部剪枝 (Pre-/In-ViT):主要针对单模态感知任务(如动作识别),利用空间冗余进行剪枝,但通常未针对多模态 VLM 目标优化,且忽略了视频帧间的时间冗余。
- ViT 外部剪枝 (Post-ViT):仅在 ViT 输出后、LLM 输入前进行剪枝(如通过文本条件选择或合并)。这种方法无法减少 ViT 本身的计算负担,而 ViT 往往是长视频输入的主要计算瓶颈。此外,许多方法依赖复杂的文本条件机制或合并算法。
核心问题:如何设计一种简单、轻量且端到端可训练的机制,在不牺牲性能的前提下,同时消除 ViT 和 LLM 中的空间和时间冗余,从而显著提升视频 VLM 的训练和推理效率?
2. 方法论:STTS (Spatio-Temporal Token Scoring)
作者提出了 STTS,一个轻量级的插件模块,旨在统一剪枝 ViT 和 LLM 中的视觉 Token。其核心流程包含三个步骤:
2.1 架构设计
STTS 插入在 ViT 的特定层 l 之后(实验中选择第 3 层)。
- 特征池化与拼接:
- 对 ViT 输出的特征进行 w×w 的空间池化(默认 w=3),降低空间维度。
- 为了引入时间上下文,将当前帧 t 的池化特征与前一帧 t−1 的池化特征拼接。
- 评分网络 (Scorer):
- 使用一个 Token Pooler(自注意力层)和一个 3 层 MLP 来预测每个 Token 的重要性分数。
- 分数越低表示越不重要。
2.2 双轴评分机制 (Dual-Axis Scoring)
STTS 通过两个维度对 Token 进行评分和剪枝:
- 空间显著性 (Spatial Saliency):
- 利用下游任务梯度(LLM 的 Loss)进行隐式学习。
- 将预测分数的对数作为 Attention Bias 注入到 ViT 的下一层 (l+1) 的注意力矩阵中。这使得模型能够根据多模态任务目标自动学习保留哪些空间区域(如前景物体),而无需文本条件。
- 时间冗余性 (Temporal Redundancy):
- 利用辅助损失函数 (Auxiliary Loss) 进行显式约束。
- 计算相邻帧对应 Patch 的 余弦相似度 (Cosine Similarity)。
- 设计 MSE Loss,强制模型预测的分数与“时间相似度”负相关(即:相似度越高 → 冗余度越高 → 重要性分数越低)。
- 公式:Lsim=(St−(1−CosSim))2。
2.3 Token 剪枝与打包 (Pruning & Packing)
- 硬剪枝:根据评分移除底部 k% 的 Token。
- 打包算法 (Packing Algorithm):
- 由于不同帧的剪枝比例不同(静态帧剪得多,动态帧剪得少),直接掩码会导致稀疏张量,无法利用 GPU 的密集矩阵计算优势。
- STTS 采用 First-Fit Descending 算法,将不同帧剩余的 Token 重新打包成紧凑的密集张量(Dense Tensor),并生成对应的 Attention Mask 确保 Token 仅关注同帧内的其他 Token。
- 这实现了真正的硬件加速,减少了 ViT 和 LLM 的总计算量。
3. 主要贡献 (Key Contributions)
- 统一的剪枝模块:首个在 ViT 和 LLM 全架构范围内进行端到端训练的统一 Token 剪枝方案,无需复杂的文本条件选择或 Token 合并算法。
- 双轴评分机制:结合了通过下游梯度学习的空间显著性和通过辅助损失正则化的时间冗余性,能够智能区分前景语义和背景噪声。
- 显著的效率提升:在剪枝 50% 视觉 Token 的情况下,训练和推理效率提升高达 62%,而平均性能仅下降 0.7%。
- 可扩展性与测试时缩放 (TTS):证明了随着采样帧数的增加,效率增益进一步扩大。结合测试时缩放(在推理时增加帧数以补偿剪枝带来的 Token 减少),在长视频 QA 任务上还能获得额外的性能提升。
4. 实验结果 (Results)
实验基于 Molmo2 架构(SigLIP ViT + Qwen3-4B LLM),在 13 个长短视频 QA 基准测试(如 VideoMME, MLVU, LongVideo 等)上进行了验证。
- 性能表现:
- 30% 剪枝:模型性能甚至超过基线(如在 NextQA 和 VideoMME 上),因为去除了干扰注意力的噪声。
- 50% 剪枝:平均性能仅下降 0.7%。在 VideoMME 等综合基准上,性能下降仅为 0.4 分。
- 鲁棒性:相比随机剪枝(Random)和启发式剪枝(Heuristic,仅基于余弦相似度),STTS 在长视频任务上表现更优,证明了学习到的评分机制能有效处理复杂的时间上下文。
- 效率提升:
- 128 帧设置:50% 剪枝带来 1.62x 的训练加速和 1.61x 的推理加速。
- 256 帧设置(长视频):由于 Transformer 的二次方复杂度,剪枝带来的收益更大,达到 2.25x 训练加速和 2.22x 推理加速。
- 测试时缩放 (TTS):
- 在 50% 剪枝的基础上,将推理帧数从 64 增加到 128(保持总 Token 预算不变),长视频 QA 平均性能提升了 0.5% - 1%。这表明 STTS 允许模型在相同计算预算下处理更长的时间上下文。
5. 意义与总结 (Significance)
- 解决瓶颈:STTS 直接解决了视频 VLM 中 ViT 编码器的计算瓶颈,这是以往仅关注 LLM 端剪枝的方法所忽视的。
- 简单有效:该方法不需要复杂的架构修改或昂贵的推理时搜索,是一个即插即用(Plug-and-play)的轻量级模块。
- 智能过滤:通过可视化分析发现,STTS 能够像人类一样理解语义,保留前景物体(如人物、移动物体)并剪除静态背景,而传统的启发式方法往往会误删重要信息(如人脸)。
- 未来方向:为构建可扩展、低延迟且适用于长视频理解的下一代 VLM 提供了新的范式,特别是在显存受限或延迟敏感的应用场景中具有极高的实用价值。
总结:STTS 通过统一的空间 - 时间评分机制,成功地在大幅降低计算成本(剪枝 50% Token,提速 60%+)的同时,保持了甚至提升了视频理解模型的性能,是视频 VLM 效率优化领域的一项重要突破。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。