想象一下,你正试图向一位非常聪明但极其忙碌的朋友(即人工智能)描述一部 30 分钟的电影。你的朋友需要先看完整部电影,才能回答你的问题。
问题:“缓慢的启动”
目前,当人工智能尝试理解视频时,它就像一个坚持在回答任何问题之前必须读完教科书每一页的学生。
- 旧方法: 人工智能观看视频的每一帧,将其分解成千上万个微小的片段(token),然后将这堆庞大的数据交给其“大脑”(大型语言模型)进行处理。
- 瓶颈: 该研究发现,最大的延迟并非人工智能的思考时间,而是最初观看和组织视频所花费的时间。这就像在开始玩游戏之前,先花了 40 分钟整理一副扑克牌。即使其他方法试图在后期丢弃一些牌,最初的整理过程依然缓慢。
解决方案:EarlyTom(“智能编辑”)
作者们创造了一种名为EarlyTom的新方法。将 EarlyTom 想象成一位超级高效的电影剪辑师,它在观看视频的过程中介入,而不是在之后。
EarlyTom 不是在视频完全处理完毕后才决定保留什么,而是在观看过程中直接编辑视频。它主要运用了两项技巧:
1. “合并”技巧(时间压缩)
想象一下观看一段视频,其中一个人静止不动地说了 10 秒钟的话。这段视频包含了该人物相同的 300 帧画面。
- 旧方法: 人工智能单独处理所有 300 帧。
- EarlyTom: 它注意到:“嘿,这 300 帧几乎完全相同。”于是,它不处理所有帧,而是将它们合并为一个单一的高质量摘要帧。这就像在传递之前,将一段 10 分钟的独白总结成一句话。这一过程发生在镜头内部(视觉编码器),因此繁重的处理工作完成得更快。
2. “聚光灯”技巧(空间选择)
现在想象人工智能必须观看视频中的人群。
- 陷阱: 该论文发现,人工智能有一种奇怪的习惯,称为“注意力下沉”。这就像一盏聚光灯卡在几个特定的点(比如一面空白墙或一个标志)上,并在这些点上过度明亮地照射,从而忽略了其他地方正在发生的实际动作。如果你只挑选“最亮”的点,可能会错过重要的动作。
- EarlyTom 的修复方案: 它将人群分为两组:
- “动态”组: 对于视频中发生变化的部分(动作),它从全局角度挑选最重要的细节。
- “静态”组: 对于事物静止的部分,它使用局部的“窗口”方法,确保不会被卡住的聚光灯分散注意力。它确保人工智能看到平衡的场景视图,而不会受到那些卡住点的偏见影响。
结果:速度不减,智能依旧
通过在过程的早期进行这种编辑,EarlyTom 实现了两个惊人的成就:
- 超快启动: 它将获得第一个答案所需的时间(首字生成时间)缩短了高达2.65 倍。如果旧方法需要 900 毫秒,这种方法仅需约 336 毫秒。
- 更少的工作量: 它将所需的总计算能力减少了高达61%。
核心结论
该论文声称,EarlyTom 使视频人工智能变得极其快速和高效,无需重新训练,也不会丧失其准确理解视频的能力。它证明,你不需要观看每一帧来理解故事;你只需要知道何时停止观看并开始思考。
简而言之:EarlyTom 是一种无需训练的工具,它在视频被观看的同时进行编辑,使视频人工智能运行得更快、更便宜,同时保持其回答的同等智能水平。
技术摘要:EarlyTom
问题陈述
视频大语言模型(Video-LLMs)已展现出强大的视频理解能力,但由于处理海量视觉 Token 的计算效率低下,其实际部署面临重大障碍。尽管近期的 Token 压缩方法在极低的 Token 保留率下实现了微小的精度损失,但它们主要在预填充过程的后期(视觉编码器之后)或大语言模型(LLM)内部进行操作。
延迟分析揭示了一个关键瓶颈:视觉编码阶段占据了首 Token 时间(TTFT)的相当大比例。在基线模型中,视觉编码占 TTFT 的 36.3%。在针对 LLM 预填充延迟优化的最先进方法(如 HoliTom、VisionZip)中,这一比例分别上升至 55.8% 和 68.4%,因为这些方法未对视觉编码器进行优化。此外,现有的压缩策略通常在 Token 处理过程中引入不可忽视的计算开销,进一步增加了延迟。另外,标准的 Top-K Token 选择方法容易受到“注意力汇”(attention sinks)的影响——即某些特定 Token 无论内容如何,始终吸引不成比例的高注意力分数——导致有偏的压缩,并可能在动态帧中造成语义信息的丢失。
方法论:EarlyTom
作者提出了EarlyTom,这是一个无需训练的 Token 压缩框架,旨在在视觉编码器内部早期执行压缩,并利用解耦的空间选择策略。该框架包含两个核心阶段:
1. 视觉编码器内部帧合并(时间压缩)
此阶段在编码过程中压缩冗余视觉信息,以减少 Token 在到达投影层或 LLM 之前的数量。
- 流式帧分割:基于帧相似性对输入视频进行自适应分割。计算连续帧之间的余弦相似度,并使用指数移动平均(EMA)进行平滑。当平滑后的相似度低于阈值(τseg)时,定义一个分段边界。
- 中间帧合并:在每个分段内,如果中间帧(排除首尾帧)与其邻居高度相似,且彼此之间的相似度高于与后续帧对的相似度,则将其合并。
- 加权帧合并:合并后的帧通过帧特征的加权融合生成,其中权重由相似度分数决定。这确保了合并后的表示仍集中在语义重要的内容周围,同时减少了时间冗余。
2. 解耦的空间 Token 选择
为了应对由注意力汇引入的偏差并进一步减少 Token 数量,该方法在帧合并后采用系统级协同设计的选择策略。
- 动态与静态分解:合并后的帧被划分为动态集合(分段的头和尾帧,具有高判别力)和静态集合(中间帧)。
- 全局 Top-K 选择(动态):对于动态帧,基于每个 Token 的注意力分数执行全局 Top-K 选择,以保留时间维度上对运动敏感的 Token。
- 局部窗口 Top-K 选择(静态):对于静态帧,为避免注意力汇偏差主导选择过程,将帧划分为局部窗口。在每个窗口内,选择具有最大注意力分数的 Token。这保留了原始的空间分布,并减轻了结构吸引子的负面影响。
- 系统协同设计:为了提高效率,计算量较轻的静态 Token 选择被卸载到 CPU,而 GPU 处理更密集的动态 Token 选择,从而利用异构计算资源。
主要贡献
- 视觉编码器内部帧合并:一种在编码阶段压缩冗余视觉信息的机制,有效减少了视觉 Token 数量,开销极小,并显著降低了 TTFT。
- 解耦 Token 选择:一种将帧分离为动态和静态集合的策略,应用不同的采样方案(全局 Top-K 与局部窗口 Top-K)来减少 Token,同时避免引入来自注意力汇的偏差。
- 最先进性能:在 LLaVA-OneVision-0.5B 和 7B 模型上的大量实验表明,EarlyTom 在保持与全 Token 基线相当的精度的同时,实现了卓越的加速效果。
实验结果
在单块 NVIDIA A100 GPU 上使用 LLaVA-OneVision-7B 模型和四个基准测试(MVBench、EgoSchema、LongVideoBench、VideoMME)进行评估:
- 效率:与全 Token 基线相比,EarlyTom 将 TTFT 降低了高达2.65 倍(在 10% 保留率下从 889 毫秒降至 336 毫秒),并将 FLOPs 降低了高达61%。在各种保留率(10%–25%)下,其在吞吐量和延迟方面始终优于其他无需训练的方法(如 VisionZip、HoliTom、FastVID)。
- 精度:该方法保持了具有竞争力的下游质量。在 10% 保留率下,EarlyTom 实现了 56.2 的平均基准分数(为全 Token 基线的 96.2%),优于其他在激进剪枝下遭受显著精度下降的方法。
- 泛化性:该方法在 LLaVA-Video-7B 和 Qwen2.5-VL-7B 架构上得到了验证,显示出在保持精度的同时,FLOPs 减少和 TTFT 加速方面的一致性改进。
- 消融实验:移除帧合并或解耦选择策略中的任一部分都会导致性能下降,证实了这两个组件对于平衡效率与保真度的必要性。
意义
本文声称,EarlyTom 通过将压缩范式从后期(编码器之后)转移到早期(视觉编码器内部),解决了 Video-LLM 部署中的一个根本性瓶颈。通过直接优化推理流程中最耗时的组件(视觉编码)并引入一种感知偏差的空间选择策略,EarlyTom 实现了显著更快的推理(更低的 TTFT)和更高的吞吐量,同时不牺牲模型性能。这项工作为 Video-LLM 在计算资源受限的、对延迟敏感的现实世界生产场景中的实际部署奠定了基础。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。