观看一段长视频并与人工智能进行交互,就像要求一个人在回答关于电影的具体问题的同时,还要记住两小时电影中的每一秒钟。目前的视频理解AI系统是建立在一种基础之上的:一个类似摄像机的组件扫描每一帧,并将描述传递给语言大脑。问题在于,随着视频变长,信息量会变得如此巨大,以至于语言大脑无法将其全部存入其短期记忆中。为了应对这一问题,工程师们尝试通过挑选少量具有代表性的帧或合并相似时刻来对视频进行总结,但这些方法往往会剥离掉理解场景随时间变化所需的关键细节。核心挑战仍然存在:如何让AI在处理数百帧视频时既不丢失故事脉络,又能将信息压缩进有限的记忆空间内?
一个研究小组开发了一种名为 LongVU-TTT 的新方法来解决这一瓶颈。他们并没有强迫语言大脑承担追踪时间的全部重任,而是在摄像机和大脑之间插入了一个专门的处理层。这个层级充当了一个动态过滤器,在视频播放时不断更新其对正在发生之事的内部理解。该系统并非将每一帧视为静态图像,而是学会了识别视觉内容何时发生变化。它通过在处理流的过程中实时调整自身的内部连接来实现这一点,从而有效地创建了一个视频历史的运行摘要。当发生重大变化时,例如角色进入房间或汽车转弯,系统会将该时刻标记为重要时刻。
研究人员发现,这种持续、即时的调整方法比以往依赖固定模式或简单平均值的技术效果更好。通过使用一种尊重图像二维布局的结构——就像我们的眼睛感知形状和边缘而非仅仅是平面的像素列表一样——该系统捕捉到了其他方法会遗漏的局部细节。至关重要的是,团队发现这种内部运行摘要并不是一个完美的档案库。它的功能更像是一个熟练的观察者,能记住事件的大致流程和近期的变化,但无法回忆起漫长视频开头的每一个具体细节。因此,该系统将这种动态理解与一种智能选择过程相结合:它保留那些发生最重要变化的帧,并用均匀间隔的样本填充剩余的记忆,以确保时间线得到覆盖。
在测试中,研究人员处理了包含多达 512 帧的视频,并将其压缩至仅 128 帧供语言大脑阅读。尽管进行了如此大幅度的缩减,该系统的表现仍优于现有的五项旨在测试视频理解能力的基准测试模型。它在需要 AI 追踪随时间变化的任务中表现出特别的优势,以可衡量的优势超越了其他先进方法。该研究还阐明了一个重要的局限性:虽然系统的内部状态非常擅长对相关时刻进行分组并突出变化,但它无法取代保留远处事件实际视觉证据的需求。当系统利用其内部知识来引导帧的选择,从而确保最关键的视觉证据被保留下来用于最终回答时,效果最为出色。
为了使这在标准计算机硬件上成为可能,团队还设计了一种处理长视频训练时巨大内存需求的方法。他们开发了一种将处理过程分解为更小、更易管理的块,并在计算机主内存与处理器之间移动数据的方法,从而使系统能够平稳运行而不减速。这使得他们能够使用广泛可用的标准显卡,而不是需要专门且昂贵的超级计算集群,来对长序列进行模型训练。结果表明,一个能够更准确、更高效地理解长视频的系统,其关键不仅在于拥有更多内存,还在于知道究竟哪些时刻值得被记住。
技术摘要:LongVU-TTT
问题陈述
长视频多模态大语言模型(MLLMs)面临一个根本性的瓶颈:随着视频长度的增加,视觉 Token 的数量呈线性增长,而 LLM 中自注意力机制的二次方复杂度使得处理长序列在计算上变得极其昂贵。现有的压缩策略(如空间池化、Token 合并或差异化丢弃)通常在显式建模时间变化之前对帧级特征进行压缩。因此,这些模型往往在缺乏对“哪些信息发生了变化”这一原则性理解的情况下进行信息压缩。此外,虽然像状态空间模型(SSMs)这样的循环架构提供了时间传播能力,但其扁平化的序列算子无法显式编码与视觉 Transformer(ViT)编码器的全局表示相辅相成的 2D 局部邻域交互。
方法论:LongVU-TTT
作者引入了 LongVU-TTT,这是一种在 ViT 编码器和 LLM 之间插入了专用卷积测试时训练(TTT)重采样器的视频 MLLM。该架构通过循环处理帧来在压缩前利用时间上下文丰富表示。
核心组件
卷积 TTT 重采样器(TTT-Conv):
- 不同于以往使用基于 MLP 的快权重或扁平化序列的 TTT 工作,LongVU-TTT 将快权重参数化为分组 2D 卷积。这在时间传播过程中保留了帧特征的空间结构(H×W)。
- 该层采用因果快权重更新:对于每一帧,隐藏状态(快权重)仅基于先前的帧进行更新。
- 更新规则最小化了当前帧的值投影与由当前快权重生成的映射之间的自监督对齐损失(L)。
- 并行因果物化(Parallel Causal Materialization): 为了平衡因果顺序与 GPU 效率,作者使用了一种策略,即在每个块(chunk)内独立计算原始梯度,然后通过前缀和进行聚合,从而同时物化权重状态。这通过异步激活检查点管理,以牺牲激活内存为代价换取了并行计算能力。
显著性驱动的混合帧选择:
- 内层循环优化产生的梯度信号可以作为衡量帧重要性的自然度量,从而消除了对辅助学习评分器的需求。
- 提取了两种信号:
- 梯度方向偏移(Gt): 测量连续帧之间快权重梯度的余弦距离,以检测场景级的变化。
- 对齐损失增量(Rt): 测量对齐损失的正向增加,以检测场景内的事件级变化。
- 混合选择器将这些信号(权重为 α=0.4)与均匀采样相结合。它保留了最显著的前 k 帧(“高光集”),并用均匀采样的帧(“均匀集”)填补剩余预算,以确保时间覆盖率。
系统优化:
- 为了在 40GB GPU 上实现 512 帧的训练而不使用序列并行,作者实现了:
- 分批瓦片式 ViT 处理(Batch-Tiled ViT Processing): 将 ViT 帧批次划分为独立的瓦片,延迟 ZeRO-3 梯度 reduce-scatter 直至最后一个瓦片。
- 异步 CPU 激活卸载: 在前向传播期间将激活传输到 CPU 内存,并在反向传播期间异步预取,从而实现通信与计算的重叠。
核心贡献
- 架构创新: 一种具有因果快权重更新的卷积 TTT 重采样器,它通过适配分组 2D 权重来为视频特征提供上下文,从而解决 LLM 的视觉 Token 瓶颈。
- 选择机制: 一种显著性驱动的混合帧选择器,利用梯度方向偏移和对齐损失增量来保留场景转换和视觉变化,而无需辅助模型。
- 受控研究: 对投影阶段的各种时间算子(Transformer、Gated DeltaNet、Mamba2、TTT-MLP)进行了系统性的比较,证明了因果更新顺序和显式 2D 局部处理是关键的设计选择。
- 诊断性洞察: 证据表明,投影层的快权重起到了时间聚合器的作用,而非可靠的片段记忆存储;随着证据变得更加遥远,其收益会逐渐减弱,这说明了保留显式帧进行长程推理的必要性。
实验结果
模型在五个基准测试上进行了评估:MLVU、LongVideoBench、Video-MME、NExT-QA 和 LVBench。
- 性能: LongVU-TTT 处理高达 512 帧并将它们减少为 128 个 LLM 帧。它在所有五个基准测试中均取得了具有竞争力的表现,在所有测试中都优于其最接近的训练基线(LLaVA-Video)。
- 在 MLVU 上,在受控条件下,TTT-Conv 比 TTT-MLP 提升了 +2.12,比双向 Mamba2 提升了 +3.04。
- 它在三个基准测试中表现优于基于注意力和固定状态的循环重采样器。
- 消融研究发现:
- 因果 vs. 非因果: 因果更新优于非因作为更新。
- 2D vs. 1D: 2D 分组卷积(TTT-Conv)优于 1D MLP 形式(TTT-MLP)。
- 状态保留: 跨块携带快权重状态可以提高性能,但每帧重置或使用打乱的网格会降低其优势。
- 选择: 结合了梯度信号和均匀采样的混合选择策略优于随机、均匀或单一信号的选择方法。
- 效率: 系统优化使在 40GB 硬件上的最大可训练帧数提升了 4 倍,并在 64 个 GPU 上将训练步长延迟降低了高达 2.23 倍(相比标准基线)。
意义与主张
论文谦虚地将其贡献定位为对视频 MLLM 投影阶段 TTT 的一次受控研究,而非在所有异构模型中创造新的 SOTA。
- 时间聚合 vs. 片段记忆: 一个核心发现是,快权重状态充当的是时间聚合器,而非可靠的长程片段存储。随着证据与查询之间的时间间隔增加,快状态的收益会递减。因此,模型依赖于显式帧保留(通过混合选择器)来进行长程推理,而主要利用 TTT 层在选择前对特征进行上下文化处理。
- 设计原则: 该工作强调,保持 2D 空间结构并强制执行因果更新顺序对于有效的投影阶段时间建模至关重要。
- 可扩展性: 所提出的系统优化表明,在无需专门的分布式注意力基础设施或序列并行的情况下,在商用 40GB 硬件上进行长视频训练(高达 512 帧)是可行的。
作者总结道,LongVU-TTT 有效地解决了时空冗余问题,它直接从 TTT 内层循环的更新中推导出压缩信号,将视觉变化捕捉为时间传播的副产品,而不是依赖外部相似性度量。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。