这篇论文介绍了一种名为 SCORE 的新方法,旨在解决人工智能(AI)在“看”长视频时遇到的一个巨大难题:信息过载。
想象一下,你让一个超级聪明的 AI 助手看一部 1 小时的电影,然后问它剧情讲了什么。现在的 AI 模型(特别是多模态大语言模型)会把每一帧画面都拆解成成千上万个“视觉碎片”(Token)来理解。
这就好比让 AI 去读一本 1000 页的书,但书里 90% 的页面都是重复的空白页或者静止的风景画。AI 不得不把这些“废话”全读一遍,结果不仅读得慢(计算成本太高),而且读着读着就忘了前面说了什么(论文里叫“上下文腐烂”,Context Rot)。
为了解决这个问题,作者们发明了 SCORE,我们可以把它想象成一位**“超级精明的剪辑师”**。
1. 核心问题:AI 为什么会“晕”?
- 现状:现在的视频压缩方法太死板。有的像“复印机”,不管内容是什么,都机械地删掉一半(比如每 3 帧删 1 帧);有的像“老式筛选器”,只根据简单的规则(比如颜色相似就删)。
- 后果:这些方法要么删掉了重要的剧情(比如主角突然拔剑的瞬间),要么留下了太多没用的背景(比如静止的蓝天)。AI 被大量无用的信息淹没,导致反应变慢,甚至理解错误。
2. 解决方案:SCORE 是如何工作的?
SCORE 的核心思想是**“动态剪辑”,它不像以前那样死板,而是通过强化学习**(一种让 AI 通过试错来学习的机制)自己学会怎么剪。
关键创新点(用比喻解释):
3. 成果有多牛?
实验结果显示,SCORE 的表现令人惊叹:
- 速度快得飞起:在只保留 10% 的视觉信息(相当于把 100 页书删掉 90 页)的情况下,AI 处理视频的速度提升了 16 倍!
- 聪明反被聪明误?不,是更聪明了:在保留 25% 信息时,它的表现甚至比不删减任何信息(原版)还要好!
- 为什么? 因为原版被太多废话干扰了(上下文腐烂),而 SCORE 把垃圾信息都清理掉了,让 AI 能更专注地看重点。
- 通用性强:它不仅在一个模型上好用,换到别的模型上也能立刻上手,不需要重新设计。
总结
SCORE 就像给 AI 戴上了一副**“智能墨镜”。
以前的 AI 看视频是“全盘接收”,不管好坏都塞进脑子里,结果脑子塞爆了。
现在的 SCORE 让 AI 学会了“抓重点”:它自动过滤掉静止的蓝天、重复的动作,只把那些“有戏”**(发生突变、有动作)的片段留给大脑处理。
这不仅让 AI 看视频快得像闪电,而且因为去除了干扰,它看得更准、更懂剧情。这对于未来让 AI 实时分析监控视频、理解超长电影或进行实时视频对话,都是巨大的突破。
论文标题
Dynamic Token Compression for Efficient Video Understanding through Reinforcement Learning
(通过强化学习实现动态 Token 压缩以进行高效视频理解)
1. 研究背景与问题 (Problem)
- 多模态大模型 (MLLMs) 的视频理解瓶颈:现有的 MLLM 在处理长视频时,视觉编码器会生成数万个视觉 Token。由于自注意力机制(Self-Attention)的计算复杂度与序列长度呈二次方关系,这导致了巨大的计算开销和推理延迟。
- “上下文腐烂” (Context Rot) 现象:随着输入 Token 数量的增加,模型利用中间信息的能力下降,导致性能退化。大量的静态背景(如天空、墙壁)和重复动作产生的冗余 Token 淹没了关键信息,加剧了这一问题。
- 现有方法的局限性:
- 基于变换的方法(如卷积、池化):通常是均匀操作,缺乏内容感知能力,容易误删关键语义信息。
- 基于启发式的方法(如相似度聚类、注意力剪枝):通常与下游任务解耦,未针对特定任务目标进行端到端优化,导致次优的压缩效果。
- 核心挑战:如何在严格保留关键信息(甚至提升性能)的前提下,动态地、自适应地压缩视频 Token,以解决计算成本和上下文腐烂问题。
2. 方法论 (Methodology)
作者提出了 SCORE (Surprise-augmented token COmpression via REinforcement learning),这是一个基于强化学习 (RL) 的统一框架,旨在学习自适应的 Token 压缩策略。
2.1 核心架构
- 位置:SCORE 作为一个轻量级的 Token 级视觉压缩器,插入在冻结的视觉编码器(Vision Encoder)和冻结的大语言模型(LLM)之间。
- 输入状态 (Surprise-Augmented State):
- 为了显式捕捉时间动态和运动显著性,压缩器不仅接收当前帧的 Token 嵌入 X[t],还引入了**“惊喜”信号 (Surprise Signal)**,即帧间残差 ΔX[t]=X[t]−X[t−1]。
- 状态表示为 H[t]=[X[t];ΔX[t]]。这种设计打破了相邻帧 Token 的高度相关性,使策略网络能够识别运动和语义变化区域,抑制静态冗余。
- 策略网络 (Policy Network):
- 一个轻量级的 MLP 将每个 Token 的表示映射为保留概率 pt,i。
- 通过伯努利采样 (Bernoulli Sampling) 生成二值掩码,决定保留或丢弃每个 Token。
2.2 强化学习优化策略
- 组式 Rollout (Group Rollouts):
- 对于每个视频,从当前策略中采样 K 个不同的掩码(Mask),生成 K 个压缩后的输入序列。
- 使用冻结的 LLM 对每个序列进行推理,计算生成质量奖励。
- 奖励函数设计 (Accuracy-Sparsity Reward):
- 性能奖励:基于目标响应的交叉熵 (CE) 损失。定义 ΔCE=τ⋅CEbase−CEcompressed,衡量压缩后是否保留了足够的信息。
- 稀疏性奖励:直接衡量压缩率(保留 Token 的比例)。
- 分裂优势估计器 (Split-Advantage Estimator):
- 将 K 个采样结果分为安全区 (ΔCE>0) 和惩罚区 (ΔCE≤0)。
- 安全区:在性能达标的前提下,鼓励更高的稀疏度(保留更少的 Token),通过归一化优势值进行排序。
- 惩罚区:对性能下降的样本施加基于稀疏度的负奖励,迫使策略保留更多 Token 以恢复性能。
- 这种机制在保持性能的同时,最大化压缩率。
2.3 课程学习策略 (Curriculum Learning)
为了解决真实视频动作细微、噪声大导致的训练困难,采用两阶段训练:
- 伪视频预热 (Pseudo-Video Warm-up):
- 使用图像 - 文本数据集构建伪视频(重复图像帧)。
- 特征:帧间残差呈现明显的“二元”模式(重复帧残差为 0,切换帧残差极大)。
- 目的:让策略快速学习“残差大则保留,残差小则丢弃”的基本逻辑。
- 真实视频训练 (Real-Video Training):
- 在真实视频 - 文本对上微调。
- 目的:让策略适应真实世界中连续、细微的运动和复杂背景,泛化到实际场景。
2.4 推理策略
- 推理时采用确定性选择:根据策略网络输出的概率,对所有 Token 进行全局 Top-K 排序,保留前 ⌊ρTN⌋ 个 Token(ρ 为用户设定的保留率),并保持原有的时空位置编码。
3. 主要贡献 (Key Contributions)
- SCORE 框架:首个将 Token 级视觉压缩 formulated 为强化学习问题的框架,直接优化下游生成质量,实现了端到端的自适应压缩。
- 惊喜增强状态表示:引入帧间残差作为状态输入,显式捕捉时间动态,解决了传统方法难以区分静态冗余和动态变化的问题。
- 综合训练策略:提出了结合组式策略梯度、分裂优势估计器和“伪视频到真实视频”课程学习的训练方案,有效解决了离散动作空间大和训练不稳定的问题。
- 性能突破:实验证明,SCORE 不仅能大幅降低计算成本,甚至在某些压缩率下(如 25% 保留率)能超越未压缩的原始模型性能,证明了去除冗余 Token 可以缓解“上下文腐烂”。
4. 实验结果 (Results)
在 Video-MME, MLVU, LVBench 等多个视频理解基准测试上进行了评估(基于 Qwen2.5-VL 和 LLaVA-Video 模型):
- 性能表现:
- 25% 保留率:SCORE 平均得分为 58.9,不仅优于所有基线(如 VidCom2 的 58.5),甚至超过了未压缩的 Vanilla 模型 (57.3)。
- 10% 保留率:SCORE 保留了 99.5% 的原始性能,显著优于其他基线。
- 通用性:在 LLaVA-Video 架构上同样表现优异,证明了策略的可迁移性。
- 效率提升:
- 预填充加速:在 10% 保留率下,LLM 的预填充 (Prefill) 速度提升了 16 倍。
- Token 减少:视觉 Token 数量从 42,566 降至 4,348,计算量大幅降低。
- 额外开销:轻量级压缩器的计算开销可忽略不计(<1% 总推理时间)。
- 消融实验:
- 验证了“惊喜增强状态”的重要性(去除残差信号会导致性能显著下降)。
- 验证了课程学习的有效性(仅用伪视频训练在低保留率下表现较差,结合真实视频训练后性能提升明显)。
5. 意义与价值 (Significance)
- 解决长视频理解瓶颈:SCORE 提供了一种可扩展的解决方案,使得 MLLM 能够高效处理长视频,同时避免了因 Token 过多导致的性能下降。
- 重新定义压缩目标:研究表明,智能的 Token 压缩不仅仅是“减少计算量”,通过去除冗余信息,反而可以缓解上下文腐烂,提升模型的推理能力。
- 实际部署价值:16 倍的推理加速和极低的性能损失,使得视频 MLLM 在延迟敏感的应用场景(如实时视频分析、边缘计算设备)中的部署成为可能。
- 方法论启示:将离散决策问题(Token 选择)与强化学习结合,并利用课程学习解决训练难题,为多模态模型的动态计算优化提供了新的思路。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。