← 最新论文
🤖 AI

Rethinking Video Token Compression with a Global Codebook: Learning Once, Compressing Everywhere

本文提出了 ONCE,一种即插即用的视频 Token 压缩框架,它通过学习一个频率感知的全局码本将高昂的压缩过程转移至离线阶段,从而实现高效、与模型无关的在线压缩,在显著降低推理延迟的同时,在视频理解基准测试中保持了极具竞争力的性能。

原作者: Jiayang He, Tianling Xu, Diancheng Kang, Huaide Jiang, Junyan Bai, Shaoming Zheng, Xuan Song

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiayang He, Tianling Xu, Diancheng Kang, Huaide Jiang, Junyan Bai, Shaoming Zheng, Xuan Song

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图教一个超级聪明的机器人如何理解电影。为了做到这一点,你将电影的每一帧都分解成数千个微小的数字“意义”单元,称为“标记”(tokens)。机器人然后像阅读句子一样阅读这串庞大的标记列表,以弄清楚发生了什么。问题在于,电影很长,而且充满了重复。如果一个角色在房间里静止站立了十秒钟,机器人就被迫连续阅读数千次完全相同的“站在房间里”这个标记。这就像是在读一本书,仅仅为了填满空间而重复了一百万遍“的”这个词;这浪费了机器人的脑力,也让它回答问题的速度变得极其缓慢。科学家们一直试图通过教机器人学会跳过无聊的部分或合并相似部分来解决这个问题,但这种方法通常需要机器人在观看每一部电影时都要进行额外的数学计算,这仍然非常缓慢且昂贵。

这篇论文介绍了一种被称为 ONCE 的新方法来处理这个问题。ONCE 不再让机器人在看每一部新视频时都去做繁琐的分类和跳过工作,而是决定在机器人看到电影之前就完成这些重活。他们创建了一个“全局码本”(Global Codebook),这本质上是一个巨大的、预先制作好的索引,记录了数千小时视频中最常见的视觉模式。你可以把它想象成一个图书馆,其中每本书都已经按照完美的货架分类好了。当一部新电影到来时,机器人不需要从头开始组织它;它只需要在预制的索引中查找模式,抓取相关的“货架”,然后进行平均化处理。这使得机器人处理视频的速度更快,因为它只是在进行快速查找,而不是进行复杂的计算。研究人员发现,这种方法效果非常好,特别是在被迫使用极少标记量的情况下,它能让机器人保持快速运行,同时又不会让它忘记正在看的内容。

问题:被压垮了大脑的机器人

视频大语言模型(Video-LLMs)就像是超级强大的侦探,它们可以观看一段视频并针对视频回答问题。为了做到这一点,它们将视频转化为一长串数字标记。但问题在于,如果你给侦探喂一部两小时的电影,生成的标记字符串会变得非常长,从而使侦查员的记忆过载。

更糟糕的是,电影充满了冗余。如果一个场景显示一只猫在沙发上坐了五分钟,视频编码器会生成数千个都表示“猫在沙发上”的标记。侦探必须阅读每一个标记,即使它们都是一样的。现有的方法试图通过让侦探在观看视频时进行“剪枝”(切除)或“合并”(组合)这些标记来解决这个问题。但这就像是要求侦探在看每一部新电影时都要停下来重新整理笔记一样。这每次都会消耗额外的时间和精力,而且整理规则会根据你使用的侦探(模型)的不同而改变。

解决方案:ONCE 与“全局码本”

这篇论文的作者何嘉阳及其团队提出了另一种方法。他们问道:“如果我们为所有人统一进行一次组织工作,而不是要求侦探每次都去做,会怎样呢?”

他们构建了一个名为 ONCE(离线到在线视频标记压缩)的系统。以下是它的工作原理,使用一个简单的类比:

想象你是一名必须整理数百万本书籍的图书管理员。

  • 旧方法(现有方法): 每当有一批新书运达时,你都必须停下手头的工作,阅读每一本书,决定哪些书是相似的,然后在上架之前将它们物理地分组在一起。对于每一批次的货物,这都需要很长时间。
  • ONCE 方法: 在任何新书到达之前,你先花时间研究你已经拥有的海量书籍。你创建了一个“主索引”(Global Codebook),列出了你见过的每一种常见的书籍类型(例如,“动作英雄”、“烹饪节目”、“自然纪录片”)。你还制定了一条规则:“如果一本书看起来像‘自然纪录片’,就把它放入 A 箱。”

现在,当一批新书(一段新视频)到达时,你不需要仔细阅读每一本书。你只需要快速扫一眼每本书,检查你的“主索引”看它属于哪个箱子,然后把它丢进去。接着,你将 A 箱中的所有书籍总结成一条单一的笔记。这非常快,因为你不是在为每一批新货物重新发明分类规则,你只是在使用你学到的规则。

详细工作原理

  1. 离线学习(“一次”的部分): 研究人员使用了一个巨大的视频数据集(LLaVA-Video-178K)并分析了其中的视觉模式。他们不仅仅是随机挑选模式;他们确保捕捉到了视频不同时间点的模式(时间分层),并根据出现的频率进行了加权。然后,他们使用一种称为“最优传输”(optimal transport)的数学技术,拟合出了一个包含 8,192 个代表性“原型”(或码字)的全局码本。这个码本充当了视觉世界的地图。
  2. 在线压缩(“到处”的部分): 当一段新视频进入系统时,系统不会进行任何新的训练。它只是查看视频的视觉标记,并询问:“这个看起来像我的 8,192 个原型中的哪一个?”它挑选出在视频中出现最频繁的原型,将所有的视频标记重新分配给这些原型,然后对它们进行平均化处理。这把数千个标记转化为了一个更小、更易于处理的数量(例如 256 或 512),同时不会丢失核心含义。

研究发现

团队在四种不同的视频理解基准测试(MVBench, EgoSchema, Video-MME, LongVideoBench)上,使用两种不同的 AI 模型(LLaVA-OneVision-7B 和 Qwen3.5-9B)对 ONCE 进行了测试。

  • 速度: 结果令人瞩目。ONCE 将语言模型需要处理的工作量(预填充 FLOPs)减少了约 96%。在现实世界中,这意味着与不使用压缩的方法相比,该系统平均运行速度提高了 2.96 倍
  • 准确度: 通常情况下,当你通过减少数据来提高系统速度时,系统会变得更笨。但 ONCE 却出奇地聪明。当标记预算非常紧缺(仅允许 32、64 或 128 个标记)时,ONCE 的得分实际上比其他压缩方法更高。它在计数事件或识别状态变化等任务中表现尤为出色。
  • 效率: 该系统在无需重新训练主 AI 模型的情况下实现了这些加速。码本是学习一次后即可到处复用的。

被排除的可能性

论文明确反对了“压缩必须在‘在线’(即视频播放期间)针对每一段视频进行”的观点。他们证明了在推理阶段(观看时)进行繁重的计算工作是低效且冗余的。他们还证明了仅仅随机挑选标记或为每段视频使用固定的一组标记,效果并不如他们的方法——即在保持分组规则固定的同时,动态选择针对特定视频的“正确”原型。

此外,他们发现“全局码本”并不仅仅存储训练样本,它学习的是一种可复用的结构。即使在面对从未见过的视频(公开视频压力测试)时,码本的表现也优于随机分组,这表明它真正捕捉到了视觉模式的底层“语法”。

核心结论

作者认为 ONCE 为视频 AI 提供了一种全新的思考方式:我们不必为每一段新视频都让 AI 更加努力地工作,而是可以教它一种通用的视觉模式语言,然后让它在需要时能够流畅且快速地运用这种语言。虽然该方法仍需要针对不同的 AI 模型使用不同的码本(因为它们的“观察方式”不同),但结果表明,这种“学习一次,到处压缩”的方法是让视频 AI 变得更快速、更高效且不牺牲理解能力的一条强有力路径。论文总结道,这是让长视频理解走向实用化的重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →