← 最新论文
🤖 AI

OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models

本文介绍了 OTT-Vid,这是一种面向视频大语言模型的免训练时序令牌压缩框架,该框架利用具有非均匀令牌质量与局部感知代价的最优传输方法,根据帧对的可压缩性动态分配压缩预算,在仅保留 10% 视觉令牌的同时实现了最先进的性能。

原作者: Minseok Kang, Minhyeok Lee, Jungho Lee, Minjung Kim, Donghyeong Kim, Dayeon Lee, Heeseung Choi, Ig-jae Kim, Sangyoun Lee

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Minseok Kang, Minhyeok Lee, Jungho Lee, Minjung Kim, Donghyeong Kim, Dayeon Lee, Heeseung Choi, Ig-jae Kim, Sangyoun Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是OTT-Vid论文的解释,将其拆解为简单概念和日常类比。

核心难题:视频太多,算力不足

想象一下,你试图观看一部 10 分钟的电影,但你的大脑(AI 模型)一次只能容纳极少量的信息。为了理解这部电影,AI 将每一帧画面分解成成千上万个微小的拼图碎片,称为**“令牌”(tokens)**。

如果你有一段长视频,这些拼图碎片的数量就会爆炸式增长。这就像试图用独轮车搬运一座砖山;AI 会不堪重负,速度变慢,且运行成本高昂。

旧方案:“如果看起来一样,就扔掉”

为了解决这个问题,研究人员曾尝试扔掉多余的砖块。他们旧的规则很简单:“如果第 5 帧中的某块砖与第 6 帧中的某块砖看起来完全一样,就删除第 6 帧中的那块。”

缺陷: 这就像看着一个静止不动的人说:“他没动,所以我删掉他。”但那个人才是主角!如果你删掉他,AI 就会忘记他的存在。

  • 结果: AI 会丢失那些保持不变的事物(如静止的物体或等待的人),因为它认为它们是无聊的重复。它也很难回答关于某事持续了多久何时发生的问题。

新方案:OTT-Vid(聪明的图书管理员)

这篇论文的作者提出了OTT-Vid,这是一种新的视频压缩方法,它不仅仅看事物是否相似,而是问:“这个片段重要吗?”

他们使用一个名为**最优传输(Optimal Transport)**的数学概念(将其想象为一位超级聪明的物流规划师)来决定保留什么、丢弃什么。其工作原理分为三步:

1. “荧光笔”(空间剪枝)

首先,AI 查看单帧画面,并高亮显示最有趣的部分。

  • 类比: 想象一位老师在批改试卷。他们不会以同等的注意力阅读每一个字,而是高亮显示关键句子。OTT-Vid 对每一帧视频都这样做,只保留“高亮”的令牌,忽略无聊的背景噪音。

2. “重要性评分”(质量分配)

这是秘诀所在。AI 为每个剩余的令牌分配一个“质量”(权重)。

  • 转折: 在这个系统中,重要 = 轻权重不重要 = 重权重
  • 为什么? 想象一辆送货卡车。你想保护易碎、珍贵的物品(重要的令牌),不想压坏它们。因此,你给它们“轻”的状态,这样系统就知道不要扔掉它们。无聊的背景内容则获得“重”的状态,意味着它们很容易被丢弃或合并。
  • 结果: 即使一个人静止站立了 10 秒钟,AI 也知道他们很重要(轻权重),并拒绝删除他们,即使他们看起来与前一帧完全相同。

3. “物流计划”(最优传输)

现在,AI 必须决定如何压缩第 1 帧到第 2 帧、第 2 帧到第 3 帧等之间的视频。

  • 类比: 想象你在搬家。你只有有限数量的箱子(预算)。
    • 旧方法: 你只是扔掉重复品。
    • OTT-Vid 方法: AI 计算“传输难度”。
      • 如果两帧非常相似且充满无聊内容,“难度”就很低。AI 会说:“太好了,我们可以把这些装进一个箱子里,节省空间!”
      • 如果两帧包含重要变化(比如一辆车开始移动),“难度”就很高。AI 会说:“别动这个!我们需要为这些保留箱子。”
  • 动态预算: AI 不会给每一对帧分配相同数量的箱子。它给视频中精彩的部分分配更多箱子,给无聊的部分分配更少箱子。

为什么它更好(结果)

研究人员在六个不同的视频挑战中测试了该方法,包括:

  1. 视频问答: “视频中发生了什么?”
  2. 时间定位: “那个人切蛋糕的确切时间是什么时候?”

结果:

  • 他们丢弃了**90%**的视频数据(仅保留 10% 的令牌)。
  • 视频问答: 与观看完整视频相比,AI 的答案正确率仍保持在95.8%
  • 时间问题: AI 在时间任务上的准确率保持在73.9%

关键要点:
以前的方法在时间任务上失败了,因为它们删除了那些实际上证明了事件持续了多久的“无聊”静止部分。OTT-Vid 保留了这些部分,因为它理解它们的重要性,而不仅仅是相似性

总结

OTT-Vid就像一位聪明的编辑,他不仅仅因为场景看起来相同就剪掉重复的片段。相反,这位编辑会问:“这个场景对故事重要吗?”如果一个角色静止不动但对情节至关重要,编辑就会保留他们。如果背景无聊且重复,编辑就会将其剪掉。这使得 AI 能够快速观看长视频,而不会忘记重要的细节。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →