← 最新论文
💻 computer science

EarlyTom: Early Token Compression Completes Fast Video Understanding

本文提出了 EarlyTom,这是一种无需训练的框架,它在视觉编码器内部执行早期视觉令牌压缩,从而显著降低首令牌延迟和计算成本,同时保持与全令牌基线相当的准确性。

原作者: Hesong Wang, Xin Jin, Lu Lu, Chenhaowen Li, Jian Chen, Qiang Liu, Huan Wang

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Hesong Wang, Xin Jin, Lu Lu, Chenhaowen Li, Jian Chen, Qiang Liu, Huan Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图向一位非常聪明但极其忙碌的朋友(即人工智能)描述一部 30 分钟的电影。你的朋友需要先看完整部电影,才能回答你的问题。

问题:“缓慢的启动”
目前,当人工智能尝试理解视频时,它就像一个坚持在回答任何问题之前必须读完教科书每一页的学生。

  • 旧方法: 人工智能观看视频的每一帧,将其分解成千上万个微小的片段(token),然后将这堆庞大的数据交给其“大脑”(大型语言模型)进行处理。
  • 瓶颈: 该研究发现,最大的延迟并非人工智能的思考时间,而是最初观看组织视频所花费的时间。这就像在开始玩游戏之前,先花了 40 分钟整理一副扑克牌。即使其他方法试图在后期丢弃一些牌,最初的整理过程依然缓慢。

解决方案:EarlyTom(“智能编辑”)
作者们创造了一种名为EarlyTom的新方法。将 EarlyTom 想象成一位超级高效的电影剪辑师,它在观看视频的过程中介入,而不是在之后。

EarlyTom 不是在视频完全处理完毕后才决定保留什么,而是在观看过程中直接编辑视频。它主要运用了两项技巧:

1. “合并”技巧(时间压缩)
想象一下观看一段视频,其中一个人静止不动地说了 10 秒钟的话。这段视频包含了该人物相同的 300 帧画面。

  • 旧方法: 人工智能单独处理所有 300 帧。
  • EarlyTom: 它注意到:“嘿,这 300 帧几乎完全相同。”于是,它不处理所有帧,而是将它们合并为一个单一的高质量摘要帧。这就像在传递之前,将一段 10 分钟的独白总结成一句话。这一过程发生在镜头内部(视觉编码器),因此繁重的处理工作完成得更快。

2. “聚光灯”技巧(空间选择)
现在想象人工智能必须观看视频中的人群。

  • 陷阱: 该论文发现,人工智能有一种奇怪的习惯,称为“注意力下沉”。这就像一盏聚光灯卡在几个特定的点(比如一面空白墙或一个标志)上,并在这些点上过度明亮地照射,从而忽略了其他地方正在发生的实际动作。如果你只挑选“最亮”的点,可能会错过重要的动作。
  • EarlyTom 的修复方案: 它将人群分为两组:
    • “动态”组: 对于视频中发生变化的部分(动作),它从全局角度挑选最重要的细节。
    • “静态”组: 对于事物静止的部分,它使用局部的“窗口”方法,确保不会被卡住的聚光灯分散注意力。它确保人工智能看到平衡的场景视图,而不会受到那些卡住点的偏见影响。

结果:速度不减,智能依旧
通过在过程的早期进行这种编辑,EarlyTom 实现了两个惊人的成就:

  1. 超快启动: 它将获得第一个答案所需的时间(首字生成时间)缩短了高达2.65 倍。如果旧方法需要 900 毫秒,这种方法仅需约 336 毫秒。
  2. 更少的工作量: 它将所需的总计算能力减少了高达61%

核心结论
该论文声称,EarlyTom 使视频人工智能变得极其快速和高效,无需重新训练,也不会丧失其准确理解视频的能力。它证明,你不需要观看每一帧来理解故事;你只需要知道何时停止观看并开始思考。

简而言之:EarlyTom 是一种无需训练的工具,它在视频被观看的同时进行编辑,使视频人工智能运行得更快、更便宜,同时保持其回答的同等智能水平。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →