← 最新论文
💬 NLP

Sparse-to-Dense: A Free Lunch for Lossless Acceleration of Video Understanding in LLMs

本文介绍了无需微调、即插即用的解码策略稀疏到密集(StD),该策略利用快速稀疏模型推测性解码令牌并由慢速密集模型并行验证的协同机制,在无损性能的前提下将大语言模型的视频理解速度提升高达 1.94 倍。

原作者: Xuan Zhang, Cunxiao Du, Sicheng Yu, Jiawei Wu, Fengzhuo Zhang, Wei Gao, Qian Liu

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Xuan Zhang, Cunxiao Du, Sicheng Yu, Jiawei Wu, Fengzhuo Zhang, Wei Gao, Qian Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图观看一部非常长的电影(视频),并利用一位超级智能的 AI 助手来回答关于它的问题。问题在于,这位助手虽然极其详尽,但也极其缓慢。每当它想说出一个新词时,都必须从头开始重读整部电影剧本,以确保没有遗漏任何内容。如果电影长达一小时,剧本就会非常庞大,导致助手陷入困境,让你等待许久才能得到答案。

本文介绍了一种名为**稀疏到密集(Sparse-to-Dense, STD)**的巧妙技巧,旨在让这位助手变得更快,同时不降低其智能水平。以下是其工作原理,借助几个日常类比来说明:

问题:过度准备的“学生”

将 AI 想象成一名正在参加考试的学生。目前,每写一个字,他们都会拿出整本教科书(视频数据),并阅读每一页来决定接下来写什么。这很准确,但既令人疲惫又缓慢。

洞察:“大部分书此刻并不重要”

研究人员发现了一个有趣的现象:当 AI 写作时,它实际上并不需要每次都阅读整本书。它主要关注与当前思路相关的少数特定页面或句子。这就像你在写电子邮件时,不需要重读你整个人生故事来决定接下来说什么;你只需要记住最后写的那几句话即可。

解决方案:“起草与验证”团队

作者组建了一个两人团队来加速这一过程:

  1. 快速的起草者(稀疏模型):
    想象一位敏捷、充满活力的实习生。该实习生被允许只查看教科书中最重要的页面(即“前 K 页”)。由于他们忽略了枯燥且无关的部分,因此可以非常迅速地写出一整段猜测(推测性 token)。

    • 潜在问题: 由于跳过了某些页面,他们可能会犯一些错误。
  2. 谨慎的编辑(密集模型):
    这是原本那位超级智能的 AI。它会阅读整本教科书。然而,它不再一次写一个字,而是充当事实核查员。它会一次性审视实习生写出的整段猜测。

    • 如果实习生写对了,编辑会说:“很好,保留它们!”然后继续前进。
    • 如果实习生犯了错,编辑会修正它,并在此处停止实习生的猜测。
    • 关键在于,编辑在通常只检查一个字的时间里,能够检查许多个字。

结果:“免费午餐”

论文称此为“免费午餐”,因为他们获得了巨大的速度提升(最高达1.94 倍),却未损失任何准确性。

  • 无需训练: 他们无需教 AI 任何新内容,也无需构建一个独立的、更小的 AI 模型。他们只是改变了现有 AI读取其记忆的方式
  • 即插即用: 这就像将标准发动机更换为直接适配同一辆车的涡轮增压发动机。你无需重建汽车;只需打开开关即可。

这对视频为何重要

视频体积巨大。一小时长的视频对 AI 来说可能转化为超过 140,000 个“词”(token)进行处理。

  • 旧方法: AI 每生成一个新字,都要阅读全部 140,000 个字。
  • 新方法(STD): 实习生通过仅查看最重要的 1,000 个词,一次性起草 9 个词。随后,编辑会迅速将这 9 个词与完整的 140,000 个词进行核对。

由于实习生通常是对的(对于单个词而言,准确率约为 95%),团队处理视频的速度要快得多,但最终答案与由那位缓慢而谨慎的 AI 单独完成的结果完全一致。

局限性

论文指出了一个物理限制:“教科书”(视频数据)仍必须适应计算机的高速内存(GPU)。如果视频太长,内存可能会填满,就像背包变得太重而无法携带一样。作者建议,未来他们可能需要将部分“书本”存储在速度较慢但容量更大的硬盘(CPU 内存)上,以处理更长的视频。

简而言之: 他们找到了一种方法,让 AI 能够“略读”视频以猜测接下来的内容,然后瞬间“双重检查”这些猜测。这使得视频理解的速度几乎提高了一倍,而无需改变 AI 的智能水平。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →