← 最新论文
🤖 machine learning

AsymVLM: Asymmetric Token Pruning for Efficient Vision-Language Model Inference

AsymVLM 是一个高效的视觉 - 语言模型推理框架,它通过利用视觉和文本模态的固有特性,对空间冗余的视觉令牌实施激进的自适应剪枝,并对文本令牌采用基于时间阈值的淘汰机制,从而在文档和图表理解任务上实现高达 54% 的浮点运算量节省,同时超越现有最先进方法。

原作者: Yilin Feng, Ahmed Burak Gulhan, Mahmut Taylan Kandemir

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Yilin Feng, Ahmed Burak Gulhan, Mahmut Taylan Kandemir

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个视觉 - 语言模型(VLM)如同一位极其聪明但略显不堪重负的助手。你给它展示一张图片(比如一份复杂的文档或图表),并提出一个问题。为了理解图片,助手将其分解为成千上万个微小的拼图块,称为“视觉令牌”。为了理解你的问题并构思答案,它则使用数量较少的一组“文本令牌”。

问题在于,助手的“工作记忆”(即其 GPU 显存)变得拥堵。它试图保留每一个拼图块和它生成的每一个词,这使得模型运行缓慢且成本高昂。

现有方法试图通过以完全相同的方式处理图片块和文字来解决这一问题:它们只是简单地丢弃固定比例的所有内容(例如,“删除 50% 的拼图块和 50% 的文字”)。本文的作者,即 AsymVLM,认为这就像试图通过不加思考地扔掉一半书籍和一半书签来整理图书馆,而完全不顾它们实际的功能。

以下是 AsymVLM 的工作原理,使用简单的类比说明:

1. 两个不同的问题

该论文指出,图片块和文字在本质上截然不同:

  • 视觉令牌(拼图块): 它们都是独立的。如果你从照片中移除一块天空,旁边那块树木的拼图并不受影响。它们具有“空间冗余性”,意味着许多块仅仅是背景噪声。
  • 文本令牌(故事): 它们是一个连锁反应。第二个词依赖于第一个词,第三个词依赖于第二个词。如果你删除句子中间的一个词,故事的其余部分可能会变得毫无意义。

2. 解决方案:双管齐下的策略

AsymVLM 没有对所有内容使用同一条规则,而是针对每种类型的令牌采用了两种不同的策略。

策略 A:针对图片的“智能编辑”(视觉令牌剪枝)

在助手开始思考之前,AsymVLM 就像一位智能编辑在审视照片。

  • 旧方法: “随机删除 50% 的像素”或“删除那些看起来对问题最不重要的像素”。
  • AsymVLM 方法: 它使用一个学习评分器。想象一位观看了数千场比赛的教练,他确切知道哪些球员(令牌)实际上有助于赢得比赛。这个评分器不仅查看图片,还查看图片与你提出的具体问题之间的关联。
  • “自适应预算”: 这是最巧妙的部分。论文指出,有些问题需要对图像进行完整扫描(例如,“这片果园里有多少个苹果?”),而有些问题只需要关注极小的一块区域(例如,“那个红苹果的价格是多少?”)。
    • 如果问题针对的是某个小区域,“重要”与“不重要”块之间的差距就很大。系统会说:“太好了,我们可以激进一点,扔掉 75% 的图片!”
    • 如果问题需要整张图片,“差距”就很小。系统会说:“好吧,为了保险起见,保留 90% 的图片。”
    • 类比: 这就像收拾行李箱。如果你只去海滩玩一天,你会轻装上阵。如果你要旅行一个月,你会打包更多东西。AsymVLM 根据具体的行程调整“打包”方式,而不是对所有人都使用同样大小的行李箱。

策略 B:针对文本的“记忆管理员”(文本令牌驱逐)

一旦助手开始生成答案,它就会逐个写出单词。如果对话变长,内存就会填满。

  • 旧方法: 针对纯文本 AI 的标准方法(如 H2O 或 StreamingLLM)试图删除最旧或“重要性”最低的单词,以便为新单词腾出空间。
  • AsymVLM 方法: 作者意识到,在这些视觉助手中,对话通常很短,而图片才是最重要的上下文。
    • 他们设定了一个固定预算。助手持续写作,直到达到限制(例如 500 个词)。
    • 一旦达到限制,它就开始删除最早生成的单词(那些对紧接着的下一句话不再需要的词),但它绝不会删除原始图片或原始问题
    • 类比: 想象你在给朋友讲故事。为了说完当前的句子,你不需要记得 10 分钟前说的第一句话。AsymVLM 就像一位管理员,清理白板上的旧且无关的草稿,为新句子腾出空间,但它会将原始提示和图片永远钉在墙上。

3. 结果:更快更智能

该论文声称,通过区别对待这两种类型的数据,AsymVLM 实现了:

  • 巨大的速度提升: 它节省了运行模型所需的高达 54% 的计算能力(FLOPs)。这是因为它在繁重的数学运算开始之前,就物理移除了不必要的图片块,而不仅仅是在运算过程中忽略它们。
  • 更高的准确性: 在读取文档或理解图表等任务上,其表现比之前的方法高出 2–3%。这是因为它保留了能回答问题的那些特定图片块并丢弃其余部分,而其他方法可能会意外删除关键块。
  • 内存效率: 它减少了运行模型所需的内存,使其能够适配更小、更便宜的计算机芯片,而这些芯片原本无法处理完整的、未经剪枝的模型。

总结

AsymVLM 是一个认识到“一刀切”行不通的系统。它使用智能、自适应的过滤器,根据具体问题修剪图片的冗余部分,并配备一位谨慎的管理员来管理文本内存,同时不丢失原始上下文。其结果是一个视觉 - 语言模型,它运行更快、占用内存更少,并且在阅读文档和图表方面表现出惊人的更高准确性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →