← 最新论文
🤖 AI

Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin

本文提出了中间层注意力预测(Middle-layer Attention Prediction, MAP),这是一种能够动态识别样本特定最优注意力层,并将其蒸馏至轻量级预测器中的方法,旨在语言模型处理前对视觉标记进行剪枝,在保持 LLaVA-NeXT-7B 97.5% 性能的同时,实现了 3.09 倍的端到端加速。

原作者: Yuyao Sun, Tao Deng, Shuang Li, Deqing Wang, Hao Geng, Minjun Yu

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuyao Sun, Tao Deng, Shuang Li, Deqing Wang, Hao Geng, Minjun Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个超级聪明的机器人如何同时观察并谈论这个世界。这就是多模态大语言模型(Multimodal Large Language Models, MLLMs)的世界。把这些模型想象成出色的侦探,它们可以看着一张图片并回答关于它的问题,比如“那只狗的项圈是什么颜色的?”或者“为什么那个人在奔跑?”为了做到这一点,机器人不仅仅是“看”图像;它将图片分解成数千个微小的数字拼图碎片,称为视觉标记(visual tokens)。每个标记都是关于图像某一部分的小块信息。

问题在于,这些机器人非常“饥饿”。为了看清一张图片,它们可能需要处理数千个这样的标记。这就像是为了找出一顶猫帽子的答案,而去读完一整部百科全书。这既费时又耗能(计算能力),使得机器人的运行速度慢且昂贵。科学家们一直试图通过在机器人开始阅读之前就扔掉那些没用的拼图碎片来让它们变得更快。这被称为视觉标记剪枝(visual token pruning)。诀窍在于知道哪些碎片值得保留,哪些应该丢弃。如果你扔掉了错误的碎片,机器人会感到困惑;如果你保留了太多,它依然运行缓慢。大问题在于:我们如何确切知道哪些图像碎片对于正在提出的特定问题最为重要?


问题所在:并非万能之法

由 Yuyao Sun 和 Tao Deng 领导的研究团队发现,目前我们在帮助这些机器人决定保留什么方面存在一个棘手的缺陷。

以前,科学家认为如果观察机器人大脑中某个特定的、中间层的“注意力”(一种表达它正在关注什么的专业说法),我们就能找到最重要的图像碎片。这就像是在说:“嘿,机器人,只要看看你在思考过程进行到一半时在想什么,然后保留那些图像碎片。”

但作者发现,这种“一刀切”的方法是行不通的。想象一下你正在看一张海滩的照片。

  • 如果有人问:“沙子是什么颜色的?”,机器人在思考过程的中途,大脑会对沙子产生反应。
  • 如果有人问:“天空是什么颜色的?”,机器人的大脑会对天空产生反应,但可能是在一个不同的思考阶段。

研究人员表明,观察哪一层大脑是“最佳”的,完全取决于具体的提问。有时答案在第 10 层,有时在第 20 层。使用固定的层就像试图用一把钥匙打开一栋大楼里所有的门;它对某些门有效,但对另一些则会失败。

此外,还存在第二个更大的问题。为了找出哪一层是针对特定问题的“最佳”层,机器人必须先将其整个图像处理完所有这些层。这就像是通过先开车走完全程,才去寻找去学校的最佳路线。等到你搞清楚该保留哪些碎片时,你已经浪费了所有你想要节省的时间和精力!

解决方案:“问题对比”侦探

为了解决这个问题,团队提出了一个名为 MAP(中间层注意力预测,Middle-layer Attention Prediction)的新方法。他们没有让机器人在实际对话期间进行繁重的体力活,而是教了一个微小的、超快速的助手来猜测机器人原本会关注什么。

他们是如何训练这个助手的:

  1. “对比”技巧 (QCTS): 他们想出了一个巧妙的方法来为每个问题挑选合适的“老师”。他们拿一张图片并问机器人两个问题:

    • 问题 A: 真实的问题(例如,“那艘船是什么颜色的?”)。
    • 问题 B: 一个枯燥、通用的问题(例如,“这张图片里有什么?”)。

    然后,他们比较了机器人对这两个问题的注意力。机器人在这两个问题之间注意力变化最大的层,就是那些真正关心船只细节的层。这种被称为**问题对比教师选择(Question Contrastive Teacher Selection, QCTS)**的方法,就像是一个聚光灯,能瞬间识别出机器人的哪部分大脑对特定问题最感兴趣。

  2. 轻量级预测器: 一旦知道了哪一层是针对特定问题的“明星层”,他们就不会保留那个沉重的层。相反,他们教了一个微小的、轻量级的预测器来模仿那个明星层的行为。这个预测器非常小且快速,以至于它可以在大机器人开始思考之前,通过观察图像和问题,立即说:“保留这 5% 的图像碎片,扔掉剩下的。”

结果:快速、轻量且聪明

团队在几种不同的机器人大脑(MLLMs)和各种复杂的提问上测试了这个新系统。结果令人印象深刻。

  • 速度: 在其中一个测试模型(LLaVA-NeXT-7B)上,MAP 让机器人的全程运行速度提升了 3.09 倍。这就像把 10 分钟的步行变成了 3 分钟的慢跑。
  • 效率: 他们成功丢弃了 94.4% 的视觉标记(仅保留了 5.56%),而机器人的正确率仍能达到使用完整图片时的 97.5%
  • 智能选择: 与其他仅仅靠猜测或使用固定规则的方法不同,MAP 的“多样性”规则确保了即使在保留极少标记的情况下,它也不会只挑选看起来相似的碎片。它挑选的是彼此不同但仍与问题相关的碎片,从而确保机器人不会错过任何关键细节。

为什么这很重要

这篇论文不仅仅是提出了一个酷炫的想法,它还提供了一个解决实际瓶颈的工具。通过证明“最佳”层会随问题而变化,并且我们可以在不进行繁重预处理的情况下预测它,MAP 使得这些强大的 AI 模型可以在标准计算机上运行得更快。这有点像是给图书管理员一张神奇的索引卡,在他们走进图书馆之前,就能告诉他们该从书架上抽哪本书,从而避免了他们扫描墙上每一本书的过程。

作者展示了通过这种方法,我们可以鱼与熊掌兼得:我们可以在保持机器人高智能的同时,显著提高其运行速度并降低成本。这表明,AI 的未来不仅在于制造更大、更重的“大脑”,还在于教它们如何更聪明地分配注意力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →