← 最新论文
💻 computer science

HAWK: Head Importance-Aware Visual Token Pruning in Multimodal Models

HAWK 是一种无需训练的多模态大模型视觉 Token 剪枝方法,它通过感知不同注意力头在视觉任务中的重要性差异,结合文本引导机制精准保留关键视觉信息,从而在大幅降低推理延迟和显存占用的同时,实现了在主流基准测试中保持甚至超越原模型精度的效果。

原作者: Qihui Zhu, Tao Zhang, Yuchen Wang, Zijian Wen, Mengjie Zhang, Shuangwu Chen, Xiaobin Tan, Jian Yang, Yang Liu, Zhenhua Dong, Xianzhi Yu, Yinfei Pan

发布于 2026-04-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Qihui Zhu, Tao Zhang, Yuchen Wang, Zijian Wen, Mengjie Zhang, Shuangwu Chen, Xiaobin Tan, Jian Yang, Yang Liu, Zhenhua Dong, Xianzhi Yu, Yinfei Pan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 HAWK(头重要性感知视觉 Token 剪枝)的新方法,旨在让多模态大语言模型(MLLM,即能“看”能“说”的 AI)变得更聪明、更快速、更省钱。

为了让你轻松理解,我们可以把 AI 处理图片的过程想象成一位侦探在分析案发现场

1. 背景:侦探的“信息过载”危机

现在的 AI 侦探(多模态模型)非常强大,但有一个大毛病:太贪心,记性太好,导致脑子转不动。

  • 现状:当 AI 看一张照片时,它不会像人眼那样直接“看”整体,而是把照片切成几千个小方块(称为 Visual Tokens,视觉令牌)。
  • 问题:这些方块太多了!比如一张图可能产生 1000 多个小方块,而文字指令只有几十个。AI 的大脑(注意力机制)需要同时处理所有这些方块,计算量呈爆炸式增长。
  • 后果:这就好比侦探在案发现场,不仅要看指纹、鞋印,还要把墙上的每一粒灰尘、每一根头发都拿放大镜看一遍。结果就是:反应太慢(延迟高),太费电(显存占用大),甚至根本跑不起来。

2. 旧方法的误区:平均主义

为了解决这个问题,以前的方法(Visual Token Pruning)试图扔掉一些不重要的方块,只保留关键的。

  • 旧思路:以前的方法假设 AI 大脑里的所有“分析员”(Attention Heads,注意力头)都是能力平均、分工相同的。它们认为:只要把大家觉得重要的方块加起来,取个平均值,就能知道哪些该留、哪些该扔。
  • 比喻:这就像是一个侦探团队,队长认为所有警员(分析员)看东西的角度都一样。于是,只要有一个警员觉得“这粒灰尘不重要”,大家就都把它扔了。
  • 缺陷:实际上,每个警员(注意力头)的特长是不同的!有的擅长找文字,有的擅长找颜色,有的擅长找形状。如果把它们混为一谈,可能会误删掉某个专家眼中的关键线索,导致破案失败(AI 变笨)。

3. HAWK 的突破:识人善任,精准剪枝

HAWK 的核心思想就是:承认每个“分析员”(注意力头)的特长不同,并据此决定保留哪些信息。

第一步:给每个“分析员”打分(静态权重)

HAWK 首先做了一个实验:它把 AI 大脑里的每个“分析员”轮流“关禁闭”(屏蔽掉),看看谁缺席时,AI 破案能力下降得最厉害。

  • 发现:确实,有的头一缺席,AI 就瞎了;有的头缺席,AI 几乎没感觉。
  • 结果:HAWK 给每个头打上了重要性分数。这就好比给侦探团队排了个座次:老张(头 A)是找线索的专家,必须留着;小李(头 B)是看背景的,可以少留点。

第二步:结合“侦探的指令”(动态引导)

光知道谁厉害还不够,还得看案子是什么

  • 如果用户问:“图里有猫吗?”那么“找猫”的专家(头)就特别重要。
  • 如果用户问:“图里的字是什么?”那么“找字”的专家就特别重要。
  • HAWK 会实时分析用户的文字指令,动态调整每个“分析员”的权重。

第三步:精准“断舍离”

HAWK 把**“谁厉害(静态权重)”“现在需要什么(动态指令)”结合起来,给照片里的每一个小方块算出一个综合重要性得分**。

  • 操作:得分高的方块(关键线索)坚决保留;得分低的方块(无关紧要的灰尘)果断扔掉。
  • 比喻:这就像侦探在整理证据时,不再是一刀切,而是根据老张、小李各自的特长,结合案情,只把最核心的证据(比如指纹、凶器)收进档案袋,把那些没用的废纸全扔了。

4. 效果:快、准、狠

实验结果显示,HAWK 的效果非常惊人:

  • 保留率极高:在 Qwen2.5-VL 模型上,HAWK 扔掉了 80.2% 的视觉方块(相当于把 100 个证据只留 20 个),但 AI 的准确率依然保留了 96.0%
  • 速度快了:推理速度(延迟)提升了约 26%,就像侦探从“慢慢翻遍整个房间”变成了“直奔核心证据”。
  • 省内存:显存占用也大幅降低,让 AI 能在更普通的电脑上运行。
  • 无需训练:最棒的是,HAWK 不需要重新训练 AI 模型(Training-free),就像给现有的侦探团队换了一套更聪明的“整理档案”流程,直接就能用。

总结

HAWK 就像是一位经验丰富的侦探队长。
他不再让所有警员平均用力,而是清楚知道每个警员的特长,并且根据案件需求,只保留最关键的线索,扔掉所有垃圾信息。

这样做的好处是:

  1. AI 变快了(不用处理垃圾信息)。
  2. AI 变聪明了(没误删关键线索)。
  3. AI 变便宜了(省了算力和内存)。

这项技术让多模态大模型在实时应用(如自动驾驶、实时视频分析)中变得真正可行。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →