← 最新论文
🤖 machine learning

ASAP: Attention-Shift-Aware Pruning for Efficient LVLM Inference

本文提出了 ASAP,一种无需训练且兼容 KV 缓存的剪枝方法,通过动态双向软注意力掩码缓解注意力偏移问题,并结合加权软合并策略消除语义冗余,从而在大幅降低计算量的同时几乎无损地保留了大型视觉语言模型的性能。

原作者: Surendra Pathak, Bo Han

发布于 2026-03-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Surendra Pathak, Bo Han

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 ASAP 的新方法,旨在让“大型视觉 - 语言模型”(LVLM,比如能看图说话的 AI)运行得更快、更省电,同时不降低它的聪明程度。

为了让你轻松理解,我们可以把 AI 看成一个正在看画展的超级侦探,而这张画(输入的图片)被切成了成千上万个小碎片(Token)

1. 核心问题:侦探被“碎片”淹没了

现在的 AI 模型非常强大,但处理高清图片时,它会把图片切成几千个小方块(Token)。

  • 传统做法的痛点:AI 处理这些碎片时,就像侦探在几千个碎片里一个个找线索。因为碎片太多,计算量呈爆炸式增长(就像要读几千页书一样),导致 AI 反应很慢,甚至需要昂贵的显卡。
  • 现有的“偷懒”方法:以前的方法试图通过“扔掉”一些不重要的碎片来加速。但这里有两个大坑:
    1. 盲目丢弃:它们只看碎片本身,不看侦探在问什么(比如问“车在哪里”,它可能扔掉了背景里的车)。
    2. “注意力偏移”的错觉:这是论文发现的一个关键问题。由于 AI 的某种内部机制(叫 RoPE),它总是下意识地更关注图片“底部”的碎片,而忽略了“顶部”的。
    • 比喻:就像侦探因为某种奇怪的规则,总是盯着画展地板上的灰尘看,而忽略了挂在墙上的名画。结果,如果画里有一辆车在远处(画面上方),侦探就完全看不到了。

2. 解决方案:ASAP(注意力感知修剪)

ASAP 就像给侦探配了一位聪明的“策展人”助手,它不需要重新训练侦探,而是直接优化工作流程。它分三步走:

第一步:修正“视力偏差”(双向注意力)

  • 问题:以前的 AI 只能按顺序看碎片(从左到右,从上到下),导致它很难把远处的碎片和近处的联系起来,而且容易受“底部偏见”影响。
  • ASAP 的做法:它允许侦探自由地“回头看”和“向前看”
    • 比喻:以前侦探只能盯着脚下的路走;现在,ASAP 给他一副360 度全景眼镜。如果侦探在画展中间,他不仅能看前面,还能立刻“瞥一眼”后面的碎片。这样,即使车在远处(画面上方),侦探也能立刻注意到,不会因为位置靠后就被忽略。

第二步:合并“重复的废话”(加权合并)

  • 问题:图片里有很多重复的地方,比如一大片蓝天或大海。这些碎片长得几乎一样,留着全是浪费。
  • ASAP 的做法:它不是简单地把相似的碎片删掉,而是把相似且重要的碎片合并成一个“超级碎片”。
    • 比喻:如果画里有 100 块一模一样的蓝天碎片,ASAP 不会把它们全扔了,而是把它们压缩成 1 块“精华蓝天”。而且,它会保留那些最有信息量的碎片(比如蓝天里有一只鸟),把那些没用的纯蓝色块扔掉。

第三步:把“捡回来的宝贝”补位(预算重分配)

  • 问题:合并碎片后,侦探手里的“碎片名额”空出来了。
  • ASAP 的做法:它会把之前被暂时淘汰、但很有价值的碎片(比如刚才合并时没选上的关键细节)重新捡回来,填补空缺。
    • 比喻:就像侦探整理背包,把重复的干粮合并后,腾出了空间,他立刻把之前因为太重被放下的“关键地图”捡回来放进包里。

3. 效果如何?

ASAP 的效果非常惊人,可以用“四两拨千斤”来形容:

  • 速度极快:它把 AI 的计算量(FLOPs)减少了约 80%。这意味着 AI 反应快了 5 倍,手机或普通电脑也能跑得动。
  • 几乎无损:虽然扔掉了 80% 的碎片,但 AI 的聪明程度(准确率)保留了 99% 以上。
  • 甚至更强:在某些复杂的任务上(比如数清楚远处有多少辆车),ASAP 甚至比没经过优化的原版 AI 表现更好,因为它纠正了原本“只看脚下”的毛病。

总结

简单来说,ASAP 就是给 AI 装了一个智能过滤器。它不再盲目地按顺序处理所有图片碎片,而是:

  1. 纠正视力,确保不忽略图片的任何角落(解决“注意力偏移”)。
  2. 去粗取精,把重复的信息合并,把重要的信息保留。
  3. 动态调整,确保留下的每一个碎片都是最有价值的。

这让 AI 既能跑得飞快(省资源),又能看得更准(不丢细节),是未来让 AI 在普通设备上流畅运行的重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →