← 最新论文
🤖 AI

CATP: Cross-Attention Token Pruning for Accuracy Preserved Multimodal Model Inference

本文提出了跨注意力令牌剪枝(CATP)方法,通过利用多模态模型中的跨注意力层及改进的投票策略来精准筛选重要令牌,从而在显著提升推理效率的同时,实现了远超现有方法的精度保持。

原作者: Ruqi Liao, Chuqing Zhao, Jin Li, Weiqi Feng, Yi Lyu, Bingxian Chen, Haochen Yang

发布于 2026-02-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruqi Liao, Chuqing Zhao, Jin Li, Weiqi Feng, Yi Lyu, Bingxian Chen, Haochen Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 CATP(交叉注意力令牌剪枝)的新技术,它的核心目标是:让大型多模态模型(既能看图又能聊天的 AI)跑得更快,同时还能保持“聪明”不“变傻”

为了让你更容易理解,我们可以把整个 AI 模型想象成一家繁忙的“图文翻译事务所”

1. 背景:事务所的困境

想象一下,这家事务所(BLIP-2 模型)由三部分组成:

  • 摄影师(图像编码器):负责拍照,把图片变成数据。
  • 翻译官(Q-Former):负责把图片里的信息“翻译”成文字能懂的语言。
  • 大作家(LLM 大语言模型):负责根据翻译好的内容,写出最终的回答。

问题出在哪里?
这家事务所里,大作家(LLM)占据了 87% 的精力和成本。他非常忙,每次处理任务时,都要阅读一大堆“便签条”(Token,即输入的信息片段)。

  • 以前的做法是:为了让他快一点,直接随机扔掉一半的便签条
  • 后果:大作家因为少看了关键信息,写出来的回答经常驴唇不对马嘴,准确率暴跌。这就好比为了赶时间,把客户最重要的需求描述给撕了,只留了个“你好”,作家当然不知道写什么。

2. 核心方案:CATP(聪明的“便签筛选员”)

这篇论文提出了一种新的筛选方法,叫 CATP。它不再随机扔便签,而是派了一位**超级聪明的“筛选员”**来工作。

这位筛选员是怎么工作的?

他手里有两份资料:

  1. 图片便签(来自摄影师的原始图片信息)。
  2. 问题便签(来自用户的具体问题,比如“图里那只猫在干什么?”)。

以前的筛选员(旧方法):
只看“问题便签”自己长得漂不漂亮(比如看字的大小、或者它自己盯着谁看),觉得重要的就留着。这往往抓不住重点。

CATP 筛选员(新方法):
他会把“问题便签”和所有的“图片便签”放在一起,进行**“交叉对质”**(Cross-Attention)。

  • 他会问:“这张图片里的‘猫’,和这个问题里的‘干什么’,关系有多紧密?”
  • 如果关系紧密,这张便签就非常重要,必须保留。
  • 如果关系疏远(比如图片里有个无关的杯子,但问题问的是猫),这张便签就可以扔掉

投票机制(Voting Strategy)

为了更精准,CATP 还搞了一个**“全员投票”**:

  • 事务所里有好多层“审核小组”(模型的不同层)和好多位“审核员”(不同的注意力头)。
  • 每一张“图片便签”都会给“问题便签”投票。
  • 投票规则:如果某张“问题便签”被很多“图片便签”强烈关注,它的得分就高;如果没人理它,得分就低。
  • 最终决定:得分最低的便签被直接“剪掉”(Pruning),得分高的留下来。

比喻:就像在选代表去开会。以前的方法是随机抓人;CATP 的方法是,让所有参会者(图片信息)给候选人(问题信息)投票,谁被大家关注得最多,谁就留下来,确保留下的都是最能代表大家意见的“关键人物”。

3. 实验结果:快且准

研究人员在“看图说话”(VQA)的任务上测试了这种方法:

  • 旧方法:如果只保留一半的信息,准确率可能从 50% 跌到 10% 以下(大作家彻底懵了)。
  • CATP 方法:即使只保留一半的信息,准确率依然能保持在 40% 以上,甚至接近不剪枝的水平。
  • 提升幅度:相比旧方法,CATP 的准确率提升了 6.6 倍到 12.1 倍

这意味着,我们可以让 AI 处理速度变快(因为要读的信息少了),但它依然能像以前一样聪明地回答问题。

4. 进一步的优化:给投票加“权重”

论文还发现,并不是所有的“图片便签”都一样重要。

  • 有些图片区域(比如猫的眼睛)本身就很重要。
  • CATP 后来升级了:在投票时,重要的图片便签拥有更大的投票权
  • 这就像在选举中,资深专家的一票比普通路人的一票更重。这样筛选出来的结果更精准,准确率又提升了一截。

总结

CATP 就像是一个精明的“信息过滤器”
它不再盲目地为了速度而牺牲质量,而是利用**“图片”和“文字”之间的深层联系**,精准地识别出哪些信息是核心,哪些是废话。

  • 对普通用户的好处:未来的 AI 聊天机器人或看图工具,反应会更快,而且不会变笨,能更准确地理解你的意图。
  • 核心思想:不要扔掉所有信息,要扔掉不相关的信息。

这篇论文证明了,通过巧妙地利用模型内部的“交叉注意力”机制,我们可以在不牺牲智能的前提下,让 AI 跑得像风一样快。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →