Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models
本文提出了 CLSE,一种无需训练的 Token 修剪框架,该框架通过在频域内量化跨层频谱演变来识别并保留具有语义活跃性的视觉 Token,从而在保持或提升推理性能的同时加速多模态大语言模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在尝试解决一个复杂的拼图,但盒子里有 1,000 块碎片,其中 800 块仅仅是蓝天或空桌子的图片。一台标准的计算机(多模态大语言模型,简称 MLLM)会试图观察这 1,000 块碎片中的每一块,以确定图像的内容。这需要很长时间并消耗大量能量,尽管其中大部分碎片对于解决拼图其实毫无帮助。
这篇论文介绍了一种全新的、“无需训练”的方法,可以快速丢弃那些无用的碎片(冗余 Token),让计算机只专注于重要的部分,而无需重新学习如何这样做。
以下是作者提出的新方法——**CLSE(跨层谱演化,Cross-Layer Spectral Evolution)**是如何运作的,我们使用一些简单的类比来解释:
1. 问题所在:“聚光灯”存在偏差
现有的方法试图通过观察计算机大脑内部的“聚光灯”(称为注意力分数)来决定哪些拼图碎片是重要的。
- 缺陷: 论文指出这个聚光灯有点“故障”。它倾向于把更亮的光投射在列表后部的碎片上,仅仅是因为它们所处的位置,而不是因为它们真的重要。这就像一位老师在批改试卷时,无论答案是否正确,都会不小心给写在页面底部的答案打出更高的分数。
- 结果: 计算机可能会保留无用的背景碎片,而丢弃掉至关重要的关键部分。
2. 解决方案:观察碎片的“舞蹈”
与其对重要性进行单次的快照观察,作者建议观察这些碎片在穿过计算机各层时是如何变化的(就像接力赛中传递球的过程)。
- 类比: 想象视觉 Token(拼图碎片)是舞者。
- 背景碎片(如天空)是乏味的舞者。他们从歌曲开始到结束都保持着同样的动作,原地不动。他们没有变化。
- 重要的碎片(如正在做特技的摩托车手)是充满动态感的舞者。他们从一个简单的姿势开始(低级细节),随着音乐的进行,逐渐演变成一套复杂的、富有意义的动作(高级含义)。
- 方法: 作者使用了一个叫做谱演化(Spectral Evolution,可以理解为一种“变化检测器”)的数学工具,来测量一个 Token 从一层到下一层之间的变化程度。
- 如果一个 Token 变化很大(在演化),它就会被保留,因为它正在做一些重要的动作。
- 如果一个 Token 保持不变(静态),它就会被丢弃,因为它只是背景噪音。
3. 为什么“频率”很重要
论文使用了“频率”(来自音乐或无线电波)的概念来解释。
- 低频: 可以想象成平滑、缓慢的嗡嗡声。这代表了乏味、不变的背景。
- 高频: 可以想象成尖锐、快速的鼓点。这代表了构成有趣部分的精细细节和突然变化。
- 诀窍: 新方法会过滤掉“平滑的嗡嗡声”(乏味的背景),只关注随着层级演化过程中出现的“鼓点”(变化的、重要的细节)。
4. 结果:更快、更聪明
作者在许多不同的模型和任务(如针对图像和视频回答问题)上测试了该方法。
- 结果: 通过丢弃“乏味的舞者”并保留“动态的舞者”,计算机变得更快了(消耗更少的能量和内存),但并没有丧失理解图像的能力。事实上,在许多情况下,它的表现甚至优于其他试图利用存在缺陷的“注意力”来猜测重要性的方法。
- 视频: 这种方法在视频领域表现尤为出色,因为视频在帧与帧之间存在更多的“乏味”重复。该方法可以在几乎不影响理解动作的前提下,将计算机需要处理的碎片数量减少 90% 以上。
总结
简而言之,这篇论文告诉我们:不要只看一眼碎片就决定它是否重要。要观察它在系统中移动时的变化过程。 如果它保持不变,它可能只是背景噪音;如果它在演化并发生转化,它就是理解图像的关键。这使得 AI 能够变得更快,且不会产生困惑。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。