← 最新论文
💻 computer science

Not All Redundant Tokens Are Alike: Analyzing Visual Token Pruning through Token Roles

本文通过视觉标记角色(token roles)的角度分析了视觉语言模型中的视觉标记剪枝现象,揭示了现有剪枝方法存在与性能并不直接相关的显著角色偏差,并证明了保留非活跃标记(non-alive tokens)可以维持甚至提升下游任务结果。

原作者: Hyeonyu Kim, Sehwan Lim, Youngwon Choi, Taeyoun Kwon, Jaejin Kim

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Hyeonyu Kim, Sehwan Lim, Youngwon Choi, Taeyoun Kwon, Jaejin Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图通过向一个超级聪明的机器人展示图片来教会它理解世界。为了做到这一点,机器人并不像人类那样“看”图像;它将图片分解成数千个微小的数字拼图碎片,称为“标记”(tokens)。你可以把这些标记想象成一场宏大而混乱的交响乐中的一个个音符。机器人必须聆听每一个音符才能理解这首乐曲。但问题在于,对于高分辨率图像,这个管弦乐队规模如此庞大,以至于会让机器人变得迟钝,并且极其消耗计算机内存。

科学家们一直试图通过教机器人忽略那些“无聊”的音符来解决这个问题——即那些看起来在重复自身或不携带太多意义的音符。这被称为“标记剪枝”(token pruning)。这就像一位指挥家告诉管弦乐队停止演奏那些听起来相同的音符,希望在音乐依然完美的前提下,让演奏速度变得更快。最近,一个名为“EmbedLens”的新工具帮助研究人员意识到,这些标记并不都是一样的。有些是“活着的”(携带图像的真实故事),有些是“汇聚点”(重复的模式,只是停留在那里),还有些是“死亡的”(完全冗余的噪声)。巨大的疑问是:如果我们知道哪些标记是“死亡的”,我们能否直接把它们全部扔掉以提高速度?

这篇题为《并非所有冗余标记都一样》(Not All Redundant Tokens Are Alike)的论文深入探讨了这个问题。研究人员仔细观察了不同的剪枝方法是如何决定剪掉哪些标记的。他们发现了一些令人惊讶的现象:那些试图剪掉“死亡”标记的方法并不总是比那些不剪除死亡标记的方法效果更好。事实上,他们的实验表明,即使是“死亡”标记,在幕后也可能在做着重要的工作,比如维持整个乐队的运转。通过保护这些“死亡”标记免遭删除,机器人的回答能力有时反而变好了,而不是变差了。事实证明,仅仅因为一个标记在单独看来毫无用处,并不意味着它是可以丢弃的;有时,整个群体需要保持完整,音乐才能听起来正确。

数字管弦乐团的故事

为了理解为什么这很重要,让我们看看这些视觉语言模型(VLM)是如何工作的。想象你有一个既能阅读又能观察的机器人。当你给它看一张猫的照片时,机器人的“眼睛”(视觉编码器)会将这张照片分解成一长串微小的数据块。然后,这些数据块会被交给机器人的“大脑”(大型语言模型)去分析这只猫正在做什么。

问题在于,一张照片可能会产生数百个这样的数据块。如果你有一段视频或一张非常详细的图像,这个列表会变得非常长,导致机器人不堪重负。处理图像的第一部分(称为“预填充延迟”)会耗费很长时间,占用大量内存,并消耗大量能量。为了解决这个问题,研究人员开发了“标记剪枝”。这就像一个聪明的编辑,他看着那份数据块列表并说:“好吧,我们不需要这500个重复的蓝色天空;我们只保留50个吧。”

在很长一段时间里,大家都认为规则很简单:“保留有趣的东西,扔掉无聊的东西。”最近,一个名为 EmbedLens 的工具改变了游戏规则。它观察了机器人的大脑内部,发现标记分为三个截然不同的组:

  1. 活跃标记(Alive Tokens): 它们是主角。它们携带图像的具体细节,比如“毛茸茸的皮毛”或“绿色的草地”。
  2. 汇聚标记(Sink Tokens): 它们像是背景噪音。它们是重复性的,并不真正描述特定的图像,但它们是稳定且始终存在的。
  3. 死亡标记(Dead Tokens): 它们是终极的噪声。它们似乎与图像或文字完全没有任何联系。

逻辑上的推测是:“既然有了死亡标记,我们就删掉它们吧!它们毫无用处!”

伟大的剪枝实验

本文作者决定测试这个假设。他们采用了三种流行的剪枝方法(FastV、DART 和 DivPrune),并问道:“当你减少标记数量时,你实际剪掉的是哪些?”

他们在十个不同的测试集上运行了这些方法,涵盖了从简单的“汽车是什么颜色?”到复杂的科学问题的各种难度。他们追踪了在不同的剪枝水平下(从移除 12.5% 到 87.5% 的标记),究竟移除了多少“活跃”、“汇聚”和“死亡”标记。

他们的发现有点混乱。
不同的剪枝方法对于什么是“无用”并没有达成共识。

  • DivPrune 在剪除“死亡”标记方面非常激进。它似乎遵循着这样一个规则:“删除噪声。”
  • 然而,FastVDART 则奇怪地保护着“汇聚”标记。即使这些标记看起来是冗余的,它们仍然保留了这种重复的背景嗡嗡声。

这里有一个转折:仅仅因为一种方法剪掉了更多的“死亡”标记,并不意味着它的表现更好。 事实上,DivPrle(它剪掉了最多的死亡标记)有时表现最好,但有时 FastV(它保留了死亡标记)反而更好。在“剪除死亡内容”与“获得高分”之间,并没有完美的匹配关系。

“保护死亡标记”的惊喜

为了弄清楚为什么会发生这种情况,研究人员进行了一个聪明的实验。他们没有让剪枝方法自行决定,而是强制要求机器人保留特定类型的标记。他们说:“好吧,FastV,你可以随意剪裁,但你必须保留所有的死亡标记。”

他们原本预期性能会下降。毕竟,如果死亡标记是没用的,保留它们只会浪费空间并干扰机器人。

结果呢?性能并没有下降。在许多情况下,它反而上升了。

  • 当他们保护活跃标记时,性能提升了(这很好理解)。
  • 但当他们保护死亡标记时,机器人的性能平均提升了约 0.93%(针对 DivPrune 方法)。

这令人震惊。这表明,即使单个“死亡”标记看起来像垃圾,但删除所有的死亡标记可能会破坏某些东西。

隐藏的管弦乐指挥家

为什么保留“无用”的标记会有帮助?作者通过一种叫做“注意力”(attention)的机制观察了这些标记是如何相互交流的。想象一下,这些标记是正在互相传递音符的音乐家。

他们发现,虽然单个“死亡”标记不会获得太多关注(它不是独奏者),但作为一组,它们占据了巨大的“注意力预算”。它们就像是一个庞大的背景合唱团。如果你把它们全部切掉,剩余的音乐家(活跃标记)就会失去它们的语境。死亡标记可能不在演唱旋律,但它们在维持节奏和结构。

当研究人员保护死亡标记时,剩余标记之间的注意力模式保持得更加平衡。由于死亡标记仍然在那里支撑着结构,“活跃”标记仍然可以进行正常的交互。

启示

论文指出,我们不能仅仅看一个标记并说:“你是死的,滚开。”事情并没有那么简单。死亡标记可能在单独存在时很弱小,但作为一个整体,它们很强大。

作者总结道,有效的剪枝不应仅仅关于寻找最重要的标记。它应该是关于构成(composition)。我们需要确保不会在无意中剥离掉一整类标记,因为这些标记虽然个体平庸,但对于群体的功能运作至关重要。这提醒我们,在一个像人工智能这样复杂的系统中,即使是那些“冗余”的部分,也可能在做着我们尚未完全理解的工作。

所以,下次当你觉得要清理一个凌乱的房间时,请记住,有时候你认为只是杂物的东西,实际上是在支撑着架子。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →