← 最新论文
💻 computer science

Putting Registers to Work: Task Registers for Token Pruning in Vision Transformers

本文提出了任务自适应剪枝(Task-Adaptive Pruning, TAP),这是一种利用特定任务寄存器在不同视觉 Transformer 任务中动态排序 Token 并分配剪枝预算的方法,在保持图像分类、语义分割和目标检测方面具有竞争力的性能的同时,实现了显著的吞吐量提升。

原作者: Hongsen Cao, Mona Jaber, Shanxin Yuan, Ahmed Sayed

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Hongsen Cao, Mona Jaber, Shanxin Yuan, Ahmed Sayed

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你拥有一个超级聪明的机器人大脑,它通过观察图片来尝试理解其中的内容。这个大脑的构造就像是一个由无数微小工人组成的庞大团队,每个工人手里都拿着一块拼图碎片(即“标记/token”)。为了做出决策,每个工人都必须与每一个其他工人进行交流。问题在于,如果图片很大,这种“聊天”的数量就会爆炸式增长,导致大脑过载、变慢,并且极其渴望电力。科学家们一直试图通过告诉大脑忽略那些无聊的部分,只保留重要的部分来解决这个问题,这有点像老师告诉班上的学生,只听取那些有真知灼见的学生发言。这被称为“标记剪枝(token pruning)”。但棘手的地方在于,什么才算得上是“聪明”或“重要”,会随着机器人试图完成的任务而改变。一张对于识别猫咪至关重要的图片碎片,对于判断天空是什么颜色来说可能毫无用处。长期以来,科学家们尝试使用一套通用的“忽略名单”来应对所有任务,但事实证明,一种尺寸并不适用于所有情况。

这篇题为《让寄存器发挥作用(Putting Registers to Work)》的论文,正是在解决这个难题。作者是来自伦敦玛丽女王大学的一个团队,他们发现决定丢弃哪些图片碎片的规则对于不同的任务来说是完全不同的。他们发现,一种在物体检测(比如在公园里找狗)中表现极佳的策略,可能会损害机器人理解场景的能力(比如弄清楚那只狗是在草地上还是在人行道上)。为了解决这个问题,他们发明了一个聪明的全新系统,称为任务自适应剪枝(Task-Adaptive Pruning, TAP)

把机器人的大脑想象成一个繁忙的厨房。通常情况下,厨师(剪枝策略)会使用同样的食谱来决定扔掉哪些食材,无论他是在做汤还是在做蛋糕。作者意识到这是一个错误。相反,他们为厨房提供了一套特殊的“任务寄存器”——可以把它们想象成根据烹饪菜肴而变化的智能、神奇的食谱卡片。当机器人需要识别一只猫时,它会抽出一张“猫卡”,这张卡会告诉大脑究竟应该保留哪些图像部分以及忽略哪些部分。当它需要绘制整个房间的地图时,它会换上一张“房间卡”。这些卡片不仅决定了要扔掉什么,还决定了在脑处理图像的过程中,在每一层(layer)的哪个阶段进行丢弃。

研究人员通过冻结一个标准的机器人大脑,并在不重新训练它的情况下测试不同的“忽略规则”来进行测试。他们发现了三个巨大的惊喜。首先,挑选物体检测中的重要碎片与挑选场景映射中的重要碎片,其最佳方式是截然相反的。其次,机器人对处理最初几层的过程非常敏感,尤其是对于像判断图像中是猫还是狗这类简单的任务。第三,当机器人丢弃一个碎片时,它需要记住这个碎片原本的样子,以便稍后填补空缺。但关键在于:对于寻找物体,最好的办法是假装那个碎片从未存在过,并使用附近的邻居来填补空隙;而对于绘制场景地图,更好的办法是实际记住精确的差异并在稍后将其粘贴回来。

为了解决这一切,TAP 使用一张针对当前任务的单一“活跃”寄存器卡。这张卡会在大脑中穿行,实时做出三个决定:

  1. 选择(Selection): 保留哪些标记,丢弃哪些标记。
  2. 预算(Budget): 在每一步丢弃多少个标记(也许是早期多丢一些,或者后期多丢一些,反之亦然)。
  3. 恢复(Recovery): 当机器人需要绘制详细地图时,要找回多少“被遗忘”的细节。

结果令人印象深刻。通过使用这些特定于任务的卡片,机器人在保持智能的同时变得更快了。在针对物体检测的标准测试(COCO)中,它变得快了 1.32 倍,同时几乎保持了相同的准确度(仅下降了 0.3 点)。在针对场景映射的测试(ADE20K)中,它变得快了 1.30 倍,且质量仅有微小的下降。即使对于简单的图像分类,它也保持了竞争力。

作者认为,这种方法是迈向真正统一机器人大脑的一步——一个可以根据不同的“思考风格”在运行中切换任务的机器人,无论是识别一辆车、描绘一条街道,还是阅读一个标牌,都可以使用同一个核心引擎。他们不仅仅是猜测这行得通,他们通过运行数千次实验证明了这一点:通过冻结大脑来测试单个规则,并展示了他们的新型“寄存器”系统如何始终优于旧有的“一刀切”方法。这提醒我们,在人工智能的世界里,有时最聪明的事情就是知道何时该忽略噪音,而“噪音”的定义完全取决于你想要观察的对象。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →