← 最新论文
🤖 AI

Where Do Tokens Go? Understanding Pruning Behaviors in STEP at High Resolutions

该论文提出了 STEP,一种混合令牌缩减框架,它通过轻量级 CNN 策略将动态超块合并与早退剪枝相结合,在几乎不损失精度的情况下显著提升了视觉 Transformer 在高分辨率语义分割任务上的计算效率和吞吐量。

原作者: Michal Szczepanski, Martyna Poreba, Karim Haroun

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Michal Szczepanski, Martyna Poreba, Karim Haroun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名导游,正带领一支庞大的游客队伍(即“令牌”)穿越一座巨大而复杂的城市(即高分辨率图像),以寻找特定的地标(即语义分割)。

在传统的**视觉 Transformer(ViT)**中,导游将城市中的每一块砖、每一片树叶和每一根草都视为需要单独管理的独立个体。即使整个公园只是一片绿草,导游也会停下来与每一根草单独交谈。这种方式极其缓慢且令人疲惫,尤其是当城市规模巨大(即高分辨率)时。

本文介绍了一种名为STEP(SuperToken 与早期剪枝)的新方法,旨在不丢失重要细节的前提下,使这次游览更加高效。它通过两种巧妙的方式实现这一目标:

1. “分组”策略(SuperTokens)

STEP 不再将图像的每一个微小部分视为独立个体,而是使用一个名为dCTS的智能助手。该助手观察城市后说道:“嘿,整片天空区域都是蓝色的,整片田野都是绿色的。让我们把它们分组在一起!”

  • 类比:想象不再管理 4,000 名独立的游客,而是由助手将公园里站着的 100 人合并为一个“超级组”。现在,导游只需与这一个小组代表交谈,而无需与 100 个个体逐一交流。
  • 结果:导游可以跳过枯燥、均匀的区域(如天空或空白墙壁),将精力集中在城市的复杂部分(如繁忙的市场或拥有许多窗户的建筑)。研究发现,仅凭这一项措施,导游需要管理的“人数”就减少了2.5 倍

2. “提前退出”策略(剪枝)

随着游览的继续,一些游客会非常迅速地确定自己的位置。也许某位游客看到了“披萨”招牌,立刻明白:“我在披萨区!”他们无需再听导游后续的讲解。

  • 类比:STEP 在游览路径的各个节点安装了“出口门”。如果某位游客 100% 确定了自己的位置,他们就被允许提前离开游览队伍。他们停止行走,也停止聆听,从而节省了导游向他们解释剩余路线的精力。
  • 结果:导游只需让那些“困惑”或“不确定”的游客完成全程游览。论文显示,多达**40%**的游客可以提前结束行程,从而节省了大量的时间和能量。

整体成果

研究人员在超级计算机(NVIDIA A100 GPU)上,使用非常庞大且详细的地图(高达 1024x1024 像素的图像)对此进行了测试:

  • 速度:游览变得快得多。在某些情况下,导游处理城市的速度比旧方法快了3.4 倍
  • 效率:计算机无需进行那么多数学运算。工作量最多减少了4 倍
  • 准确性:最棒的是,导游并没有迷路。即使人数减少、游览时间缩短,导游找到地标的准确度仍几乎与之前相当(准确率仅下降极小幅度,不到 2%)。

局限性(“交通拥堵”)

论文还发现了一个有趣的副作用:尽管导游需要管理的人数减少了,但速度并不总是呈直线提升。

  • 类比:想象导游开着一辆车。即使乘客变少了,如果司机必须不断停车、查看地图并决定谁可以下车,车辆可能仍然行驶缓慢。“检查谁已准备好离开”这一动作(即剪枝机制)会产生些许交通和混乱,从而轻微拖慢整体速度。
  • 结论:该方法在减少工作量(数学运算)方面极其高效,但决定剔除哪些人的过程需要更加顺畅,才能实现最大的速度提升。

简而言之:STEP 就像一位聪明的导游,他将相似的游客分组,并让那些自信的游客提前离开。这使得探索巨大而详细的城市变得更快、更轻松,同时仍能准确完成任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →