← 最新论文
🤖 AI

Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models

该论文提出了“Reroute”,一种用于视觉语言模型的无需训练的插件,它通过将不可逆的标记移除替换为可恢复的路由机制,允许被延迟处理的视觉标记在后续解码器阶段重新进入处理池,从而在保持效率的同时提升定位性能。

原作者: Cheng-Yu Yang, Shao-Yuan Lo, Yu-Lun Liu

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Cheng-Yu Yang, Shao-Yuan Lo, Yu-Lun Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个巨大的视觉信息库(一张图像),一个智能机器人(视觉语言模型)需要阅读它来回答问题。机器人并不是将图像作为一个整体来阅读,而是将其分解成数千个微小的“视觉标记”(visual tokens),就像一个个独立的拼图碎片。

问题在于,阅读数千个碎片会消耗大量的能量和内存,从而降低机器人的运行速度。

旧方法:“排序并删除” (Rank and Remove)

此前,为了提高速度,研究人员使用了一种名为**“排序并删除”**的方法。
这就像一位严厉的图书管理员,看着你的拼图碎片并说道:“这100块碎片现在看起来很重要。留下它们。把剩下的900块永远扔掉。”

管理员是根据这些碎片在那一刻的表现来做出决定的。但问题是,机器人的大脑是分层的,就像一座多层建筑。

  • 在底层(早期层): 机器人还处于困惑状态,对所有事物的观察都比较模糊。它可能会认为一片天空的碎片并不重要。
  • 在顶层(深层): 机器人突然意识到:“等等!那片天空其实是我正在寻找的那个人背后的背景!”

但因为底层的管理员已经把那块碎片扔掉了,顶层的机器人永远无法看到它。这种丢弃的决定是不可逆的。如果机器人稍后需要那个碎片,那就太晚了。这导致机器人在处理需要精确位置的任务(例如指出“穿着绿色衬衫的男人”具体站在哪里)时会失败。

新方法:“重路由,而非删除” (Reroute, Don't Remove)

该论文的作者提出了一种名为 Reroute(重路由) 的新方法。他们不再是把碎片扔掉,而是把它们放进一个“候诊室”。

其运作方式如下:

  1. 检查点: 在建筑物的底层,管理员仍然会对碎片进行检查。他们挑选出前10%的碎片,让它们直接进入下一层进行详细工作。
  2. 候诊室: 其余90%的碎片并没有被扔进垃圾桶。它们被送入了一条旁路通道(残差路径),跳过了当前层的繁重计算工作。
  3. 重新进入: 当机器人到达下一层的下一个检查点时,管理员会再次查看整个集合——包括那些正在通道中等待的碎片。
  4. 第二次机会: 如果一个在第一层被忽视的碎片在第二层突然显得非常重要,管理员可以将它从候诊室中拉出来,让它加入工作。

为什么这很重要

论文通过实例展示了这种简单的改变——将碎片保留在系统中,而不是删除它们——带来了巨大的差异,尤其是在机器人被迫变得非常高效(仅保留极小比例的碎片)时。

  • “穿绿衣男”的比喻: 在论文的示例中,当机器人需要寻找“穿绿色衬衫的男人”时,旧方法因为觉得衬衫标记在初期看起来不重要而将其丢弃。结果机器人没能找到那个人。而新方法则将衬衫标记保留在候诊室中。当机器人进行更深层的推理时,它意识到了衬衫至关重要,于是将其拉回,并成功找到了那个人。
  • 无额外成本: 最棒的是,这不需要机器人学习任何新知识,也不会消耗更多能量。由于“候诊室”中的碎片跳过了当前层的繁重计算,总能量消耗与旧的“丢弃”方法基本持平。这只是一种更聪明的管理碎片的方式。

核心结论

该论文认为,我们不应该将减少视觉信息视为一个一次性的“删除”按钮。相反,我们应该将其视为一种路由系统。通过允许“延迟处理”的信息随着 AI 变得越来越聪明而重新参与评估,我们可以让这些模型在保持高效运行的同时,不会对稍后可能发现的重要细节变得“盲目”。

作者在几种不同的 AI 模型上进行了测试,发现该方法一致地提高了模型定位物体(grounding)的能力,且不会损害模型回答一般性问题的能力,同时保持了计算机的高效运行。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →