← 最新论文
💻 computer science

Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding

该论文揭示了现有视觉 Token 剪枝方法在复杂视觉推理任务中因“相关视觉信息偏移”而失效的机制,并提出了无需训练的解码阶段感知剪枝框架(DSTP),有效解决了该问题并显著提升了多模态大模型在各类任务中的性能。

原作者: Jiwan Kim, Kibum Kim, Wonjoong Kim, Byung-Kwan Lee, Chanyoung Park

发布于 2026-04-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiwan Kim, Kibum Kim, Wonjoong Kim, Byung-Kwan Lee, Chanyoung Park

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文探讨了一个关于多模态大模型(MLLMs)的有趣问题:为什么现在的模型在“看图说话”时很厉害,但一旦遇到需要“看图推理”的复杂数学或逻辑题,如果为了省资源而删减图片信息,模型就会变得“变傻”?

作者发现了一个核心原因,并提出了一种聪明的解决办法。我们可以用**“导游带团”**的比喻来理解整篇论文。

1. 背景:为了省电费,导游开始“偷懒”

想象一下,你有一个超级聪明的导游(AI 模型),他带你看一张巨大的、细节丰富的地图(图片)。

  • 以前的做法(视觉理解):如果问题很简单,比如“地图上有只猫吗?”,导游只需要扫一眼地图的某个角落就能回答。
  • 现在的挑战(视觉推理):如果问题很复杂,比如“根据地图上的比例尺和路线,算出从 A 点到 B 点的最短路径,并解释为什么”,导游就需要在地图的不同区域之间反复跳转、计算、推理。

为了节省计算资源(就像为了省导游的体力),研究人员发明了一种**“视觉 Token 剪枝”**技术。

  • 剪枝(Pruning):就像导游在出发前(Prefill 阶段),先快速扫一眼地图,把觉得“不重要”的角落直接撕掉或忽略,只保留他认为最重要的几个点。
  • 问题:在简单的“找猫”任务中,这招很管用,因为猫的位置一开始就定死了。但在复杂的“算路线”任务中,导游一开始觉得重要的点,可能随着推理的深入,变得不再重要;而一开始被撕掉的角落,可能正是解题的关键。

2. 核心发现:导游的“注意力”会漂移(RVIS)

论文作者通过观察发现,现有的剪枝方法有一个致命缺陷:它们假设导游的注意力是“静止”的。

  • 现象:在复杂的推理过程中,导游的视线(注意力)是动态漂移的。
    • 第一步:他看地图左上角的数字。
    • 第二步:他需要看右下角的图例。
    • 第三步:他又要回头看中间的路径。
  • 作者称之为:相关视觉信息漂移 (RVIS)
  • 比喻:这就好比你让导游只盯着地图上的“起点”看,然后让他闭着眼睛去算“终点”怎么走。当他算到一半需要看“路标”时,发现路标早就被他在出发前撕掉了,结果当然算错了。

结论:现有的剪枝方法之所以在复杂推理中失败,是因为它们**“刻舟求剑”**——在出发前定死了哪些信息重要,却忽略了推理过程中信息需求的变化。

3. 解决方案:DSTP(智能导游助手)

为了解决这个问题,作者提出了一种叫 DSTP 的新方法。它不需要重新训练导游,而是给导游配了一个**“智能助手”**。

这个助手有两个核心功能:

  1. 雷达监测 (RISD)

    • 在导游开始回答问题(解码阶段)时,助手会时刻监测导游的视线。
    • 如果助手发现导游的视线突然从“起点”移到了“路标”,并且这种移动幅度很大(超过了预设的阈值),助手就会立刻警觉:“嘿!导游的注意力漂移了!我们需要新的信息!”
  2. 动态换票 (CPTS)

    • 一旦检测到漂移,助手不会把导游之前撕掉的地图全捡回来(那样太费体力),而是只把当前最需要的那一小块地图(被撕掉的关键信息)捡回来,替换掉当前导游手里不再需要的旧信息。
    • 关键点:它不是完全替换,而是“保留上下文”。就像导游手里拿着地图,助手把需要的部分贴上去,同时保留原来的框架,防止导游迷路。

4. 效果:既快又准

实验结果表明,加上这个“智能助手”后:

  • 简单任务:表现依然很好,甚至略有提升。
  • 复杂推理任务:原本因为剪枝而暴跌的准确率,被大幅拉回了接近“全图模式”的水平。
  • 成本:增加的额外计算量非常小,几乎可以忽略不计。

总结

这篇论文告诉我们:在处理复杂的视觉推理任务时,不能“一劳永逸”地删减图片信息。

就像导游带团,如果路线复杂,就不能只盯着出发时的几个景点看。必须允许导游在行进过程中,根据当前的思考步骤,动态地去查看之前被忽略的地图细节。

**DSTP 就是那个聪明的机制,它让模型在“省钱”(剪枝)和“聪明”(推理)之间找到了完美的平衡点:平时只带必要的信息,一旦推理需要,立刻精准调取关键信息,既高效又准确。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →