← 最新论文
💻 computer science

Beyond Accuracy: Auditing Spatial Provenance in Visual Token Pruning for OCR-Critical MLLM Inference

本文引入了一种针对文本丰富型多模态大语言模型(MLLM)中视觉标记剪枝的证据-风险审计框架,该框架揭示了基于准确率的指标如何掩盖空间溯源方面的关键失效,并证明了透明且无需训练的选择器在不牺牲 OCR 关键区域可追溯性的情况下,能够实现相当的准确率,同时显著提升批处理速度和内存效率。

原作者: Feixiang Liu, Qiang Qiu, Hao Zhang, Xinyue Wang

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Feixiang Liu, Qiang Qiu, Hao Zhang, Xinyue Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一个世界:计算机可以“看见”图片并回答关于图片的问题,就像一个超级聪明的朋友,能从照片中读出菜单内容,或者告诉你街标上写了什么。这就是多模态大语言模型(MLLM)的领域。为了实现这一点,计算机将图像分解成数千个微小的数字拼图碎片,称为“视觉标记”(tokens)。然后,它像读书中的文字一样,一个接一个地阅读这些碎片,以弄清楚图像的内容。

然而,观察一张带有大量文本的高分辨率照片,就像试图在一次坐席中读完一整部百科全书一样;这需要耗费大量的时间和计算资源。为了让这些模型更快,科学家们开发了一种被称为“视觉标记剪枝”(visual-token pruning)的小技巧。把它想象成一个图书管理员:在你提问之前,他会快速扫描一本书,并扔掉那些他认为你不需要的页面,只保留最重要的部分。目标是在保持答案正确的同时,让过程变得快得多。但问题在于:仅仅因为图书管理员认为自己保留了正确的页面,并不意味着他真的做到了。如果图书管理员扔掉了你询问的具体日期所在的页面,但计算机由于知道日期通常长什么样而猜对了日期,那么答案虽然是对的,但推理过程却是破碎的。这篇论文研究的正是这种隐藏的危险。


伟大的标记劫案:当答案正确,但线索消失时

这篇论文的作者 Feixiang Liu 及其团队决定用一个非常具体的问题来审计这些“图书管理员”(剪枝方法):如果计算机给出了正确的答案,它是否真的观察了图片的正确部分来获取答案?

他们发现,在很多情况下,答案是“不”。

想象你在参加一场关于收据的测试。问题是:“总价是多少?”收据在一个小方框里写着一个微小的特定数字。一个聪明的剪枝方法可能会扔掉收据图像中 70% 的标记以节省时间。令人惊讶的是,计算机可能仍然能正确回答“15.99”。但作者发现,在许多这类“正确”的答案中,计算机实际上并没有保留代表那个微小价格框的标记。相反,它根据收据的形状、字体,或者仅仅根据它对收据通常长什么样的通用知识来猜测价格。

这是本文的主要发现:准确率本身是一个骗子。 你可以拥有一个准确率达到 78% 的模型,但如果你仔细观察它看哪里,你会发现它忽略了它原本需要的特定证据。作者将这种缺失的环节称为“空间溯源性”(spatial provenance)——一种高级的说法,即:“我们能否将答案追溯到图像中存放证据的确切位置?”

侦探的工具箱

为了证明这一点,团队构建了一个特殊的“证据风险审计”。他们把图像视为一个犯罪现场。

  1. 正面线索: 他们在图像上选取了一个特定的单词或数字(例如价格),并询问:“计算机是否保留了这个特定位置的标记?”
  2. 陷阱: 他们还针对那些不存在的事物(例如一个虚假的价格)进行提问,以观察计算机是在真正检查,还是仅仅在瞎猜。
  3. 审计: 他们比较了三种不同的挑选保留标记的方法:
    • 目标法(Target): 计算机根据问题尝试猜测哪些标记是重要的。
    • 随机法(Random): 计算机通过掷数字骰子来挑选标记。
    • 网格法(Grid): 计算机以整齐的棋盘格模式挑选标记。

令人震惊的结果

结果令人大开眼界。当他们在 Qwen 模型上以 30% 的保留预算(仅保留 30% 的图像标记)进行测试时:

  • “目标法” 保持了答案正确(准确率 0.786),并且在约 62% 的问题中保留了特定的证据标记。
  • “随机法” 的正确率较低(0.739 准确率),且仅保留了 27% 的证据标记。
  • “网格法” 与随机法类似,仅保留了 31% 的证据。

这里的转折在于:尽管“目标法”表现更好,但在它得到正确答案的情况下,仍然有近 40% 的情况丢失了证据!这意味着计算机经常依赖语言模式而非图像本身。

作者还发现,不同的模型遵循不同的规则。适用于一个模型(如 Qwen)的方法对于另一个模型(如 LLaVA 或 InternVL)并不适用。例如,一种能保护 LLaVA 证据的方法,实际上可能会让它更多地进行猜测。没有“一劳永逸”的设置。

速度的代价

论文还研究了现实世界的速度收益。通过剔除 70% 的标记,他们确实让计算机处理得更快了。

  • 对于 Qwen 模型,他们在处理图像批次时看到了 4.32 倍 的加速。
  • 他们还节省了 76.4% 用于存储图像数据的内存。

但作者警告说,这种速度是有隐藏代价的。如果你将模型用于关键任务,比如阅读医疗处方或法律文件,因为证据被扔掉而靠猜测来给出答案是非常危险的。论文建议,我们不应该只报告“准确率”(Accuracy)和“压缩率”(Compression Ratio)。我们也需要报告“空间溯源性”(Spatial Provenance)——即一个分数,告诉我们有多少实际的视觉证据在剪枝过程中幸存了下来。

核心结论

这篇论文并不是说剪枝不好。它说的是我们需要更聪明地衡量它。仅仅因为计算机给出了正确的答案,并不意味着它看到了正确的东西。作者提出了一个新的标准:当我们为计算机压缩图像以便阅读时,我们必须检查“线索”是否仍然存在。如果答案是对的,但线索消失了,那么这个系统就是不可靠的,无论它有多快。

最后,作者建议,对于需要阅读特定文本的任务(如 OCR),我们需要保留比我们想象中更多的图像,或者至少要诚实地说明我们到底看了多少图像。他们为 AI 安全领域开启了一扇新门,表明“快速”和“准确”是不够的;我们还需要“可追溯性”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →