← 最新论文
💻 computer science

Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction

本文介绍了 PriorTR,这是一种无需训练的 Token 缩减方法,它通过在单次前向传播中使用空 Token 探测(null token probe)来显式地将任务条件注意力与模型诱导先验分离,从而在激进的 Token 预算下改善准确率与效率之间的权衡,进而加速多模态大语言模型。

原作者: Zengjie Chen, Yuxiang Cai, Jingcai Guo, Taotao Cai, Jianwei Yin, Zhi Chen

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Zengjie Chen, Yuxiang Cai, Jingcai Guo, Taotao Cai, Jianwei Yin, Zhi Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是对论文 "Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction" (PriorTR) 的解释,已翻译为通俗易懂的中文,并保留了原有的创意类比。

核心问题:“嘈杂的房间”

想象一下,你正试图在一个拥挤、嘈杂的房间里,与一位非常聪明的的朋友(AI)进行一场严肃的对话。房间里挤满了数百人(代表图像的视觉标记/tokens)。

你的朋友正试图回答你提出的一个特定问题,比如:“那个穿红衬衫的人在做什么?”

然而,你的朋友有一个坏习惯:他们天生会被房间里最响亮、最显眼的人所吸引,而不管你问的是什么。如果有一个穿着亮黄色西装的人站在扩音器旁边,即使那个人与你的问题毫无关系,你的朋友也会立刻盯着他看。

在 AI 世界中,这被称为**“模型诱导先验”(model-induced prior)**。AI 会自然而然地关注图像中高对比度或纹理丰富的部分(比如明亮的蓝天或繁忙的背景),仅仅是因为这些部分在视觉上很“吵”,而不是因为它们与你的指令相关。

旧方法:挑选最响亮的声音

以往用于加速这些 AI 模型的方法,试图通过忽略房间里的多数人来节省时间。它们会观察 AI 正在关注谁,然后只保留那些人。

缺陷在于: 由于 AI 天生会对“响亮的人”(背景噪音)产生偏好,旧方法会保留错误的人。它们留下了那个穿黄西装的人,却丢弃了那个正在做你所询问动作的红衬衫人。当 AI 被迫在剩下极少人数的情况下进行推断时(即“严格的标记预算”下),它往往会给出错误的答案,因为它观察的是错误的信息。

新方案:PriorTR(“静音过滤器”)

作者提出了一种名为 PriorTR 的新方法。把它想象成一个聪明的技巧,可以帮助 AI 忽略自己的坏习惯,转而只关注所询问的内容。

其工作原理如下,分步骤进行:

1. “沉默的观察者”(空标记/Null Token)

在 AI 尝试回答你的问题之前,研究人员先让它做一个“虚假”的问题。他们在图像之后、你的问题之前插入一个沉默的、空的标记(就像一个空格或一段停顿)。

  • 类比: 就像问你的朋友:“先别管我问了什么,你就看着这个房间,告诉我谁最显眼。”
  • 结果: 你的朋友指出了那些响亮、显眼的人(背景噪音)。这张注意力图就是**“先验”(Prior)**。它展示了 AI 天生喜欢看什么。

2. “真实的问题”(后验/Posterior)

接下来,你提出了真正的问题:“那个穿红衬衫的人在做什么?”

  • 类比: 你的朋友再次观察房间,但这一次,他们是在寻找那个穿红衬衫的人。这就是**“后验”(Posterior)**(带有你指令后的注意力)。

3. “减法技巧”(先验修正/Prior Correction)

现在,PriorTR 将这两张图进行对比。

  • 用大白话解释数学逻辑: 它用“真实问题”的注意力图去减去“沉默观察者”的注意力图。
  • 结果: 如果 AI 在两种情况下都在看那个响亮的黄西装,那么减法操作就会抵消掉这个信号。如果 AI 仅仅是因为你的提问才开始看那个穿红衬衫的人,那么这个信号就会被保留下来。

这就创建了一个**“经先验修正后的”(Prior-Corrected)**注意力图。它精准地突出了由你的特定问题带来的、全新的且有用的信息,剥离了 AI 天生的偏见。

收益:更快且更聪明

一旦 AI 知道哪些人(标记)实际上与你的问题相关,它就可以把剩下的其他人扔掉。

  • 物理剪枝(Physical Pruning): AI 不仅仅是“忽略”了多余的人;它从物理上将他们从记忆中移除,并停止思考他们。
  • 好处: 这使得 AI 运行得更快(需要更少的计算能力)且更便宜(占用更少的内存),但令人惊讶的是,它也让答案更准确,因为 AI 不再会被背景噪音所干扰。

为什么这很重要

论文表明,当强制要求 AI 在极少数“人”留存的情况下工作(激进的标记缩减)时,旧方法表现得很糟糕,因为它们保留了错误的人。PriorTR 通过使用这种“静音过滤器”技巧,保留了正确的人。

总结来说: PriorTR 教会了 AI 如何区分“它天生喜欢看什么”和“你实际想让它看什么”,从而使其在保持智能的同时,工作效率更高。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →