← 最新论文
🤖 machine learning

Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning

本文提出了 DualSpeed,一种结合了用于提高效率的视觉 Token 修剪与用于解决训练-推理不匹配的全序列辅助模式及自蒸馏的快慢训练框架,从而在不损失性能的情况下将多模态大语言模型(MLLM)的训练速度提升高达 4.0 倍。

原作者: Dingkun Zhang, Shuhan Qi, Yulin Wu, Xinyu Xiao, Xuan Wang, Long Chen

发布于 2026-02-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Dingkun Zhang, Shuhan Qi, Yulin Wu, Xinyu Xiao, Xuan Wang, Long Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图通过展示成千上万张图片,来教导一名非常聪明的学生(一个多模态大语言模型)。

问题所在:“信息过载”的瓶颈
目前的这些模型就像是会被信息淹没的学生。当你给他们看一张图片时,计算机会将图片分解成数百甚至数千个被称为“视觉标记”(visual tokens)的小碎片。这就像是你为每个学生递过去一本一千页的书,即便其中大部分页面只是空白或重复的图案。

尝试阅读所有这些页面非常耗时。这使得训练这些模型变得极其缓慢、昂贵且耗能。

旧思路:“剪切与粘贴”的错误
研究人员意识到许多页面都是无用的。他们尝试了一种名为**视觉标记剪枝(Visual Token Pruning)**的技术,这就像是用荧光笔划掉那些无聊、冗余的页面,然后再把书交给学生。这种方法在后期测试(推理)阶段效果很好,能让模型运行得更快。

但当他们尝试在训练期间使用这种方法时,却产生了副作用。这造成了一种“不匹配”。

  • 类比: 想象一下,你只用了一本书的十页摘要来训练学生。然后,在期末考试时,你却递给了他们那本完整的一千页原著。学生会惊慌失措并考试不及格,因为他们从未学会如何处理完整版本。他们太习惯于简短的版本了。

解决方案:DualSpeed(“快慢结合”训练营)
该论文的作者张鼎坤及其团队创建了一种名为 DualSpeed 的新训练框架。可以将其想象为一个通过随机切换来解决不匹配问题的“双轨制”训练营。

  1. 快速通道(极速练习):

    • 在大多数时间里(约 90% 的环节),模型在“快速模式”下进行训练。
    • 在这里,他们使用“剪枝”技术来剔除无用的视觉标记。模型通过高效的精简摘要进行快速学习。
    • 为了帮助模型记住它正在看哪个版本,他们在简短摘要的开头添加了一个微小的、隐形的“名牌”(称为模式隔离器/Mode Isolator)。这告诉模型:“嘿,这是压缩版;请专注于关键细节。”
  2. 慢速通道(全书复习):

    • 偶尔(约 10% 的时间),模型会切换到“慢速模式”。
    • 在这里,我们会向模型展示完整的、未经剪枝的图片(整整 1,000 页)。
    • 为了确保模型在这些稀少的环节中不会变得懒散,他们使用了一种名为**自我蒸馏(Self-Distillation)**的技巧。“快速模式”(已经学到了很多知识)会充当老师,在“慢速模式”的学生耳边低声传递答案。这确保了学生即使在接触完整版本较少的情况下,也能有效地学习。

结果:两全其美
通过混合这两种模式,模型既获得了快速通道的速度,又保留了处理慢速通道中复杂世界的能力。

  • 速度: 他们将模型的训练速度提升了 2.1 倍到 4.0 倍。
  • 性能: 尽管速度更快,但模型并没有变笨。它们保留了原有的 99% 以上的性能。
  • 灵活性: 最终的模型既足够聪明,能够处理简短摘要(如果你追求速度),也能处理完整图像(如果你追求最高精度)。

总结
该论文声称,通过使用这种“快慢切换”系统,我们可以更快速地教导这些庞大的 AI 模型,而不会让它们忘记如何阅读“全书”。他们发现,在训练过程中大约 90% 的视觉标记实际上是冗余的;通过智能地剔除这些标记(同时偶尔练习完整版本),我们可以在不损失智能的前提下,节省大量的成本和时间。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →