← 最新论文
🤖 machine learning

Prune Once: Retraining-Free Task-Agnostic Pruning for Vision-Language Models

本文介绍了 PORTA,一种针对视觉语言模型的无需重训、任务无关的剪枝框架,该框架利用激活变化和自适应稀疏度分配,在无需特定任务数据或微调的情况下,实现高压缩率并保持广泛的下游性能。

原作者: Minseok Kang, Hyunwoo Kim, Chanyoung Kim, Minwoo Kim, Jaekoo Lee, Dahuin Jung

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Minseok Kang, Hyunwoo Kim, Chanyoung Kim, Minwoo Kim, Jaekoo Lee, Dahuin Jung

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的机器人大脑,它既能看图,也能读句,并能瞬间理解它们之间的联系。这就是**视觉-语言模型(Vision-Language Models, VLMs)**的世界。把这些模型想象成巨大的、饥肠辘辘的图书馆,它们读过互联网上的每一本书,也看过每一张照片。它们在解决谜题、回答问题和寻找特定图像方面表现出色,但有一个问题:它们极其沉重。运行它们需要拥有海量内存和算力的庞大计算机,就像试图背着一座图书馆去登山远足一样。正因如此,很难将这些聪明的机器人放入手机或平板电脑等小型设备中。

为了解决这个问题,科学家们使用了一种叫做**剪枝(pruning)**的技术。想象一下,机器人的大脑是一个巨大的连接网络。剪枝就像是小心地剪掉那些对机器人思考毫无帮助的微小、无用的细线,只留下那些强壮且重要的细线。这使得机器人变得更轻、更快,而不会让它忘记如何完成工作。然而,现有的多数决定剪掉哪些细线的方法,就像是使用一张专为另一个国家设计的地图;它们通常需要针对机器人可能面临的每一个任务进行专门的练习测试(数据),否则就会产生混乱,或者当机器人从看图切换到读词时会感到困惑。本文探讨了如何一次性完美地修剪这些巨大的大脑,使其可以在任何地方运行,而无需针对每个新任务进行重新训练或微调。


“一劳永逸”的大脑修剪术

认识一下 PORTA(Prune-Once: Retraining-free Task-Agnostic pruning,意为:一次剪枝:无需重训的任务无关剪枝法),这是由研究员 Minseok Kang 及其团队提出的一种新方法。他们的目标是解决一个令人沮丧的问题:目前的剪枝方法往往像是一个裁缝,每当你想要换一件不同的衬衫时,他都需要重新为你量体裁衣。如果你想让机器人做图像分类,你就得用一种方式剪枝;如果你想让它做检索,你又得用另一种方式。这既慢又贵。PORTA 则不同。它像是一位大师级的裁缝,只需观察一次面料,就能精准裁剪,从而使最终的西装能够胜任任何场合——无论是参加赛跑、参加会议,还是在舞会上跳舞。

论文指出,其他方法之所以无法实现这种“一劳永逸”的方法,主要是因为它们依赖于机器人内部信号的**大小(magnitude/量级)**来决定保留什么。作者认为,在这些巨型模型中,信号的大小可能会产生误导,因为大脑的“语言”部分和“视觉”部分的行为方式不同。这就像是在图书馆里判断一声呐喊的重要性,与在体育场里判断一声呐喊的重要性不同;音量(量级)虽然不同,但意义可能是一样的。因此,仅仅观察音量的方法往往会剪掉错误的部分,尤其是在机器人被要求执行它从未见过的任务时。

秘诀所在:变异性胜过音量

与其倾听信号有多响亮,PORTA 倾听的是信号有多多变。研究人员称之为激活变异性(activation variation)

这里有一个类比:想象一个教室里的学生群体。

  • 旧方法(量级): 老师问:“谁的声音最大?”然后只留下那些叫喊得最厉害的学生。但也许那个叫喊得最大的学生只是因为对某个特定话题感到兴奋,而那个安静的学生实际上一直在认真听讲。
  • PORTA 方法(变异性): 老师问:“谁会根据问题的不同而改变自己的回答?”那个能根据话题调整答案的学生,才是真正理解了教材的人。

在机器人的大脑中,PORTA 寻找的是那些在不同输入下表现出大量变异(波动)的特征。如果大脑的一个部分会对许多不同的图片或文字做出不同的反应,说明它正在做重要的工作。如果大脑的一个部分无论你展示什么都保持不变,那么它可能只是累赘。通过使用这种“可变性”评分,PORTA 可以找出哪些部分的机器人是真正有用的,无论它是在看一只猫还是在读一首诗。这使得剪枝具有“模态无关性(modality-agnostic)”,这意味着它能公平地对待视觉和语言部分,而不会将偏差倾向于其中一方。

智能剪裁:并非所有层都平等

一旦 PORTA 知道哪些特征是重要的,它就必须决定从机器人的大脑中每个层级剪掉多少。大脑并不是一个统一的整体;有些层像是房子的地基,而有些层则像是屋顶。你不会像对待屋顶那样激进地修剪地基。

PORTA 使用了一种巧妙的**自适应稀疏性(adaptive sparsity)**机制。它根据输出的变异程度来观察每一层正在做多少“工作”。

  • 如果一个层正在承担繁重的任务(其输出具有高变异性),PORTA 会说:“别动太多!”并给予较低的剪枝率(保留大部分内容)。
  • 如果一个层只是在混日子(低变异性),PORTA 会说:“我们可以大幅度削减它。”

这确保了机器人不会仅仅因为我们试图让它变小,就丧失思考的能力。论文表明,这种方法防止了其他方法在尝试过度剪裁时出现的“性能悬崖(performance cliffs)”现象。

结果:更强、更轻、随时待命

研究人员在三个著名的机器人大脑上测试了 PORTA:CLIPBLIPQwen2-VL。他们不仅测试了一个任务,而是进行了全方位的测试:

  • 图像分类: 识别图片中的内容(例如区分花朵和狗)。
  • 检索: 根据文本描述找到正确的图片(或反之亦然)。
  • VQA(视觉问答): 回答关于图像的复杂问题。

结果令人印象深刻。即使他们剪掉了机器人 65% 的参数(使其变得非常小),PORTA 仍使机器人的表现远优于其他方法。

  • CLIP 模型上,在 65% 的稀疏度下,PORTA 的平均性能比名为 SparseGPT 的方法提高了 12.6%,比 Wanda 提高了 21.5%
  • BLIP 上(在 45% 稀疏度下),PORTA 达到了 90.26 的平均分,超过了 SparseGPT 的 89.95
  • Qwen2-VL 上(在 50% 稀疏度下),PORTA 达到了 54.30 的平均准确率,超过了次优方法(Wanda)0.87 个百分点

或许最重要的一点是,PORTA 是**鲁棒(robust)**的。论文显示,无论你使用一小组图片来进行剪枝“校准”,还是使用一大组图片,或者使用来自一个网站或另一个网站的图片,PORTA 表现都很稳定,而其他方法则会根据所使用的数据在性能上剧烈波动。

总结

PORTA 表明,我们不需要通过重新训练这些巨型模型来使它们变小。通过仅仅观察机器人的内部信号是多么多变而非多么响亮,并从那些工作量较少的层中剪掉更多内容,我们可以创建一个单一的、精简的模型,它能胜任任何工作。这是一种“一次剪枝,永久使用”的方法,它最终可以让这些超级聪明的视觉-语言模型运行在我们口袋里的设备中,而无需依靠超级计算机来驱动它们。作者通过广泛的零样本(zero-shot)实验证实了这一点,表明经过 PORTA 剪枝的模型可以直接投入新任务,即使在高度压缩的情况下也能保持高准确度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →