← 最新论文
🤖 machine learning

LASER: Loss-Aware Singular-value Decomposition and Rank Allocation for Efficient Low-Precision Vision-Language Models

该论文提出了 LASER,一种用于视觉语言模型的低秩压缩框架,该框架利用由曲率信息引导的损失感知奇异值分解以及跨层秩分配策略,在保持低精度推理准确性的同时实现显著的解码加速。

原作者: Haiyu Wang, Yutong Wang, Leshu Li, Yihui Ren, Sai Qian Zhang

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Haiyu Wang, Yutong Wang, Leshu Li, Yihui Ren, Sai Qian Zhang

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:“装不进兜里”的巨型大脑

想象一下,视觉语言模型(VLM)就像一个超级聪明、巨大的大脑,它能够观察图片并回答相关问题。它功能极其强大,但也极其庞大。这就像是试图把一整座图书馆的百科全书都塞进你的背包里。因为体积太大,它需要消耗大量的能量来运行,需要巨大的硬盘来存储,并且在普通的手机或笔记本电脑上运行速度非常缓慢。

科学家们以前也尝试过用两种主要技巧来缩小这些模型:

  1. 剪枝(Pruning): 剪掉大脑中看似无用的部分。
  2. 量化(Quantization): 将大脑的思想转化为更简单、更短的语言(比如使用缩写)。

但还有第三种极具前景的技巧叫做低秩分解(Low-Rank Decomposition)。想象一下,你观察一幅复杂的画作,发现它其实只是由几层简单的笔触叠加而成的。如果你能找到这寥寥几笔,你就能在不存储每一个像素的情况下重现这幅画。这就是“低秩”所做的事情:它简化了模型内部的数学运算。

旧方法的缺陷: 以前尝试这种方法的人,就像是在通过猜测哪些笔触该保留来缩小画作。他们往往只关注让图片看起来保持一致(重构),而不是确保大脑依然能正确思考。他们还把大脑的每个部分都一视同同,尽管有些部分其实比其他部分更重要。

解决方案:LASER(损失感知奇异值分解与秩分配)

论文的作者创造了 LASER,一种能在不损失智能的前提下缩小这些巨型大脑的新方法。你可以把 LASER 想象成一位聪明的、具备损失感知的雕塑家

以下是 LASER 如何通过三个简单步骤工作的:

1. “曲率”指南针(损失感知 SVD)

旧方法会问:“如果我移除这个部分,图片看起来还一样吗?”
LASER 则会问:“如果我移除这个部分,模型的答案会出错吗?”

想象你在剪辑一部电影。普通的剪辑师可能会仅仅因为一个场景与下一个场景看起来相似就把它剪掉。而 LASER 就像是一位知道哪些场景对剧情至关重要的导演。它使用一种数学“指南针”(称为 K-FAC)来衡量如果改变某个特定部分,模型的置信度准确度会下降多少。它不仅仅观察数字的大小,更观察这些数字如何影响最终结果。这确保了在缩小模型时,“大脑”依然保持聪明。

2. “公平份额”预算(跨层秩分配)

想象你有一个 100 美元的预算,用来修理一栋有 10 个房间的房子。

  • 旧方法: 给每个房间正好 10 美元。
  • LASER 方法: 先走遍整个房子。厨房快塌了(非常敏感),所以给它 40 美元。壁橱状况良好(不敏感),所以给它 5 美元。剩下的钱根据需求分配给其他房间。

LASER 意识到,AI 的所有部分并不完全平等。有些层非常“脆弱”,需要保留更多的原始复杂度;而有些层则可以被大幅度缩小。它使用一种特殊的“校准”过程,来确定应该给每一层分配多少“空间”(秩),从而使整个模型保持平衡且准确。

3. “混合型”FFN(重量级选手)

在这些 AI 大脑内部,有两种主要的“工作人员”:

  • 注意力团队(The Attention Team): 他们观察图像和文本,以确定关注重点。
  • FFN 团队(前馈网络团队): 他们负责繁重的处理和推理工作。这个团队占据了模型体积的巨大份额。

旧方法主要缩小“注意力团队”,却忽略了“FFN 团队”。LASER 进入 FFN 团队并说道:“我们不能平等地缩小所有人,否则团队会崩溃。”
它使用了一种混合策略

  • 它识别出哪些特定的工作人员(通道)擅长被简化,并使用“笔触”技术(S之一 SVD)来缩小他们。
  • 它让那些顽固、难以处理的工作人员保持原样(保持稠密)。
  • 然后,它将整个团队转化为一种更简单的语言(量化)以进一步节省空间。

结果:快速、精简且聪明

论文声称,通过使用这种智能雕塑方法:

  • 速度: 模型的运行速度比之前的顶尖方法快 2.3 倍,比标准的高精度方法快 4.7 倍
  • 准确性: 尽管模型被缩小和简化了,但它回答问题的正确程度几乎与那个巨大的、未缩小的版本一样出色。
  • 效率: 它节省了大量的内存,使得在通常无法处理这些强大 AI 大脑的设备上运行它们成为可能。

简而言之: LASER 是一种缩小巨大 AI 大脑的聪明方法。它不是盲目地切除碎片,而是仔细测量哪些碎片是必不可少的,给重要的部分分配更多空间,并简化其余部分,从而得到一个运行快速、体积精简且依然非常聪明的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →