← 最新论文
💬 NLP

SigmaScale: LLM Compression with SVD-based Low-Rank Decomposition and Learned Scaling Matrices

SigmaScale 是一种新颖的大语言模型压缩方法,它通过激活感知奇异值分解(activation-aware SVD)来优化学习到的对角缩放矩阵,从而降低权重矩阵的有效内在秩,在 Llama 3.1 和 Qwen3 等模型上实现了与最先进技术相媲敌的性能。

原作者: Ernests Lavrinovics, Marco Letizia, Roy Janco, Shai Segal, Johannes Bjerva, Maurizio Pierini

发布于 2026-06-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Ernests Lavrinovics, Marco Letizia, Roy Janco, Shai Segal, Johannes Bjerva, Maurizio Pierini

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:巨型模型过于沉重

想象一下,像 Llama 3.1Qwen3 这样的超大规模语言模型(LLM)就像一座规模宏大、细节极其丰富的图书馆。这些图书馆包含了数十亿本书籍(参数),使 AI 变得聪明并能回答问题。然而,正因为它们如此庞大,导致它们搬运起来很重,运行起来很昂贵,且仅仅为了阅读一句话就需要功能强大且耗能巨大的计算机。

科学家们希望在不丢失“智能”部分的前提下,将这些图书馆缩小,使其能够适配较小的设备。这被称为压缩

旧方法:“蒙眼编辑”

缩小这些模型的一种流行方法叫做 SVD(奇异值分解)。可以将模型的“大脑”想象成一张巨大的数字表格。

  • 类比: 想象你有一份 100 页的文件,但你只能保留 10 页。旧的 SVD 方法就像一个蒙着眼睛的编辑。它看着文件说:“好吧,我会保留前 10 页墨水最多的页面,然后把剩下的全部扔掉。”
  • 缺陷: 有时,最重要的信息并不在墨水最多的页面上。它可能隐藏在页边距里,或者以极小的字体书写。通过盲目地切掉“尾部”数据,模型会失去理解细微差别的能力,从而开始犯错。

新方案:SigmaScale(“聪明缩减器”)

该论文的作者提出了一种名为 SigmaScale 的新方法。SigmaScale 不再只是盲目地切掉底部的 90% 数据,而是扮演了一个拿着放大镜和荧光笔的聪明编辑的角色。

以下是它的工作步骤:

1. “拉伸与收缩”技巧

在编辑裁剪页面之前,SigmaScale 会对文档应用一种特殊的“拉伸与收缩”过滤器。

  • 类比: 想象这份文档是由橡胶制成的。SigmaScale 拉伸重要的部分(让它们变得更大、更容易观察),并收缩不重要的部分(让它们变得更小)。
  • 它是如何做到的: 它学习两组数字(向量),这两组数字就像行和列的尺子。它不仅仅是猜测在哪里进行裁剪;它通过学习精确地如何拉伸数据,从而使最关键的信息移动到列表的最顶端。

2. “激活感知型”损失函数

论文提到了这种方法是“激活感知”(activation-aware)的。

  • 类比: 普通的编辑只是看着纸张。SigmaScale 则观察纸张是如何被实际使用的。它会询问:“当人类阅读这份文档时,他们究竟需要哪些词汇才能理解故事?”它根据模型实际处理信息的方式来优化拉伸过程,而不仅仅是看页面上的数字长什么样。

3. 结果:一个更小、更聪明的图书馆

在拉伸了重要部分之后,编辑(SVD)切掉了底部。由于 SigmaScale 先拉伸了重要的部分,因此“切割”发生在一个存储价值较低信息的位置。

  • 结果: 最终得到的“缩减版”模型虽然体积变小了,但它比旧方法更好地保留了“内在秩”(即核心智能)。

实验展示了什么

研究人员在 Llama 3.1 (8B)Qwen3-8B 上测试了该方法。他们将 SigmaScale 与其他顶尖方法(如 SVD-LLM 和 ASVD+)进行了对比。

  • 轻度压缩(保留 90% 的体积): SigmaScale 是明显的赢家。它保持的“困惑度”(衡量模型有多困惑的指标)比其他方法都要低得多。这就像是保留了 90% 的图书馆,却不知为何保留了 95% 的智能。
  • 中度压缩(保留 75% 的体积): SigmaScale 依然表现出色,通常在特定的逻辑和推理测试中击败了竞争对手。
  • 极端压缩(保留 50% 的体积): 在这里,SigmaScale 也遇到了困难,与其他方法一样。论文承认,如果你把图书馆缩减到一半大小,即使是聪明的编辑也无法阻止模型“丧失理智”。它并不是一种解决极端缩减问题的万能药。

“微调”步骤

在缩小模型后,它会变得有些摇晃不稳。研究人员还测试了两种使其恢复稳定的方法:

  1. 监督式微调(Supervised Fine-Tuning): 用新的示例来教导缩减后的模型。
  2. 知识蒸馏(Knowledge Distillation, KD): 让一个巨大的、未经过缩减的“教师”模型来引导这个小的“学生”模型。

发现: 令人惊讶的是,对于这种特定的方法,“教师”(KD)并没有比直接教导学生带来更多的帮助。两种方法的效果几乎相同。

总结

SigmaScale 是一种让缩小 AI 模型变得更聪明的新技术。它不再只是简单地砍掉数据底部,而是首先学习如何重新排列数据,从而保存最重要的部分。

  • 最适用场景: 需要节省空间但又不能承受太多智能损失的情况(轻度到中度压缩)。
  • 不适用场景: 试图将模型缩小到极小尺寸(极端压缩)的情况,在这种情况下该方法会失效。
  • 核心要点: 它是一种灵活的、学习型的方案,能够适应模型大脑的具体形状,而不是使用一种一刀切的公式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →