← 最新论文
🤖 machine learning

Generalized Fisher-Weighted SVD: Scalable Kronecker-Factored Fisher Approximation for Compressing Large Language Models

本文提出了一种广义费舍尔加权奇异值分解(GFWSVD),这是一种针对大语言模型的可扩展训练后压缩方法,它利用全费舍尔信息矩阵的克罗内克因子近似来捕捉参数相关性,并显著优于现有的基于对角线的压缩技术。

原作者: Viktoriia Chekalina, Daniil Moskovskiy, Tatiana Matveeva, Andrey Kuznetsov, Evgeny Frolov

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Viktoriia Chekalina, Daniil Moskovskiy, Tatiana Matveeva, Andrey Kuznetsov, Evgeny Frolov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图将一座宏大且复杂的图书馆缩小到足以装进一个背包的大小,同时又不丢失其中的故事。这正是科学家在人工智能领域——特别是研究“神经网络”(旨在模仿大脑学习能力的计算机程序)时所面临的日常挑战。这些程序由数百万个被称为“参数”的小开关组成。为了让这些程序在更小的设备上运行得更快,研究人员试图剪掉那些没怎么干活的开关。但棘手之处在于,这些开关并不是孤立工作的。它们就像一个复杂的舞团;如果你拉走一名舞者,整个舞步可能会崩溃,因为那名舞者正与其他人手拉手。

多年来,决定剪掉哪些舞者的标准做法是观察每个舞者个体,而忽略了这种“手拉手”的关系。这就像是在检查一名舞者是否疲劳,却没注意到他正在支撑着搭档。这种方法很快,但往往会毁掉整场表演。你即将阅读的这篇论文通过引入一种新的方式来观察参数的“舞蹈”,解决了这个问题。它使用了一种名为“费雪信息矩阵”(Fisher Information Matrix)的数学工具,这个工具就像一张地图,展示了每个开关是如何与其他开关相互连接的。其目标是在保持“故事”(智能)完好无损的前提下,缩小(即压缩)这个“图书馆”(AI模型)。

核心理念:看见整体舞蹈,而非仅仅是舞者

论文的作者 Viktoriia Chekalina 及其团队意识到,旧的地图太模糊了。他们想要一张不仅能显示哪些舞者重要,还能显示他们如何相互关联的地图。为此,他们发明了一种名为**无矩阵费雪分解(Matrix-free Fisher Factorization, MFF)**的新算法。

把费雪信息矩阵想象成覆盖整个舞池的巨大、浓密的迷雾。过去,想要看穿这层迷雾以寻找连接是不可能的,因为迷雾太厚,舞池也太大了。旧的方法只是简单地猜测连接是简单的(比如一条直线),这忽略了真实舞蹈中复杂的曲线。

团队的新技巧 MFF 就像是一副特殊的眼镜,让你无需拨开整个迷雾,就能看到迷雾的结构。MFF 不尝试写下每一个单独的连接(这会消耗大量内存),而是实时计算连接,并专注于舞蹈的特定“层”。这是一种“无矩阵”方法,意味着它从不实际构建那个庞大、沉重的地图,而只是利用地图的形状来引导切割。

解决方案:一种缩减模型的新方法

利用这种观察连接的新方式,团队开发了一种名为 GFWSVD(广义费雪加权 SVD)的方法。如果你把 AI 模型想象成一块粘土,标准方法可能只是切掉边缘。然而,GFWSVD 理解粘土内部的纹理。它知道有些部分的粘土是紧密交织在一起的,必须以特定的方式进行切割才能保持形状。

论文证明,在特定的数学条件下(具体来说,如果连接遵循一种被称为“矩阵多元正态分布”的模式),他们的方法是缩减模型的唯一最优方式。这不仅仅是一个猜测;它是通过减少参数来最小化对模型性能损害的数学上的完美方式。

研究发现:削减一半的模型

团队在一些最著名的 AI 模型上测试了他们的新方法,包括用于编写代码或聊天等各种用途的巨型语言模型 Llama 2Llama 3.1,同时也测试了用于理解文本的模型 BERT

以下是他们的发现:

  • 压缩能力: 他们能够将这些巨型模型缩小高达 50%。这意味着将参数数量减半。
  • 性能表现: 即使体积减小了一半,这些模型的表现仍与原始版本一样出色,甚至有时甚至更好。在许多测试中,GFWSVD 在各项指标上都全面超越了当前最优秀的方法(如对角近似法和基于激活的方法)。
  • 避免崩溃: 当他们尝试将模型压缩 40% 时,标准方法开始失效,导致 AI 失去推理或回答问题的能力。然而,GFWSVD 依然保持了稳健和可靠。
  • 速度: 由于模型变小了,它们的运行速度也更快。在强大的计算芯片(NVIDIA A100)上,压缩后的模型处理文本的速度比未压缩的原始模型快了 1.34 倍

为什么这很重要

作者表明,通过关注参数之间隐藏的连接(非对角线元素),你可以更激进地缩小 AI 模型而不使其损坏。他们证明,忽视这些连接(正如大多数其他方法所做的那样)会浪费大量的性能潜力。

他们还表明,这种方法可以作为其他训练过程的一个极佳“起点”。如果你先使用 GFWSVD 来缩小模型,然后让模型再进行少量的学习(微调),它比使用标准缩减方法能更好地保持准确性。

简而言之,这篇论文为裁剪巨型 AI 模型提供了一把全新的、具有数学依据的“剪刀”。它让我们在丢弃冗余体积的同时保留智能,使强大的 AI 能够在更小的设备上运行,并降低运行成本,且不会失去原始模型的魔力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →