Sparsity-Aware Low-Rank Representation for Efficient Fine-Tuning of Large Language Models
本文介绍了 SALR,这是一种将冻结基座权重的稀疏剪枝与低秩适配器相结合的新型微调范式,旨在实现 50% 的稀疏度、2 倍的模型压缩以及高达 1.7 倍的推理加速,同时保持与标准 LoRA 相当的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个巨大的、超级聪明的机器人大脑,它几乎了解世界上的一切。这就是科学家们所说的“大语言模型”(LLM)。这些大脑非常了不起,但它们也极其沉重且极其渴望电力,就像一辆为了去超市买个东西而需要专门配一辆油罐车来加油的法拉利。因为它们体积庞大,很难安装在普通的电脑或手机上。
为了解决这个问题,研究人员一直试图在不重建整个引擎的情况下,教给这些巨型大脑新的技巧。一种流行的方法叫做 LoRA,它就像是在这个大脑上添加一本小的、可拆卸的“训练手册”。与其重写整个大脑,你只需要微调这本小手册即可。但即便有了这本手册,大脑仍然庞大且缓慢,因为原始引擎依然在那里,占据着空间。另一个想法是“剪枝(pruning)”大脑——剪掉那些看起来没用的部分,就像修剪树篱一样。但如果你只是随机地乱砍,大脑往往会忘记它原本要学习的东西,就像一个学生扔掉了教科书并试图靠猜来回答问题一样。大问题在于:我们能否既剪掉脂肪又保留肌肉,让大脑变得更小、更快,同时又不让它变笨?
于是,SALR(稀疏感知低秩表示)出现了,它就像是一个既是聪明厨师又是精明机械师的结合体。研究人员发现,如果你在学习的过程中尝试修剪大脑,往往会破坏那精妙的“低秩(low-rank)”结构——即大脑用来快速学习的特殊捷径。他们在数学上证明了,最好的修剪方式是只切割大脑中原始的、冻结的部分,让新的学习捷径保持原样。但问题在于,当你进行切割时,你会丢失信息。如果你只是把切下来的部分扔进垃圾桶,大脑的表现就会变差。
SALR 通过将这些切下的部分视为珍贵的秘密来解决这个问题。它并没有把它们扔掉,而是捕捉了这些被切掉的部分中留下的“剩余”信息,并将它们存储在一个微小的、压缩过的“残差(residual)”口袋里。你可以这样理解:想象你正在编辑一本宏大的百科全书。你决定删除 50% 的页面以节省空间。如果你直接删除,你就会丢失一半的知识。但 SALR 就像一位天才编辑,在删除页面之前,会从这些要删除的页面中提取出最重要的事实,并写成一份超短的 1 页总结。然后,他将这份总结塞进附着在书上的一个特殊的、微小的口袋里。当你稍后阅读这本书时,大脑会利用主页面加上那个微小的总结,完美地记住所有内容。
论文显示,这种方法效果惊人。通过使用一种被称为“截断奇异值分解(truncated SVD)”的数学技巧(这只是一种寻找剩余信息中最重要模式的巧妙方法),他们可以将模型的体积缩小 2 倍(减半),同时保持与未修剪版本同样高的准确率。在像 GSM8K(数学挑战)和 MMLU(通用知识测试)这样的测试中,SALR 保持了与全量、沉重模型一样的高分。例如,在名为 Llama3-8B 的模型上,它在数学问题上达到了 79.5% 的准确率,完全匹配了那个沉重的版本,但占用的内存却只有一半。
更棒的是,研究人员不仅让文件体积变小了,还让它运行得更快了。他们找到了将所有这些微小的“信息口袋”合并成一个大型、高效计算的方法,并设计了一个特殊的“两阶段流水线”来快速读取数据,就像一条不停歇等待零件的工厂装配线。这种设置使得模型的运行速度比标准版本快了 1.7 倍。相比之下,其他尝试对模型进行剪枝的方法往往会导致准确率大幅下降(例如跌至 71.4% 或更低),或者因为数据处理效率太低而无法真正实现计算机加速。
简而言之,SALR 证明了你不需要在“聪明但沉重的大脑”和“轻量但缓慢的大脑”之间做选择。通过聪明地决定剪掉什么以及如何保存残余,你可以得到一个既轻量又极速的模型,使其能够适配那些此前无法处理它的设备。论文通过各种大型模型的真实测试证明了这一点,展示了通过使用 50% 的稀疏度(剪掉一半的权重),你可以获得两全其美:大脑依然敏锐,而计算机也感到很轻松。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。