← 最新论文
🤖 machine learning

Beyond Single-Dimensional Compression: The Compound Sparsity Frontier of Large Language Models

本文引入了一种结合了静态参数剪枝与动态标记级层跳过的复合稀疏性框架,该框架通过超越单一机制的压缩方法,有效地延迟了性能退化,并揭示了大型语言模型中一种最优的近平衡分配策略。

原作者: Chao Han, Haozhe Hu, Xiaoyu Shen

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Chao Han, Haozhe Hu, Xiaoyu Shen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的机器人,它能写故事、回答问题并解决谜题。这个机器人是一个“大语言模型”(LLM),它非常强大,但它也像个巨人。它体积庞大且沉重,占据了大量的计算机内存,而且思考起来需要很长时间。为了让这些机器人对每个人都变得有用,科学家们试图让它们变得更小、更快,同时又不让它们变笨。他们通过“压缩”这个机器人来实现这一点,这就像打包行李:你希望装进所有重要的东西,但必须舍弃一些东西以节省空间。

通常有两种主要的方法来缩小这些机器人。第一种就像是在阅读前编辑一本书:你永久地删掉一些你认为不必要的词句(这被称为“参数剪枝”)。第二种就像是一个聪明的读者,他决定说:“我不需要读完这一章的每一页;我会跳过那些无聊的部分”(这被称为“Token 跳过”)。通常,科学家们会分别测试这两种方法。他们会问:“我们可以删除多少?”或者“我们可以跳过多少页?”但问题在于:如果你删掉太多或者跳过太多页面,机器人很快就会开始犯傻。这篇论文提出了一个有趣的新问题:如果我们同时做这两件事呢?如果我们删掉一点书的内容,并且同时跳过一些页面,我们能否在机器人开始变傻之前,将机器人压缩得更小?

研究人员 Chao Han、Haozhe Hu 和 Xiaoyu Shen 决定测试这个“复合”想法。他们构建了一个系统,首先削减机器人的大脑(参数),然后添加一个智能开关,让机器人在思考时可以跳过步骤(动态 Token 跳过)。他们想看看通过在这两种方法之间分担“缩减”的负担,是否能比只使用其中一种方法更有效地压缩机器人。

他们的实验表明,是的,混合这两种方法比只使用其中一种效果更好。当他们尝试单独通过删除大脑部分来缩小机器人时,一旦删除了大约 20% 的数据,机器人就开始无法理解任务。但当他们把“大脑削减”与“页面跳过”结合起来时,机器人可以在开始崩溃前处理高达 30% 的总缩减量。这就像是在说:“如果你只拿走你的鞋子,你跑不了多远。如果你只告诉你要单腿跑步,你也跑不了多远。但如果你既拿走了你的鞋子,又告诉你要单腿跑步,你实际上比只做其中一件事时能跑得更远。”

然而,存在一个极限。论文发现,即使有了这种聪明的组合方式,你最终也会撞上一堵“墙”。无论你如何混合和搭配缩减方式,总有一个点,即无论你的打包策略多么聪明,你都无法进一步压缩机器人而不损失它的智慧。研究人员还发现,这两种方法以一种微妙的方式相互干扰。如果你把机器人的大脑修剪得太厉害,它会对跳过页面变得非常敏感,反之亦然。他们发现的最佳策略是保持平衡:不要过度疯狂地删除大脑部分,也不要跳过太多页面。相反,应该平分工作量。例如,如果你想让机器人总共缩减 50%,最好的结果来自于删除大约 30% 的大脑部分,并跳过大约 28% 的思考步骤。

简而言之,这篇论文表明,虽然我们不能打破物理定律让这些机器人变得无限小,但我们可以更聪明地缩小它们。通过使用一种混合了不同类型压缩的“复合”方法,我们可以推迟机器人感到困惑的时刻,并让它更长时间地保持良好运行。但作者也明确表示:这并不是一个能永远解决所有问题的万能方案。仍然存在一个硬性的限制,一个“稀疏边界”,无论我们的打包策略多么巧妙,我们最终都会撞上它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →