GLASS: Global-Local Aggregation for Inference-time Sparsification of LLMs
GLASS 是一个无需训练的框架,它通过秩聚合将局部提示特定激活与全局模型内在先验相结合,从而改进大语言模型的推理时稀疏化,稳定动态前馈网络剪枝,并显著提升生成保真度与解码速度,尤其在短提示长文本场景中效果更为突出。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你拥有一个巨大且极其聪明的图书馆(即大型语言模型,或 LLM),它能撰写故事、回答问题并解决难题。但这个图书馆太过庞大,无法装入你的手机或笔记本电脑。它太重、太慢,且运行所需的能量过多。
为了让它在你的设备上运行,你需要对其进行“剪枝”——本质上,你需要告诉它在思考时忽略 50% 的内部神经元,从而使其运行更快并占用更少的内存。
问题:短提示的“猜谜游戏”
现有方法试图通过查看你输入的第一件事(即“提示”)来决定保留哪些神经元。它们会说:“好吧,你问了一个简短的问题,所以我们将保持这些特定的神经元处于激活状态。”
本文认为,这就像试图仅凭你踏出家门的第一步来规划整个公路旅行。
- 短提示:如果你问了一个简短的问题,模型就没有足够的信息来判断哪些神经元对于它即将生成的长答案实际上至关重要。
- 长答案:随着模型开始撰写长故事,神经元的“重要性”会发生变化。那些看似对简短问题重要的神经元,对于故事的其余部分可能毫无用处。
- 结果:模型会感到困惑,犯下错误,写作质量也会下降,因为它保留了错误的神经元并关闭了正确的神经元。
解决方案:GLASS(全局 - 局部聚合)
作者提出了一种名为GLASS的新方法。将 GLASS 想象为一位聪明的经理,它利用两种不同的信息来源做出决策,而不仅仅依赖一种。
- 局部视角(“当下”信号):这查看你刚刚输入的内容。它会问:“基于这个具体问题,哪些神经元此刻正在活跃?”这对于上下文很有用,但对于简短的问题来说并不可靠。
- 全局视角(“内在”信号):这是本文的重大创新。在模型甚至看到你的问题之前,研究人员进行了一项特殊测试,让模型使用空提示(仅一个空白空间)与自己对话。他们问道:“无论发生什么,这个模型总是使用哪些神经元?”这就创建了一份模型最重要、最可靠神经元的“作弊清单”。
GLASS 的工作原理:“排名”类比
GLASS 并非只选其一。它使用一种称为排名聚合的巧妙投票系统。
想象你正在为体育比赛挑选一支队伍:
- 局部教练说:“球员 A 非常适合这场特定的比赛。”
- 全局教练说:“球员 A 是我们拥有的最佳球员,无论何时,这是基于他整个职业生涯的。”
如果你只听局部教练的,你可能会选出一位只适合一次进攻却不适合整场比赛的球员。如果你只听全局教练的,你可能会选出一位明星球员,但他并不符合特定的战术策略。
GLASS 将两者结合。它取“局部”列表和“全局”列表并将它们合并。如果某个神经元被两位教练都排名靠前,那么它肯定会被保留。如果一位教练不确定(例如当提示很短时),另一位教练的意见就能力挽狂澜。
“空提示刺激”(NPS)技巧
为了在不依赖海量书籍或维基百科文章数据集的情况下获得那份“全局”作弊清单,作者使用了一种称为空提示刺激的技巧。
- 他们不是让模型阅读一本书,而是让它从虚无中生成文本(即“空”提示)。
- 这迫使模型完全依赖其内部连接。这就像要求一位音乐家在没有乐谱的情况下演奏音阶,以观察他们自然最常用哪些手指。这提供了模型最关键神经元的一份纯粹、无偏见的地图。
结果:更快且更智能
本文在多种模型(如 Llama、Gemma 和 Mistral)上测试了 GLASS,发现:
- 质量更优:当被要求根据简短提示撰写长故事时,GLASS 犯的错误远少于以往的方法。其质量更接近完整、未剪枝的模型。
- 速度更快:在三星 Galaxy S25 Ultra(一款高端手机)上,GLASS 在某些情况下使模型运行速度提高了11 倍。这是因为模型变得足够小,可以完全放入手机的快速内存中,从而避免了不断交换数据的缓慢过程。
简而言之
GLASS 是一款“即插即用”工具,能让大型 AI 模型在小型设备上运行。它通过结合模型当下正在做的事情与模型天生擅长的事情,解决了在简短问题上“猜错”的问题,确保 AI 即使在资源有限的情况下也能保持聪明和快速。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。