CoCurve: Cross-Module Co-Pruning Curvature for Training-Free Structured LLM Pruning
CoCurve 是一种针对大语言模型的免训练结构化剪枝方法,它通过利用二阶泰勒展开式来捕捉费舍尔矩阵(Fisher matrix)中的跨模块依赖关系,从而共同优化注意力单元与前馈网络(FFN)单元的移除,并借此通过单次二次规划实现高效且无需标签的压缩,且无需进行微调。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个由数十亿个微型齿轮和弹簧组成的巨大、超级聪明的机器人大脑。这就是大语言模型(LLM),一种可以写故事、解数学题、甚至编写软件的 AI 类型。但问题在于,这些大脑如此庞大且沉重,运行起来极其昂贵且思考缓慢。为了让普通人也能使用它们,科学家们需要将它们缩小,就像把一座巨大的图书馆装进一本口袋大小的书里。这个过程被称为“剪枝”(pruning)。
把剪枝想象成编辑一部长电影。你想剪掉那些无聊的场景,让电影变得更短、更快,但你又不想破坏剧情。长期以来,编辑们(科学家)认为最好的剪枝方式是逐一检查每个场景。如果某个场景本身看起来很枯燥,他们就会把它剪掉。他们假设,如果剪掉了一堆枯燥的场景,电影只会变短一点,而故事本身保持不变。他们把电影看作是一系列独立的片段。
然而,这篇论文指出,一部电影(或一个 AI 大脑)并不只是独立片段的列表。它是一个复杂的网络,其中的场景会相互对话。有时候,一个本身看起来很无聊的场景,实际上是连接另外两个重要场景的秘密胶水。如果你剪掉了那个“无聊”的场景,整个故事可能会崩塌,即使你没有剪掉其他场景。旧的编辑方法忽略了这些隐藏的联系。
进入 CoCurve:绘制连接图谱的侦探
来自南洋理工大学的研究人员引入了一种名为 CoCurve(跨模块协同剪枝曲率)的新方法。CoCurve 不仅仅是观察单个齿轮是否脆弱,它更像是一个侦探,负责绘制出每一个齿轮是如何与其它所有齿轮相连的地图。
以下是他们是如何做的,我们用一个简单的类比:想象 AI 大脑是一个巨大的城市,其中有两种类型的建筑:注意力塔(Attention Towers,帮助 AI 聚焦特定词汇)和 FFN 工厂(FFN Factories,负责处理和理解这些词汇)。
- 旧方法(“节点优先”的错误): 传统方法会走遍这座城市,逐一检查每栋建筑,然后说:“这座塔看起来有点空荡,把它拆了吧,”或者“这家工厂似乎效率很低,把它关了吧。”他们假设拆掉几栋空置的建筑不会对城市造成伤害。但他们忽略了一个事实:有些“空旷”的塔实际上是连接两座繁忙工厂的唯一桥梁。拆掉它们会导致交通堵塞,从而使整个城市停摆。
- CoCurve 方法: CoCurve 不仅仅检查建筑,它还检查建筑之间的桥梁。它使用一种巧妙的数学技巧(对“KL 散度”进行二阶泰勒展开,这是一种衡量当你隐藏 AI 的某部分时,其回答变化程度的高级方法)来绘制城市的地图。
- 地图上的对角线显示了单个建筑自身的权重(就像旧方法那样)。
- 非对角线线条则显示了“协同剪枝曲率”。这是指如果你同时拆除两栋特定的建筑所造成的额外破坏。它揭示了有时,两栋看似虚弱的建筑其实是一个超强的团队,你必须同时保留它们。
神奇的技巧:无需训练
通常,弄清楚这些连接需要大量的繁重工作,比如重新训练 AI 或进行数百万次测试。但 CoCurve 是一种“无需训练”的方法。它就像一个一击即中的魔术。
- 研究人员提取了一小段无标签的文本(比如书中的几页内容)。
- 他们让 AI 运行这段文本,但每次只“遮盖”(hide)一个建筑,以观察 AI 的回答如何产生波动。
- 利用一个精妙的数学捷径(格拉姆乘积/Gram product),他们只需通过这些单次测试,就能计算出整个连接地图。他们不需要测试每一对可能的建筑组合(那会耗费无穷的时间),也不需要更新 AI 的权重。这一切都是一次性完成的。
他们的发现
该团队在四个不同的 AI 模型上测试了 Co循环 CoCurve,这些模型的参数量从 30 亿到 240 亿不等。他们将其与九种流行的剪枝方法进行了对比。
- 结果: CoCurve 表现持续优于其他方法。它让 AI 保持得更聪明、更强大,尤其是在编写代码或解决数学问题等棘手任务中,其他方法往往会让 AI “崩溃”并彻底失效。
- 巨大的胜利: 在一个拥有 240 亿参数的大型模型上,当他们剪掉 40% 的大脑时,CoCurve 在预测下一个词(一种称为困惑度/perplexity 的指标)方面的表现比次优方法好出了 14.5 倍。
- “桥梁”的发现: 论文证明,这种提升并非仅仅来自于找到了“最好的”建筑。提升专门来自于跨模块边缘——即注意力塔与 FFN 工厂之间的连接。当他们在数学运算中移除这些连接时,该方法的表现大幅下降,这证明了这些隐藏的桥梁正是成功的关键所在。
何时有效?
研究人员还发现了一个关于何时进行这种侦探工作的规则。如果一个模型拥有过多的冗余建筑(比如一个拥有 100 家完全相同的工厂都在做同样事情的城市),连接图谱就会变得嘈杂且混乱。在这种情况下,CoCurve 有一个“安全开关”(阻尼因子/damping factor),它会关闭复杂的桥梁映射功能,转而采用简单的“检查每个建筑”的方法。这确保了它在面对那些连接关系并非至关重要的模型时,绝不会让情况变得更糟。
总结
CoCurve 改变了游戏规则,它教会我们:在一个复杂的 AI 大脑中,你不能只剪枝节点(部分),你必须同时剪枝边缘(连接)。 通过尊重不同部分之间隐藏的团队协作,CoCurve 创建了更小、更快且不会丧失智能的模型。这是一种更聪明的“编辑电影”的方式,确保即使在运行时缩减一半的情况下,剧情依然完整。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。