CORP: Closed-Form One-shot Representation-Preserving Structured Pruning for Transformers
本文提出了一种名为 CORP 的闭式单步结构化剪枝方法,该方法仅利用无标签数据和仿射重构来移除 Transformer 中的多层感知机(MLP)和注意力组件,从而在不进行重新训练或微调的情况下实现高精度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一座庞大且极其聪明的图书馆(一个 Transformer 模型),它能够回答问题、识别图像并撰写故事。但这座图书馆过于巨大,占据了一整栋建筑,需要庞大的团队来运营,而且太重了,无法搬进小公寓(比如手机或笔记本电脑)。
你希望将这座图书馆缩小,使其能装进背包,同时不丧失其讲述精彩故事或识别猫咪的能力。这被称为剪枝。
问题所在:“蛮力”方法
目前大多数缩减这些图书馆的方法,就像雇佣一支编辑团队去阅读每一本书,决定剪掉哪些页面,然后再雇佣一整支新的教师团队,重新教导图书馆如何在缺失页面的情况下运作。这种方法耗时漫长,需要大量“有标签”的数据(答案键),而且如果你剪得太多太快,往往会导致图书馆崩溃。
解决方案:CORP(“一次性”修复)
本文作者提出了一种名为CORP的新方法。将 CORP 想象成一位总建筑师,他能够审视图书馆,决定剪除什么,并立即重新设计剩余的书架,使书籍依然完美契合——整个过程只需单次遍历,无需任何答案键或重新教学。
以下是 CORP 的工作原理,使用简单的类比说明:
1. “缺失页面”问题
当你从书中剪掉一个章节(一个维度)时,故事就会断裂。剩余的文本不再通顺,因为它依赖于缺失的部分。
- 旧方法: 直接剪掉页面,希望读者能猜出那里原本有什么。(结果:故事变得毫无意义)。
- CORP 方法: CORP 意识到缺失的页面并非随机;它实际上是由保留下来的页面组成的可预测混合体。
2. “仿射”翻译器(针对 MLP)
在图书馆内部,有一些处理信息的区域(称为 MLP)。CORP 审视它保留的页面,并问道:“我能否写一个简单的公式,仅基于我保留的页面,来预测缺失的页面原本会说什么?”
它利用一点数学(称为岭回归)来创建一个“翻译器”。它精确计算出保留的页面与缺失页面之间的关系。然后,它将这种转换折叠进剩余的书架中。
- 神奇之处: 你不需要保留缺失的页面。你只需微调剩余的书架,让它们“代述”缺失页面的内容。图书馆变小了,但故事保持不变。
3. “注意力”修复(针对大脑)
图书馆还有一个“大脑”(注意力机制),它决定将哪些书籍放在一起查看。当你剪除大脑的部分时,连接就会变弱。
CORP 在这里也做了类似的事情。它审视被剪除的连接,并找出如何调整剩余的连接,使它们依然能够有效地“相互对话”。它本质上重写了图书馆的地图,使剩余的路径依然通向相同的目的地。
为何这很特别?
- 无需重新训练: 你不需要重新教导图书馆。你只需在少量数据样本上(比如查看几本随机书籍以了解风格)进行一次数学计算,然后进行剪除。
- 无需标签: 你不需要知道书籍的“正确答案”。你只需要看到文本即可。
- 一次性完成: 整个过程在单一步骤中完成。无需反复的优化迭代。
结果
作者在著名的图像识别图书馆(DeiT)上测试了这种方法。
- 他们剪除了图书馆**50%**的结构(一半的书架,一半的大脑连接)。
- 结果: 图书馆识别图像的准确率仍保持在83.27%。
- 额外好处: 速度大幅提升(1.6 倍加速),且占用内存更少。
他们还在语言模型(OPT)和其他视觉模型(DINOv2)上进行了测试,表明这种“建筑师”方法适用于不同类型的图书馆,即使它们显著变小,依然能保持智能。
总结
CORP 就像一种针对 AI 模型的魔法收缩射线。它不是简单地删除部分并寄希望于最好的结果,而是精确计算出剩余部分需要如何改变,以补偿损失的部分。它瞬间完成这一过程,无需教师或重写,使得巨大的 AI 模型能够装入更小的设备,同时保持智能。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。