← 最新论文
💬 NLP

Super-Tuning: From Activation-Aware Pruning to Sparse Fine-Tuning

本文提出了 Super 和 Supra,这两种稀疏参数高效微调方法利用激活感知剪枝信号来选择固定的可训练参数,并证明了将这些稀疏支撑与像 LoRA 这样的低秩适配器相结合,在微调大语言模型方面比现有配置取得了更优的准确率。

原作者: Ivan Ilin, Philip Zmushko, Peter Richtárik

发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Ivan Ilin, Philip Zmushko, Peter Richtárik

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个巨大的、超级聪明的机器人大脑(大型语言模型),它几乎无所不知。但它太庞大、太沉重了,你无法随身携带它去教它一个新技巧,比如解决数学问题。通常情况下,要教它新东西,你必须调整它数十亿个微小的齿轮。这既耗时又费电,还需要一台像小房子一样大的计算机。

迎来 Super-Tuning(超级微调),这是一种教导这些巨大大脑的新方法,它就像是在使用“聚光灯”而不是“大锤”。

问题所在:为什么不直接修复一切?

把这个机器人大脑想象成一个拥有数十亿本书的巨大图书馆。如果你想教它一个新的数学技巧,旧的方法(全量微调/Full Fine-Tuning)就像是重写图书馆里的每一本书。这既累人又昂贵。

为了节省时间,科学家发明了 PEFT(参数高效微调)。这就像是说:“我们只需在几页纸上贴上几张便利贴,而不是重写整个图书馆。” 最著名的便利贴方法叫做 LoRA,它在书本上添加了一层小巧、灵活的笔记。它效果很好,但论文的作者们在想:如果我们对哪些页面贴便利贴更加挑剔一点,能不能做得更好?

核心创意:“聚光灯”策略

作者 Ivan、Philip 和 Peter 提出了一个聪明的疑问:“如果我们使用那些告诉我们大脑哪些部分是‘无用’(剪枝/pruning)的线索,来确定哪些部分最‘有用’进行调整,会怎样呢?”

他们提出了两种新方法:SuperSupra

1. Super: “寂静角落”策略

想象你走进图书馆,观察每本书上面落了多少灰尘,以及人们触摸它的频率。

  • 旧的方法(剪枝): 通常,人们会扔掉那些落满灰尘、很少被触碰的书,因为他们认为这些书并不重要。
  • Super 的方法: 作者们意识到,也许那些落满灰尘、很少被触碰的书其实是写新数学笔记的完美场所!为什么?因为改变一本没人读的书不会破坏图书馆的主线故事,但它可能是添加新数学技巧的绝佳之地。

他们使用了一种特殊的“测尘仪”(称为 Wanda 分数),它观察两件事:

  1. 书有多“重”(其权重/weight)。
  2. 书被风吹动的程度(通过快速测试运行得到的激活值/activation)。

Super 并没有选择最活跃的书籍,而是选择了最安静的书籍(即 “BottomK” 或得分最低的部分)作为唯一允许学习的对象。这就像是说:“我们只让图书馆里最安静、最落灰的页面来贴上新的便利贴。”

结果: 在他们的数学测试中,这种“寂静角落”策略表现得非常出色。在一个 10 亿参数的模型上,它达到了 55.46% 的平均准确率,虽然略低于标准的 LoRA 方法(后者达到了 61.07%),但比随机挑选页面要好。

2. Supra: “混合动力”升级

作者们接着问道:“如果我们把‘寂静角落’策略与标准的‘便利贴’(LoRA)结合起来会怎样?”

见见 Supra。想象你有一个 560 万个“学习令牌”(针对较小的模型)或 2100 万个(针对较大的模型)的预算。

  • Supra 拆分了这个预算。它使用一部分令牌来调整“安静、落灰的页面”(Super 部分),剩下的则用于添加灵活的“便利贴”(LoRA 部分)。
  • 他们测试了不同的拆分比例。对于较小的模型,最佳组合是将 80% 的预算用于“安静页面”,20% 用于“便利贴”。这个组合(Supra)达到了 62.23% 的平均准确率,超过了标准 LoRA 方法 1.16 个百分点

对于较大的 80 亿参数模型,结果略有不同。表现最好的版本实际上是一个仅基于简单权重大小(忽略了测尘仪)的“安静页面”版本,其准确率达到了 79.12%。这表明对于更大的模型,仅仅挑选“最轻”的页面可能就足够了,添加复杂的“测尘仪”并不总是有帮助。

他们排除了什么(“禁区”)

论文非常谨慎地说明了它没有声称的内容:

  • 它不是魔法: 他们明确表示,该方法并不是解决一切问题的“突破”。它只是一种挑选要转动哪些齿轮的新方法。
  • 不是“顶级”之选: 他们尝试挑选了活跃的页面(TopK),但其表现通常不如挑选最安静的页面(BottomK)。因此,“越响亮的书越适合修改”的观点在他们的实验中被排除了。
  • 不是“动态”变化的: 他们的这种方法在训练开始前就选定了页面,并且不再更改。他们承认,如果有一种方法能在学习过程中改变主意并选择不同的页面,可能会更好,但他们没有测试这一点。
  • 并非保证: 结果是基于单个“种子”(一个特定的随机起点)。作者们认为结果是很有前景的,但也承认他们并没有证明它在每种可能的情况下都能 100% 有效。

他们有多确定?

作者们的态度是审慎且克制的。他们说他们的结果“表明”简单的、受剪枝启发的想法可以奏效。他们并未声称已经“解决了”微调问题。

  • 他们通过(测量)证明,在特定的数学测试(如 Math17K)中,他们的混合方法(Supra)在测试的所有设置中实现了最高的平均准确率(针对 1B 模型)。
  • 他们测量出,对于 8B 模型,一个简单的“仅基于量级”(只看权重大小)的方法与他们更复杂的“测尘仪”方法一样出色。
  • 他们模拟了效率并发现,虽然该方法节省了“便利贴”的空间(检查点大小),但由于计算机在后台仍需进行一些繁重的计算,它并不一定会让训练过程在当前的计算机上跑得更快。

总结

Super-Tuning 想象成一位聪明的图书管理员,他意识到要教一个巨大的大脑新的数学技巧,你不需要对着整个图书馆大喊大叫。你只需要对着最安静、最落灰的角落低声细语。有时,将这种低语与一些标准的便利贴结合起来(Supra),会给你带来最好的结果。

这是一个简单、廉价的小技巧,它表明我们可能一直以来都看错了大脑的部分。但正如作者警告的那样,这仅仅是个开始,我们需要进行更多测试才能确定它在任何地方都有效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →