← 最新论文
⚡ electrical engineering

AIRE-Prune: Asymptotic Impulse-Response Energy for State Pruning in State Space Models

AIRE-Prune 是一种针对状态空间模型(SSM)的结构化后训练剪枝方法,它通过基于闭式渐近脉冲响应能量评分进行状态分配与选择来降低状态维度,在多种基准测试中实现了显著的计算量减少且仅造成极小的精度损失。

原作者: Apurba Prasad Padhy, Fernando Camacho, Saibal Mukhopadhyay

发布于 2026-02-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Apurba Prasad Padhy, Fernando Camacho, Saibal Mukhopadhyay

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你拥有一座庞大且超级聪明的图书馆(一个状态空间模型,State Space Model),它能够阅读长篇故事或聆听长段音频。为了理解故事,这座图书馆的大脑内部拥有数以千计的微型“记录员”(称为状态,states)。每个记录员都负责记住过去的一段特定信息。

问题在于,这座图书馆人员过剩了。它雇佣了比实际需要多得多的记录员,这使得图书馆运行缓慢、成本高昂且难以管理,尽管其中大多数记录员只是在无所事事地坐着。

AIRE-Prune 是一种聪明的新方法,它可以在不损害图书馆讲述故事能力的前提下,解雇那些不必要的记录员。以下是它的工作原理,通过简单的类比来解释:

1. 旧方法:“最响亮的尖叫”(最坏情况)

以前的方法试图通过询问:“谁的声音最大?如果把某人推向极限,谁能发出最响亮的尖叫?”来决定保留哪些记录员。

这就像是一场消防演习,你只留下那些能尖叫得最响亮的人。问题在于,在现实生活中,从来没有人会叫得那么大声。因此,你会留下那些擅长尖叫但对日常对话毫无用处的人,同时解雇了那些虽然声音小但确实在做日常工作的实干家。这被称为“最坏情况”(worst-case)方法,通常过于保守。

2. 新方法:“总能量得分”(AIRE-Prune)

论文作者说:“让我们不再担心最响亮的尖叫。相反,让我们衡量每个记录员在漫长的、无限的时间内,实际完成了多少总工作量。”

他们称之为渐近脉冲响应能量(Asymptotic Impulse-Response Energy)。

  • 隐喻: 想象你敲击了一下记录员一次(一个“脉冲”)。这一次敲击会在最终的故事中产生多少能量?
  • 有些记录员就像一面重鼓:你敲击一次,它就会持续震动很久,为故事贡献大量的“能量”。
  • 其他记录员则像一根羽毛:你敲击一下,它几乎纹丝不动。它们几乎对故事没有任何贡献。

AIRE-Prune 根据这种总能量为每一个记录员计算得分。如果一个记录员的得分很低,这意味着他们基本上是“累赘”。

3. “全局记分板”(归一化)

这里有一个棘手的部分:图书馆有不同的房间(层/layers)。在“入口室”,记录员可能天生就很吵;而在“出口室”,记录员可能天生就很安静。如果你只比较原始得分,你可能会不小心解雇掉整个安静房间里的所有人。

AIRE-Prune 通过创建一个归一化记分板来解决这个问题。它观察“入口室”,并问道:“好的,这里的顶尖 10% 的员工是谁?”然后在“出口室”也进行同样的操作。接着,它将所有这些“顶尖员工”放在一张巨大的名单上进行决策。这确保了每个房间都能得到公平对待,无论该房间平时是吵闹还是安静。

4. 结果:精简冗余

论文在著名的挑战集 Long Range Arena(模型需要记忆极长序列数据的测试)上测试了该方法。

  • 神奇数字: 他们能够平均解雇 60.8% 的记录员(状态)。
  • 代价: 图书馆的准确率仅下降了 0.29%。这几乎是不可察觉的。
  • 收益: 因为解雇了这么多记录员,图书馆变得更快,且占用的内存更少。

为什么这比竞争对手更好?

论文将 AIRE-Prune 与之前最好的方法(称为 LAST,它使用的是“最响亮的尖叫”即最坏情况方法)进行了对比。

  • LAST 像是一个谨慎的经理,为了以防万一而保留了太多人。
  • AIRE-Prune 则像是一个聪明的经理,他观察实际的每日产出。它发现图书馆携带了许多旧方法未能识别出的“累赘”。

总结

可以将 AIRE-Prune 视为 AI 模型的一个高效人力资源部门。它不是根据谁可能叫得最响来猜测谁很重要,而是衡量谁在一段时间内实际贡献了能量。通过解雇那些低能量的员工,它让 AI 运行得更快、更便宜,同时保持故事(准确性)几乎完全不变。

论文声称,这种方法适用于不同类型的 AI 模型(如 S5、S4D 和 Mamba),并且无需重新训练。你只需计算得分,切掉底部的 60%,大功告成。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →