← 最新论文
🤖 machine learning

Neural network relief: a pruning algorithm based on neural activity

本文提出了一种受人脑稀疏连接性启发的迭代剪枝算法,该算法利用基于神经活动的重要性度量来识别并停用不重要的连接,从而在保持各种深度神经网络架构和数据集上相当的准确率的同时,实现了显著的参数压缩。

原作者: Aleksandr Dekhovich, David M. J. Tax, Marcel H. F. Sluiter, Miguel A. Bessa

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Aleksandr Dekhovich, David M. J. Tax, Marcel H. F. Sluiter, Miguel A. Bessa

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在尝试解决一个巨大的、复杂的拼图。你有一个装有数千块碎片的巨大盒子,但当你真正坐下来拼凑图像时,你实际上只需要其中的一小把。其余的部分只是杂物,占据着空间并让你更难找到正确的碎片。这正是现代“深度神经网络”(DNNs)所面临的情况——这些驱动图像识别和语音助手等功能的超智能计算机大脑。这些数字大脑由数百万个微小的连接组成,但研究人员注意到,对于任何单一任务,其中大多数连接都只是在那里无所事事。它们被过度使用且装备过剩。

科学家们提出的核心问题是:我们如何在不伤及肌肉的情况下减掉脂肪?我们希望缩小这些庞大的网络,使其运行得更快、占用更少的内存,同时又不让它们忘记如何解决拼图。你即将阅读的这篇论文通过观察这些计算机大脑在工作时是如何“思考”的来解决这个问题。他们并没有仅仅靠猜测哪些连接是无用的,而是提出了一种新方法,通过倾听大脑的活动,找到最安静的部分,并温柔地将其关闭。这就像一个聪明的清洁工,他不只是扫除整个房间,而是仔细检查哪些灯关着,然后将它们永久关闭,让明亮、活跃的部分继续承担重任。


“神经网络缓解”策略

认识一下 NNrelief,一种新的剪枝算法(一个表示“修剪”的专业术词),它表现得就像一个非常专注的管弦乐团指挥。在典型的深度神经网络中,每一位音乐家(或神经元)都在演奏,即使他们只是在轻声哼唱。NNrelief 的目标是找出那些并没有真正为歌曲做出贡献的音乐家,并请他们休息一下,同时保持音乐听起来依然完美。

旧方法 vs. 新方法

长期以来,修剪这些网络的标准方法是基于量级(magnitude)。想象你有许多绳索连接着两个点。旧方法会说:“切断最细的绳子!”其理念是,细绳(一个小数值,或称“权重”)承载不了多少重量,所以它一定是无用的。

但本文的作者认为,这有点像仅仅通过一个人喊叫的声音有多大来判断其对团队的贡献。一个人可能拿着扩音器(巨大的权重)却在低声耳语(微弱的信号),这意味着他实际上并没有提供什么帮助。相反,一个声音普通的人可能会在正确的时间说出正确的话。

NNrelief 改变了游戏规则。它不再仅仅关注绳子的粗细(权重),而是观察实际有多少信号通过这根绳子。它会询问:“这个连接现在究竟承载了多少信息量?”如果一个连接承载的信号很弱,即使它的绳子很粗,也会被剔除。如果一个连接承载着强烈的信号,即使它的绳子很细,也会被保留。

它是如何工作的:“重要性得分”

团队创造了一个简单的数学技巧,称为重要性得分(importance score)。你可以把它看作是网络中每一个连接的“贡献度计”。

  1. 他们观察网络解决一个问题(例如识别一张猫的照片)。
  2. 他们计算每个连接中流过了多少“能量”或“信号”。
  3. 他们将连接按重要程度从高到低进行排序。
  4. 他们设定一个目标:“保留前 95% 的信号”。
  5. 他们切断所有低于该线的连接。

酷的地方在于?他们并不只是切掉固定数量的连接(比如“切掉 50%”)。他们是根据活动量来进行切割。这意味着网络会根据保持信号强度所需的程度,自行决定需要保留多少连接。

“缓解”效应

当他们这样做时,发生了一些令人着迷的事情。网络不仅变小了,而且变得更加平衡了。在剪枝之前,一些连接在拼命强调重要性,而另一些则保持沉默。剪枝之后,剩余的连接都开始拥有大致相同的水平的重要性。作者称之为**“神经网络缓解(Neural Network Relief)”**。这就像一个团队,每个人都各司其职,而不是只有少数超级巨星而其他人都是累赘。网络变成了一台精简、高效的机器,其中每一个剩余的连接都在做有用的事情。

结果:大获全胜,微小损失

团队在几个著名的网络架构(LeNet, VGG, 和 ResNet)上进行了测试,使用了标准图像数据集,如 MNIST(手写数字)、CIFAR-10/100(小型彩色图像)以及 Tiny-ImageNet。

以下是他们的发现:

  • 对于 VGG 网络: 在 CIFAR-10 数据集上,他们成功将网络缩小了50 倍以上(保留了不到 2% 的原始参数),且几乎没有精度下降。在 Tiny-ImageNet 数据集上,他们实现了超过 40 倍的压缩(仅保留了 2.32% 的参数),而准确率仅下降了 0.03%
  • 对于 ResNet 网络: 他们实现了高比例的参数剪枝,具体而言,在 CIFAR-10 上的 ResNet-56 保留了 76.2% 的参数(意味着剪掉了约 23.8% 的参数),同时保持了非常接近原始水平的准确率。
  • 优化器的惊喜: 他们测试了两种不同的“训练教练”(优化器),即 AdamSGD。在 VGG 网络上,Adam 表现得更加激进,比 SGD 切掉了更多的连接。然而,在 ResNet 网络上,两位教练的表现相似,这表明网络类型本身与训练方法同样重要。

他们没有做的事

需要注意的是,本文并未声称什么。作者明确指出,他们的目标并不是最小化当前计算机硬件所需的数学计算量(FLOPs),尽管他们确实看到了某些减少。他们的主要焦点在于连接的数量以及它们所携带的“信号”。他们也没有声称解决了“持续学习”(在学习新任务时不忘记旧任务)的问题,尽管他们暗示这种方法是迈向这一未来目标的重要一步。

总结

这篇论文表明,我们不需要去猜测神经网络的哪些部分是无用的。通过倾听神经元的实际活动,我们可以以手术般的精准度减掉脂肪。其结果是一个更小、更简单且具有惊人鲁棒性的网络。这有点像发现只要你调对了节奏,用一个更小的引擎也能开得一样快。“神经网络缓解”的方法表明,有时,少即是多,前提是你确切知道该放手哪些部分。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →