核心问题:猜测正确的规模
想象一下你正在盖房子。你知道你需要足够的空间才能住得舒适,但你并不确切知道到底需要多少个房间。
- 如果盖的房间太少,房子会显得拥挤且无法正常运作。
- 如果盖得太多,你会在空置的空间上浪费大量的建材和取暖费用。
在人工智能(AI)的世界里,神经网络就像这些房子。它们需要具有一定的“密度”(拥有许多连接)才能变得聪明,但拥有过多的连接会让它们变得缓慢且训练成本高昂。问题在于:没有人知道针对特定任务究竟需要多少个连接。 通常情况下,研究人员必须先猜一个数字,构建网络,如果失败了,就得重新开始。这就像是盖一座房子,然后拆掉,再用不同数量的房间重新建造,如此循环往复。
旧方法:“拆迁队”
长期以来,寻找合适规模的标准方法是迭代幅度剪枝(Iterative Magnitude Pruning, IMP)。
- 类比: 想象你先盖了一座拥有 100 间房的宏伟豪宅。然后,你雇佣了一支拆迁队,通过逐一拆除墙壁和移除房间的方式来缩小规模,并在每拆除几间房后测试一下房子是否仍能正常运作。
- 问题: 这种方式极其浪费。你花了大量的时间和金钱去盖那座 100 间房的豪宅,仅仅是为了把它拆掉大部分。论文指出,这种方法消耗的计算能力是训练普通网络的 3 到 4 倍。
新方法:“渐进式容量增长”(Gradual Capacity Growth, GCG)
作者提出了一种名为**渐进式容量增长(GCG)**的新方法。与其盖一座豪宅然后再拆掉它,不如从一个微小的、稀疏的“种子”房屋开始,并逐个增加房间,直到它恰到好处为止。
它是如何工作的:“路径生长”园丁
该方法的核心是一个名为 PathGrow 的工具。你可以把它想象成一位聪明的园丁,他准确地知道在哪里种植新的藤蔓。
- 从小开始: 他们从一个非常小的网络(一个稀疏的种子)开始。
- 寻找高流量路径: 园丁观察现有的网络,查看哪些“路径”(连接)承载着最重要的信号(就像繁忙的高速公路对比寂静的小径)。
- 聪明地添加连接: PathGrow 不会随机添加连接,而是将新连接添加到最繁忙、最重要的路径上。这有助于网络学习得更快。
- 避免瓶颈: 为了防止房子变成一个交通拥堵的狭窄隧道,园丁会加入一点随机性。这确保了网络保持多样性,不会陷入“瓶颈”。
如何知道何时停止
他们如何知道何时停止生长?他们不需要靠猜。
- 他们观察网络性能随增长的变化情况。
- 他们使用一个简单的数学规则(指数曲线)来预测何时增加更多房间将不再能显著改善房屋性能。
- 一旦曲线趋于平缓(意味着“收益递减”),他们就会停止。此时,他们已经找到了“运行密度”——即那个既能完美运作又是最小的规模。
结果:更快、更便宜
论文在标准的图像识别任务(例如识别照片中的猫、狗或汽车)上测试了这种方法。
- 性能: GCG 方法找到的网络几乎与“拆迁队”(IMP)找到的网络一样聪明。
- 成本: 然而,GCG 要便宜得多。它仅需要大约 1.5 倍于标准训练运行的计算能力,而旧的拆迁方法则需要 3 到 4 倍。
- 无需预先猜测: 最大的胜利在于,他们不需要预先猜测最终的规模。网络会自我生长,直到达到满意状态。
局限性(不足之处)
作者坦诚地说明了该方法目前还不能做到的事情:
- 不够极端: 因为他们只“添加”连接而从不“移除”坏连接,所以他们最终得到的网络比拆迁队找到的网络稍微大一些(更稠密)。他们无法达到剪枝法所能实现的“极端稀疏性”(极小尺寸)。
- 特定的规则: 他们的“园艺”规则在标准图像网络上表现良好,但对于工作原理不同的新型 AI(如语言模型)可能需要特殊的调整。
- 硬件现实: 节省的开支是基于数学运算计算的,而不一定等同于在计算机芯片上的实际运行时间,因为芯片可能存在其他瓶颈。
总结
把 GCG 看作是一个聪明的、循序渐进的建造者。它不是先盖一座摩天大楼再拆掉来寻找合适的大小,而是从一个小棚屋开始,只在需要的地方增加房间,并在房子变得完美的那一刻停止。它节省了时间,节省了金钱,并且在不需要预先知道答案的情况下,找到了一个非常好的解决方案。
技术摘要:用于稀疏网络发现的渐进式容量增长
1. 问题陈述
稀疏神经网络学习的核心挑战在于,网络密度(稀疏度)与任务性能之间的关系通常是未知的且依赖于任务的。虽然性能通常会在某个“运行密度”(即产生接近稠密模型精度的最小密度)之后趋于饱和,但识别这一密度通常需要昂贵的试错过程或稠密预训练。
现有方法存在特定的局限性:
- 迭代幅度剪枝 (IMP): 需要稠密预训练和多次重训练周期,其产生的浮点运算量 (FLOPs) 是稠密训练的 3–4 倍。
- 动态稀疏训练 (DST) 与初始化剪枝: 这些方法要求预先设定目标稀疏度,从而无法在不进行详尽搜索的情况下发现最优运行密度。
- 基于增长的扩展: 先前的研究方法通常通过扩展宽度来收敛至稠密模型,将稀疏性视为一种临时状态而非最终的架构属性。
本文认为,发现运行密度是一个独立于优化固定稀疏预算的问题。其目标是在无需稠密预训练或预设稀士目标的情况下,通过建设性地增长稀疏网络来寻找性能饱和的最小密度 ρ∗,同时最小化累积训练成本。
2. 方法论:渐进式容量增长 (GCG)
作者提出了 渐觉式容量增长 (Gradual Capacity Growth, GCG),这是一种建设性的从稀疏到稠密的训练框架。GCG 从一个稀疏种子开始,逐步增加连接,直到估计出性能饱和为止。
核心组件:
- 初始化: 网络使用 PHEW [19] 在低密度 (ρinit) 下进行初始化,这提供了一个高性能的起点,同时避免了节点断连问题。
- 增长机制 (PathGrow):
- 动机: 基于神经切线核 (NTK) 分析,参与高权重路径的连接可以加速收敛。然而,单纯追求最大化路径权重可能会造成瓶颈(如隐藏层过窄),从而损害泛化能力。
- 路径权重幅度乘积 (PWMP): 为了高效识别高信号路径,GCG 计算潜在边的得分 S(i,j)。该得分是源节点“复杂度”(从输入到节点 i 的总 PWMP)与目标节点“通用性”(从节点 j 到输出的总 PWMP)的乘积。该计算通过在具有绝对值权重的网络上进行单次前向和后向传播完成。
- 概率采样: 为了避免确定性地添加最高分边的瓶颈问题,PathGrow 根据与 PWMP 得数成比例的概率对新连接进行采样。这使增长向高信号路径倾斜,同时保留了结构多样性。
- 训练调度:
- 交替增长: 增长发生在训练过程的早期阶段,并与短期的“粗略训练”阶段交替进行。这使得网络能够在梯度变得嘈杂之前暴露有用的路径权重信号。
- 指数增长: 密度在每一步按当前密度的比例 (Δρk=γ⋅ρk) 增加,从而促进对密度-性能景观的高效探索。
- 权重初始化: 新连接使用零权重进行初始化,以避免噪声并允许梯度下降学习适当的值。
- 停止准则:
- 由于在每个中间密度下并不进行大规模训练,该方法通过拟合指数饱和曲线 (P(Gk)=P0+A(1−e−βρk)) 来处理观察到的性能-密度轨迹。
- 估计出的运行密度 ρ^∗ 为拟合曲线达到最大预测提升 95% 时的最小密度。
3. 主要贡献
- 建设性框架: GCG 引入了一种从稀疏到稠密的范式,在训练过程中发现运行密度,消除了对稠密预训练或预设稀疏预算的需求。
- PathGrow 算法: 一种概率增长规则,通过平衡快速收敛(通过高 PWMP 路径)与结构多样性(通过随机采样)来避免瓶颈。
- 高效性: 该方法估计运行密度的累积训练成本显著低于迭代剪枝。
- 实证验证: 在 CIFAR、TinyImageNet 和 ImageNet 上的广泛实验表明,GCG 能够识别出在适度密度下达到近乎稠密性能的稀疏子网络。
4. 结果
- 性能 vs. 密度: 在 CIFAR 和 TinyImageNet 上,GCG 找到的子网络在密度约为 30–50% 时,其性能能匹配或超过迭代幅度剪枝 (IMP-C)。虽然 IMP-C 在较低密度(约 15–20%)下达到最优精度,但 GCG 在适度密度下也能达到相当的精度。
- 基准对比:
- PathGrow vs. 其他方案: 在大多数基准测试中,PathGrow 的表现优于或等同于随机增长 (RG) 和基于梯度的增长 (GG)。它比 GG 更高效,因为 GG 需要为缺失的连接进行昂贵的梯度估计。
- GCG vs. PHEW/RigL: 当训练预算归一化时,GCG 的表现始终优于单次剪枝 (PHEW) 和动态稀疏训练 (RigL),凸显了迭代增长的优势。
- ImageNet: 在带有 ResNet-50 的大规模 ImageNet 上,GCG 比动态方法(如 RigL 和 GSE)落后约 2 个百分点。作者将其归因于仅增长的方法无法剪除并重新分配那些随时间变得不再有用的连接。
- 训练成本: GCG 的效率显著高于 IMP-C。在 CIFAR 基准测试中,GCG 实现相当性能所需的 FLOPs 大约为稠密训练运行的 1.5 倍,而 IMP-C 则需要 3–4 倍。
5. 意义与局限性
意义:
本文不仅将稀疏学习视为一个优化问题,更将其视为对网络如何生长为高性能子网络的探索。GCG 提供了一种实用的机制,用于在有限的优化预算下探索精度与密度的权衡。它作为剪枝的一种补充方法,特别适用于在无需高昂稠密预训练成本的情况下,探索中度稀疏领域的稀疏网络。
局限性(由作者指出):
- 稀疏性上限: 仅增长的方法无法达到极端稀疏水平,因为低重要性的连接从未被显式移除。
- 架构特定性: PWMP 启发式算法是为前馈和卷积结构定制的,不能自然地扩展到注意力机制(查询-键矩阵)中,因为在这些结构中,量级与功能重要性是脱节的。
- 效率指标: 成本分析是基于算法 FLOPs 而非实际运行时间,忽略了可能抵消增益的硬件特定开销(例如,稀疏内存访问、内核启动开销)。
- 领域范围: 实验局限于视觉基准测试;在大规模 NLP 或语音领域的验证仍是未来的工作。
作者总结道,GCG 代表了向更广泛的基于增长的研究议程迈出的重要一步,为破坏性剪枝和固定预算的动态训练提供了一种建设性的替代方案。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。