Layers Matter: Why Continual Learning Regularization Should Be Layer-Adaptive
本文证明了标准的持续学习正则化项未能考虑到关键的逐层曲率信息,并证明了一种通过强烈保护早期层同时允许深层进行显著移动的层自适应方法,能够提升性能并减少遗忘。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,机器通过调整被称为神经网络的数字大脑内部的“旋钮”和“拨盘”来进行学习。当机器被教授一项新技能(例如识别特定类型的花朵)时,它会微调这些设置以更好地完成该任务。然而,一个被称为“灾难性遗忘”的持久问题经常发生:当机器学习新花朵时,它会无意中覆盖掉之前掌握关于狗或汽车等知识。为了阻止这种情况,研究人员开发了一些方法来轻轻地锚定机器的设置,告诉它要小心,不要移动那些对旧任务至关重要的脑部组件。最常见的方法将每一个设置都视为同等重要,无论其位于复杂结构的哪个位置,都为整个网络分配统一的保护水平。
德国人工智能研究中心与凯泽斯劳特恩-兰道大学的一支研究小组发现,这种统一的方法存在根本性的缺陷。他们发现,神经网络中的各个部分并非生而平等。某些层,特别是最初处理原始视觉数据的早期层,具有极高的敏感性;即使稍作移动,也会导致机器忘记它所知道的一切。而其他层(通常位于网络的更深处)则要稳健得多,可以自由调整而不会造成破坏。由于对每一层都采取同样的谨慎程度,现有的方法正在浪费其保护力量,它们在守护错误的部分,却让最脆弱的部分暴露在外。
研究人员首先检查了已经在大规模数据集(如用于识别图像中物体的图像集)上训练过的神经网络的内部结构。他们测量了如果扰动每一层,会对遗忘产生多大的影响。他们的测量结果揭示了一个残酷的现实:这些层的敏感度差异巨大。在某些网络中,最敏感的层比最不敏感的层要脆弱近两百倍。这种巨大的差距意味着,如果采用一种对每一层都应用相同保护强度的策略,就像试图用一张薄塑料布盖住房子来抵御洪水;它可能盖住了屋顶,却让地基完全敞开了。
为了理解为什么会发生这种情况,团队研究了网络学习过程中的数学景观。他们证明了遗忘的风险并不是均匀分布的,而是集中在早期层中的特定方向上。当机器学习一项新任务时,它自然想要改变其设置。如果机器被迫移动一个高度敏感的早期层,其造成的知识损失是巨大的。如果它移动一个更深、更灵活的层,代价则是微不足道的。现有的方法根据单个设置的平均行为来分配重要性,这些方法无法看到这个大局。它们忽略了这样一个事实:整个早期层作为一个单一且脆弱的单元在起作用,而深层则作为一个稳固且可适应的整体在起作用。
研究人员提出了一个简单但强大的解决方案:停止将网络视为一个统一的整体,而是将其视为具有不同需求的层级结构。他们制定了一条经验法则,即加强保护早期层,同时允许深层进行更多自由的移动。这种方法与许多现有系统所做的恰恰相反,因为现有系统通常对整个网络施加统一的惩罚。通过将这种新的“层自适应”策略应用于现有的学习方法,团队在几种不同类型的网络上测试了他们的想法。他们发现,通过屏蔽早期层并让深层进行调整,机器在有效地学习新任务的同时,能更好地保留旧知识。
研究结果在不同类型的网络和训练历史中表现得非常清晰。在经过大规模图像数据集预训练的网络上,新方法显著提高了机器记忆过去任务的能力。在一次使用超过两万一千张图像进行训练的网络进行的特定测试中,新方法将最终准确率提升了近百分之一,这在这一领域是一个显著的增益。有趣的是,当网络以一种使早期层特别敏感的方式进行训练时,该方法效果最好。当网络以不同的方式训练时,敏感度分布发生了变化,最优策略也随之改变,这证明了该方案并非“一劳永逸”的固定手段,而是一种能够根据网络脆弱性具体形状进行调整的灵活规则。
这项研究还强调了仅仅尝试测量每一层的精确敏感度所存在的局限性。虽然理论上建议保护程度应与每一层的精确敏感度相匹配,但研究人员发现,试图做到极其精确往往会导致结果变差,因为测量值噪声太大,且层与层之间的差异过于极端。相反,一种更平滑、更渐进的方法效果更好。通过确保保护程度从早期层到深层呈稳步递减,机器的表现明显优于旧有的统一方法。这表明,关键不在于为每一层计算出一个完美的数值,而在于理解网络脆弱性的总体方向。
这项工作改变了我们对如何让机器进行持续学习的看法。它使该领域从“神经网络的每个部分都同等重要”的观念,转向一种更细致的观点,即网络的结构决定了策略。研究人员展示了,通过尊重这些数字大脑中天然存在的敏感等级制度,我们可以构建出既能学习新事物又不会丢失旧知识的机器。研究结果为工程师们提供了一个实用的指南:如果你想让机器记住,请保护其思考过程的开端,并让其结尾部分去适应。这种基于对这些网络实际行为深度理解的视角转变,为创造更稳定、更强大的人工智能提供了一条清晰的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。