Parameter-Level Attribution of Symmetry in Trained Networks Though Parameter-Wise Functional Sensitivity
本文确立了实现函数对称性的光滑参数空间作用存在的充分必要条件,即该对称性的切轨道位于网络函数敏感性的图像之内,从而提供了一个框架,用以识别在已训练网络中,能够遵循对称轨道或下降至等变子空间的局部参数方向。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代人工智能的广袤版图中,神经网络常被视为“黑盒”:这些复杂的系统接收数据并产生答案,却很少能提供关于其如何得出结论的见解。这些系统由数学连接层构建而成,每一层都包含一个特定的数值,即参数,机器在训练过程中会对这些参数进行调整。研究这些系统的科学家面临的一个核心问题是:经过训练的网络内部结构是否反映了其所学习世界的运行规则。如果一个网络学习了一项涉及对称性的任务——例如,识别出形状在旋转后看起来依然相同——那么网络的内部布线是否确实包含了一个镜像这种旋转的机制?研究人员长期以来一直怀疑答案是肯定的,但要证明究竟是网络的哪些部分负责这种行为,仍然是一个难以捉摸的问题。这种不确定性至关重要,因为理解这些模型的内部几何结构,可以揭示它们是如何泛化知识的,以及它们是否真正理解了它们被训练去模拟的物理定律。
来自牛津大学和海德堡理论研究所的研究团队开发了一种观察这些网络内部的新方法,超越了简单的统计学,转而考察参数如何影响网络输出的精确局部几何结构。他们专注于一个被称为“函数敏感度”(functional sensitivity)的概念,该概念衡量的是当单个内部数值发生微小变化时,网络的最终答案会改变多少。通过绘制这些微小的变化,研究人员创建了一幅详细的图像,展示了网络输出可以移动的方向。他们提出了一个具体的问题:如果一个网络学习了一个具有已知对称性的函数,那么这种对称性是否可以追溯到网络参数内部的一种特定运动?换句话说,是否存在一条穿过网络内部设置的路径,能够精确地对应于它所执行函数的旋转或平移?
研究人员将此表述为一个“提升问题”(lifting problem),即询问在最终输出中看到的平滑变换是否可以被“提升”回网络内部设置中的平滑变换。他们发现,为了使这种运动存在,由于对称性而导致函数发生变化的各种方向,必须能够通过网络当前的参数来实现。如果网络的内部设置过于僵化或对齐不良,那么输出中的对称性就无法通过移动参数来完全实现。为了测试这一点,该团队开发了一种计算最佳参数移动方向的方法,以要么遵循对称性,要么纠正对称性的缺失。他们识别出了两条截然不同的路径:一条是让网络沿着对称轨道移动,从而在不改变其基本性质的情况下有效地旋转所学习的函数;另一条是让网络向完美对称的状态移动,从而减少函数未能遵循对称性时的任何误差。
为了验证这些理论方向在实践中是否有效,研究人员在两个不同的任务上训练了神经网络。首先,他们使用了一个旨在区分完整圆圈与楔形切片的简单图像分类器。随后,他们将计算出的方向应用于训练好的网络。当他们沿着对称路径移动网络参数时,网络的决策边界正如预测的那样精确地旋转,在改变其方位的同时保持了准确性。当他们沿着趋向对称性的路径移动参数时,网络的输出变得更加符合旋转规则,减少了其行为中的误差。至关重要的是,他们发现只有在每次移动时重新计算方向,这些方向才能可靠地发挥作用。如果他们在开始时计算一次方向并保持固定,网络很快就会偏离航道,无法维持对称性或进行修正。这表明,参数与对称性之间的关系是高度局部的,并且随着网络的移动而发生变化。
该团队在更复杂的系统中重复了这一过程,该系统旨在学习一个被称为哈密顿系统(Hamiltonian system)的旋转势能的物理学。尽管网络的架构并未显式强制其遵循旋转对称性,但训练后的网络仍然学习到了底层的物理规律。当研究人员在此应用他们的方法时,观察到了同样的模式:每一步都重新计算方向,可以使网络旋转其学习到的势能或使其更具对称性;而保持方向固定,则会导致逐渐偏离正确行为。这项研究表明,虽然神经网络可以学习编码对称性,但负责这种行为的具体参数并非静态的。追踪这些对称性回到网络内部结构的能力,取决于对参数局部几何结构的不断重新评估。研究结果表明,对称性的内部表示是一个动态特征,需要持续的调整才能与网络已学习遵循的数学规则保持一致。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。