← 最新论文
🤖 machine learning

Learning reshapes power-law anisotropy in internal representations

本文通过论证在线性与非线性网络中,特征学习如何通过输入统计特性与任务结构的动态相互作用,驱动谱指数发生非单调演化(不同于谱指数保持静态的机制),从而阐明了神经表示中幂律各向异性出现的机制。

原作者: Asahi Nakamuta, Jun-nosuke Teramae

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Asahi Nakamuta, Jun-nosuke Teramae

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

神经网络作为现代人工智能背后的引擎,常被描述为将原始数据转化为复杂决策的“黑盒”。为了理解其运作机制,科学家们会深入观察其内部的“内部表示”——即网络在处理信息时所创建的高维模式。衡量这些模式形状的一种关键方法,是观察不同信息方向的重要性是如何分布的。在许多系统中,从小鼠的大脑到最先进的语言模型,这种分布都遵循一个特定的规则:少数方向承载了海量的信息,而其余方向承载的信息则逐渐递减,并遵循一种被称为“幂律”的可预测数学曲线。这种不均匀性(或称各向异性)被认为对于网络如何高效学习和泛化至关重要。长期以来,研究人员一直假设这种模式仅仅是网络所接收数据的静态反映,就像输入数据留下的指纹一样。然而,一项新的研究挑战了这一观点,认为这种模式不仅是继承而来的,更是由学习过程本身主动重塑的。

京都大学的一个研究小组致力于揭示这种重塑过程究竟是如何发生的。他们专注于一个简化的神经网络模型——一个具有宽隐藏层的两层系统——并将其置于“教师-学生”场景中。在这种设定下,学生网络试图通过使用已经具备幂律结构的数据,来学习由一个“教师”定义的任务。研究人员想要知道:学生网络是仅仅复制教师的模式,还是学习的行为本身改变了内部表示的几何结构?通过从数学上求解控制网络随时间变化的方程,他们发现答案完全取决于网络是如何被训练的。他们发现,网络并不会稳定在单一、固定的模式中;相反,其内部信息的形状是动态演化的,在学习过程中会经历不同的阶段。

研究表明,这些模式的演变并非一条直线,而是一场穿越不同机制的旅程。当网络处于“特征学习”模式进行训练时(即它通过主动重组其内部结构来解决任务),信息的模式会经历剧烈的转化。最初,网络的内部状态镜像了输入数据的特征。但随着学习的开始,模式发生了偏移。研究人员发现,网络会经历多达四个不同的组织阶段。在学习的最早期阶段,模式变得更加倾斜,信息在少数方向上的集中度变得更高。随着学习的持续,这种陡峭程度逐渐放缓,模式最终稳定在一个新的、稳定的形状上,而这个形状是由教师要求网络执行的具体任务决得多。这个新形状是原始数据结构与任务需求的一种融合,导致最终形成的模式既不同于原始数据,也不同于初始状态。

至关重要的是,研究人员证明,这种动态重塑只有在允许网络深度学习特征时才会发生。如果网络是在一种几乎不改变其内部结构、主要依赖其初始随机设置的机制下进行训练,那么模式就会保持冻结状态。在这种状态下,内部表示几乎与开始时完全一致,仅仅反映了输入数据,而没有发生任何显著的重组。这一区别至关重要,因为它证明了在真实神经网络中观察到的幂律各向异性并非仅由数据本身导致的必然结果。相反,它们是输入的统计特性与特定学习任务目标之间特定且主动的相互作用的结果。

为了确保这些发现不仅仅是其简化数学模型的特例,该团队在更复杂的、行为更接近现实世界人工智能的非线性网络上测试了他们的理论。结果证明,即使在这些更真实的系统中,在特征学习机制下,内部表示也会在训练期间改变其形状,而在网络主要依赖其初始随机设置的机制下,则保持静态。这项研究表明,在生物脑和人工大脑中观察到的幂律各向异性是一种流动的属性,不断被学习过程所改写。它不是数据的固定特征,而是系统适应其环境的一种动态签名。这项工作为网络内部状态的微观几何结构是如何锻造而成的提供了一个清晰的解析性解释,为理解系统所见数据与其发展的智能之间的关系提供了一种全新的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →