在人工智能领域,计算机通过调整其内部设置以最小化误差来进行学习,这一过程是由被称为“优化器”的数学工具驱动的。这些工具就像是在广阔且多雾的山谷中寻找最低点的徒步旅行者,根据脚下地面的坡度来迈出步伐。几十年来,标准的方法是只观察即时的坡度,而忽略了前一时刻发生的情况。然而,自然界很少如此简单。许多自然模式,从海岸线的锯齿状边缘到心跳的波动节奏,都具有一种在每个尺度上不断重复的、粗糙且自相似的复杂性。数学家称之为分形几何。最近,研究人员开始思考,如果将这两个想法——粗糙的多尺度模式,以及用于衡量它们的数学工具——结合起来,是否能帮助计算机更好地学习。具体而言,他们询问使用“分形”激活函数(这种函数将这种复杂的粗糙结构注入神经网络)与“分数阶”优化器(这种优化器旨在记录更长历史记录而非仅仅对当下做出反应)进行配对,是否会效果更好。
一个研究小组试图通过建立一个统一的实验框架来测试这个想法,以观察这两个概念如何相互作用。他们并非仅仅凭空猜测,而是构建了一个包含两个不同阶段的严谨测试。首先,他们创建了受控的二维地形,模拟分形几何的粗糙感。其中一些地形平滑且可预测,而另一些则被刻意加入了层层微小的、重复的振荡,以模拟现实世界数据的复杂性。他们将二十一种不同的优化方法送入这些表面,以观察哪些方法能最可靠地找到最低点。在第二阶段,他们转向更真实的设置,在十个用于分类任务的公开数据集上训练神经网络。他们将这些网络与四种特定类型的分形激活函数配对,并针对同样的二十一种优化器进行了测试,每项实验运行了四十次,以确保结果并非偶然的运气。
结果揭示了一个关于这些工具如何协同工作的令人惊讶的真相。在受控的粗糙地形上,那些能够记住过去步骤的方法表现得异常出色。当地形充满了分形所创造的那种持久且重复的模式时,那些回顾历史的优化器能够比那些仅观察即时坡度的优化器更有效地穿越噪声并找到目标。然而,当研究人员转向神经网络实验时,情况发生了剧烈的变化。在训练真实计算机模型的混沌环境中,数据是以小规模、带有噪声的批次进行处理的,同样的基于记忆的方法往往会陷入困境。那种在平滑、确定性表面上发挥作用的机制——即回顾之前的步骤——往往会在现实世界的训练中放大随机噪声,导致不稳定或进度缓慢。
研究发现,最成功的方法并不是盲目地在所有地方应用记忆或分形结构,而是寻找特定的、精心的配对。研究人员发现,一种特定的优化器——它根据数学规则调整学习步长的大小,而不存储长期的梯度历史——在几乎所有数据集上都被证明是最稳健且最有效的。这种方法在与一种增加适度粗糙度的特定分形激活函数相结合时,始终能产生最好的结果。相比之下,那些依赖于存储和平均过去梯度的法,在神经网络训练的噪声环境中往往表现不佳,尽管它们在受控表面上取得了成功。
最终,这篇论文表明,虽然分形激活函数和分数阶优化器在数学上是兼容的,并且在正确匹配时可以非常强大,但它们并不是万能的解决方案。益处来自于激活函数、优化器设计以及数据性质之间的特定组合。研究人员表明,仅仅为一种方法贴上“分形”或“分数阶”的标签并不能保证更好的性能;事实上,不加区别地使用基于记忆的技术在噪声环境下可能会产生负面影响。相反,最实际的路径是将激活函数和优化器的选择视为一个共同决策,选择适合当前问题的特定配对。研究结论指出,对于大多数实际应用而言,一种在不过度依赖过去历史的情况下局部调整步长的方法,在速度、稳定性和准确性之间提供了最佳的平衡,这证明了有时,带着正确的工具向前看,比向后看更有用。
技术摘要:分形激活函数与分数阶优化器的结合
问题陈述
神经网络训练经常遇到具有不规则、多尺度结构的损失景观(loss landscapes)。虽然分形几何为描述此类粗糙性提供了数学框架,且分数阶微积分提供了分析非局部行为和记忆效应的工具,但这两个领域在神经网络研究中历史上一直独立发展。
以往的研究已经确立了分形激活函数(源自 Weierstrass 和 Blancmange 型级数)可以为网络注入多尺度非线性表示,从而可能增加表达能力。另外,分数阶优化器被提出用于扩展一阶梯度下降,通过引入非整数阶导数来引入记忆效应和非局部行为。然而,这两个组件之间的相互作用——即设计用于具有分数阶记忆原理的优化器是否适用于训练使用分形激活函数的网络——仍是一个未被探索的问题。此外,分数阶优化器在显式被分形结构扰动的目标景观上的有效性也尚未得到系统性的评估。
研究方法
本研究采用两阶段实验框架来调查分形激活与分数阶优化器之间的相互作用。
1. 数学基础
作者建立了 Weierstrass 型函数与分数阶导数之间的理论联系。他们证明了对于具有粗糙度指数 γH 的 Weierstrass 型函数,阶数为 ν<γH 的分数阶导数存在,并将该函数映射为另一个具有降低指数的 Weierstrass 型函数。离散 Grünwald–Letnikov (G-L) 公式被确定为这些导数的计算机制,它通过具有代数衰减系数的加权历史和来实现离散化。该核函数构成了基于记忆的优化器的基础,而截断的 Weierstrass 级数则构成了分形激活的基础。
2. 实验设计
研究评估了 21 种优化器,涵盖 5 个组别,以及 4 种分形激活函数(外加标准基准),并在两个不同的任务上进行了测试:
任务 A:受控表面优化
- 表面: Ackley 和 Himmelblau 基准函数。
- 变体: 标准形式以及通过 Weierstrass 型级数 (PJ) 扰动产生的加性变体,以引入受控的多尺度粗糙性。
- 指标: 最终损失、最佳损失、成功率(达到已知极小值)、到极小值的距离以及运行时间。
- 设置: 每个优化器在每个表面变体上进行 40 次重复实验。
任务 B:神经网络分类
- 数据集: 十个来自 OpenML 的公共分类数据集(如 Iris, Wine, Ionosphere, Vehicle Silhouettes)。
- 架构: 前馈多层感知机 (MLP)。
- 激活函数: 四种选定的分形激活函数(调制 Blancmange, 衰减余弦, 修改后的 Weierstrass–Tanh, Weierstrass–Mandelbrot x+sin)以及 ReLU 和 Tanh。
- 设置: 每种配置(优化器 × 激活函数 × 分数阶)进行 40 次重复实验。
3. 优化器家族
21 种优化器分为以下类别:
- 经典基准: SGD, RMSprop, Adam, Adadelta。
- Herrera 型(局部缩放): 使用受 Caputo 启发、基于幂律因子的当前梯度 fν(gt) 对当前梯度进行重缩放,而不存储历史记录(例如 FSGD, FAdam)。
- 基于记忆(显式历史): 用有限历史 G-L 梯度 gt(ν) 替换当前梯度,并通过下降保障和范数匹配进行稳定(例如 MemoryFSGD, MemoryFAdam)。
- 自适应记忆型: 将普通梯度与经过范数匹配的分数阶梯度结合,通过一个受限的、受稳定性与损失控制的混合系数 λt 进行组合(例如 AdaptiveMemoryFSGD)。
- 相关工作: 包括 AdaGL, FCSGD_GL 以及 AOFGD 的变体。
核心贡献
- 统一的理论框架: 本文明确地将 Weierstrass 型函数的分析与优化器中使用的离散 G-L 构建联系起来,证明了分形激活与分数阶优化器是同一个多尺度数学机制的不同实现。
- 新的自适应框架: 引入了 AdaptiveMemory 系列优化器。这些方法保持分数阶 ν 固定,但通过自适应信任系数 λt 来控制记忆项的贡献,从而在记忆被认为不可靠时,能够精确地退化为经典优化器。
- 系统的实证比较: 在分形扰动表面和神经网络分类任务上对 21 种优化器进行了全面的评估,提供了关于不同分数阶机制(局部缩放 vs. 显式记忆)在不同条件下表现的细粒度视图。
结果
表面优化实验
- 优化器家族的主导地位: 基础优化器家族(SGD vs. RMSprop/Adadelta)是决定性因素。无论是否存在分数阶修改,SGD 类方法在 Ackley 和 Himmelblau 上均优于其他方法。
- 分形扰动的影响:
- 在 Himmelblau 上,加性分形扰动降低了所有方法的可靠性,但有利于自适应阶数方法(AOFGD_Adam)和基于 Adam 的变体。
- 在 Ackley 上,扰动创造了低值局部区域,使得基于记忆和随机扰动的 SGD 变体(如 FCSGD_GL, MemoryFSGD)能够利用这些区域,尽管由于平坦的外围平台,整体成功率仍然较低。
- 记忆 vs. 缩放: 在受控表面上,显式梯度记忆(基于记忆组)被证明是可靠的,特别是在存在持续振荡结构的扰动景观中。
神经网络分类实验
- 分形激活函数: 在 10 个数据集中的 8 个中,分形激活函数占据了前 15 名的席位,并在 6 个数据集中提供了表现最佳的配置。然而,在所有优化器配置的平均水平下,标准激活函数(ReLU, Tanh)的表现往往优于分形激活。Modified Weierstrass–Tanh(亚临界型)是最一致的分形激活函数,而超临界型的 Weierstrass–Mandelbrot 变体表现通常较差。
- 优化器性能:
- Herrera 型(局部缩放): 这些方法整体表现最强,在 6 个数据集中获得了唯一的最佳配置,并在第 7 个数据集中并列第一。它们提供了高性能且计算开销极低。
- 显式记忆(GL-Memory): 这些方法在分类任务中表现较差,经常跌出前 15 名,并表现出高方差。作者将其归因于在小批量(minibatch)训练中放大了采样噪声,这与它们在确定性表面上的成功形成了对比。
- 自适应记忆: 该组相比纯记忆方法表现出更好的鲁棒性,在排名中更高,并在两个数据集(Climate-Model Simulation Crasches, Glass Identification)中胜出。
- 相互作用: 最佳结果是通过特定的配对(例如 Modified Weierstrass–Tanh 与 Herrera 型优化器)实现的,而非通用地应用分形组件。没有一种分数阶 ν 是普遍最优的;获胜的配置使用的 ν 值为 {0.75,1.25,1.50}。
意义与主张
本文声称,分形激活函数和分数阶优化器是针对训练问题不同部分(表示 vs. 优化动力学)的数学兼容修改,但它们的结合只有通过特定的、可识别的配对才能产生收益,而非作为通用的替代方案。
- 机制 vs. 排名: 研究强调了一个关键的分歧:显式梯度记忆在确定性、多尺度景观(表面实验)上有益,但在随机小批量训练(分类实验)中会成为负担,因为它会放大噪声。
- 实践指导: 作者建议:
- 联合选择激活函数、优化器公式和分数阶。
- 将 Herrera 型局部缩放 作为默认的分数阶扩展,因为它成本极低且具有精确的经典极限。
- 将分数阶视为需要调优的离散超参数。
- 仅在低噪声且存在持续多尺度结构的设置中,或仅通过有界的自适应混合(所提出的 λt 框架)使用显式梯度记忆。
研究结论认为,虽然统一的框架为进一步研究提供了可复现的基础,但数据并不支持无差别地使用显式梯度记忆,且“最佳”方法高度依赖于特定的数据集以及激活-优化器配对。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。