✨ 要点🔬 技术摘要
想象一下,你正试图教一个机器人画画,但这个机器人很笨拙,总是把画布弄脏。为了解决这个问题,你需要一套指令——一个“食谱”——告诉机器人应该如何精确地调整它的笔触,从而更接近杰作。在人工智能的世界里,这些指令被称为“权重更新规则”。它们是计算机通过从错误中学习所采取的数学步骤。几十年来,科学家们一直在手工制作这些食谱,加入像“动量”(让机器人保持向好的方向移动)或“自适应速率”(在遇到困难时减速)这样的成分。但这里有一个大问题:我们是否错过了一个更好的食谱?有没有一种更高效的教学方式,是人类尚未想到过如何写下来的?这就是“符号回归”的游乐场,这种技术就像是一个数字炼金术士,在无穷无尽的数学符号组合中进行搜索,以寻找完美的公式。
在这篇论文中,两位研究人员决定让计算机来掌勺。他们没有去猜测哪些成分能做出最好的优化器,而是使用了一种叫做符号回归 的方法来搜寻新的权重更新规则。可以把它想象成一种遗传算法,培育出数百万个不同的数学表达式,并测试每一个表达式,看看它是否能帮助小型神经网络比人类设计的最佳规则更快、更准确地完成任务。他们不仅仅是在微调现有的食谱;他们让计算机利用包含常见数学运算(如加法、乘法或开平方根)和标准成分(如梯度和动量)的工具箱,发明了全新的规则。
结果出人意料地美味。在 30 个不同的学习挑战中,计算机发现的规则在 25 个案例 中击败了人类调优的最佳优化器。当计算机找到获胜者时,与标准方法相比,它平均减少了 44.47% 的误差(以均方误差衡量)。然而,论文谨慎地指出,这些实验是在小型、简单的网络上进行的,且仅运行了 10 个 epoch (一个训练轮次)。作者认为,虽然这些新规则对于这些特定任务而言既简洁又有效,但我们尚不知道它们是否能在大规模深度学习的复杂现实世界中站得住脚。
发现的规则并不都长得一样。有些很简单,而另一些则是三角函数、指数和有理表达式的狂野混合。然而,许多规则都有一个共同的精神:它们将动量(就像一个加速滚动的球)与自适应归一化(根据过往表现调整步长)结合在一起。研究人员发现,计算机可以在没有被明确告知的情况下,偶然发现这些有效且具有可解释性的公式。这表明,“如何学习”的空间是广阔的,充满了人类直觉可能会忽略的隐藏瑰宝。但在我们丢掉旧食谱之前,作者警告说,这些发现是一个充满希望的开始,而非最终的胜利。这些规则需要在更大的网络和更长的训练周期中进行测试,以看看它们究竟是 AI 学习的未来,还是仅仅是解决小谜题的一种巧妙技巧。
技术摘要:利用固定深度的符号回归搜索前馈神经网络权重更新规则的空间
问题陈述
训练前馈神经网络依赖于权重更新规则(优化器)来最小化误差函数。虽然标准优化器如 SGD、Momentum、Adam 和 AdaGrad 被广泛使用,但它们通常是基于启发式设计的。作者研究了符号回归是否能够算法化地发现显式的、紧凑的权重更新规则,使其在小规模符号回归基准测试上的表现经验性地优于这些经过超参数调优的手工设计优化器,且不会显著增加计算复杂度。
研究方法
搜索空间与表示
本研究利用符号回归 来搜索表示为固定深度表达式树的权重更新规则。
算子: 搜索空间包含一组固定的一元算子(例如 ln、exp、sin、tanh、sqrt)、二元算子(+、-、*、/、^)以及特定的超参数(η、θ、ϵ、γ、β1、β2)。
操作数: 表达式树的叶节点源自现有优化器中常见的量。这些包括当前权重、梯度、速度项、梯度的移动平均值(一阶和二阶矩)以及累积平方梯度。操作数的定义反映了 Heavy-Ball、Nesterov、AdaGrad、RMSProp、Adadelta、Adam 和 AdamW 的机制。
约束: 所有生成的规则都被限制在固定的表达式树深度为 5。
实验设置
基准测试: 评估使用了 10 个符号回归基准函数(来自 Hemberg 等人的 5 个和来自 Feynman 等人的 5 个),这些函数具有不同的表达式树深度和复杂度。
架构: 为每个基准测试测试了三种不同的全连接前馈神经网络架构,通过改变层数以及使用 sigmoid 与线性激活函数进行变化。这导致了 30 个独特的基准/网络组合。
基准对比: 在进行符号回归之前,对建立的优化器(Gradient Descent、Heavy-Ball、NAG、AdaGrad、RMSProp、AdaDelta、Adam、AdamW)进行网格搜索,以针对每种组合建立尽可能好的基准性能。
进化过程: 使用遗传编程(GP)算法进化候选权重更新规则的种群。
种群: 每个线程的最大规模为 100 个候选者。
评估: 通过使用候选规则训练一个随机初始化的神经网络正好 10 个 epoch 来评估候选者。其适应度指标是均方误差(MSE)。
种子初始化: 随后的实验尝试使用在之前基准测试中发现的规则来为种群提供种子,但如果种子初始化未能产生具有竞争力的结果,则会退回到随机种群。
终止条件: 如果改进变得微不足道,或者找到了 100 个优于基准的表达式,则停止运行。
核心贡献
优化器的经验性发现: 本文证明了符号回归可以发现显式的权重更新规则,其性能优于经过超参数调优的标准优化器。
紧凑性与可解释性: 被发现的规则在结构上是紧凑的(固定深度)且具有可解释性,尽管没有被显式约束为这些形式,但它们通常结合了可识别的特征,如自适应归一化、类动量项和非线性变换。
搜索空间探索: 本研究探索了一个巨大的潜在方程空间(估计对于给定深度而言,拥有约 ≈ 1.71 × 10 65 \approx 1.71 \times 10^{65} ≈ 1.71 × 1 0 65 个唯一的规则)以寻找有效的动力学机制,揭示了多个在代数上不同的表达式可以实现相当的性能。
结果
成功率: 在 25 出 30 个基准/神经网络组合中,符号回归程序发现的更新规则优于经过超参数调优的既有优化器。
性能增益: 在这 25 个改进的案例中,总体的均方误差(MSE)降低了 44.47% 。
失败案例: 失败的 5 个案例集中在最大的神经网络架构(Neural Network 3)中,这表明随着模型复杂度的增加,发现的规则可能会变得竞争力下降。
结构多样性: 表现最好的发现规则并未收敛到单一的符号形式。然而,四个“规范表达式特征”在多个基准测试中反复出现,它们都包含了累积梯度统计量。许多规则利用了涉及移动平均值的非线性(三角函数、双曲函数、指数函数)和有理表达式。
重要性与局限性
作者将这项工作定位为一项初步研究 ,而非对深度学习优化器的决定性基准测试。
重要性: 结果表明,符号回归是一种轻量级的机制,用于发现紧凑、显式且高性能的优化器变体。它强调了有效的优化动力学即使在功能形式随任务显著变化时,也可能允许低复杂度的符号表示。
局限性: 该研究受限于在小型神经网络上仅训练 10 个 epoch 的符号回归任务,而非大规模机器学习数据集或分类任务。该搜索是随机性的,且发现的规则缺乏理论上的收敛保证。
未来展望: 论文结论指出,仍需在更大的架构、更长的训练周期以及标准的深度学习基准测试上进行进一步验证。未来的工作还应纳入复杂度惩罚、稳定性约束以及用于确保发现的优化器既高性能又可分析的后验代数简化。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。