✨ 要点🔬 技术摘要
深度学习是驱动从语音助手到医学影像等一切技术的背后力量,它依赖于被称为神经网络的人工大脑。为了教导这些网络,研究人员必须选择一种被称为“优化器”的数学工具。可以将优化器想象成学生在学习时用来纠正错误的一套规则;它决定了在每获得一条新信息后,要如何调整其理解程度。多年来,标准的做法是在训练开始之初就选定一套规则,并一直沿用这套规则直到任务完成。这种选择通常是基于猜测或习惯做出的,然而,这是一个至关重要的决定,它能决定最终的模型是卓越非凡还是平庸之辈。问题在于,对于课程开始阶段最合适的规则集,未必是课程结束时最合适的;而试图通过逐一测试每种可能性来寻找完美的规则,其成本极其高昂,需要大量的计算时间和算力,而这些资源往往会被浪费。
来自 insureAI 和苏黎世联邦理工学院(ETH Zürich)的一个研究小组决定探索是否可以让这个过程变得更聪明、更廉价。他们没有在训练开始前锁定单一优化器,而是开发了一种名为“重复优化器重采样”(Repeated Optimizer Resampling,简称 ROR)的方法。想象一场长跑比赛,教练不再是为整个赛程分配一名跑者,而是在每隔几英里时进行一次检查。在每个检查点,教练会派出由不同策略组成的小型团队,让他们在前方短距离内进行冲刺。教练观察谁在这一小段路程中表现最好,保留那名跑者,并让他继续进行下一段赛程,而其他跑者则被送回家。这个过程在整个训练过程中不断重复,从而允许团队随着旅程的推进切换策略。研究人员在四项不同的任务上测试了这个想法:两项涉及手写数字和衣物图像分类的任务,以及两项涉及从复杂数据表中预测保险索赔的任务。
结果显示,这种动态方法效果显著,但在所需精力方面却有一个令人惊讶的转折。研究人员发现,短期的“侦察”跑并不需要很长就能发挥作用。事实上,在决定保留谁之前,仅让跑者向前迈出一步,就足以找到一条表现几乎与通过穷举测试所有选项所找到的最佳固定策略不相上下的路径。通过使用这种“一步侦察”法,该团队仅使用了运行全部九种不同策略所需总计算能力的四分之一到三分之一。这意味着他们在获得几乎同样高质量结果的同时,节省了大量的成本和能源。该方法能够识别出不同任务需要不同的策略;例如,一项图像任务从始至终都偏好特定的优化器,而一个保险模型则在学习过程中多次切换策略,这证明了单一的固定规则并不总是最佳选择。
研究还比较了处理优化器“记忆”的两种方式。在其中一个版本中,如果同一个策略连续两轮获胜,它将保留其积累的知识和动量。而在另一个版本中,每次选中某个策略时,它都会从一个全新的、干净的状态开始。研究人员发现,保留记忆并不总能带来更好的结果或更低的成本。最重要的发现是,侦察时长的影响远大于对最终性能的影响。由于最重要的学习发生在训练的最早期阶段,因此简短的检查就足以发现最有希望的方向。虽然被称为“单次选择”(one-shot selection)的一次性早期检查更便宜,且在最佳策略保持不变的图像任务中表现良好,但 ROR 的重复检查在需要策略随时间变化的保险模型中展现出了价值。
最终,这项研究表明,我们不需要通过穷举测试所有可能性来寻找一条良好的训练路径,也不需要僵化地坚持单一选择。通过允许训练过程根据频繁且短暂的检查来进行适应和策略切换,我们可以以极小的成本实现高性能。该方法并不保证能得到比通过全面搜索找到的绝对最佳固定策略更好的结果,但它能在使用显著更少资源的情况下,非常接近那个巅峰性能。这为导航复杂的 AI 训练领域提供了一种实用的方法,表明只要检查足够频繁且决策足够迅速,灵活、自适应的方法可以与大规模、穷举式的搜索一样有效。
技术摘要:用于自适应优化器选择的重复重采样
问题陈述 训练深度神经网络通常需要在训练开始前选择一个单一的优化器,并在整个过程中保持固定。虽然优化器的选择是一个关键的超参数,但对于特定问题而言,最优选择在事前往往是未知的。通过回顾性地识别最佳固定优化器需要进行穷举搜索——即让每个候选优化器都训练至收敛并舍弃除胜出者之外的所有选项——这在计算上是非常昂贵的。此外,最适合早期下降阶段的优化器可能与最适合后期精细化阶段的优化器不同,这表明静态的选择可能是次优的。
方法论:重复优化器重采样 (ROR) 本文提出了一种重复优化器重采样 (Repeated Optimizer Resampling, ROR) 程序,该程序旨在单次演进的训练过程中寻找最优优化器,而非在训练前进行寻找。ROR 在两个时间尺度上运行:侦察期 (s s s ) 和保留段长度 (b b b ),其中 1 ≤ s ≤ b 1 \le s \le b 1 ≤ s ≤ b 。
锦标赛机制: 在定期的时间间隔内,启动一场锦标赛。当前的模型权重会被复制 K K K 次(为每个候选优化器各复制一份)。
侦察: 每个候选优化器使用相同的样本顺序对其副本进行 s s s 个 epoch 的训练。
选择: 产生最佳验证目标值 (J v a l J_{val} J v a l ) 的优化器被宣布为“侦察胜出者”。
延续: 胜出者从其侦察权重开始,继续训练剩余的 b − s b-s b − s 个 epoch。
承诺: 如果完成的段落使现任(incumbent)验证目标值改善了阈值 δ \delta δ ,则新的权重和优化器状态成为现任状态。否则,训练停止。
状态策略 论文评估了关于如何处理优化器状态(例如动量缓冲、自适应矩估计)的两种 ROR 变体:
状态保留 ROR (SP-ROR): 如果现任优化器再次获胜,其累积的状态将被保留并恢复。挑战者则以新初始化的状态开始。
冷启动 ROR (CS-ROR): 在每次锦标赛开始时,包括现任优化器在内的所有优化器都会以新的状态重新初始化。
这种方法不同于 Hyperband 等方法,后者会永久剔除失败的配置。在 ROR 中,每个优化器都会从当前的现任权重重新进入每次锦标赛,这使得一个在早期失败的候选者有可能在后期被选中。
实验设计 作者在四个任务上评估了九种固定的优化器(包括 Adam、AdamW、Lion、Muon、SGD-Nesterov、Nadam、RMSprop、LAMB 和 ScheduleFreeAdamW):
图像分类: MNIST 和 Fashion-MNIST(全连接 MLP)。
保险定价: 使用泊松偏差(Poisson deviance)计算机动第三者责任险索赔次数,并在 MLP 和 Transformer 架构上分别进行评估。
实验使用了十个随机种子。“先知”(Oracle)基准 定义为在穷举比较后找到的最佳固定优化器。成本通过等效 epoch 数 来衡量,这考虑了所有训练分支(包括接受的和拒绝的)。
核心结果
成本效率: 单 epoch ROR (s = 1 s=1 s = 1 ) 仅需识别最佳固定优化器所需总训练成本的 24% 至 35% 。它也比具有较长侦察期 (s = 3 s=3 s = 3 ) 的 ROR 便宜 51% 至 68%。
预测性能: 在所有四个任务中,没有任何一种 ROR 变体表现出与事后找到的最佳固定优化器之间存在统计学显著差异(置信度为 95%)。
在 MNIST 上,单 epoch ROR 达到的准确率略低于最佳固定优化器(Muon),但成本仅为前者的极小部分。
在 Fashion-MNIST 和 保险 Transformer 上,单 epoch ROR 达到了与最佳固定优化器相当的性能,且配对比较的结果均包含零。
在 保险 MLP 上,特定的 ROR 配置实现了比最佳固定优化器(Lion)更低的偏差,但与 s = 3 s=3 s = 3 (以及 s = 1 s=1 s = 1 )的配对比较均包含零,表明没有明确的改进证据。
侦察时长: 将侦察期 (s s s ) 从 1 个 epoch 增加到 3 个 epoch 会显著增加计算成本,却未能带来一致的预测性提升。作者将其归因于大多数验证损失的降低都发生在训练的最早期步骤,之后损失趋于平缓。
优化器动态: 生成的优化器调度并非静态。在保险 MLP 上,首选优化器频繁变化(平均每次运行切换 5.6 次),而图像任务则更为稳定。这证实了最优优化器可以随着训练过程而改变。
状态保留: 通过对比 SP-ROR 和 CS-ROR,发现不存在一致的预测或计算优势。选择状态策略并不会显著改变最终的模型性能或优化器切换的频率。
意义与主张 论文声称 ROR 提供了一种实用的机制,可以在不完成每个候选运行至收敛的情况下搜索优化器。
自适应选择: 它证明了首选优化器可以在训练期间发生变化,支持了“自适应序列可能优于固定选择”的假设,或者至少能在不进行穷举搜索的情况下达到最佳固定结果。
实用性: 其主要贡献在于证明了短侦察 (s = 1 s=1 s = 1 ) 足以捕捉优化器选择的大部分价值。这使得从业者能够以极小的训练预算,接近最佳固定优化器(事后找到的)的性能。
基准比较: “单次尝试”(在开始附近选择一次优化器)的成本比单 epoch ROR 更低,且在 MNIST 上表现良好。然而,在优化器随时间变化的敏感任务(如保险 MLP)中,重复锦标赛提供了更好的结果。论文得出结论,重复锦标赛的价值取决于任务对优化器随时间变化的敏感程度。
作者保持了谦逊,指出 ROR 并未在所有任务中都以统计学显著的方式一致地优于最佳固定优化器,但它成功地以显著更低的成本近似了最佳固定结果。研究强调,虽然较长的侦察期能为每次锦标赛提供更多证据,但鉴于早期训练步骤的收益递减,这通常是不必要的。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。