想象你正试图在一个广阔、迷雾笼罩的山谷中找到最低点(即“优化问题”)。通常,为了高效地做到这一点,你需要一张能明确指示“向下”方向的地图(即梯度)。但在许多现代人工智能场景中,你并没有地图。你只能迈出一小步,环顾四周看看自己是变高了还是变低了,然后决定下一步该做什么。这被称为零阶优化。
这种“摸索前行”方法的问题在于它既缓慢又不稳定。如果你一次只观察一个点,就会浪费时间;如果你试图通过观察随机点来猜测方向,就会被迷雾(高方差)所迷惑。
本文介绍了一种名为**相干坐标下降(CoCD)**的新方法。以下是其工作原理,使用简单的类比来说明:
1. “陈旧”与“新鲜”的问题
想象你正在穿越一个迷宫。
- 旧方法(标准方法): 每当你迈出一步,就会丢弃上一步学到的所有内容。你将每一次新的环顾都视为第一次进入迷宫。这是一种浪费。
- 本文的洞见: 本文认为迷宫不会瞬间改变。如果你知道 10 秒前路径是畅通的,那么现在它很可能依然畅通。作者将这种现象称为**“时间相干性”**。CoCD 不会丢弃旧信息,而是将其保存在“记忆缓冲区”中。它不将旧数据视为垃圾,而是将其视为下一步的有益“预热”。
2. “记忆衰退”类比
CoCD 使用了一个巧妙的技巧来管理这种记忆,类似于你如何记住一段对话:
- 新鲜信息: 你清楚地记得朋友刚才说的话(最近的计算结果)。
- 旧信息: 你记得他们一分钟前说的话,但记忆稍微模糊了一些。
- 非常旧的信息: 你记得他们一小时前说的话,但这部分记忆已经非常模糊。
在数学上,这是通过一个“动量”旋钮(称为 γ)来控制的。如果你调大它,你会更信任旧信息;如果你调小它,你主要依赖新信息。这使得人工智能能够平稳移动,而不会因随机噪声而变得抖动。
3. “模糊镜头”的惊喜
这是本文最反直觉的部分。通常,在数学中,你希望测量尽可能精确。你希望用显微镜观察地面。
本文声称,使用略微模糊的镜头实际上更好。
- 类比: 想象你要走下一条崎岖多石的小路。如果你盯着每一颗微小的鹅卵石(高精度)看,你可能会被它们绊倒,或者被噪声搞糊涂。
- CoCD 技巧: 如果你稍微眯起眼睛(使用更大的“步长”或平滑半径),你就不会再看到那些小石头。你开始看到山坡的整体坡度。这种“模糊”实际上平滑了路径,使下山更容易,不易绊倒。本文证明,这种“隐式平滑”使优化更加稳定。
4. “流水线”策略
为了使这种方法快速,CoCD 不会一次性查看整个迷宫(这太慢了),也不会随机选择点(这很混乱)。
- 它采用循环方法:它以严格、重复的顺序检查路径(坐标 1,然后 2,然后 3,再回到 1)。
- 它像先进先出(FIFO)队列一样更新其“记忆缓冲区”。当它检查一个新点时,它会更新地图的该特定部分,并让该点的旧数据自然消退。
为什么这很重要?
作者在多种人工智能模型上测试了这种方法(例如用于图像识别或预测机器人运动的模型)。
- 结果: 与之前丢弃旧数据的方法相比,CoCD 的速度显著更快,精度更高。
- 稳定性: 与依赖随机猜测的方法相比,它不太可能“卡住”或原地打转。
- 效率: 它在实现这些结果时不需要大量的计算机内存,使其适用于资源受限的设备(如手机或机器人)。
总之: CoCD 是一种在迷雾景观中更聪明的导航方式。它不会忘记过去或随机猜测,而是记住最近的过去,模糊掉那些分散注意力的小细节以看清大局,并以稳定、有组织的节奏前进。
技术摘要:用于轻量级零阶优化的相干坐标下降法
问题陈述
零阶(ZO)优化对于反向传播不可用或计算成本过高的场景至关重要,例如受内存限制的设备端学习、黑盒对抗攻击以及基于模拟的强化学习。然而,现有的 ZO 方法在样本效率与方差之间面临根本性的权衡:
- 标准有限差分(FD): 提供低方差的梯度估计,但样本效率低下,对于 d 个参数,每一步需要 O(d) 次函数评估。
- 随机化方法(例如进化策略、SPSA、随机子空间): 降低了每一步的查询成本,但引入了高方差,通常需要使用较小的学习率或较大的批量大小,从而阻碍了墙钟时间的收敛。
当前方法往往依赖于丢弃“过时”的梯度(在先前迭代中计算得出),将其视为有害的滞后,并假设有限差分步长(ϵ)必须最小化以准确逼近真实梯度。本文挑战了这些假设。
方法论:相干坐标下降法(CoCD)
作者提出了相干坐标下降法(CoCD),这是一种确定性、样本高效且预算感知的 ZO 优化器。CoCD 基于两个核心见解:
- 时间相干性: 优化轨迹表现出连续性;梯度随时间的演变受函数 Lipschitz 平滑性的约束而平滑变化。因此,过时的梯度不仅仅是噪声,还可以作为当前几何结构的免费近似(“热启动”)。
- 隐式景观平滑: 反直觉的是,较大的有限差分步长(ϵ)可以通过隐式平滑优化景观来提高收敛稳定性,从而降低有效平滑常数(Lϵ)。
算法框架
CoCD 利用**先进先出(FIFO)**缓冲区来维护全局梯度估计 g^∈Rn。
- 循环更新: 算法循环遍历坐标。在每一步中,它执行 B 次函数查询(计算预算),利用新鲜的有限差分估计来更新特定坐标。
- 动量与衰减: 在更新之前,对整个缓冲区应用全局动量衰减因子 γ∈[0,1]。
- γ=1.0:保留所有历史梯度,直到循环刷新(完美记忆)。
- γ=0.0:在每一步清除缓冲区,恢复标准的块循环坐标下降法(BCCD)。
- 0<γ<1:提供“渐逝记忆”,指数级抑制非常旧的梯度,同时保留近期历史。
- 更新规则: 更新方向由混合梯度估计 g^t 形成,并按学习率 α 缩放:xt+1=xt−α⋅g^t。
- 高效实现: 为了处理结构化张量(例如 CNN 核)而不产生 prohibitive 的内存复制开销,CoCD 采用使用连续一维张量缓冲区和原地操作的虚拟化展平机制,将内存占用严格保持在一份模型副本的大小。
理论贡献
本文为 CoCD 提供了严格的理论依据:
- 与带热启动的 BCCD 的等价性: 作者证明了 CoCD 在数学上等同于配备了过时梯度热启动的块循环坐标下降法(BCCD)。这使得形式化的收敛分析成为可能。
- 近似误差界: 本文推导了误差界,表明近似误差取决于有效平滑常数(Lϵ)与步长(δ)的乘积。关键在于,它证明了较大的 ϵ 会降低 Lϵ,有效地平滑景观,从而允许使用更大的步长和更长的梯度历史而不牺牲稳定性。
- 收敛保证: 在 Polyak-Łojasiewicz (PŁ) 条件和温和假设下,CoCD 实现了与一阶方法相当的线性收敛,即使是在操作过时梯度估计的情况下。分析表明,在满预算情况(B=n)下,CoCD 恢复了标准梯度下降的收敛速率。
- 稳定性分析: 理论分析表明,动量(γ)指数级地抑制旧梯度的权重,从而稳定非凸景观中的下降过程。
实证结果
实验在 MLP、CNN 和 ResNet 架构(最多 27 万个参数)上进行,涵盖了回归(SARCOS)和分类(MNIST、CIFAR-10)任务。
- 与 BCCD 的性能对比: CoCD 在样本效率和最终准确率方面均显著优于标准 BCCD(γ=0)。
- 在CIFAR-10上,BCCD 未能摆脱随机猜测状态(10.13% 准确率),而 CoCD 达到了 45.08% 的准确率。
- 在SARCOS上,CoCD 将最终损失从 188.73(BCCD)降低到了 31.18。
- 与随机化方法的稳定性对比: 与 SPSA 和 ZO-SGD 等随机化 ZO 基线相比,CoCD 表现出更优越的稳定性。虽然随机化方法在 SARCOS 回归任务上发散,但 CoCD 保持稳定。
- 效率: CoCD 展现了更优越的墙钟速度,通过避免密集高斯采样的开销,运行速度比 ZO-SGD 快约2 倍(每集 8.1 秒 vs. 15.7 秒)。
- 超参数敏感性:
- 平滑半径(ϵ): 较大的 ϵ 值(例如 ϵ=1.0)提高了稳定性和性能,验证了隐式平滑假设。
- 动量(γ): 较高的 γ 值始终加速了收敛,并且在高维设置中对相干性至关重要。
意义与主张
本文主张,确定性的、感知结构的更新为轻量级 ZO 优化提供了优于随机化的替代方案。通过将过时梯度重新定义为计算资产而非负担,CoCD 弥合了启发式效率与理论严谨性之间的差距。
主要主张包括:
- 资源效率: CoCD 实现了低查询复杂度(每步 O(1)),同时避免了随机估计器固有的高方差,使其适用于受内存限制的边缘设备。
- 理论见解: 这项工作为使用较大的有限差分步长来诱导隐式平滑提供了反直觉的理论依据,从而改善了非凸景观中的收敛性。
- 实际影响: 该方法为在设备端训练模型或在梯度不可访问的黑盒场景中提供了一种可行的路径,在稳定性和收敛速度方面优于现有的最先进 ZO 方法。
作者指出,CoCD 目前对中小规模模型最有效,未来的工作将专注于针对更大系统的扩展策略(例如分块并行化)。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。