想象一下,你正在教一个机器人如何行走。你给它一个指令,它迈出一小步,然后你检查它是否摔倒。如果它摔倒了,你就告诉它:“好的,下次步子小一点。”如果它向前踉跄得太远,你就说:“慢点!”这种检查、纠正和调整的过程,正是计算机在深度学习中学习的方式。
在这个场景中,这位“老师”被称为优化器。它的任务是引导计算机的学习过程,使其不会陷入停滞、 overshoot 目标或在原地打转。
问题:“摇摆不定”的学习者
长期以来,标准的“老师”是一种称为SGD(随机梯度下降)的方法。它简单但缓慢。为了加快速度,科学家们加入了“动量”,这就像给机器人一个助跑。
然而,这种“动量”方法存在两个重大缺陷:
- 噪声梯度:有时机器人会感到困惑,因为它收到的指令前后不一致(就像一位老师同时大喊不同的方向)。
- 过冲:由于机器人凭借动量移动得如此之快,它常常径直冲过最佳位置,不得不来回奔跑,浪费时间和能量。
为了解决这些问题,科学家们创造了AdaPID。你可以将 AdaPID 想象为一位聪明的老师,它使用一种特殊的控制系统(就像汽车中的巡航控制)来保持机器人稳定。它很出色,但仍继承了其早期祖先的两个隐藏缺陷:
- 收敛缺陷:有时,学习率(步长)会变得奇怪,导致机器人永远无法真正稳定在最佳答案上。
- 稳定性缺陷:在学习过程中,机器人仍然会略显抖动和不稳定。
解决方案:"IAdaPID-ADG"超级老师
本文的作者创造了一种新的优化器,名为IAdaPID-ADG。他们通过借鉴其他研究人员的两个绝妙想法,并将它们融入 AdaPID 的配方中,修复了这两个缺陷。
以下是他们如何做到的,使用简单的类比:
1. 修复收敛缺陷(“不回头”规则)
- 旧方法:想象机器人正在爬山。有时,它迈出一大步,意识到步子太大了,于是退而迈出一小步。但随后,它可能会不小心迈出比前一步更大的步子,导致其摇摆不定,无法平稳到达山顶。
- 修复方法(来自 AMSGrad):新老师引入了一条规则:"你迈出的步子永远不能超过你曾经迈过的最大步子。"
- 结果:这确保了随着机器人越来越接近目标,它的步子会越来越小,从而保证它真正到达山顶而不会来回弹跳。这解决了收敛问题。
2. 修复稳定性缺陷(“突变”传感器)
- 旧方法:想象机器人正在一条小路上行走。突然,地面从平整的柏油路变成了碎石路。机器人仍以相同的速度行走,结果绊倒了。
- 修复方法(来自 DiffGrad):新老师增加了一个传感器,用于观察上一条指令与当前指令之间的差异。如果指令突然发生变化(差异很大),老师会自动让机器人减速以防止碰撞。如果指令相似,机器人则可以保持速度。
- 结果:这就像减震器一样,平滑了行驶过程,防止机器人变得抖动。这解决了稳定性问题。
结果:效果如何?
作者在四个不同的“游乐场”(数据集)上测试了这位新的“超级老师”(IAdaPID-ADG):
- MNIST:识别手写数字的经典测试。
- CIFAR10:识别日常物体(如汽车、鸟类和猫)的更困难测试。
- IARC 与 AnnoCerv:用于检测宫颈癌的真实世界医学图像。
结果:
- 速度与精度:在所有四个“游乐场”上,新优化器都比竞争对手学习得更快、更准确。
- 数据:在某些情况下,其“误差”(机器人出错的程度)比其他方法小了数千倍。
- 准确率:它在训练任务中取得了近乎完美的分数(高达 100%),并在测试任务中保持了极高的准确率(手写数字测试高达 98.68%,医学图像测试超过 97%)。
总结
本文声称,通过将“不回头”规则与“突变”传感器结合到现有的智能老师(AdaPID)中,他们创造了一种新的优化器,它更快、更稳定、更准确。它能够在学习正确答案时避免困惑或过冲,使其成为教授计算机识别各种模式(从手写数字到医学扫描)的强大工具。
技术摘要:一种具有增强收敛性与稳定性的改进型自适应 PID 优化器,适用于深度学习
问题陈述
深度学习训练严重依赖优化算法,这些算法主要建立在基于动量的随机梯度下降(SGD)之上。虽然动量能够加速训练,但它存在两个根本性缺陷:(1)不同参数间的梯度存在噪声且变化剧烈,单一的全局学习率无法有效管理;(2)“过冲”现象,即累积的动量导致参数在最优解附近振荡。
为解决这些问题,研究者提出了自适应 PID(AdaPID)优化器,将 Adam 的自适应学习率机制与基于控制理论的 PID(比例 - 积分 - 微分)结构相结合,以抑制振荡。然而,作者指出 AdaPID 从其 Adam 基础中继承了两个关键局限性:
- 收敛性问题:与 Adam 类似,由于对平方梯度的指数移动平均的性质,AdaPID 可能无法保证收敛。
- 稳定性问题:AdaPID 在训练过程中仍可能表现出不稳定性,导致性能波动。
方法论
本文提出了一种新型优化器,即IAdaPID-ADG(改进型 AdaPID AMSDiffGrad),它将两个现有 Adam 扩展版本——AMSGrad 和 DiffGrad——中的特定增强功能整合到了 AdaPID 框架中。
解决收敛性问题(整合 AMSGrad):
为了确保有效学习率非递增并保证收敛,作者整合了 AMSGrad 的核心思想。优化器不再使用标准的平方梯度(vt)和平方梯度差(dt)的指数移动平均,而是维护这些值的运行最大值(vtmax 和 dtmax)。这些最大值被用于更新规则的分母中,防止有效学习率意外增加。
解决稳定性问题(整合 DiffGrad):
为了减轻不稳定性和振荡,作者引入了受 DiffGrad 启发的调制因子。该因子 μt 基于当前梯度与先前梯度之间的绝对差值(Δgt),通过 Sigmoid 函数计算得出:μt=1+e−∣Δgt∣1。该因子动态缩放学习率;当梯度差值较大时,调制因子会调整步长以稳定更新。
组合更新规则:
最终的 IAdaPID-ADG 更新规则将 PID 的积分项(It)和微分项(Dt)与来自 AMSGrad 的自适应缩放(使用 vmax 和 dmax)以及来自 DiffGrad 的稳定性调制(μt)相结合。权重更新定义如下:
wt=wt−1−ημtv^tmax+σKiIt+d^tmax+σKdDt
其中 η 是学习率,Ki 和 Kd 是增益系数,σ 是稳定性常数。
主要贡献
- 新型优化器设计:提出了 IAdaPID-ADG,该优化器独特地将 AMSGrad 的收敛保证和 DiffGrad 的稳定性机制融合到 PID 控制结构中。
- 全面评估:在四个数据集上进行了广泛测试:
- 基准数据集:MNIST(手写数字)和 CIFAR-10(彩色图像)。
- 真实世界医疗数据集:IARC 和 AnnoCerv(宫颈癌图像分类)。
- 消融研究:在 MNIST 数据集上进行了系统分析,表明当将 AMSGrad 组件(收敛性)和 DiffGrad 组件(稳定性)添加到基础 AdaPID 时,两者均对最终性能产生积极贡献。
实验结果
所提出的优化器在训练损失、训练准确率和测试准确率方面与 AMSGrad、DiffGrad 和标准 AdaPID 进行了对比评估。
- 基准数据集:
- MNIST:IAdaPID-ADG 实现了 2×10−5 的训练损失(显著低于竞争对手的 4×10−3),训练准确率达到 100%,测试准确率达到 98.68%。
- CIFAR-10:该优化器达到了 3×10−6 的训练损失和 80.09% 的测试准确率,优于所有基线模型。
- 医疗数据集(IARC & AnnoCerv):
- 在 ResNet50、ResNet101 和 ResNet152 架构上进行了测试。
- 在 IARC 数据集上,IAdaPID-ADG 实现的训练损失约为 4×10−5 至 7×10−4,而 DiffGrad 为 2×10−2 至 5×10−2。测试准确率最高达到 97.35%。
- 在 AnnoCerv 数据集上,该优化器实现的测试准确率介于 94.96% 至 95.39% 之间,其训练损失比 DiffGrad 低数个数量级。
- 总体观察:在所有数据集上,IAdaPID-ADG 展现出的训练损失比竞争优化器低 2 到 3 个数量级。与基线相比,学习曲线显示出更快的收敛速度和显著减少的振荡。
意义与主张
本文主张,IAdaPID-ADG 通过同时解决自适应 PID 方法固有的收敛性和稳定性问题,显著优于现有优化器。作者断言,整合非递增有效学习率和基于梯度差值的调制因子,产生了一种不仅在训练过程中更准确,而且更稳定的优化器。
研究结论指出,所提出的方法在标准基准和复杂的真实世界医学成像任务中均提供了改进的泛化能力和优化效率。作为未来工作,作者建议将该优化器应用于推荐引擎等复杂信息系统,并通过 Krylov 子空间方法等迭代数值方法进一步分析其收敛特性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。