← 最新论文
🔢 mathematics

PowerStep: Memory-Efficient Adaptive Optimization via p\ell_p-Norm Steepest Descent

PowerStep 是一种内存高效的自适应优化器,它通过 p\ell_p-范数最速下降法实现坐标级自适应而无需存储二阶矩统计量,在匹配 Adam 收敛速度的同时,显著降低了大规模 Transformer 训练的内存开销。

原作者: Yao Lu, Dengdong Fan, Shixun Zhang, Yonghong Tian

发布于 2026-05-12
📖 1 分钟阅读🧠 深度阅读

原作者: Yao Lu, Dengdong Fan, Shixun Zhang, Yonghong Tian

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个巨大且复杂的机器人(即神经网络)说一门新语言。为此,你在机器人尝试每句话后都会给予反馈。这种反馈就是“梯度”,它告诉机器人应向哪个方向移动才能变得更好。

多年来,训练这些机器人的标准方法是一种名为Adam的算法。Adam 就像一位非常谨慎、高度有条理的图书管理员。每当机器人犯了一个错误,Adam 不仅会查看当前的错误,还会维护一本庞大而详细的账本(即“二阶矩缓冲区”),记录机器人曾经犯下的每一个错误的历史。

  • 问题所在:随着机器人变得更大(拥有数十亿个参数),这本账本变得极其庞大。它占用的内存如此之多,以至于拖慢了整个系统,甚至导致系统崩溃。这就像试图背着一装满百科全书的沉重背包跑马拉松。

登场:PowerStep——“智能直觉”方法

这篇论文的作者提出了一种名为PowerStep的新优化器。PowerStep 不再背负那装满历史数据的沉重背包,而是基于几何学和直觉运用了一个巧妙的技巧。

以下是 PowerStep 的工作原理,使用简单的类比来说明:

1. “重球”与“账本”

  • Adam(账本):“我记得你昨天在单词'A'上犯了一个大错,在单词'B'上犯了一个小错。我会根据这些过去错误的平方来调整你的路径。”这需要存储大量数据。
  • PowerStep(重球):PowerStep 使用一种称为“动量”的概念。想象一个重球从山坡上滚下。如果球滚得很快(强信号),它就会继续滚动;如果它滚得很慢(弱信号),就需要一点推力。
    • PowerStep 不需要记住球速的历史。它只需观察球此刻滚动的速度。
    • 它对当前速度应用一种特殊的“魔法过滤器”(带符号的幂变换)。如果球滚得太快,过滤器会温和地让它慢下来;如果它滚得太慢,过滤器就会给它一个助推。

2. “音量旋钮”类比

将机器人的学习过程想象成一个拥有成千上万个音量旋钮(对应机器人的每一个部分)的音响系统。

  • Adam 会聆听音乐的整个历史来决定如何调节每个旋钮。它很准确,但需要一台庞大的计算机来处理所有这些历史数据。
  • PowerStep 则聆听声音的当前音量。
    • 如果某个旋钮已经调得很高(机器人很自信或梯度很大),PowerStep 会将音量调低一点,以防止它变得太响(过冲)。
    • 如果某个旋钮几乎没开(机器人不确定或梯度很小),PowerStep 会将音量调高,以帮助它听得更清楚。
    • 魔法之处:它无需写下历史书就能瞬间完成这一操作。它只是对当下做出反应。

为什么这很重要?

该论文宣称 PowerStep 取得了三大主要胜利:

  1. 体积减半:由于 PowerStep 不需要存储那本庞大的“二阶矩账本”,它比 Adam 节省50% 的内存。这就像将那装满百科全书的沉重背包换成了一本轻便的笔记本。
  2. 速度相同:尽管更轻量,PowerStep 的学习速度与 Adam 完全相同。它能在相同的时间内到达终点。
  3. 经受住“压缩”考验:研究人员尝试将数据压缩成极小、低质量的格式(称为“int8 量化”),这通常会破坏 Adam,因为它丢失了太多细节。
    • Adam:被压缩后,Adam 的“账本”因缺失细节而变得极其混乱,导致机器人开始原地打转(发散)。
    • PowerStep:因为它依赖于当前的动量,而不是脆弱的历史账本,即使数据被压缩,它也能保持稳定。这使得与标准方法相比,内存使用量减少了8 倍,而不会破坏机器人。

总结

该论文证明,你无需背负厚重的历史书就能有效训练巨型 AI 模型。通过使用一种基于几何学的智能方法,对当下的“动量”做出反应,PowerStep 实现了与行业标准(Adam)相同的结果,但内存成本仅为一半。而且,当将其与数据压缩结合时,它就成为了训练未来巨型 AI 模型的高效工具。

注:该论文在从小型(1.24 亿参数)到超大型(2350 亿参数)的模型上验证了这一点,证明其在任何规模下都有效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →