← 最新论文
🤖 machine learning

Navigating LLM Valley: From AdamW to Memory-Efficient and Matrix-Based Optimizers

本综述全面回顾了大语言模型的优化算法,将方法从经典的一阶方法归类至包括Muon在内的先进基于矩阵的优化器,同时倡导进行严谨且感知规模的基准测试,以联合评估收敛性、稳定性、内存效率及实现复杂度。

原作者: Aditya Ranganath

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Aditya Ranganath

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个巨大且超级聪明的机器人(大型语言模型或 LLM)如何说人类语言。这个机器人拥有数十亿个微小的齿轮(参数),需要被完美地调整。将这些齿轮转动以使机器人变得更智能的过程被称为优化

这篇名为《导航 LLM 山谷》的论文,是为那些设计用于转动这些齿轮的工具(优化器)的工程师们编写的一本指南。作者 Aditya Ranganath 认为,我们正在超越“一刀切”的工具时代,进入一个需要针对不同工作部分使用专用工具的新纪元。

以下是使用简单类比对论文主要思想的分解:

1. 当前的王者:AdamW

长期以来,业界一直依赖一种名为AdamW的工具。

  • 类比:想象 AdamW 是一位经验丰富、全地形适应的徒步者。它知道如何在泥泞、岩石和平坦的地面(不同类型的数据)上行走而不会被困住。它是“默认”选择,因为它几乎在所有地方都表现良好。
  • 问题:这位徒步者背着一个巨大的背包。对于机器人中的每一个齿轮,AdamW 都携带两个额外的沉重笔记袋(内存状态)来记录它走过的路。当机器人变得巨大(拥有数十亿个齿轮)时,这个背包变得如此沉重,以至于徒步者甚至无法开始行走,或者他们不得不放弃机器人的规模以适应背包。

2. 新路径:为什么我们需要新工具

论文指出,我们不能仅仅继续使用那个沉重的背包。我们需要新的策略来使机器人更大、更快,或者能够适应更小的计算机。作者将新工具组织成不同的“家族”,每个家族都试图解决一个特定的问题:

  • “轻量打包者”家族(内存高效优化器)

    • 示例:Adafactor、8-bit 优化器、LOMO。
    • 类比:这些工具不再为每个齿轮携带一个完整的背包,而是使用“折叠地图”。它们意识到,对于机器人中的大金属片(矩阵),你不需要单独跟踪每一个点。你只需要跟踪行和列。这缩小了背包,允许机器人在不耗尽空间的情况下增长得更大。
    • 另一个技巧:一些工具(如 LOMO)是专门为“微调”(教机器人新技能)设计的,当你内存非常有限时,它们允许你更新整个机器人,而不仅仅是其中的一小部分。
  • “仅符号”家族(基于符号的优化器)

    • 示例:Lion、signSGD。
    • 类比:想象你在黑暗中行走。旧方法(AdamW)精确测量你需要走多远以及朝哪个方向走。“仅符号”家族则说:“谁在乎确切的距离?只要告诉我你需要向左、向右、向上还是向下走。”
    • 好处:这要简单得多,需要的内存也更少。这就像发送一条写着“向北走”的短信,而不是详细的 GPS 坐标。它效果出奇地好,但需要非常仔细的调节,以确保你不会走得太远或太短。
  • “曲率”家族(二阶方法)

    • 示例:Shampoo、Sophia。
    • 类比:老徒步者(AdamW)只看脚下的地面。“曲率”徒步者则观察整座山丘的形状。他们会问:“这是一处陡峭的悬崖还是平缓的斜坡?”通过理解地形的形状,他们可以迈出更大、更聪明的步伐,更快地到达底部。
    • 代价:观察整座山丘需要大量的脑力(计算)。它可能让你用更少的步数到达底部,但每一步的规划时间更长。
  • “矩阵”家族(基于矩阵的优化器)

    • 示例:Muon。
    • 类比:机器人的大脑是由大金属片(矩阵)组成的,而不是一堆散落的螺丝。旧工具将每个螺丝独立处理。“矩阵”工具则将整张金属片视为一个物体。它们同时旋转和拉直整张金属片,以确保其保持平衡。
    • 好处:这尊重了机器人大脑的实际结构,可能使其更稳定、更高效。

3. “山谷”隐喻

标题《导航 LLM 山谷》指的是训练模型就像在崎岖、多雾的山谷中行走。

  • 目标:尽快到达底部(最佳性能)。
  • 权衡
    • 有些路径很快,但需要巨大的背包(AdamW)。
    • 有些路径很轻便,但可能更慢或需要更谨慎的导航(基于符号的方法)。
    • 有些路径很聪明,但需要大量的规划时间(曲率方法)。
    • 有些路径仅适用于特定类型的地形(基于矩阵的方法)。

4. 重大警告:如何比较工具

作者花了很多时间警告我们如何测试这些新工具。他说,许多论文声称它们的新工具“更好”,但这种比较往往是不公平的。

  • “不公平比赛”类比:想象一位新跑者声称比奥运冠军跑得更快。但这位新跑者热身了一个小时,而冠军被迫赤脚在雨中奔跑。
  • 论文的规则:要真正知道一个新的优化器是否更好,你必须公平地比较它们。你必须检查:
    • Token 效率:每读一个词发生多少“学习”?
    • 挂钟时间:实际上需要多长时间?
    • 内存:它消耗多少计算机 RAM?
    • 调节:你是否给了新工具公平的调节机会,还是仅仅对旧工具使用了默认设置?

5. 结论:没有单一的赢家

论文得出结论,不存在一个能取代 AdamW 处理所有事情的单一“完美”优化器。

  • 未来:我们正在走向一个可能混合使用工具的世界。也许我们在巨大的内存消耗部分使用“轻量打包者”,在速度方面使用“仅符号”工具,在核心结构方面使用“矩阵”工具。
  • 要点:优化 LLM 不再仅仅是数学问题;它是关于系统工程。它是关于平衡内存、速度、稳定性以及机器人大脑的具体形状。最好的工具完全取决于你试图完成的具体工作。

简而言之,这篇论文呼吁停止将优化视为一个简单的数学问题,转而将其视为一个复杂的工程挑战,其中内存、速度和硬件与算法本身同样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →