← 最新论文
🤖 machine learning

No Subspace to Track: Non-Identifiability and Optimizer State in Low-Rank Training

本文表明,被认为可以被 GaLore 等内存高效优化器追踪的低秩梯度子空间,由于高估计器噪声的存在,在本质上是不可识别的,从而揭示了性能增益实际上源于在子空间刷新过程中正确地传输优化器状态,而非源于该子空间的稳定性。

原作者: Noel Thomas

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Noel Thomas

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心思想:追逐幽灵

想象你正在试图教一个巨型机器人(大语言模型)说话。为了高效地完成这项任务,这个机器人使用了一个特殊的技巧,叫做 GaLore

这个技巧是这样运作的:每隔几分钟,机器人会观察它刚刚犯下的“错误”(梯度),并尝试找到发生这些错误的前 128 个方向。然后,它会忽略其他所有内容,只在这 128 个方向上进行学习。其假设是,这 128 个方向就像一条缓慢移动的河流;它们会轻微漂移,但基本保持不变,因此机器人可以“追踪”它们。

该论文的主要发现令人震惊: 这条河并不是在缓慢流动。它甚至不是一条河流。它是一个每次在你观察它时都会完全改变形状的瀑布。

作者证明了,除了大约 39 个方向的核心部分之外,机器人选出的“前 128 个方向”本质上是随机噪声。如果机器人现在选定了一组方向,并在 10 秒后又选了另一组,这两组方向会几乎完全不同(就像两个从帽子里随机抽取 128 个数字的人,几乎没有任何重合)。

既然如此,GaLore 为什么有效?

你可能会问:“如果方向一直在随机变化,为什么机器人仍然能学习?

论文解释说,GaLore 之所以有效,并不是因为它在追踪一条特定的路径,而是因为它在捕捉能量

  • 类比: 想象你正试图用桶接雨水。你不需要知道每一滴雨水具体会落在哪里。你只需要把桶放在下雨的大致区域即可。
  • 尽管“前 128 个方向”每次都会完全改变,但它们仍然捕捉到了大约 67%–73% 的总“能量”(即有用的信息)。因此,即使机器人在不断切换地图,它仍在持续学习。

为什么平均化没有帮助

一个修复“变化地图”问题的自然想法是:“让我们看看过去 10,000 张地图,并将它们取平均值,从而得到一个稳定的地图。

作者测试了这一点,发现行不通

  • 类比: 想象雨水不仅仅是随机噪声,而是一种特定的风和云的模式(信号)。如果你试图随时间对雨水进行平均,你并不会得到一张清晰的降雨图;你只会得到一团模糊的混沌。
  • 机器人错误中的“噪声”并非简单的静态噪声,而是一个复杂的信号,当你试图通过平均化来消除它时,它会变得非常缓慢地缩小。无论你如何进行平均,你都无法创建一个稳定的“前 128”列表,因为这个列表本身就不是以稳定的形式存在的。

真正的问题:机器人的记忆

真正的问题不在于地图,而在于机器人的记忆
机器人使用一种叫做 Adam 的优化器,它拥有长期记忆(它会记得过去 1,000 步的错误)。

  • 问题所在: 每当机器人刷新其地图(每 160 步)时,地图都会旋转 90 度。但机器人的记忆仍然指向旧的地图。这就像你在开车,方向盘突然转动了 90 度,但你的双手还握在原来的位置。机器人正试图根据一张已经不存在的地图来进行转向。

论文中发现的解决方案

作者测试了两种修复这种“转向问题”的方法:

  1. 旋转记忆(传输/Transport): 机器人不应该让记忆停留在旧位置,而应该物理性地旋转其记忆,以匹配新的地图。
    • 结果: 这效果非常好。这就像意识到方向盘转动了,并立即调整双手以匹配它。
  2. 缩短记忆: 机器人的记忆太长了(记得 1,000 步之前)。由于地图每 160 步就会改变一次,记住 1,000 步是毫无意义的,因为那些旧的步骤属于一个完全不同的世界。
    • 结果: 通过告诉机器人只记住最近的 100 步(而不是 1,000 步),它就不再试图基于过时的地图进行转向。这也取得了很好的效果。

给构建者的启示

如果你正在构建一个使用这些低秩(low-rank)技巧的系统,以下是来自论文的建议:

  1. 不要试图追踪子空间。 它是一个幽灵。它变化得太快,无法被追踪。
  2. 检查你的“可复现秩”(kk^*)。 在信任 128 个秩之前,先检查到底有多少个方向是真实的。论文发现,只有大约 39 个方向是真实的,其余都是噪声。
  3. 如果你使用的秩高于真实数值:
    • 旋转你的记忆: 确保你的优化器记忆随新地图一起移动。
    • 缩短你的记忆: 不要让机器人记得太久以前。
    • 停止平均化: 不要浪费时间尝试通过平均化地图来使其稳定;这行不通。

简而言之: “低秩子空间”并不是一个你可以跟随的稳定物体。它是一个快速变化的云团。让这些系统生效的诀窍不是更好地跟随云团,而是停止试图跟随它,转而调整你的记忆以应对不断的变换。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →