← 最新论文
🤖 machine learning

The Loss Does Not See the Basis, but Adam Does

本文表明,Adam 在分解模型中无法恢复低秩解的原因在于其缺乏规范等变性(gauge equivariance),而梯度下降及其他共享标量优化器则具备该属性,从而能够保持对低秩插值器的隐式偏置。

原作者: Devender Singh

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Devender Singh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图解决一个巨大的、杂乱无章的拼图,拼图的碎片是排列在网格中的数字。在人工智能的世界里,这被称为“矩阵分解”。你有一个巨大且复杂的图像(数据),你想将其分解成两叠更小、更简单的卡片,当它们相乘时,能够重新还原出原始图像。目标是找到最简单的卡片堆,同时仍能完美契合这张图像。这很重要,因为更简单的解决方案通常在现实世界中表现更好,能够避免陷入仅仅记住噪声而非学习模式的陷阱。

为了解决这个拼图,计算机使用一种叫做“梯度下降”的方法,这就像一名徒步旅行者试图通过始终向下的步伐,寻找山谷的底部。长期以来,科学家们注意到,如果你从非常小的卡片开始,这位徒步旅行者会自然而然地找到最简单的解。然而,一个更新、更快的徒步旅行者——“Adam”(一种流行的 AI 工具)——却经常迷失方向,即使存在简单的解,它也会找到一个复杂且混乱的解。核心问题一直是:为什么这个快速的徒步旅行者无法找到简单的路径?我们能否在不降低速度的情况下修复这个问题?

这篇题为《损失函数看不见基底,但 Adam 能看见》的论文研究了为什么会发生这种情况。作者发现,问题不仅仅在于速度,而在于徒步旅行者如何看待世界。这个拼图具有一种隐藏的对称性:你可以以许多不同的方式旋转你的卡片堆,而最终的图像保持不变。这就像旋转地球仪:大陆的位置移动了,但地图本身仍然是相同的。传统的徒步旅行者(梯度下降)忽略了特定的旋转,只观察山谷的形状,从而自然地找到最简单的解。但快速的徒步旅行者(Adam)会被卡片的特定旋转所分心。它将一个方向视为“特殊的”,而将另一个方向视为“不同的”,尽管在数学上它们是完全等同的。这种分心导致它选择了一个复杂的、高秩的解,而不是简单的、低秩的解。

作者证明了任何尊重这种旋转对称性的优化器(解决拼图的工具)都会自然地找到简单的解,而那些破坏对称性的优化器则会陷入复杂的解中。他们测试了九种不同的优化器,并发现了一个明显的划分:那些“尊重对称性”的优化器(如梯度下降、Muon 和修改版的 Adam)找到的误差低至 0.000006,而那些“破坏对称性”的优化器(如标准 Adam 和 RMSProp)的误差则超过了 0.42——这是一个巨大的差异。

为了证明这并非偶然,他们构建了一个“旋钮”,可以平滑地将 Adam 从其混乱的、厌恶旋转的模式转变为旋转友好的模式。随着他们转动旋钮,解变得越来越简单且准确,这表明 Adam 观察数据的方式正是问题的根源。他们甚至在真实世界的数据(如地球的高光谱图像)上进行了测试,发现旋转友好的方法比标准 Adam 减少了约 44% 的误差。

有趣的是,论文还发现,“旋转友好”并不总是灵丹妙药。如果拼图本身很杂乱,含有大量的随机噪声(“谱尾”),那么超级快速、旋转友好的徒步旅行者 Muon 有时会过于急躁并拟合噪声,而缓慢、稳健的徒步旅行者(梯度下降)表现得更好。因此,最好的工具取决于拼图的具体性质。

最后,作者研究了这对被称为 Transformer(聊天机器人的大脑)的现代 AI 模型有何影响。他们发现,如果你让两个完全相同的 AI 模型在起始阶段拥有相同的数学逻辑,但只是旋转了它们的内部卡片方式不同,标准 Adam 优化器会在仅仅一步之后就让它们的行为变得完全不同。它们的内部结构会变得截然不同,尽管它们最初代表的是同一个函数。这意味着优化器的选择不仅仅是一个微调细节;它从根本上决定了 AI 学习到的是哪一个版本的解。论文得出结论:为了获得最佳、最简单的结果,我们需要尊重数学中隐藏对称性的优化器,而不是被数字排列的具体方式所分心。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →