Zeta: Dual Whitening for Matrix Optimization via Coordinate-Adaptive Preconditioning
本文介绍了 Zeta,一种双重白化优化器,它通过在谱白化之前应用坐标白化来纠正尺度异质性,从而解决了现有矩阵感知方法存在的关键脆弱性,进而提升了大规模语言模型和视觉模型的收敛性与泛化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个庞大且复杂的机器人(神经网络)学习一项新技能,比如写诗或识别猫。为了做到这一点,你需要一位“教练”(优化器),在机器人每次犯错后,告诉它如何调整其脑细胞(参数)。
长期以来,最好的教练会对每一个单独的脑细胞进行处理。他们观察每个细胞,看它出了多少错,然后给它一个微小的推力。这效果还可以,但它忽略了脑细胞是成队工作的这一事实。
最近,一种名为 Muon 的新型教练出现了。Muon 不再一个一个地观察细胞,而是同时观察整个团队(矩阵)。它试图确保整个团队以一种完美平衡、协调的方式移动,就像一支花样游泳队。这对于巨大的机器人来说效果极佳,但论文作者发现 Muon 的逻辑中隐藏着一个缺陷。
问题所在:“大嗓门”队友
作者发现,在 Muon 的花样游泳队中,有些队友叫得实在太大声,以至于淹没了其他所有人。
用技术术语来说,矩阵中某些部分的“动量”(对过去错误的记忆)巨大无比,而其他部分却微乎其微。当 Muon 试图进行它那华丽的“同步舞蹈”(称为 Newton–Schulz 迭代)时,这些大嗓门打乱了节奏。由于输入是不平衡的,团队无法进行有效的协调。这就像是在指挥一个管弦乐团,小号的声音震耳欲聋,而小提琴却在低声细语;无论指挥多么出色,音乐听起来都会很糟糕。
作者通过运行“均匀性测试”(一种统计检查)证明了这一点。他们发现,在进行任何修复之前,矩阵中的“音量水平”是完全失衡的。
解决方案:Zeta(两步走教练)
作者提出了一种名为 Zeta 的新教练。Zeta 意识到,在修复管弦乐团的节奏之前,你必须先解决音量水平的问题。因此,Zeta 使用了一个严格的两步走过程:
第一步:音量旋钮(坐标白化)
在团队尝试起舞之前,Zeta 会走遍四周,调低大嗓门小号的音量,并调高低语小提琴的音量。它对矩阵中的每一个条目进行归一化处理。现在,每个人都站在了平等的起跑线上。团队不再被少数几个大嗓门所主导。第二步:同步舞蹈(谱白化)
现在音量已经平衡了,Zeta 让团队开始表演它那华丽的同步舞蹈。因为输入现在变得平静且平衡,舞蹈得以完美呈现。团队展现出了 Muon 曾试图实现但因音量不平衡而失败的、优美且协调的几何运动模式。
为什么顺序很重要: 论文强调,你不能交换这两个步骤。如果你先跳舞(第二步)然后再修复音量(第一步),舞蹈仍会被最初的喧闹声所毁掉。音量修复必须发生在舞蹈之前,以建立舞蹈所需的稳定基础。
结果:更快、更聪明
作者在各种“机器人”(AI 模型)上测试了 Zeta,其规模从小型(6 亿参数)到庞大(80 亿参数),甚至包括使用了“混合专家模型”(即大脑的不同部分处理不同任务)的模型。
- 学习更快: Zeta 比旧的教练(AdamW 和 Muon)学得更快。它用更少的训练步数就达到了同样的技能水平。
- 更好的泛化能力: 使用 Zeta 训练的模型在处理未见过的任务(如回答难题或识别图像)时表现得更好。
- 高效性: Zeta 并没有拖慢速度。它在学习速度提升的同时,并没有增加太多每步的额外时间。
核心结论
把 Zeta 看作是一位意识到:在教导一个团队进行完美和谐的动作之前,首先必须确保每个人的说话音量是一致的教练。通过先修复“音量失衡”,团队终于能够正确地完成“和谐之舞”,从而造就出更聪明、学习更快的 AI。
该论文声称,这是对这些先进优化器运作方式中结构性问题的根本性修复,证明了在尝试优化几何结构之前先平衡规模,才是成功的关键。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。