← 最新论文
🤖 machine learning

Stabilizing Native Low-Rank LLM Pretraining

本文介绍了 Spectron,这是一种谱重整化技术,通过控制权重更新的增长来稳定端到端的原生低秩大语言模型预训练,使仅使用低秩权重的从零训练模型能够达到密集模型的性能,同时提高推理效率。

原作者: Paul Janson, Edouard Oyallon, Eugene Belilovsky

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Paul Janson, Edouard Oyallon, Eugene Belilovsky

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下人工智能的世界,就像一座巨大且繁忙的图书馆,最聪明的书正由一群巨大的、隐形的抄写员撰写。这些抄写员就是“大语言模型”(LLM),他们每天都在变得更大、更聪明。但问题在于:为了编写这些书,他们需要一个如此庞大的图书馆,以至于建造它需要耗费巨资,维持灯火通明则需要消耗如山般的电力。这些模型内部的“权重”就像是抄写员的记忆库;记忆库越大,他们能学习的东西就越多,但这也意味着他们变得越来越沉重且昂贵。

有一段时间,科学家们认为让这些模型变小的唯一方法是先完整地写出它们,然后再尝试缩小它们,就像是在行李箱已经装满后尝试压缩它一样。也有人尝试在旅途中只使用行李箱的一小部分,同时保留一个“全尺寸”的备份。但如果从一开始就只用最核心、最轻便的物品来打包行李呢?这就是“低秩”(low-rank)训练的梦想:从第一天起就将模型构建得自然而轻量且高效。问题在于,当科学家们尝试从零开始构建这些轻量化模型时,它们总是会崩溃。它们内部的数学逻辑会变得疯狂,数值会爆炸,训练过程也会崩溃,就像汽车引擎转速过高导致气缸爆裂一样。大问题在于:我们能否从头开始构建这些轻量化模型而不让它们发生爆炸,而且它们是否依然能像那些沉重、昂贵的模型一样聪明?

这篇论文介绍了一种名为 Spectron 的新方法,它给出了肯定的回答。作者发现,这些轻量化模型之所以崩溃,是因为它们内部的数值正在不受控制地增长,就像一个没有塞子的气球在被吹大一样。他们发现,模型内部发生的变化的“规模”(称为谱范数/spectral norm)增长得太快、太大了。为了解决这个问题,他们发明了一个安全阀。想象一下你正在驾驶一艘速度极快且非常轻盈的小船。如果你把方向盘转得太猛,船就会失控旋转。Spectron 就像是一个自动驾驶仪,每当船试图转向过急时,它都会轻轻地将方向盘拨回到一个安全的角度。它通过不断检查船只运动的“规模”,并将其按比例缩小到足以保持稳定、又不至于让船停止移动的程度来实现这一点。

研究人员在多种不同规模的模型上测试了这一方法,范围从约 9400 万参数的小型模型到 4.54 亿参数的大型模型。他们发现,通过使用 Spectron,这些轻量化模型可以在没有“沉重”备份权重的情况下,从零开始进行训练。不仅如此,它们不仅保持了稳定性,而且学习效果也和那些庞大、沉重的模型一样好。事实上,当他们将一个使用 Spectron 训练的 4.54 亿参数模型与一个 7.8 亿参数的沉重模型进行比较时,他们发现这个轻量化模型可以用显著更少的资源达到同样的智能水平。这就像是找到了一种方法,可以制造出一辆速度与重型卡车一样快、但油耗却只有一半的跑车。

论文还探讨了如何构建这些模型才能获得最佳效果。他们通过模拟实验,试图找出模型规模与阅读数据量之间的完美平衡点。他们发现,对于这些轻量化模型,其“甜点位”(最佳平衡点)与重型模型略有不同:拥有一个稍小一点的模型并让它阅读稍多一点的数据会更好。这表明在未来,我们或许能够构建出极其聪明的人工智能系统,它们运行起来成本更低,也更容易适配普通计算机,而不是必须依赖超级计算机。作者基于他们的实验结果对这些结论充满信心,展示了该方法在不同规模和任务中都能可靠运行,为构建下一代高效人工智能提供了一套稳定的方案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →