← 最新论文
🤖 machine learning

A Defense of the Quadratic Model

本文表明,通过在中间检查点进行泰勒展开应用,简单的二次模型能够出人意料地准确地预测大语言模型的优化动力学,从而揭示了结构化的海森谱(Hessian spectra),并证实了训练通常发生在依赖于批量大小的随机稳定性边缘。

原作者: Alexandru Meterez, Pranav Ajit Nair, Depen Morwani, Cengiz Pehlevan, Sham Kakade, Alex Damian

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Alexandru Meterez, Pranav Ajit Nair, Depen Morwani, Cengiz Pehlevan, Sham Kakade, Alex Damian

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在黑夜中穿行于一片巨大的、雾气弥漫的山脉。这座山就是一台巨型人工智能的“损失景观”(loss landscape),一个复杂的地形,AI所迈出的每一步都是为了寻找最低的谷底(即最佳性能)。问题在于,这座山如此巨大且扭曲,以至于没有人能同时看清整张地图。多年来,科学家们一直试图预测 AI 的移动方式,但他们使用的是简单的平面图或理想化的模型。有时这些地图很管用,但有时它们要么过于简单而无法使用,要么过于复杂而难以计算。核心问题是:我们能否使用一张简单的平面图来预测 AI 在这片混沌山脉中的旅程?

要理解这一点,你需要了解几件事。首先,AI 模型通过“优化”来学习,这仅仅意味着通过采取微小的步长来减少错误。其次,“海森矩阵”(Hessian)是一种描述任何特定位置地面有多陡峭或多弯曲的数学方法。如果你了解了曲线,你就能预测走一步会将你带入谷底还是带向悬崖。最后,有一个概念叫做“稳定性边缘”(edge of stability),这就像是在悬崖边缘行走,那里的地面如此陡峭,以至于一步走错就会跌落,然而 AI 却能在这种情况下继续前行。这篇论文探讨的是:最简单的地图——一个平坦的、二次方(碗状)近似模型——是否真的可以预测大型 AI 在现实世界中的行为。

为了理解这一点,作者决定在拥有 1.5 亿个参数、在 30 亿个词汇上训练的语言大模型(LLM)上,对这个简单的“二次方模型”进行压力测试。他们想看看,与其试图理解整座疯狂的山脉,是否只需观察 AI 当前所在位置周围的一小块平坦地面,并利用它来预测接下来的几步。

他们发现了一些非常酷的现象:这个简单的碗状地图竟然奏效了!当他们在训练进行到每 10% 的进度时停止训练,并在该处创建一个平坦的二次方版本的问题时,这个简单的模型能够准确地预测 AI 在接下来 10% 训练过程中的行为。这就像是,尽管山脉本身是崎岖不平的,但 AI 花费了大量时间处于特定的“碗状”谷底中,因此一个简单的碗状地图就足以告诉你在下一步会走向何方。这种预测在训练接近尾声时甚至比在开始时表现得更好。

一旦证明了简单的地图有效,他们便借此窥探了 AI 学习过程的内部机制。他们研究了“海森谱”(Hessian spectrum),这就像是景观中所有不同坡度和曲线的列表。他们发现,这个列表并非随机生成的;它具有非常特定的结构。列表的顶端由处理词汇的部分(“解嵌入”层/unembedding layer)所主导,而长长的尾部则遵循一种通用的“幂律”(power law)。这意味着,无论 AI 使用的是极小的批次数据还是巨大的批次数据,其尾部的形状都是一致的,而且它并不受优化器所使用的特定技巧(预调节器/preconditioners)的影响。这是一种隐藏在混沌中的普遍模式。

最后,他们调查了“稳定性边缘”。他们想知道 AI 是在谷底小心翼翼地行走,还是在悬崖边缘翩翩起舞。通过调整学习率和批次大小(即数据块的大小),他们发现 AI 确实是在边缘起舞。当 AI 使用小批次时,它在进行“随机稳定性边缘”舞蹈,这意味着它的摇摆是由数据中的随机噪声引起的。当它使用大批次时,它则在“确定性边缘”上摇摆,即这种不稳定是由步长本身的数学特性引起的。在这两种情况下,AI 都运行在稳定的极限边缘,这表明这种危险的平衡行为实际上正是这些模型学习得最好的方式。

论文得出结论:虽然 AI 的世界极其复杂,但我们可以通过将其视为一系列简单的、局部的二次方问题来理解它。我们不需要一个关于整座山的单一且不可能实现的理论,我们只需要观察 AI 当前所处的那个局部“碗”即可。这个简单的模型不仅仅是一个玩具模型;它是一个极其准确的代理,能够反映现实世界中 AI 预训练的实际运作方式,为我们提供了一种理解和改进这些庞大系统的新型、可处理的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →